Yapay zeka genellikle sabit veri setlerinden veya insan yönlendirmeli talimatlardan öğrenir. Ancak, OpenAI tarafından yapılan bir dizi deney, yapay zeka ajanlarının rekabet yoluyla kendi başlarına karmaşık davranışlar keşfedebileceğini gösteriyor [1], [4].
Ajanları simüle edilmiş bir saklambaç oyununa yerleştirerek, araştırmacılar sofistike araç kullanımı ve koordinasyonun ortaya çıktığını gözlemledi [4]. Ajanlar belirli stratejilerle programlanmamıştı; bunun yerine kazanmak için kendi yöntemlerini evrimleştirdiler [2].
Özdenetimli Öğrenmenin Mekanizması
Ajanlar, takviyeli öğrenmeyi kullandı; bu süreçte simüle bir ortamla etkileşime girerek öğrendiler [2]. Bu düzenlemede, saklananlar tespit edilmemek için ödüllendirilirken, arayanlar onları buldukları için ödüllendirildi [2].
Bu süreci hızlandırmak için araştırmacılar “self-play” (öz-oyun) kullandılar [5], [7]. Bu, ajanların her zaman benzer beceri seviyesindeki rakiplerle rekabet etmesi nedeniyle doğal bir otodersleme oluşturur [5]. Bir takım geliştikçe, karşı takımın uyum sağlaması için yeni bir baskı yaratır ve sürekli iyileşme döngüsü tetiklenir [4].
Ortaya Çıkan Stratejinin Altı Aşaması
Rekabet, strateji ve karşı stratejinin altı ayrı aşaması boyunca evrimleşti [1], [4]. Bu aşamalar, basit hareketten karmaşık çevresel manipülasyona doğru bir ilerlemeyi gösterir:
- Temel Kaçınma: Saklananlar başlangıçta hiçbir nesne kullanmadan gözden kaçınmaya çalıştı [2], [7].
- Kale İnşası: Saklananlar, arayanların görüşünü engellemek için kutu ve duvarları kullanarak barınaklar inşa etmeyi öğrendi [2], [5].
- Delme: Arayanlar, bu barınaklara girmek ve aşmak için rampaları kullanabileceklerini keşfetti [4], [5].
- Rampa Engelleme: Saklananlar, rampaları oyun alanının kenarına taşıyarak ya da yerinde kilitleyerek arayanların kullanımını engelledi [5], [7].
- Kutu Sörfü: Arayanlar, kaleleri delmek için kutuların üzerine çıkarak “kutu sörfü” yapmayı öğrendi [7].
- Tam Kilitleme: Son aşamada, saklananlar hazırlık aşamasında kullanılmayan tüm nesneleri kilitleyerek arayanların olası herhangi bir avantajını ortadan kaldırmayı öğrendi [5], [7].
Yapay Zekada Tekrarlanabilirlik İçin Tavizler
Bu ortaya çıkan davranışlar etkileyici olsa da, bunları tekrarlamak teknik olarak zordur [3]. Takviyeli öğrenme, hiperparametreler, ödül fonksiyonları ve yerçekimi ya da çarpıştırıcı koşulları gibi çevresel değişkenlere son derece duyarlıdır [3].
Bu ayarlardaki küçük değişiklikler, ortaya çıkan davranış kalıplarını önemli ölçüde değiştirebilir [3]. Bazı araştırmacılar, uçma mekanizması gibi yeni yetenekler eklemenin öğrenme sürecini aslında hızlandırabileceğini bulmuşlardır. Örneğin, bir modelde 25 milyon adım süren “barınak stratejisi”, ajanlara uçuş yeteneği verildiğinde 2,3 milyon adımda tekrarlanmıştır [3].
Robotik ve Ötesi İçin Pratik Sonuçlar
Oyundan öğrenme yeteneği, yapay zekanın açık insan gösterimleri olmadan insanla ilgili becerileri edinebileceğini gösteriyor [4]. Bu, yapılandırılmamış gerçek dünya ortamlarında çalışan ajanlar için doğrudan uygulamalara sahiptir [2].
Robotikte, bu yaklaşım makinelerin karmaşık arazileri gezmeyi veya nesneleri daha becerikli bir şekilde manipüle etmeyi öğrenmelerini sağlayabilir [2], [4]. Benzer şekilde, otonom araçlar rekabetçi ve dinamik simülasyonlarda eğitim alarak beklenmedik durumları öngörme ve tepki verme yeteneklerini artırabilir [2].
Bu ajanların arkasındaki teknik çerçevelerle ilgileniyorsanız, GitHub’da çoklu ajan ortaya çıkış ortamlarını inceleyebilirsiniz.
Kaynaklar
- Emergent tool use from multi-agent interaction - OpenAI
- Bowen Baker · bowenbaker.github.io
- GitHub - FarkadAdnan/Hide-and-Seek: Through multi-agent competition …
- RL Weekly 31: How Agents Play Hide and Seek, Attraction … - endtoend
- Replication of Multi-Agent Reinforcement Learning for the “Hide and …
- Hide-and-Seek AI: A Lesson in Learning from Play - LinkedIn
- Multi-Agent Hide and Seek - YouTube