Kecerdasan buatan biasanya belajar dari dataset statis atau instruksi yang dipandu manusia. Namun, serangkaian eksperimen oleh OpenAI menunjukkan bahwa agen AI dapat menemukan perilaku kompleks secara mandiri melalui kompetisi [1], [4].
Dengan menempatkan agen dalam permainan simulasi sembunyi-temukan, peneliti mengamati munculnya penggunaan alat yang canggih dan koordinasi [4]. Agen-agen tersebut tidak diprogram dengan strategi tertentu; sebaliknya, mereka mengembangkan metode mereka sendiri untuk menang [2].
Mekanisme Pembelajaran Swasupervisi
Agen-agen menggunakan pembelajaran penguatan, sebuah proses di mana mereka belajar dengan berinteraksi dengan lingkungan simulasi [2]. Dalam pengaturan ini, penyembunyi diberi hadiah karena menghindari deteksi, sementara pencari diberi hadiah karena menemukan mereka [2].
Untuk mempercepat proses ini, peneliti menggunakan “self‑play” [5], [7]. Ini menciptakan autokurikulum alami karena agen selalu bersaing melawan lawan dengan tingkat keterampilan yang serupa [5]. Saat satu tim meningkatkan kemampuan, hal itu menimbulkan tekanan baru bagi tim lawan untuk beradaptasi, menghasilkan siklus perbaikan berkelanjutan [4].
Enam Tahap Strategi Emergen
Kompetisi berkembang melalui enam fase berbeda dari strategi dan kontra‑strategi [1], [4]. Tahapan ini menunjukkan progresi dari gerakan sederhana hingga manipulasi lingkungan yang kompleks:
- Penghindaran Dasar: Penyembunyi pada awalnya mencoba tetap tidak terlihat tanpa menggunakan objek apa pun [2], [7].
- Membangun Benteng: Penyembunyi belajar menggunakan kotak dan dinding untuk membangun tempat perlindungan yang menghalangi pandangan pencari [2], [5].
- Menerobos: Pencari menemukan bahwa mereka dapat menggunakan ramp untuk melompat ke dalam dan mengatasi tempat perlindungan ini [4], [5].
- Penolakan Ramp: Penyembunyi menanggapi dengan memindahkan ramp ke tepi area permainan atau mengunci ramp di tempat untuk mencegah penggunaan oleh pencari [5], [7].
- Box Surfing: Pencari belajar melakukan “box surf,” bergerak di atas kotak untuk menerobos benteng [7].
- Penguncian Total: Pada tahap akhir, penyembunyi belajar mengunci semua objek yang tidak terpakai selama fase persiapan mereka untuk menghilangkan segala keuntungan potensial bagi pencari [5], [7].
Pertukaran dalam Reproduksibilitas AI
Meskipun perilaku emergen ini mengesankan, mereplikasi mereka secara teknis sulit [3]. Pembelajaran penguatan sangat sensitif terhadap hiperparameter, fungsi hadiah, dan variabel lingkungan seperti gravitasi atau kondisi kolider [3].
Perubahan kecil pada pengaturan ini dapat secara signifikan mengubah pola perilaku yang dihasilkan [3]. Beberapa peneliti menemukan bahwa menambahkan kemampuan baru, seperti mekanisme terbang, sebenarnya dapat mempercepat proses pembelajaran. Misalnya, “strategi tempat perlindungan” yang memerlukan 25 juta langkah pada satu model berhasil direplikasi dalam 2,3 juta langkah ketika agen diberikan kemampuan terbang [3].
Implikasi Praktis untuk Robotika dan Lainnya
Kemampuan belajar dari permainan ini menunjukkan bahwa AI dapat memperoleh keterampilan yang relevan bagi manusia tanpa demonstrasi eksplisit dari manusia [4]. Hal ini memiliki aplikasi langsung untuk agen yang beroperasi di lingkungan dunia nyata yang tidak terstruktur [2].
Dalam robotika, pendekatan ini dapat memungkinkan mesin belajar cara menavigasi medan yang kompleks atau memanipulasi objek dengan lebih cekatan [2], [4]. Demikian pula, kendaraan otonom dapat meningkatkan kemampuan mereka untuk memperkirakan dan merespons situasi tak terduga dengan melatih dalam simulasi kompetitif dan dinamis [2].
Jika Anda tertarik pada kerangka kerja teknis di balik agen-agen ini, Anda dapat menjelajahi lingkungan emergensi multi‑agen di GitHub.
Sumber
- Emergent tool use from multi-agent interaction - OpenAI
- Bowen Baker · bowenbaker.github.io
- GitHub - FarkadAdnan/Hide-and-Seek: Through multi-agent competition …
- RL Weekly 31: How Agents Play Hide and Seek, Attraction … - endtoend
- Replication of Multi-Agent Reinforcement Learning for the “Hide and …
- Hide-and-Seek AI: A Lesson in Learning from Play - LinkedIn
- Multi-Agent Hide and Seek - YouTube