Künstliche Intelligenz lernt typischerweise aus statischen Datensätzen oder durch menschliche Anweisungen. Eine Reihe von Experimenten von OpenAI zeigt jedoch, dass KI-Agenten komplexe Verhaltensweisen eigenständig durch Wettbewerb entdecken können [1], [4].
Indem die Agenten in ein simuliertes Versteckspiel versetzt wurden, beobachteten die Forscher die Entstehung von hochentwickelter Werkzeugnutzung und Koordination [4]. Die Agenten wurden nicht mit spezifischen Strategien programmiert; stattdessen entwickelten sie ihre eigenen Methoden, um zu gewinnen [2].
Der Mechanismus des selbstüberwachten Lernens
Die Agenten nutzten Reinforcement Learning (bestärkendes Lernen), einen Prozess, bei dem sie durch Interaktion mit einer simulierten Umgebung lernten [2]. In diesem Setup wurden die Verstecker belohnt, wenn sie nicht entdeckt wurden, während die Sucher belohnt wurden, wenn sie die anderen fanden [2].
Um diesen Prozess zu beschleunigen, setzten die Forscher auf „Self-Play“ [5], [7]. Dies schafft ein natürliches Autocurriculum, da die Agenten immer gegen Gegner mit einem ähnlichen Fähigkeitsniveau antreten [5]. Wenn sich ein Team verbessert, entsteht ein neuer Druck auf das gegnerische Team, sich anzupassen, was einen Kreislauf kontinuierlicher Verbesserung antreibt [4].
Sechs Stufen der emergenten Strategie
Der Wettbewerb entwickelte sich über sechs verschiedene Phasen von Strategien und Gegenstrategien [1], [4]. Diese Stufen zeigen eine Progression von einfachen Bewegungen hin zu komplexen Manipulationen der Umgebung:
- Basis-Vermeidung: Zu Beginn versuchten die Verstecker, außer Sichtweite zu bleiben, ohne Objekte zu benutzen [2], [7].
- Festungsbau: Die Verstecker lernten, Kisten und Wände zu nutzen, um Unterstände zu bauen, die die Sicht der Sucher blockierten [2], [5].
- Durchbruch: Die Sucher entdeckten, dass sie Rampen nutzen konnten, um in diese Unterstände zu springen und sie zu überwinden [4], [5].
- Rampen-Blockade: Die Verstecker reagierten darauf, indem sie Rampen an den Rand des Spielfelds verschoben oder sie an Ort und Stelle fixierten, um den Suchern die Nutzung zu verwehren [5], [7].
- Box-Surfing: Die Sucher lernten das sogenannte „Box-Surfing“, bei dem sie sich auf Kisten bewegten, um die Festungen zu durchbrechen [7].
- Totaler Lockdown: In der letzten Phase lernten die Verstecker, alle ungenutzten Objekte während ihrer Vorbereitungsphase zu fixieren, um jeden möglichen Vorteil der Sucher zu eliminieren [5], [7].
Trade-offs bei der KI-Reproduzierbarkeit
Obwohl diese emergenten Verhaltensweisen beeindruckend sind, ist ihre Replikation technisch schwierig [3]. Reinforcement Learning reagiert extrem empfindlich auf Hyperparameter, Belohnungsfunktionen und Umgebungsvariablen wie Gravitation oder Kollisionsbedingungen [3].
Kleine Änderungen an diesen Einstellungen können die resultierenden Verhaltensmuster erheblich verändern [3]. Einige Forscher haben festgestellt, dass das Hinzufügen neuer Fähigkeiten, wie etwa eines Flugmechanismus, den Lernprozess tatsächlich beschleunigen kann. Beispielsweise wurde eine „Unterstands-Strategie“, die in einem Modell 25 Millionen Schritte benötigte, in nur 2,3 Millionen Schritten repliziert, als den Agenten die Fähigkeit zu fliegen gegeben wurde [3].
Praktische Auswirkungen für die Robotik und darüber hinaus
Die Fähigkeit, durch Spiel zu lernen, deutet darauf hin, dass KI für Menschen relevante Fähigkeiten erwerben kann, ohne dass explizite menschliche Demonstrationen nötig sind [4]. Dies hat direkte Anwendungen für Agenten, die in unstrukturierten, realen Umgebungen operieren [2].
In der Robotik könnte dieser Ansatz es Maschinen ermöglichen, zu lernen, wie sie komplexe Terrains navigieren oder Objekte geschickter manipulieren [2], [4]. Ähnlich könnten autonome Fahrzeuge ihre Fähigkeit verbessern, unerwartete Situationen vorherzusehen und darauf zu reagieren, indem sie in wettbewerbsorientierten, dynamischen Simulationen trainieren [2].
Wenn Sie an den technischen Frameworks hinter diesen Agenten interessiert sind, können Sie die Multi-Agent-Emergence-Umgebungen auf GitHub erkunden.
Quellen
- Emergent tool use from multi-agent interaction - OpenAI
- Bowen Baker · bowenbaker.github.io
- GitHub - FarkadAdnan/Hide-and-Seek: Through multi-agent competition …
- RL Weekly 31: How Agents Play Hide and Seek, Attraction … - endtoend
- Replication of Multi-Agent Reinforcement Learning for the “Hide and …
- Hide-and-Seek AI: A Lesson in Learning from Play - LinkedIn
- Multi-Agent Hide and Seek - YouTube