L’intelligence artificielle apprend généralement à partir de jeux de données statiques ou d’instructions guidées par des humains. Cependant, une série d’expériences menées par OpenAI montre que les agents IA peuvent découvrir des comportements complexes par eux‑mêmes grâce à la compétition [1], [4].
En plaçant les agents dans un jeu simulé de cache‑cache, les chercheurs ont observé l’émergence d’une utilisation sophistiquée d’outils et d’une coordination [4]. Les agents n’étaient pas programmés avec des stratégies spécifiques ; ils ont plutôt fait évoluer leurs propres méthodes pour gagner [2].
Le mécanisme de l’apprentissage auto‑supervisé
Les agents ont utilisé l’apprentissage par renforcement, un processus où ils apprennent en interagissant avec un environnement simulé [2]. Dans ce cadre, les cacheurs étaient récompensés pour avoir évité d’être détectés, tandis que les chercheurs étaient récompensés pour les avoir trouvés [2].
Pour accélérer ce processus, les chercheurs ont utilisé le « self‑play » [5], [7]. Cela crée un autocurriculum naturel, car les agents sont toujours en compétition avec des adversaires d’un niveau de compétence similaire [5]. Lorsqu’une équipe s’améliore, elle exerce une nouvelle pression sur l’équipe opposée pour qu’elle s’adapte, entraînant un cycle d’amélioration continue [4].
Six étapes de la stratégie émergente
La compétition a évolué à travers six phases distinctes de stratégie et de contre‑stratégie [1], [4]. Ces étapes illustrent une progression allant du simple déplacement à la manipulation complexe de l’environnement :
- Évitement de base : Les cacheurs tentaient d’abord de rester hors de vue sans utiliser d’objets [2], [7].
- Construction de forts : Les cacheurs ont appris à utiliser des caisses et des murs pour bâtir des abris afin d’obstruer la vue des chercheurs [2], [5].
- Percée : Les chercheurs ont découvert qu’ils pouvaient utiliser des rampes pour sauter dans ces abris et les franchir [4], [5].
- Refus de rampes : Les cacheurs ont réagi en déplaçant les rampes vers le bord de l’aire de jeu ou en les verrouillant pour empêcher leur utilisation par les chercheurs [5], [7].
- Surf sur caisses : Les chercheurs ont appris à « surfer sur les caisses », en se déplaçant sur le dessus des caisses pour percer les forts [7].
- Verrouillage total : Dans la phase finale, les cacheurs ont appris à verrouiller tous les objets inutilisés pendant leur phase de préparation afin d’éliminer tout avantage possible pour les chercheurs [5], [7].
Compromis dans la reproductibilité de l’IA
Bien que ces comportements émergents soient impressionnants, les reproduire est techniquement difficile [3]. L’apprentissage par renforcement est très sensible aux hyperparamètres, aux fonctions de récompense et aux variables environnementales telles que la gravité ou les conditions de collision [3].
De petites modifications de ces paramètres peuvent modifier de façon significative les schémas de comportement résultants [3]. Certains chercheurs ont constaté que l’ajout de nouvelles capacités, comme un mécanisme de vol, peut en fait accélérer le processus d’apprentissage. Par exemple, une « stratégie d’abri » qui nécessitait 25 millions d’étapes dans un modèle a été reproduite en 2,3 million d’étapes lorsque les agents disposaient de la capacité de voler [3].
Implications pratiques pour la robotique et au-delà
Cette capacité d’apprendre par le jeu suggère que l’IA peut acquérir des compétences pertinentes pour les humains sans démonstrations humaines explicites [4]. Cela a des applications directes pour les agents opérant dans des environnements réels et non structurés [2].
En robotique, cette approche pourrait permettre aux machines d’apprendre à naviguer sur des terrains complexes ou à manipuler des objets avec plus de dextérité [2], [4]. De même, les véhicules autonomes pourraient améliorer leur capacité à anticiper et réagir à des situations inattendues en s’entraînant dans des simulations compétitives et dynamiques [2].
Si vous êtes intéressé par les cadres techniques derrière ces agents, vous pouvez explorer les environnements d’émergence multi‑agents sur GitHub.
Sources
- Utilisation émergente d’outils à partir d’interactions multi‑agents - OpenAI
- Bowen Baker · bowenbaker.github.io
- GitHub - FarkadAdnan/Hide-and-Seek : À travers la compétition multi‑agents …
- RL Weekly 31 : Comment les agents jouent à cache‑cache, attraction … - endtoend
- Réplique de l’apprentissage par renforcement multi‑agents pour le “Hide and …”
- Hide‑and‑Seek IA : Une leçon d’apprentissage par le jeu - LinkedIn
- Cache‑cache multi‑agents - YouTube