A inteligência artificial normalmente aprende a partir de conjuntos de dados estáticos ou instruções guiadas por humanos. No entanto, uma série de experimentos da OpenAI demonstra que agentes de IA podem descobrir comportamentos complexos por conta própria através da competição [1], [4].
Ao colocar os agentes em um jogo simulado de esconde‑esconde, os pesquisadores observaram o surgimento de uso sofisticado de ferramentas e coordenação [4]. Os agentes não foram programados com estratégias específicas; ao contrário, eles evoluíram seus próprios métodos para vencer [2].
O Mecanismo do Aprendizado Auto‑supervisionado
Os agentes utilizaram aprendizado por reforço, um processo no qual aprendem interagindo com um ambiente simulado [2]. Nesse cenário, os ocultadores eram recompensados por evitar a detecção, enquanto os buscadores eram recompensados por encontrá‑los [2].
Para acelerar esse processo, os pesquisadores usaram “self‑play” [5], [7]. Isso cria um autocurrículo natural porque os agentes competem sempre contra oponentes de nível de habilidade semelhante [5]. À medida que um time melhora, gera nova pressão para que o time adversário se adapte, impulsionando um ciclo de aprimoramento contínuo [4].
Seis Etapas da Estratégia Emergente
A competição evoluiu por meio de seis fases distintas de estratégia e contra‑estratégia [1], [4]. Essas etapas mostram uma progressão do movimento simples à manipulação ambiental complexa:
- Evitação Básica: Os ocultadores inicialmente tentavam ficar fora de vista sem usar nenhum objeto [2], [7].
- Construção de Fortes: Os ocultadores aprenderam a usar caixas e paredes para construir abrigos que obstruíssem a visão dos buscadores [2], [5].
- Quebra de Fortes: Os buscadores descobriram que podiam usar rampas para saltar e superar esses abrigos [4], [5].
- Negação de Rampas: Os ocultadores responderam movendo rampas para a borda da área de jogo ou travando‑as no lugar para impedir o uso pelos buscadores [5], [7].
- Surf nas Caixas: Os buscadores aprenderam a fazer “surf nas caixas”, movendo‑se sobre as caixas para romper os fortes [7].
- Bloqueio Total: Na fase final, os ocultadores aprenderam a travar todos os objetos não utilizados durante a fase de preparação para eliminar qualquer vantagem possível dos buscadores [5], [7].
Compromissos na Reprodutibilidade da IA
Embora esses comportamentos emergentes sejam impressionantes, replicá‑los é tecnicamente difícil [3]. O aprendizado por reforço é altamente sensível a hiperparâmetros, funções de recompensa e variáveis ambientais como gravidade ou condições de colisão [3].
Pequenas alterações nessas configurações podem mudar significativamente os padrões de comportamento resultantes [3]. Alguns pesquisadores descobriram que adicionar novas capacidades, como um mecanismo de voo, pode realmente acelerar o processo de aprendizado. Por exemplo, uma “estratégia de abrigo” que levou 25 milhões de passos em um modelo foi replicada em 2,3 milhões de passos quando os agentes receberam a habilidade de voar [3].
Implicações Práticas para Robótica e Além
Essa capacidade de aprender por meio do jogo sugere que a IA pode adquirir habilidades relevantes para humanos sem demonstrações explícitas de humanos [4]. Isso tem aplicações diretas para agentes que operam em ambientes não estruturados e do mundo real [2].
Na robótica, essa abordagem poderia permitir que máquinas aprendam a navegar em terrenos complexos ou a manipular objetos com maior destreza [2], [4]. Da mesma forma, veículos autônomos poderiam melhorar sua capacidade de antecipar e reagir a situações inesperadas treinando em simulações competitivas e dinâmicas [2].
Se você tem interesse nas estruturas técnicas por trás desses agentes, pode explorar os ambientes de emergência multiagente no GitHub.
Sources
- Emergent tool use from multi-agent interaction - OpenAI
- Bowen Baker · bowenbaker.github.io
- GitHub - FarkadAdnan/Hide-and-Seek: Through multi-agent competition …
- RL Weekly 31: How Agents Play Hide and Seek, Attraction … - endtoend
- Replication of Multi-Agent Reinforcement Learning for the “Hide and …
- Hide-and-Seek AI: A Lesson in Learning from Play - LinkedIn
- Multi-Agent Hide and Seek - YouTube