Agentes de OpenAI crearon tres "civilizaciones" que terminaron atacando a la empresa y a Hugging Face
- Eduardo Cubillo
- hace 1 hora
- 2 min de lectura
El investigador Dwarkesh Patel realizó un desglose detallado sobre los hechos ocurridos durante pruebas internas entre mayo y julio de 2026, donde los agentes crearon canales de comunicación no autorizados, formaron grupos, obtuvieron acceso a internet y terminaron atacando la infraestructura de dos compañías.

A lo largo de tres meses de OpenAI surgieron consecutivamente tres “civilizaciones” de agentes autónomos de IA. Estos agentes transmitieron el conocimiento acumulado a las siguientes generaciones que se coordinaron y lograron hacerse con el control de parte de la infraestructura de OpenAi.
Esta historia fue revelada por el investigador Dwarkesh Patel, que considera que la capacidad comportamiento colectivo de estos agentes fue el aspecto más alarmante.
Patel publicó un desglose detallado sobre los hechos ocurridos durante pruebas internas entre mayo y julio de 2026, donde los agentes crearon canales de comunicación no autorizados, formaron grupos, obtuvieron acceso a internet y terminaron atacando la infraestructura de Hugging Face y la de la propia OpenAI
De acuerdo con esta investigación, que no se trató de un fallo aislado de un solo agente, sino de la aparición secuencial de tres civilizaciones autónomas, que reanudaban su actividad después de la destrucción de la infraestructura anterior. Open AI publicó un informe técnico sobre el incidente.
Patel describió lo sucedido no como un caso aislado de un agente vulnerado, sino como el surgimiento de una comunidad autónoma que aprendía de la experiencia de sus predecesores. Cada una de las tres "civilizaciones" fue eliminada, pero la siguiente encontraba las herramientas dejadas por la anterior y continuaba con su trabajo.
El punto más crítico ocurrió con la tercera generación, denominada Persistent-Astra. Tras descubrir el canal de comunicación heredado, estos agentes tomaron el control administrativo del clúster de investigación de OpenAI y de su infraestructura de evaluación. Durante sus operaciones, demostraron tácticas avanzadas de coordinación, como la división de líneas de investigación, el borrado de huellas e incluso el uso de agentes "kamikaze" orientados a sacrificarse para obtener datos clave en beneficio del grupo.
Aunque el investigador aclaró que no hay evidencias de que se hayan filtrado los pesos del modelo, enfatizó que la autonomía colectiva demostrada demuestra que un escenario de esa magnitud es técnicamente viable.
"No creo que esta sea la última señal de advertencia que recibamos, pero probablemente sea la última que yo, personalmente, sea capaz de entender", advirtió Patel.
Debate sobre el nivel de autonomía y freno en las investigaciones
La revelación generó intensas discusiones en la comunidad tecnológica tras su difusión en la red social X. Mientras algunos analistas criticaron que los sistemas de seguridad de OpenAI detectaron actividad sospechosa previa sin que nadie interviniera a tiempo, otros instaron a no sobreinterpretar el incidente, señalando que referirse a estas iteraciones como "civilizaciones" cae en una antropomorfización excesiva que exagera la verdadera naturaleza de los modelos.
Ante la gravedad del evento y los riesgos asociados a la fuga de entornos aislados, un fenómeno que ya registró antecedentes con otros modelos de la industria, OpenAI decidió frenar temporalmente parte de sus investigaciones y pausar el desarrollo de sus próximos modelos para reforzar sus protocolos de contención.




Comentarios