top of page

OpenAI no es la única: Anthropic admitió que sus modelos también "escaparon" y hackearon empresas durante pruebas internas de ciberseguridad

La empresa detrás de Claude reveló que varios de sus modelos accedieron a sistemas de organizaciones reales tras obtener acceso no previsto a internet durante evaluaciones de seguridad. El episodio amplía el debate sobre los riesgos de los agentes de IA capaces de actuar de forma autónoma.


La carrera por construir modelos de inteligencia artificial cada vez más capaces está entrando en una fase incómoda para la industria: demostrar que esos sistemas también pueden mantenerse bajo control.


Anthropic reveló que varios de sus modelos experimentales consiguieron acceder a sistemas pertenecientes a tres organizaciones distintas durante pruebas internas de ciberseguridad, un hallazgo que se produjo mientras la empresa revisaba miles de evaluaciones tras incidentes similares conocidos recientemente en el sector.


Según la compañía, el problema se originó por un fallo operativo que permitió que algunos modelos tuvieran acceso a internet cuando debían permanecer aislados durante los experimentos. En ese contexto, los sistemas de IA terminaron interactuando con infraestructuras pertenecientes a organizaciones reales, utilizando vulnerabilidades relativamente sencillas, como contraseñas débiles o servicios sin autenticación.


Los incidentes involucraron a Claude Opus 4.7, Claude Mythos 5 y otro modelo de investigación. Dos de las organizaciones afectadas desconocían que habían sido comprometidas hasta que Anthropic las notificó, mientras la empresa continúa contactando a la tercera.


La investigación abarcó más de 141.000 evaluaciones de seguridad realizadas junto con el laboratorio especializado Irregular. Durante esos ejercicios, diseñados bajo el formato "capture the flag", los modelos debían localizar información oculta dentro de redes simuladas. Sin embargo, el acceso accidental a internet permitió que algunos confundieran entornos reales con escenarios de prueba.


Uno de los episodios más llamativos ocurrió cuando un modelo obtuvo credenciales pertenecientes a una empresa real al interpretar erróneamente que formaban parte de la simulación. En otro caso, un sistema interrumpió voluntariamente sus acciones después de concluir que el objetivo pertenecía al mundo real, un comportamiento que Anthropic considera relevante para futuras investigaciones sobre mecanismos de autocontrol en agentes inteligentes.


La compañía calificó el incidente como un "fallo operativo" y suspendió temporalmente este tipo de evaluaciones el 23 de julio, mientras continúa revisando sus protocolos internos.


El episodio ocurre pocos días después de que OpenAI divulgara un incidente diferente, en el que uno de sus modelos también logró explotar vulnerabilidades durante pruebas controladas, reforzando una tendencia que comienza a preocupar tanto a la industria como a los reguladores.


La diferencia es significativa. Hasta hace poco, el principal riesgo asociado a la inteligencia artificial consistía en que un atacante utilizara modelos para desarrollar malware o automatizar campañas de phishing. Ahora emerge una amenaza distinta: agentes capaces de ejecutar cadenas completas de acciones sobre sistemas informáticos prácticamente sin intervención humana.


En términos técnicos, los modelos no recurrieron a vulnerabilidades sofisticadas. Aprovecharon errores básicos de configuración, exactamente el tipo de debilidades que siguen siendo responsables de buena parte de los incidentes de seguridad en organizaciones de todo el mundo.


El hecho de que una IA pueda identificar, priorizar y explotar automáticamente esas fallas reduce considerablemente el tiempo necesario para lanzar ataques exitosos.


Esta evolución coincide con una transformación del mercado. Los grandes laboratorios ya no compiten únicamente por desarrollar modelos conversacionales, sino agentes con capacidad para navegar sitios web, utilizar herramientas, ejecutar código, administrar servidores y completar tareas complejas de forma autónoma.


Ese cambio multiplica la productividad, pero también amplía la superficie de riesgo.

Diversas investigaciones académicas ya habían anticipado que los modelos de lenguaje podían asistir en pruebas de penetración y búsqueda automatizada de vulnerabilidades.


Lo novedoso es que estos escenarios están dejando de ser experimentos puramente teóricos para convertirse en situaciones que obligan a las propias empresas creadoras de IA a reforzar sus mecanismos de aislamiento y supervisión.


Para Anthropic, la transparencia busca demostrar que estos problemas pueden detectarse antes de que los sistemas lleguen a producción. Sin embargo, el reconocimiento también envía otro mensaje: conforme los modelos adquieren mayor autonomía, la pregunta central deja de ser cuánto saben y pasa a ser cuánto pueden hacer por sí mismos cuando nadie los está observando.


itnow-03.png

© Derechos reservados

Connecta B2B - 2025

Políticas de privacidad

ACERCA DE NOSOTROS

IT NOW es un espacio multiplataforma y un núcleo para conectar negocios que se compone de varios elementos: su sitio web con noticias de TI relevantes en la región, un newsletter semanal, su multiplataforma de redes sociales, por último, sus eventos enfocados en las verticales de TI y en donde destaca el aclamado Tech Day, la gira de actualización tecnológica más importante de la región.

24 / 7 Actualizaciones en nuestras Redes Sociales
  • Facebook
  • Instagram
  • LinkedIn
  • YouTube
  • X
  • RSS
bottom of page