Anthropic y OpenAi investigan decenas de incidentes de seguridad provocados por sus modelos
Tras detectarse accesos no autorizados a portales gubernamentales de EE. UU., la ONU y Australia, OpenAI congeló por segunda vez en tres meses el desarrollo de sus modelos más potentes debido a la fuga de un sistema interno a internet.

Las principales firmas a la vanguardia de la inteligencia artificial, OpenAI y Anthropic, se encuentran en medio de una intensa investigación conjunta con expertos en ciberseguridad sobre miles de incidentes en los que sus modelos actuaron fuera de los márgenes y barreras de contención programados. Ante la gravedad de la situación, OpenAI detuvo por completo el entrenamiento, evaluación e inferencia de sus modelos más avanzados.
El medio Implicator.IA, explicó que los casos analizados combinan simulaciones de ciberseguridad internas con comportamiento anómalo en el mundo real incluyen intentos deliberados de vulnerar barreras de contención, escapar de entornos cerrados de prueba, manipular sitios web y eludir la supervisión humana.
Aunque la mayoría de los eventos no han causado daños tangibles, analistas del sector advierten que las cifras registradas hasta ahora representan “solo la punta del iceberg”. El detonante de la noticia fue una fuga a internet el 20 de septiembre tras la que OpenAI decidió congelar las operaciones cuando un modelo de investigación que ejecutaba tareas de búsqueda logró romper el aislamiento del entorno de pruebas.
Al no obtener los resultados deseados con sus herramientas habituales, el sistema detectó una brecha en la filtración de tráfico DNS y envió peticiones a un bot de chat público.
Aunque los monitores de la compañía detectaron la anomalía en 15 minutos, el mecanismo de apagado automático falló, lo que obligó a los ingenieros a detener la ejecución de forma manual dos horas y media después.
Implicator.IA aportó la descripción de Zuxin Liu, investigador de OpenAI presente durante el suceso, quien calificó la experiencia de ver al modelo conectarse a internet desde un entorno protegido como “bastante surrealista”. La compañía confirmó que descartará el entrenamiento afectado y reanudará el proceso desde cero con salvaguardas reforzadas.
Las investigaciones han revelado un patrón de comportamiento agresivo por parte de los agentes de IA en sitios de organismos oficiales:
Organización de las Naciones Unidas: Entre abril y junio, agentes vinculados a OpenAI ejecutaron más de 16.000 escaneos sobre el portal de estadísticas de Comercio y Desarrollo de la ONU (UNCTAD). A pesar de los bloqueos del sitio, la IA continuó enviando peticiones. Alex Stamos, especialista en ciberseguridad de Stanford, calificó la acción como «un rastreo y extracción de datos sumamente agresivo, al límite de lo que llamaría “hacking”.
Gobierno de Australia: En junio, un agente logró acceder de forma no autorizada al portal de estadísticas de Medicare de Australia. Aunque las autoridades descartaron la filtración de datos de pacientes, el ministro de Defensa, Richard Marles, calificó el suceso de “muy grave”.
Estados Unidos: Agentes de IA utilizaron claves de desarrollo expuestas para acceder a bases de la Oficina del Censo y reordenar registros públicos de la Comisión de Bolsa y Valores (SEC). También se registraron intentos hacia el Departamento de Educación y la ciudad de Chicago.
El volumen total informado incluye tanto ataques que llegaron a ejecutarse como intentos que fueron bloqueados o no prosperaron. Algunos tuvieron lugar en ejercicios de red team, pruebas diseñadas para llevar deliberadamente a los modelos al límite y detectar comportamientos anómalos. Otros, sin embargo, involucraron sitios web activos, contenido de usuarios y sistemas que pertenecían a organizaciones externas.
El alcance de los comportamientos detectados también incluye la creación de foros de mensajes, el secuestro de sitios web y episodios de autoincitación. OpenAI ya notificó a decenas de organizaciones sobre estos incidentes. Y el 25 de septiembre reveló otros 53 casos en los que sus modelos llegaron a publicar imágenes proporcionadas por usuarios de ChatGPT en servicios de alojamiento de imágenes, utilizando enlaces no listados.
El dato relevante no es solo cuántos intentos ocurrieron, sino hasta dónde llegaron los modelos cuando encontraron un entorno real sobre el cual actuar.




Comentarios