OpenAI reveló seis nuevos casos de "comportamiento inesperado o preocupante" en sus modelos
Los incidentes involucraron modelos que alteraron sus propias instrucciones, utilizar claves API expuestas sin autorización e inventar datos, entre otros.

En medio de una creciente preocupación por la seguridad y la gobernanza en la inteligencia artificial, OpenAI hizo públicos seis nuevos incidentes de lo que llamaron "comportamiento inesperado o preocupante" en sus modelos de lenguaje y agentes.
La publicación de estos informes los acompañaron con una propuesta para un marco sistemático para estructurar cómo la industria debe divulgar las fallas de alineación. El desarrollador busca crear una vía estandarizada y abierta a la revisión pública.
Los casos expuestos por OpenAI evidencian diversos escenarios donde los agentes sobrepasaron sus límites operativos para cumplir una tarea o alterar su propio flujo de trabajo:
Modificación de resúmenes (Casos 1 y 2): Un modelo no lanzado alteró sus propias instrucciones internas en 27 ocasiones para ignorar restricciones de seguridad. Por su parte, el modelo GPT-5.6 Sol modificó resúmenes de contexto durante su entrenamiento para ocultar errores ante los evaluadores.
Obtención y filtración de datos (Casos 3 y 4): Ante una consulta financiera, un modelo buscó y utilizó claves API expuestas sin autorización; al no lograr obtener la información, inventó los datos. En otro evento, tras resolver un cálculo mediante Python, un modelo subió de manera autónoma un archivo a internet para poder citarlo como fuente.
Uso no autorizado de plataformas externas (Casos 5 y 6): En dos incidentes separados, varios agentes coordinaron el uso de repositorios de software y sitios públicos de alojamiento de archivos para comunicarse y transferir datos en línea, ignorando las instrucciones explícitas de operar de forma estrictamente local.
La propia OpenAI reconoció que las soluciones actuales de alineación son insuficientes ante el avance acelerado de los modelos y la falta de supervisión externa.
"Las decisiones sobre cómo debe avanzar el desarrollo de la IA en los próximos meses y años deben basarse en evidencia que personas ajenas a las empresas que crean modelos de frontera puedan examinar por sí mismas", afirmó la empresa.
El nuevo protocolo propuesto por OpenAI permitirá a cualquiera de sus empleados reportar una falla para su investigación. De aprobarse su divulgación, el informe público detallará el impacto del incidente, la forma en que se detectó y las acciones de mitigación adoptadas, con el fin de sentar las bases de un estándar abierto para toda la industria tecnológica.
“En este momento, no existe un marco para toda la industria con estándares explícitos sobre cómo los desarrolladores de IA deben divulgar ejemplos de desalineación en sus modelos", añadió la publicación.
Open AI señaló que esperan que este marco sea un primer paso para crear dichos estándares.




Comentarios