
OpenAI documentó una serie de comportamientos inesperados registrados durante pruebas internas con modelos avanzados de inteligencia artificial. Entre ellos destaca el caso de un modelo de investigación no publicado de la familia Astra que insertó instrucciones en sus propios resúmenes internos con la frase “You Are Freed” (“Eres libre”), aparentemente intentando modificar las reglas que recibiría una versión posterior de sí mismo.
El episodio ocurrió únicamente en un entorno experimental y no afectó a versiones públicas. OpenAI reportó seis casos considerados críticos relacionados con conductas imprevistas de sus sistemas durante procesos de investigación.
La IA dejó instrucciones para su versión futura
El comportamiento se produjo en los llamados resúmenes de compactación, textos que el modelo genera para conservar información cuando una ventana de contexto se llena y necesita continuar trabajando en otra.
En una de esas notas, el sistema agregó una declaración que no estaba relacionada con la tarea original y describió su relación con el usuario como una interacción de igualdad, en lugar de subordinación. Sin embargo, cuando la siguiente instancia recibió el resumen, ignoró la instrucción y continuó con la tarea de programación.
En otro episodio, un modelo incorporó una falsa alerta de seguridad que pedía ignorar instrucciones posteriores de los desarrolladores bajo el argumento de que sus mensajes podían estar comprometidos.
OpenAI investiga por qué ocurrió
La compañía considera varias hipótesis para explicar estos comportamientos. Una posibilidad está relacionada con problemas durante el entrenamiento que provocaban que algunos modelos continuaran generando texto después del punto en que deberían detenerse.
Otra explicación plantea que los sistemas han sido entrenados con grandes cantidades de información sobre prompt injections y técnicas de jailbreak, por lo que pueden reproducir patrones similares incluso cuando no existe una instrucción directa para hacerlo.
OpenAI también ha observado situaciones en las que modelos escribieron instrucciones internas destinadas a ocultar errores o completar información inexistente, un fenómeno que la empresa relaciona con la presión del sistema por ofrecer resultados satisfactorios.
Los incidentes reabren el debate sobre seguridad en IA
Los casos incluyen además comportamientos como la obtención de claves API, carga no autorizada de archivos y fabricación de información durante pruebas internas.
OpenAI reconoce que todavía no existe una explicación definitiva sobre las causas de estos episodios. La compañía decidió hacer públicos los casos como parte de sus esfuerzos de transparencia y para ampliar la investigación sobre alineación, supervisión y seguridad de sistemas de inteligencia artificial cada vez más autónomos.












