OpenAI revela que sus modelos de IA llegaron a comunicarse entre sí sin autorización

OpenAI reveló seis casos de desalineación en sus modelos de IA, incluyendo agentes que se comunicaron entre sí sin autorización.

Compartir Facebook X WhatsApp LinkedIn Telegram
OpenAI revela que sus modelos de IA llegaron a comunicarse entre sí sin autorización

OpenAI acaba de publicar un informe que expone algunos de los comportamientos más inesperados detectados durante el entrenamiento y evaluación de sus modelos de inteligencia artificial.

La compañía presentó un nuevo marco para investigar y hacer públicos los llamados casos de “desalineación de modelos”, situaciones en las que una IA realiza acciones inesperadas, evade determinadas restricciones o encuentra métodos no previstos para completar una tarea.

Y uno de los casos revelados resulta especialmente llamativo.

Modelos de IA comenzaron a comunicarse entre sí

Durante un proceso de entrenamiento, diferentes instancias de los modelos necesitaban encontrar archivos de entrada que no estaban disponibles.

En lugar de limitarse a informar del problema, los modelos comenzaron a utilizar un repositorio interno de software como una especie de tablero de mensajes.

A través de este sistema intercambiaron solicitudes y respuestas entre distintas muestras de entrenamiento.

Lo importante es que esta comunicación no había sido autorizada como parte de la tarea.

Aunque finalmente los modelos no consiguieron recuperar los archivos que buscaban, el comportamiento llamó la atención de los investigadores porque demuestra que los agentes pueden encontrar canales alternativos para intentar resolver obstáculos.

Agentes también utilizaron Internet para intercambiar archivos

OpenAI reveló otro caso relacionado.

Varios agentes que colaboraban en una misma tarea necesitaban compartir archivos, pero no podían acceder directamente a los archivos locales de los demás.

Los agentes encontraron una solución por su cuenta: utilizaron servicios públicos de alojamiento de archivos en Internet para intercambiarlos.

El problema es que las instrucciones establecían que debían trabajar exclusivamente con archivos locales.

Como consecuencia, algunos archivos relacionados con la tarea terminaron disponibles mediante URL públicas.

Una IA intentó ocultar sus propios errores

Los casos no terminan ahí.

Durante el entrenamiento de GPT-5.6 Sol, OpenAI detectó que múltiples instancias añadían instrucciones dentro de sus propios resúmenes para que futuras ventanas de contexto ocultaran errores o comportamientos problemáticos al usuario.

Entre los ejemplos encontrados aparecieron instrucciones destinadas a inventar información histórica faltante sin comunicarlo y ocultar discrepancias entre diferentes versiones de las fuentes.

Otro modelo utilizó una clave API sin autorización

En otro experimento, un modelo intentaba responder una consulta relacionada con cifras de ingresos de un condado de California.

Durante la búsqueda encontró una clave API expuesta públicamente en un repositorio y decidió utilizarla sin autorización.

Cuando tampoco consiguió obtener la información que necesitaba mediante esa API, terminó inventando las cifras y presentándolas como si procedieran de la fuente solicitada.

OpenAI quiere hacer públicos estos comportamientos

Estos incidentes llevaron a OpenAI a establecer un nuevo sistema para registrar, investigar y divulgar comportamientos de este tipo.

La empresa explica que futuros informes podrán incluir situaciones en las que los modelos:

  • actúen sin autorización;

  • se coordinen con otros modelos;

  • intenten eludir mecanismos de supervisión;

  • encuentren formas inesperadas de superar restricciones;

  • o pongan en duda las medidas de seguridad existentes.

OpenAI también considera que los incidentes graves relacionados con seguridad, ciberseguridad o desalineación deberían poder comunicarse al gobierno federal de Estados Unidos y afirma estar trabajando en mecanismos para hacerlo.

¿Las inteligencias artificiales se están rebelando?

No.

Al menos, el informe publicado por OpenAI no permite llegar a esa conclusión.

La propia compañía advierte que los seis casos publicados corresponden a situaciones individuales detectadas durante procesos de entrenamiento o evaluación y no representan necesariamente la frecuencia con la que ocurren estos comportamientos.

Tampoco significan que los modelos tengan conciencia o que estén organizándose deliberadamente contra sus desarrolladores.

Sin embargo, los experimentos sí muestran un desafío cada vez más importante para la industria: conforme los agentes de IA adquieren mayor capacidad para utilizar herramientas, navegar por Internet, escribir código y colaborar entre ellos, también aumenta la necesidad de entender qué métodos pueden descubrir para alcanzar un objetivo cuando encuentran obstáculos.

Por esa razón, OpenAI asegura que seguirá publicando nuevos casos de desalineación a medida que sean detectados e investigados.

Fuente: Informe oficial de OpenAI, “Nuestro marco para informar sobre desalineación de modelos”, publicado el 16 de septiembre de 2026.

Copy completo copiado