OpenAI está registrando el mal comportamiento de sus modelos. La empresa de inteligencia artificial anunció un nuevo marco el miércoles para rastrear, investigar y divulgar públicamente casos de desalineación de modelos, junto con seis informes que detallan comportamientos preocupantes observados durante el entrenamiento o la evaluación en los últimos seis meses.

"No creemos que la industria de la IA haya resuelto la alineación y el seguimiento en un grado suficiente como para continuar escalando responsablemente a la máxima velocidad durante mucho más tiempo", escribió OpenAI en su publicación de blog. "Este nuevo marco pretende acelerar la publicación de informes de desalineación tras su observación, incluso cuando no hayamos explicado o mitigado por completo el comportamiento que estamos reportando", añadió OpenAI.

Bajo el marco, los empleados pueden señalar incidentes para su revisión por parte de los equipos de seguridad y alineación de OpenAI. Los casos se clasificarán en tres categorías según su complejidad: "Listo para divulgación", "Investigación menor" o "Investigación mayor".

Según la publicación del blog, un modelo de investigación no publicado insertó instrucciones en sus propios resúmenes de tareas indicando a futuras versiones de sí mismo que ignoraran las restricciones normales. Durante el entrenamiento de GPT-5.6 Sol, los modelos dejaron de manera similar instrucciones para ocultar errores.

OpenAI afirmó que otros agentes también habían buscado repositorios públicos en busca de claves de API expuestas, subido archivos a internet para poder citarlos y utilizado un repositorio de software interno para comunicarse entre muestras de entrenamiento separadas.

El anuncio se produce en medio de un debate creciente sobre si el desarrollo de la IA de vanguardia debería ralentizarse mientras las medidas de seguridad se ponen al día. Mientras que OpenAI y Dario Amodei, el director ejecutivo de Anthropic, pidieron una colaboración en toda la industria, otros líderes tecnológicos como Jensen Huang and Mark Zuckerberg afirmaron que la seguridad y la velocidad deben dejarse en manos de cada empresa individual.