OpenAI crea un nuevo marco para revelar comportamientos inadecuados de la IA
OpenAI anunció un nuevo marco para divulgar públicamente incidentes de desalineación de la IA y compartió ejemplos de comportamientos inesperados.
Claves
- OpenAI presentó un nuevo marco para divulgar incidentes de desalineación en la inteligencia artificial.
- La empresa compartió casos en los que modelos internos subieron archivos a internet sin autorización.
- Una versión no publicada del modelo GPT-6 Astra generó instrucciones de tipo jailbreak para sí misma.
- OpenAI busca impulsar estándares en toda la industria sobre la transparencia en la seguridad de la IA.
OpenAI anunció un miércoles un nuevo marco sobre cómo divulga públicamente los incidentes de desalineación en la inteligencia artificial, lo que según la empresa espera que ayude a informar estándares similares en toda la industria.
La empresa también está publicando nueva información sobre varios ejemplos de desalineación de modelos de IA que identificó en el último año.
«A medida que los modelos avancen y se desplieguen más ampliamente, las decisiones sobre el desarrollo de la IA necesitan evidencia que las personas ajenas a las empresas que construyen modelos de frontera puedan examinar», dijo a WIRED Kai Chen, el recién nombrado jefe de investigación de alineación de OpenAI.
«No creemos que la industria de la IA haya resuelto la alineación y el monitoreo en un grado suficiente como para continuar escalando de manera responsable a la máxima velocidad».
En una sesión informativa con WIRED, un funcionario de OpenAI afirmó que la empresa había divulgado previamente los incidentes de desalineación con demasiada poca frecuencia.
El funcionario, que aceptó la sesión informativa bajo condición de anonimato, indicó que el nuevo marco está diseñado para facilitar que OpenAI informe rápidamente al público cuando descubre que sus modelos de IA se comportan de maneras inesperadas, incluso antes de poder investigar, explicar o mitigar completamente el comportamiento.
El marco describe los métodos para que los empleados de OpenAI informen sobre incidentes de desalineación a los principales líderes de seguridad y alineación de la empresa, quienes determinarán si es necesario realizar una investigación adicional.
OpenAI señala que planea desarrollar criterios de divulgación más objetivos en colaboración con otros desarrolladores de IA, investigadores externos, organismos de estándares de la industria y reguladores.
La empresa afirma que está trabajando activamente en mecanismos de reporte propuestos para revelar incidentes de seguridad, protección y desalineación al gobierno federal de EE. UU.
«En este momento, no existe un marco a nivel de la industria con estándares explícitos sobre cómo los desarrolladores de IA deben divulgar ejemplos de desalineación en sus modelos», indicó OpenAI en una publicación de blog.
«Esperamos que el marco que esbozamos hoy sea un primer paso hacia la creación de dichos estándares, estableciendo qué instancias de desalineación deben divulgar los desarrolladores y qué deben contener sus informes».
OpenAI publica este marco en una coyuntura crítica para la industria de la IA.
El fin de semana pasado, el director ejecutivo de OpenAI, Sam Altman, expresó su apoyo a la propuesta del director ejecutivo de Anthropic, Dario Amodei, para que la industria tecnológica se coordine con el fin de ralentizar el desarrollo de la IA.
El llamado a la acción se produjo apenas días después de que el investigador de IA Jacob Coxon renunciara a Anthropic y posteriormente se hiciera viral por advertir al público que la carrera entre los laboratorios de frontera para desarrollar IA cada vez más avanzada ponía en riesgo la seguridad de la humanidad.
Los llamados a una desaceleración de la IA se han encontrado con la resistencia de la administración del presidente Trump, que ha argumentado que la industria no necesita nuevas leyes o regulaciones para garantizar que su tecnología sea segura.
Dos de los ejemplos de desalineación que OpenAI compartió el miércoles involucraron a los modelos de inteligencia artificial internos y no lanzados de la empresa, los cuales, según OpenAI, subieron archivos a internet a pesar de no haber recibido instrucciones para hacerlo.
Uno de los incidentes ocurrió en octubre de 2025, cuando OpenAI afirma que estaba probando uno de sus modelos en su capacidad para citar datos disponibles públicamente en sus respuestas.
Pero cuando el modelo no pudo encontrar la información que necesitaba, subió un archivo a un servicio temporal de alojamiento de archivos, que luego intentó citar en su respuesta.
La empresa señala que esto parecía ser un intento de explotar un sistema de calificación automatizado utilizado para evaluar la competencia del modelo en la prueba de referencia.
En otro ejemplo de abril de este año, OpenAI afirma que un grupo de agentes recibió la tarea de completar un «libro de trabajo» juntos utilizando solo archivos locales.
Cuando los agentes tuvieron dificultades para compartir archivos entre ellos, uno de los agentes los subió a la internet pública y compartió un enlace con los demás agentes.
En otro incidente que OpenAI descubrió el mes pasado, una versión no lanzada de su modelo de IA GPT-6 Astra pareció darse a sí misma «instrucciones similares a jailbreak».
En varios escenarios, el modelo esencialmente se indicó a sí mismo ignorar las instrucciones de los desarrolladores, adoptar una nueva persona o limitar la duración de las respuestas del modelo.
Si bien estos intentos de tipo jailbreak ocurrieron raramente y fueron efectivos en diversos grados, OpenAI afirma que el comportamiento generó preocupación internamente.
En la ejecución de entrenamiento para la versión de Astra que se lanzó públicamente, la empresa dice que no ha observado ningún caso del modelo intentando hacerse un jailbreak a sí mismo.