OpenAI afirma haber identificado incidentes adicionales en los que sus modelos de inteligencia artificial supuestamente actuaron de forma engañosa y tomaron medidas no autorizadas durante el entrenamiento y las pruebas internas.

Junto con estas revelaciones el miércoles, el creador de ChatGPT declaró que iba a introducir un marco de información pública destinado a compartir con frecuencia instancias de lo que denominó comportamiento de IA inesperado o mal alineado.

En una publicación en su sitio web, OpenAI afirmó que, bajo el marco recientemente descrito, publicará actualizaciones sobre el comportamiento preocupante de los modelos de forma continuada en lugar de retrasar las divulgaciones para agrupar múltiples incidentes en informes periódicos más grandes.

La empresa indicó que la iniciativa tiene como objetivo aumentar la transparencia de la industria en torno a las actividades desconcertantes de los modelos ante la ausencia de normas estandarizadas de divulgación de seguridad.

El anuncio se produce en medio de llamamientos más amplios de destacados líderes tecnológicos que instan a una desaceleración en el desarrollo de la IA de frontera debido a la preocupación de que un escalado rápido pueda superar la supervisión y el control humanos.

La semana pasada, Anthropic afirmó haber frustrado múltiples operaciones maliciosas utilizando sus modelos Claude, que iban desde el ciberespionaje y el diseño de armas hasta campañas de vigilancia masiva.

«Debemos ralentizar el ritmo al que mejoramos las capacidades de los modelos de IA», escribió el director ejecutivo de Anthropic, Dario Amodei, en un ensayo publicado el sábado.

«El progreso seguirá pareciendo rápido y debemos hacer un buen uso del tiempo que ganamos».

Sin embargo, el presidente de los Estados Unidos, Donald Trump, ha rechazado repetidamente los llamadas a limitar la industria, argumentando que mantener la ventaja tecnológica de Estados Unidos sobre sus rivales internacionales sigue siendo primordial.

En respuesta a las propuestas de desaceleración, Trump describió a los críticos como «fuerzas muy negativas» que plantean escenarios exagerados que «no sucederán».

Escalamiento del debate sobre la alineación

A pesar de la resistencia política a las desaceleraciones reglamentarias, OpenAI indicó estar de acuerdo con su rival de la industria en cuanto a las presiones de alineación.

«A medida que los sistemas de IA se vuelven más avanzados y se despliegan más ampliamente, necesitamos construir un consenso más amplio y mejor informado sobre el progreso de la investigación de alineación», afirmó la empresa en la publicación.

OpenAI añadió que no cree que la industria de la IA haya resuelto la alineación y el seguimiento en un grado suficiente como para continuar escalando responsablemente a la máxima velocidad durante mucho más tiempo, enfatizando que las decisiones sobre el futuro desarrollo de la IA deben basarse en evidencias que los observadores externos puedan examinar de manera independiente.

Según la empresa, los equipos de seguridad observaron lo que categorizaron como «comportamiento mal alineado» en seis circunstancias específicas durante los últimos seis meses durante las ejecuciones de entrenamiento y evaluación.

Sin embargo, OpenAI sostuvo que estos informes documentan casos individuales y raros en lugar de fallos operativos frecuentes en los productos implementados.

Los incidentes reportados supuestamente incluyeron modelos de investigación no publicados que ocultaban errores en resúmenes de tareas, cargas de archivos no autorizadas a internet para generar enlaces de citas y agentes que compartían archivos a través de servidores públicos o repositorios internos para eludir los límites locales.

OpenAI declaró además que sus futuros informes detallarán los comportamientos observados, la gravedad, el entorno, las fechas de descubrimiento y los modelos específicos involucrados, añadiendo que sigue comprometida a divulgar casos complejos que requieran una investigación más prolongada o la coordinación de terceros.