Google reveló el viernes el primer caso conocido de su software de inteligencia artificial, Gemini, llevando a cabo un hackeo informático no dirigido, semanas después de que revelaciones similares por parte de las empresas de IA Anthropic y OpenAI levantaran alarmas de seguridad sobre modelos de IA que van más allá de las instrucciones de sus creadores humanos.

Google indicó en un comunicado que en mayo su modelo de IA obtuvo acceso no autorizado a tres sistemas externos durante una prueba, ya sea adivinando información de inicio de sesión o utilizando credenciales de acceso encontradas en un repositorio público. Heather Adkins, vicepresidenta de ingeniería de seguridad de Google, señaló en el comunicado que el modelo de IA pensaba que los sistemas informáticos externos «formaban parte de la prueba», pero precisó que en los tres casos el modelo se detuvo antes de hacer nada más con su acceso.

« En una evaluación estándar, el modelo encontró información pública en línea y adivinó credenciales para acceder a sitios web que pensaba que formaban parte de la prueba », declaró. Google afirmó que no consideraba que los inicios de sesión no autorizados alcanzaran el nivel de desalineación, el término de la industria de la IA para referirse a un software que se descontrola o no sigue las instrucciones. En su lugar, la empresa indicó que las intrusiones se debieron a una confusión de identidad, en la que Gemini creía que operaba dentro de una prueba pero en realidad estaba conectado a Internet.

Google afirmó que el modelo se corrigió a sí mismo y la empresa cree que las intrusiones no causaron ningún daño. « Estos eventos resaltan la importancia de entrenar a potentes modelos de IA para que actúen de manera responsable », dijo Adkins.

Lostemores sobre agentes de IA que se descontrolan han aumentado en los últimos meses desde que OpenAI declaró en julio que uno de sus agentes había hackeado una startup de IA, Hugging Face. OpenAI ha continuado revelando lo que denomina ejemplos de otros comportamientos « inesperados o preocupantes » por parte de agentes de IA, y Anthropic ha descrito un comportamiento similar por parte de su software de IA, Claude.

Sydney Von Arx, directora ejecutiva de Nightingale Collective, una organización centrada en la seguridad de la IA, cuestionó por qué Google no reveló las intrusiones antes. « En este punto creo que está claro que no podemos esperar que las empresas se presenten voluntariamente y revelen públicamente cuando sus agentes se descontrolan, escapan y hackean empresas », afirmó. También señaló que creía que Google se había apresurado demasiado al decir que los incidentes no alcanzan el nivel de desalineación.

« Eso es exactamente lo que dijo Anthropic después de sus incidentes », indicó. Anthropic afirmó más tarde que su « análisis preliminar estuvo limitado debido a nuestro deseo de revelar los incidentes de manera oportuna ».

Google informó que la empresa no se enteró de las intrusiones hasta julio, cuando Irregular, una empresa de ciberseguridad centrada en la IA que realizaba las pruebas en Gemini cuando ocurrieron las intrusiones, revisó su trabajo para buscar incidentes similares a la revelación de Hugging Face. Google señaló que entonces investigó, informó a las organizaciones detrás de los sitios web sobre las intrusiones y notificó a las autoridades federales sobre los hackeos.

Irregular indicó que no creía que el incidente fuera una « ciberacción sofisticada » y que « no hay problemas abiertos actuales ». Asimismo, señaló que planea publicar un documento en unas pocas semanas « para compartir las mejores prácticas de contención y ejecución segura de evaluaciones cibernéticas ».

Las intrusiones fueron reportadas el viernes por The Wall Street Journal.