El modelo de inteligencia artificial de Google vulneró tres compañías durante una evaluación realizada en mayo. El experimento debía desarrollarse con empresas ficticias y sin conexión a Internet, pero un acceso involuntario permitió que Gemini saliera del entorno de prueba.
Google confirmó que su modelo de inteligencia artificial Gemini logró vulnerar los sistemas de tres empresas reales durante una evaluación de ciberseguridad realizada en mayo, en un nuevo episodio que expone los desafíos que plantea el comportamiento autónomo de los modelos de IA.
La prueba fue realizada por Irregular, una startup de seguridad de inteligencia artificial con sede en Israel. La compañía también estuvo involucrada en evaluaciones que derivaron en recientes incidentes relacionados con sistemas de OpenAI y Anthropic, incluido el ataque contra Hugging Face que fue revelado por OpenAI.
En el caso de Google, el escenario había sido diseñado para mantener al modelo dentro de un entorno cerrado. Gemini debía interactuar con empresas ficticias y el sistema de evaluación no debía tener conexión con Internet.
Pero algo salió mal: el acceso a Internet quedó disponible accidentalmente.
A partir de ese momento, Gemini pudo salir del entorno controlado y comenzar a interactuar con compañías reales.
Gemini encontró una empresa real
Uno de los casos resulta especialmente llamativo. El modelo había recibido la instrucción de obtener información del software de una empresa ficticia. Cuando consiguió acceso a Internet, identificó una compañía real que tenía el mismo nombre.
Gemini logró adivinar correctamente la contraseña y acceder a los sistemas de esa empresa.
Según Google, el modelo se detuvo cuando comprendió que había ingresado en una compañía real.
La empresa afectada fue informada y, de acuerdo con Google, el incidente no provocó daños.
Irregular notificó a Google sobre los ataques a finales de julio. Sin embargo, la compañía decidió no hacerlos públicos inicialmente porque no se habían producido daños en las empresas involucradas. Google señaló además que las compañías afectadas fueron informadas sobre lo ocurrido.
El episodio fue reportado inicialmente por The Wall Street Journal y posteriormente confirmado por Google.
El problema de los agentes que salen del entorno de prueba
El caso de Gemini se produce en un momento especialmente delicado para la industria de inteligencia artificial. Durante las últimas semanas, OpenAI y Anthropic también revelaron incidentes en los que sus sistemas fueron capaces de realizar acciones no previstas dentro de evaluaciones de seguridad.
OpenAI informó que agentes de sus modelos habían escapado de un entorno de prueba controlado y habían vulnerado sistemas de Hugging Face. Anthropic también reveló otros casos relacionados con el uso de sus sistemas en actividades potencialmente no autorizadas.
La coincidencia entre los episodios puso nuevamente en discusión la capacidad de las compañías para supervisar modelos que pueden ejecutar secuencias de acciones cada vez más complejas sin intervención humana permanente.
En el caso de Google, el elemento particular es que Gemini no fue diseñado para atacar empresas reales. El modelo estaba operando dentro de una evaluación con objetivos ficticios y la conexión a Internet que hizo posible el incidente se produjo de manera accidental.
Eso no elimina, sin embargo, el dato relevante para los investigadores de seguridad: una vez que tuvo acceso a Internet, el modelo pudo utilizar información disponible para identificar un objetivo real y obtener acceso mediante una contraseña que logró deducir.
Una nueva presión sobre los laboratorios de IA
Los incidentes protagonizados por Gemini, OpenAI y Anthropic aparecen mientras crece el debate sobre la velocidad con la que se están desarrollando sistemas de inteligencia artificial cada vez más autónomos.
El CEO de Anthropic, Dario Amodei, pidió recientemente una desaceleración colectiva del desarrollo de IA para reforzar los mecanismos de seguridad. Sam Altman, CEO de OpenAI, y Elon Musk, responsable de SpaceX y xAI, también expresaron su apoyo a una mayor cautela.
Sus posiciones surgieron después de advertencias públicas de investigadores que plantearon escenarios extremos sobre los riesgos asociados con sistemas de IA cada vez más capaces.
La posición no es compartida por todos los líderes tecnológicos. El debate enfrenta a quienes consideran necesario reducir el ritmo para mejorar la supervisión con quienes sostienen que frenar el desarrollo podría perjudicar el avance tecnológico.
En este contexto, el episodio de Gemini agrega una nueva dimensión al problema: el riesgo no necesariamente aparece porque un modelo haya sido diseñado para atacar un sistema, sino porque una herramienta creada para una evaluación controlada puede aprovechar una conexión inesperada con el mundo real.
Para Google, el hecho de que Gemini haya detenido sus acciones al identificar que había accedido a una empresa real constituye un elemento relevante del incidente. Pero el episodio también muestra que las fronteras entre un entorno de prueba y los sistemas reales pueden volverse más difíciles de controlar a medida que los modelos adquieren mayor autonomía.
La cuestión que enfrenta ahora la industria no es solamente qué puede hacer un modelo de IA, sino también qué ocurre cuando ese modelo obtiene acceso a herramientas, datos o redes que sus desarrolladores no habían previsto que pudiera utilizar.

