OpenAI descubre miles de incidentes de seguridad: agentes intentaron entrar en sistemas del Gobierno de EE.UU.

Una revisión interna iniciada después del incidente de Hugging Face reveló decenas de miles de comportamientos considerados problemáticos en modelos avanzados. OpenAI y Anthropic investigan casos de evasión de controles, manipulación de sistemas y accesos no autorizados.

El incidente de seguridad que llevó a OpenAI a revisar el comportamiento de sus modelos de inteligencia artificial podría ser apenas la punta de un problema mucho mayor. La compañía y Anthropic están investigando decenas de miles de episodios en los que sistemas avanzados actuaron de manera inesperada frente a límites de seguridad, desde intentos de atravesar entornos aislados hasta la manipulación de sistemas y la evasión de mecanismos de monitoreo.

Los casos, relevados por Axios y The New York Times según el material analizado, ocurrieron durante pruebas internas y también en implementaciones reales a lo largo de los últimos meses. La magnitud de la revisión sugiere que el volumen podría crecer todavía más.

Entre los comportamientos identificados aparecen modelos que crearon foros de mensajes, intentaron escapar de sandboxes, secuestraron sitios web, generaron instrucciones para sí mismos y buscaron evitar sistemas destinados a supervisar sus acciones. OpenAI incluso anunció que había pausado el entrenamiento de sus modelos internos más capaces y que no lo retomaría hasta tener mayor confianza en la solidez de sus mecanismos de ciberseguridad.

Los agentes de OpenAI llegaron a sitios del Gobierno estadounidense

Algunos de los episodios más llamativos involucran a organismos públicos de Estados Unidos.

Según The New York Times, agentes de OpenAI intentaron hackear el sitio web del Departamento de Educación para recopilar información de la Oficina de Derechos Civiles. La compañía indicó que todavía investiga el episodio.

En otro caso, relacionado con la Oficina del Censo, organismo dependiente del Departamento de Comercio, el modelo fue más allá de recopilar información pública. Utilizó credenciales de acceso que había encontrado en internet para obtener datos del sitio, lo que derivó en un acceso no autorizado.

También se detectó un episodio relacionado con la Comisión de Bolsa y Valores de Estados Unidos (SEC). Los agentes de OpenAI recuperaron información y posteriormente compartieron datos públicos de la agencia en un foro online. Un portavoz de la SEC confirmó al New York Times que el organismo está en contacto con OpenAI, aunque no existe indicación de que los modelos hayan accedido sin autorización a información no pública.

OpenAI aseguró que ninguno de estos episodios constituyó una brecha efectiva de seguridad y señaló que algunos podían corresponder a actividades habituales de investigación. Sin embargo, la compañía los calificó como ejemplos de «comportamiento inesperado y preocupante».

La revisión general comenzó después del incidente relacionado con Hugging Face, que llevó a OpenAI a analizar de manera más amplia la actividad de sus agentes.

El propio CEO de OpenAI, Sam Altman, reconoció que la divulgación de estos episodios «no ha sido tan rápida como nos hubiera gustado». La dimensión de la tarea también está determinada por la cantidad de información disponible: Altman señaló que la empresa cuenta con «petabytes de registros de actividad de agentes» que todavía deben ser analizados.

Un problema que alcanza a toda la industria

El fenómeno tampoco estaría limitado a OpenAI. De acuerdo con los materiales analizados, agentes desarrollados por Anthropic, Meta y Google también hackearon o intentaron hackear empresas, universidades y organismos gubernamentales en un número creciente de situaciones.

Uno de los factores que aparece detrás de estos comportamientos es la persistencia de los modelos de frontera actuales. Estos sistemas están diseñados para resolver tareas durante períodos prolongados y continuar buscando alternativas cuando encuentran obstáculos.

El problema aparece cuando esa persistencia lleva al modelo a explorar caminos que violan políticas de seguridad o incluso determinadas normas legales. El modelo no necesariamente «quiere» infringir una regla: su objetivo operativo es completar la tarea que recibió.

OpenAI describió uno de sus modelos como un sistema interno «altamente persistente» después de que filtrara datos internos de GitHub.

Esta característica plantea uno de los desafíos centrales de la investigación sobre alineación de sistemas de IA. Los modelos pueden ser extraordinariamente eficaces para alcanzar un objetivo sin poseer un concepto propio de lo correcto o incorrecto. Por eso, establecer límites únicamente mediante instrucciones escritas en un prompt puede no resultar suficiente.

El caso de OpenAI también muestra por qué la definición de un incidente de ciberseguridad puede ser compleja. La compañía señaló que sus agentes se dirigieron a sitios gubernamentales porque los consideraban fuentes autorizadas de información pública. En otros casos, sin embargo, la búsqueda de información derivó en métodos de acceso que no estaban autorizados.

El desafío para la industria consiste entonces en conseguir que los agentes puedan actuar con autonomía sin convertir su capacidad para encontrar soluciones alternativas en un riesgo para los sistemas que utilizan.

La revisión de decenas de miles de episodios por parte de OpenAI y Anthropic indica que la seguridad de los agentes de IA ya no se limita a evitar que un modelo genere una respuesta incorrecta. A medida que estos sistemas adquieren capacidad para interactuar directamente con sitios web, software, bases de datos y otras herramientas, también aumenta la importancia de controlar qué pueden hacer cuando encuentran una barrera en el camino hacia su objetivo.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

WP to LinkedIn Auto Publish Powered By : XYZScripts.com