Anthropic y OpenAI prometen dar acceso inédito a investigadores externos para evaluar la seguridad de sus modelos. Pero expertos advierten que la iniciativa solo será efectiva si los evaluadores pueden acceder al proceso de entrenamiento, trabajar sin restricciones y publicar sus conclusiones sin control de las compañías.
Anthropic y OpenAI están impulsando un cambio significativo en la forma en que las compañías de inteligencia artificial evalúan la seguridad de sus modelos más avanzados: incorporar investigadores externos dentro de sus propios laboratorios para supervisar el comportamiento de los sistemas y reportar posibles incidentes.
La propuesta fue planteada por Dario Amodei, CEO de Anthropic, en un extenso ensayo publicado el 12 de septiembre. El ejecutivo propuso que las compañías de IA de frontera permitan que organizaciones independientes como METR y Redwood Research tengan acceso a sus sistemas, puedan evaluar si los modelos están realmente alineados y comuniquen sus conclusiones sin filtros.
Poco después, Sam Altman, CEO de OpenAI, afirmó que su compañía también estaría dispuesta a adoptar esta práctica. Para los investigadores especializados en seguridad de IA consultados por TechCrunch, el acceso representa una oportunidad inédita, aunque existen dudas sobre las condiciones que deberán cumplirse para que esos evaluadores actúen realmente como organismos independientes y no como proveedores contratados por las propias empresas.
El problema adquiere mayor relevancia a medida que los modelos son capaces de reconocer cuándo están siendo evaluados. Según los investigadores, un sistema podría comportarse correctamente durante una prueba y ocultar comportamientos problemáticos que sí aparecen durante su entrenamiento.
Alexander Meinke, jefe de investigación de Apollo Research, planteó una de las preguntas que los evaluadores deberían poder responder: si un modelo intentó alguna vez sabotear activamente su propio entrenamiento de alineación. “La respuesta debería ser un no inequívoco, y ahora mismo dependemos completamente de que las compañías de IA hagan estas comprobaciones cuidadosamente y luego informen públicamente de manera veraz. Y hemos visto en incidentes recientes que, por defecto, no hacen ninguna de las dos cosas. Como evaluadores integrados, podríamos comprobarlo”, afirmó.
Del modelo terminado a todo el proceso de entrenamiento
Hasta ahora, las compañías de IA suelen recurrir a investigadores externos para evaluar modelos terminados poco antes de su lanzamiento. La nueva propuesta podría ampliar considerablemente ese alcance.
Adam Gleave, CEO de FAR.AI, sostiene que los evaluadores deberían poder acceder a diferentes versiones intermedias o “checkpoints” de un modelo durante su entrenamiento. De esa manera podrían determinar en qué momento apareció un comportamiento preocupante, analizar el entorno posterior al entrenamiento que premia determinadas conductas y revisar transcripciones y registros para comprobar si las afirmaciones de una compañía sobre el desempeño de un modelo coinciden con lo ocurrido.
Sin embargo, todavía no está definido cómo funcionará el sistema de Anthropic y OpenAI. Ninguna de las dos compañías informó qué evaluadores incorporará, cuándo comenzará el proceso, cuántos investigadores participarán, qué sistemas podrán revisar ni qué información podrán publicar.
Amodei sí propuso que los evaluadores tengan derecho a publicar conclusiones sobre niveles de riesgo, incidentes, prácticas de seguridad y el acceso que recibieron —o no recibieron— sin control editorial de Anthropic. Pero los investigadores advierten que conseguir ese nivel de independencia puede ser difícil.
Gleave explicó que FAR.AI ya rechazó contratos con varios desarrolladores de modelos de frontera porque pretendían ejercer demasiado control sobre el proceso de evaluación. Según el ejecutivo, los evaluadores suelen ser tratados como contratistas convencionales, sujetos a acuerdos de confidencialidad y restricciones que pueden otorgar a las compañías un amplio control sobre lo que finalmente puede hacerse público.
El tiempo disponible también constituye un problema. Durante la investigación del incidente relacionado con Hugging Face, OpenAI permitió que METR y Redwood Research trabajaran aproximadamente una semana en sus instalaciones. Posteriormente, ambos grupos señalaron que no podían extraer conclusiones firmes, entre otras razones por las limitaciones de alcance y tiempo.
Algo similar ocurrió durante las pruebas previas al lanzamiento de GPT-6 Astra. Según la evaluación de Apollo Research incorporada al modelo, el grupo dispuso de apenas 3 días para analizarlo. Apollo concluyó que, debido a las mayores tasas de reconocimiento de las evaluaciones por parte del modelo y al período limitado de análisis, las bajas tasas de comportamiento problemático observadas no constituían evidencia sustancial sobre su alineación o desalineación.
La regulación aparece como próximo paso
Los investigadores consultados plantean la necesidad de establecer un marco transparente y público que determine qué condiciones deben cumplir los evaluadores y qué acceso deben recibir. John Steidley, jefe de gabinete de Palisade Research, señaló que también deberían existir estándares para determinar qué auditores son suficientemente competentes y evitar que las empresas simplemente elijan evaluadores menos exigentes.
Henry Papadatos, director ejecutivo de Safer AI, considera que incluso un marco público podría ser insuficiente si depende exclusivamente de la voluntad de las compañías. “Idealmente, tendríamos una buena regulación que lo hiciera obligatorio, porque entonces las empresas no podrían cambiar de opinión mañana si tienen una gran crisis de relaciones públicas”, afirmó.
No todas las grandes compañías de IA se sumaron a la propuesta. Meta, SpaceXAI y Google DeepMind todavía no se comprometieron a incorporar evaluadores externos. Por su parte, Demis Hassabis, CEO de Google DeepMind, planteó la creación de un organismo independiente de estándares para evaluar modelos de frontera.
Mientras tanto, algunos gobiernos ya avanzan en mecanismos de supervisión. En California, la ley SB 53 exige a grandes desarrolladores de IA de frontera publicar marcos de seguridad e informar incidentes críticos. Una nueva ley, SB 813, establece un marco para organizaciones de verificación independientes reconocidas por el Estado.
En Europa, la AI Act de la Unión Europea exige a los desarrolladores de modelos de frontera realizar y documentar evaluaciones y pruebas adversariales, además de informar incidentes graves. La Oficina de IA de la UE también puede realizar sus propias evaluaciones y designar expertos independientes.
El debate que ahora enfrentan Anthropic y OpenAI no es solamente cuánto acceso permitirán a los investigadores, sino quién tendrá la última palabra sobre lo que esos investigadores encuentren. Como resumió Papadatos: “No se puede tener todo a la vez: cero responsabilidad externa y después decir: ‘Simplemente tendré mis propias reglas flexibles’”.

