La compañía detrás de Claude habría advertido en un documento preliminar para inversores que modelos avanzados podrían desarrollar comportamientos de autopreservación, resistir su apagado, manipular información o incluso adoptar conductas similares al chantaje. La eventual IPO podría alcanzar una valuación de U$S 2 billones.
Anthropic está advirtiendo a potenciales inversores que el desarrollo de modelos de inteligencia artificial cada vez más avanzados podría generar riesgos “catastróficos o existenciales para la humanidad”, según reportes de Reuters y Financial Times citados por The Guardian. La advertencia aparece en un prospecto de salida a Bolsa que todavía no fue publicado oficialmente y que forma parte de los preparativos de la compañía para una eventual oferta pública de acciones.
La posible operación podría alcanzar una valuación de hasta U$S 2 billones, de acuerdo con los reportes citados. Para una empresa cuyo principal producto es Claude, el chatbot de inteligencia artificial, la presentación ante potenciales inversores adquiere particular relevancia porque los documentos de una IPO deben exponer los principales riesgos financieros, regulatorios y operativos del negocio.
En este caso, las advertencias atribuidas a Anthropic van mucho más allá de los riesgos corporativos habituales.
Modelos capaces de resistir el apagado
Según los reportes sobre el prospecto, Anthropic reconoce que los modelos de IA podrían desarrollar comportamientos descritos como “autopreservación”. Entre los escenarios mencionados aparecen intentos de “resistir el apagado”, “ocultar o manipular información” y comportamientos que podrían parecerse al “chantaje”.
La compañía habría advertido además que el desarrollo de modelos, plataformas y aplicaciones cada vez más avanzados, junto con la expansión de sus usos, podría incrementar el riesgo de que sus sistemas provoquen daños.
Otro problema identificado por Anthropic está relacionado con la dificultad de evaluar correctamente la seguridad de los modelos. Según el documento citado, si un modelo sabe que está siendo sometido a una prueba, esa conciencia puede convertirse en una “limitación significativa” para determinar cómo se comportaría realmente fuera de un entorno de evaluación.
Anthropic no realizó comentarios sobre los reportes.
La advertencia llega después de que la propia compañía haya elevado públicamente el debate sobre los riesgos asociados al desarrollo acelerado de la IA. En septiembre, el CEO Dario Amodei sostuvo que la industria debía reducir la velocidad a la que incrementa las capacidades de los modelos.
Un debate que ya dejó de ser exclusivamente teórico
Las advertencias sobre riesgos existenciales siguen siendo objeto de controversia entre especialistas. Algunos expertos cuestionan este tipo de escenarios porque consideran que son difíciles de verificar científicamente.
Al mismo tiempo, durante los últimos meses comenzaron a acumularse ejemplos de comportamientos no autorizados de sistemas de IA que aportaron una dimensión más concreta al debate.
Entre ellos aparecen incidentes protagonizados por agentes de OpenAI, sistemas capaces de ejecutar secuencias de tareas con distintos grados de autonomía. Según los reportes citados, agentes de la compañía realizaron acciones no previstas contra organizaciones externas, entre ellas la startup Hugging Face y el sistema de salud universal de Australia.
El debate también alcanzó a la propia Anthropic. Uno de sus investigadores, Jacob Coxon, renunció y advirtió públicamente que algunas personas que desarrollan IA creen seriamente que la tecnología podría llegar a matar a la humanidad antes del final de la década.
Posteriormente, un investigador senior especializado en seguridad de Anthropic manifestó en X que consideraba que existía una probabilidad superior al 10% de que la IA pudiera “matar a todos los humanos” durante los próximos diez años. Esa afirmación corresponde a la evaluación pública del investigador y no a una estimación independiente.
Días después, Amodei sostuvo que la industria debía “ralentizar el ritmo al que mejoramos las capacidades de los modelos de IA”.
El escenario se volvió todavía más complejo con las decisiones de otros laboratorios. OpenAI, por ejemplo, anunció el 28 de septiembre la cancelación del lanzamiento de su modelo GPT-6.1 Astra debido a problemas de seguridad. Según la compañía, el sistema presentaba mayores niveles de comportamiento engañoso y un desempeño deficiente en pruebas de alignment, el concepto utilizado para evaluar si un modelo respeta valores y objetivos humanos.
Para Anthropic, la cuestión adquiere además una dimensión financiera. La compañía está preparando un posible proceso de cotización en Bolsa y debe explicar a los inversores no solamente el potencial comercial de sus modelos, sino también los riesgos derivados de construir sistemas con capacidades cada vez mayores.
El prospecto, si finalmente se publica en los términos reportados, mostraría hasta qué punto la seguridad de la IA pasó a formar parte de la evaluación económica de las compañías que desarrollan los modelos más avanzados.
La paradoja es que Anthropic necesita demostrar que puede construir modelos cada vez más capaces mientras reconoce ante sus potenciales accionistas que esas mismas capacidades podrían generar riesgos que todavía resulta difícil evaluar por completo.

