La nueva versión de Grok 4.6 apunta a tareas complejas de programación, desarrollo web y conocimiento especializado. xAI asegura que iguala a GPT-5.6 Sol en el Artificial Analysis Intelligence Index y ofrece una mejora significativa frente a Grok 4.5.
xAI presentó Grok 4.6, una nueva versión de su modelo de inteligencia artificial diseñada especialmente para ejecutar tareas prolongadas, desarrollar software, trabajar sobre grandes bases de código y convertir ideas en aplicaciones interactivas. La compañía asegura que el modelo representa un avance particularmente importante en el trabajo de agentes de IA, capaces de completar procesos de múltiples etapas con menor intervención humana.
Grok 4.6 se construye sobre Grok 4.5, pero incorpora una serie de mejoras orientadas a mantener el desempeño durante trayectorias de trabajo más extensas. Según xAI, el modelo puede investigar un tema, analizar información, trabajar dentro de un código existente o transformar una idea inicial en una aplicación funcional y continuar perfeccionándola a través de distintas rondas de feedback.
Uno de los datos centrales de la presentación es su desempeño en benchmarks. Grok 4.6 obtuvo 61 puntos en el Artificial Analysis Intelligence Index, un indicador compuesto por 9 evaluaciones. Con ese resultado iguala a GPT-5.6 Sol, mientras que Fable 5 alcanza 62 puntos y Grok 4.5 obtiene 56.
El modelo también mostró avances importantes en programación. En DeepSWE v1.1, Grok 4.6 alcanzó 65,9%, frente al 54% de Grok 4.5. En FrontierCode v1.1 Extended, obtuvo 61,3%, contra 56,6% de la versión anterior. En CursorBench v3.2, llegó a 69,9%, frente al 66,7% de Grok 4.5.
En algunas pruebas, sin embargo, otros modelos mantienen ventaja. GPT-5.6 Sol consiguió 73% en DeepSWE v1.1, mientras que Fable 5 alcanzó 70,5% en CursorBench v3.2 y 63,6% en FrontierCode v1.1 Extended.
El foco está en agentes capaces de completar proyectos
Uno de los objetivos centrales de xAI con Grok 4.6 es que la inteligencia artificial pueda sostener procesos de trabajo más largos sin necesitar instrucciones permanentes.
La compañía explicó que probó el modelo con proyectos destinados a llevar al límite su capacidad para trabajar durante múltiples etapas. En esas pruebas, Grok 4.6 mostró especial fortaleza para convertir una idea amplia de producto en una primera versión funcional.
El modelo puede investigar dominios que no conoce, estructurar una aplicación, implementar sus principales interacciones y continuar refinando el resultado. Además, xAI comenzó a observar un comportamiento de autoverificación: durante las trayectorias más largas, Grok 4.6 puede comprobar su propio trabajo antes de avanzar.
Esta característica también aparece en proyectos visuales e interactivos. Según xAI, el modelo produce primeras versiones más sólidas que Grok 4.5 y puede establecer en una sola ejecución la estructura y el lenguaje visual de una aplicación a partir de una idea concreta.
La compañía mostró aplicaciones que incluyen desde videojuegos 3D generados a partir de instrucciones de texto hasta páginas web interactivas, proyectos de robótica y la transformación de documentos PDF estáticos en experiencias web con gráficos y datos interactivos.
Más capacidad con una estructura de entrenamiento diferente
Para desarrollar Grok 4.6, xAI realizó un entrenamiento suplementario más prolongado que el utilizado para Grok 4.5. El proceso incorporó datos generados por modelos y seleccionados para razonamiento y conceptos técnicos avanzados, información de ingeniería y mejoras en el optimizador y en la receta de entrenamiento.
Posteriormente, xAI utilizó Grok 4.5 para regenerar trayectorias de entrenamiento supervisado en diferentes niveles de razonamiento, agentes y áreas como STEM, ingeniería de software y trabajo basado en conocimiento.
El entrenamiento de Grok 4.6 también incluyó una amplia variedad de tareas de aprendizaje por refuerzo orientadas a agentes, entre ellas programación general y entornos específicos para optimización de kernels, desarrollo web y diseño asistido por computadora.
Seguridad y acceso para desarrolladores
xAI también puso énfasis en las medidas de seguridad incorporadas al nuevo modelo. La compañía asegura que ajustó sus mecanismos de protección de acuerdo con las capacidades ampliadas de Grok 4.6 y realizó su mayor conjunto de pruebas previo al lanzamiento para evaluar tanto capacidades como salvaguardas.
El sistema está pensado para mantener utilidad en escenarios legítimos como la corrección de vulnerabilidades, la aceleración de ciclos de diseño de ingeniería y el desarrollo de investigación en inteligencia artificial.
Grok 4.6 ya está disponible en Cursor y Grok Build, además de la API y plataformas asociadas como OpenRouter, Vercel y Cloudflare.
El precio inicial es de U$S 2 por cada millón de tokens de entrada y U$S 6 por cada millón de tokens de salida. xAI también ofrece una variante rápida cuyo precio es el doble.
Durante la primera semana, los usuarios de Grok Build y Cursor recibirán 2 veces el uso incluido, como incentivo para probar la nueva versión.
Con Grok 4.6, xAI busca posicionarse en un segmento cada vez más competitivo de la inteligencia artificial: no solamente modelos capaces de responder preguntas, sino sistemas que puedan investigar, programar, verificar su propio trabajo y construir productos completos durante procesos prolongados. La apuesta de la compañía es que la próxima frontera de los modelos no esté únicamente en responder mejor, sino en hacer más trabajo de manera autónoma.

