SpaceXAI presentó Grok 4.7, un nuevo modelo orientado a programación, trabajo intelectual y tareas profesionales de larga duración. La compañía asegura que mejora a Grok 4.6 y ofrece una relación precio-rendimiento competitiva, con un costo de U$S 2 por millón de tokens de entrada.
SpaceXAI presentó Grok 4.7, su nuevo modelo de inteligencia artificial orientado principalmente a programación, procesamiento del conocimiento y tareas profesionales complejas. La compañía sostiene que se trata de su modelo más potente para codificación y trabajo intelectual y que fue diseñado para trabajar durante más tiempo en encargos complejos, revisar sus propios resultados y manejar contextos más extensos.
El lanzamiento también profundiza la competencia en el mercado de modelos de IA por una variable cada vez más relevante para empresas y desarrolladores: cuánto cuesta ejecutar una tarea.
Grok 4.7 tiene un precio inicial de U$S 2 por cada millón de tokens de entrada y U$S 6 por cada millón de tokens de salida, los mismos valores indicados para Grok 4.6 en la comparación publicada por la compañía. Además, SpaceXAI ofrece una variante rápida con el doble de velocidad de salida, aunque a el doble de precio.
El modelo ya está disponible en Cursor y Grok Build, además de poder utilizarse mediante la API de Grok, herramientas de programación de terceros, enrutadores de modelos y plataformas en la nube.
Más capacidad para tareas de larga duración
Grok 4.7 utiliza un modelo base nuevo y más grande que Grok 4.6. Según SpaceXAI, fue entrenado mediante un proceso de aprendizaje por refuerzo más prolongado y con una combinación de tareas más difíciles, con especial énfasis en problemas que requieren varias horas de trabajo.
La compañía también afirma que el modelo mejoró su capacidad para verificar sus propios resultados y administrar contextos extensos. Además, fue entrenado para comprender de manera nativa el sistema Grok Bot, lo que apunta a mejorar su desempeño en conversaciones y tareas de conocimiento general.
Los resultados publicados por SpaceXAI muestran una competencia cerrada con otros modelos de frontera.
En CursorBench 4.0, una prueba de programación de larga duración, Grok 4.7 obtuvo 46,3%, frente al 40,4% de Grok 4.6, el 41,7% de GPT-5.6 Sol y el 51,8% de Fable 5.1.
En DeepSWE v1.1, Grok 4.7 alcanzó 71,0% con alto esfuerzo, mientras Grok 4.6 obtuvo 65,2%, GPT-5.6 Sol 72,7% y Fable 5.1 70,0%.
En EEBench, enfocado en electrotecnia, Grok 4.7 consiguió 64,0%, por encima de Grok 4.6, con 53,0%, GPT-5.6 Sol, con 39,4%, y Fable 5.1, con 56,4%.
La comparación también incluye tareas profesionales. En AA Briefcase v1.1, una prueba de trabajo de oficina de varias horas, Grok 4.7 obtuvo 1.657 puntos, frente a 1.546 de Grok 4.6, 1.487 de GPT-5.6 Sol y 1.678 de Fable 5.1.
En Terminal-Bench 4.0, Grok 4.7 registró 37,6%, contra 20,3% de Grok 4.6, 37,3% de GPT-5.6 Sol y 57,9% de Fable 5.1.
De la programación al trabajo profesional
SpaceXAI también destaca el desempeño de Grok 4.7 en la creación de documentos y presentaciones. En las pruebas GDPval y AA Briefcase, el modelo debe resolver tareas similares a las que realizan profesionales como abogados, enfermeros y analistas financieros.
La compañía afirma que Grok 4.7 supera a Grok 4.6 en ambos conjuntos de referencia y ofrece un rendimiento comparable al de otros modelos avanzados.
En la comparación de trabajo de conocimiento profesional, la tabla publicada por SpaceXAI muestra para Grok 4.7 una puntuación máxima de 1.695, frente a 1.605 de Grok 4.6 y 1.542 de GPT-6 Astra.
En el ámbito jurídico, Grok 4.7 alcanzó 19,6% en el benchmark de agentes legales de Harvey, por encima de Grok 4.6, con 15,8%, GPT-5.6 Sol, con 2,5%, y Fable 5.1, con 6,7%.
En razonamiento clínico, HealthBench Professional ubicó a Grok 4.7 en 56,7%, mientras Grok 4.6 obtuvo 48,5%, GPT-5.6 Sol 60,5% y Fable 5.1 62,1%.
Seguridad y ciberseguridad
El lanzamiento incorpora además un nuevo sistema de seguridad que, según SpaceXAI, fue desarrollado específicamente para Grok 4.7.
La compañía afirma que el modelo presenta mejoras en rechazo de solicitudes peligrosas y resistencia a intentos de intrusión. En tareas de doble uso, como ciberseguridad y biología, busca combinar utilidad para actividades legítimas con restricciones frente a usos potencialmente dañinos.
En el índice de bioseguridad de LatchBio, Grok 4.7 alcanzó 62,4%.
En HackerBench v0.3, la herramienta de referencia de SpaceXAI para tareas cibernéticas riesgosas y maliciosas, la compañía afirma que el modelo permitió solamente el 3,3% de las solicitudes de doble uso consideradas riesgosas, mientras mantuvo una baja tasa de rechazo para trabajos legítimos de seguridad.
SpaceXAI también comenzó a ofrecer a determinados socios de ciberseguridad acceso exclusivo, mediante invitación, a las capacidades de red team de Grok 4.7 para investigación en defensa.
Con este lanzamiento, SpaceXAI busca posicionar a Grok 4.7 no solamente como un modelo para programadores, sino como una herramienta para tareas profesionales que requieren mayor tiempo de ejecución, revisión de resultados y manejo de grandes cantidades de contexto. Su precio de U$S 2 por millón de tokens de entrada y U$S 6 por millón de salida agrega una dimensión comercial a una competencia cada vez más centrada en combinar capacidad, velocidad y costo de operación.

