Meta Superintelligence Labs lanzó Muse Glimmer con pesos abiertos bajo licencia Apache 2.0. El modelo está diseñado para ejecutar agentes de IA directamente en computadoras personales, sin depender de la nube, y puede funcionar con una única GPU de consumo.
Meta avanza en una de las tendencias que puede modificar la arquitectura del mercado de inteligencia artificial: llevar los agentes desde la nube directamente a los dispositivos de los usuarios. Meta Superintelligence Labs presentó Muse Glimmer, un modelo de IA de 30.000 millones de parámetros diseñado específicamente para ejecutar tareas agenticas de manera local.
La compañía liberó los pesos del modelo bajo una licencia abierta Apache 2.0 y los puso a disposición de desarrolladores a través de Hugging Face. Según Meta, Muse Glimmer es lo suficientemente compacto como para funcionar en una Mac o PC equipada con una única GPU de consumo.
El objetivo es que los desarrolladores puedan construir agentes capaces de ejecutar tareas como gestionar una agenda, redactar mensajes, organizar archivos, programar o utilizar herramientas sin que toda la información tenga que salir del dispositivo hacia una infraestructura en la nube.
Un modelo pensado para funcionar sin conexión
Meta sostiene que la mayoría de los despliegues actuales de modelos de IA todavía dependen de infraestructura cloud y acceso a Internet. Muse Glimmer busca llevar parte de esas capacidades al hardware local.
El modelo fue optimizado para flujos de trabajo de agentes que permanecen activos y necesitan combinar varias capacidades: ejecución durante períodos prolongados, uso preciso de herramientas, comprensión multimodal, memoria de contexto extensa y seguimiento de instrucciones.
Para conseguirlo, Meta utilizó una arquitectura compacta y una técnica de destilación que transfiere capacidades de razonamiento agentico desde un modelo docente de mayor tamaño. El entrenamiento se dividió en tres etapas: preentrenamiento, entrenamiento intermedio y postentrenamiento, con técnicas que incluyen aprendizaje supervisado, destilación y reinforcement learning.
Muse Glimmer fue evaluado además bajo los criterios del Advanced AI Scaling Framework de Meta antes de su lanzamiento como modelo de pesos abiertos.
30.000 millones de parámetros y menos de 20 GB
Uno de los principales desafíos para ejecutar modelos de gran tamaño en dispositivos personales es la memoria necesaria.
Meta señala que un modelo de 30.000 millones de parámetros funcionando a precisión completa requeriría más de 55 GB de memoria, una cantidad que excede la capacidad disponible en la mayoría de las GPU de consumo.
Para resolverlo, la compañía aplicó técnicas de cuantización que reducen los pesos a aproximadamente 4 bits, llevando el tamaño del modelo a menos de 20 GB. De esta manera, queda espacio suficiente para la memoria de trabajo, el codificador utilizado para comprender imágenes y otros componentes necesarios para ejecutar el modelo.
Meta afirma haber validado que esta compresión genera una degradación mínima o nula en las tareas agenticas evaluadas.
La compañía también incorporó speculative decoding, una técnica que utiliza un modelo auxiliar para proponer bloques completos de tokens que luego son verificados en paralelo por el modelo principal. El objetivo es acelerar la generación de respuestas sin modificar su calidad.
Las pruebas de rendimiento fueron realizadas con el modelo K-Quant-17GB y un generador DFlash cuantizado sobre equipos con MacBook M4 Max, M5 Max y NVIDIA RTX-5090.
Agentes capaces de ejecutar tareas completas
Muse Glimmer fue evaluado en distintos benchmarks para medir su capacidad de actuar como agente autónomo. Meta destaca su desempeño en DeepSearch QA, MCP-Atlas, τ-Bench y SWE-Bench, pruebas que evalúan desde la utilización de herramientas hasta la programación, depuración de código y resolución de tareas de varios pasos.
Entre las capacidades incorporadas se encuentran también la recuperación ante errores: cuando una herramienta devuelve un resultado inesperado o una llamada falla, el modelo puede diagnosticar el problema e intentar nuevamente en lugar de detener la ejecución.
El modelo también admite entradas multimodales. Mediante un codificador de percepción específico puede procesar texto e imágenes intercalados, permitiendo a los agentes interpretar capturas de pantalla, gráficos y documentos.
Muse Glimmer es compatible con OpenClaw y otros esquemas de orquestación de agentes, permite controlar diferentes niveles de esfuerzo de razonamiento y fue entrenado con datos correspondientes a más de 100 idiomas.
Meta apuesta por un ecosistema abierto
El lanzamiento no se limita al modelo. Meta también publicó documentación para desarrolladores y anunció integraciones optimizadas con llama.cpp, MLX y ExecuTorch, que estarán disponibles progresivamente.
En los próximos días, Muse Glimmer podrá ejecutarse localmente mediante plataformas como Ollama, LM Studio y Unsloth, mientras que frameworks de edge como llama.cpp, ExecuTorch y MLX permitirán distintos tipos de despliegue.
Para quienes necesiten servir el modelo a escala, Meta menciona vLLM y SGLang, además de proveedores como Together AI, Fireworks AI y OpenRouter.
La compañía también trabaja con AMD, Arm, Dell, Intel y NVIDIA para optimizar el rendimiento del modelo en distintos dispositivos.
El lanzamiento refuerza así una estrategia de Meta que busca extender su apuesta por los modelos abiertos hacia la inteligencia artificial agentica. En lugar de concentrar toda la capacidad de cómputo en grandes centros de datos, Muse Glimmer plantea otra posibilidad: agentes personales capaces de ejecutar tareas complejas directamente en los dispositivos de los usuarios.

