Meta libera Muse Glimmer, un modelo agéntico de 30B pensado para una sola GPU de consumo
Pesos Apache 2.0, contexto de 131K y cuantización de 4 bits que entra en una placa de 24 GB. Los benchmarks son de Meta, y no todos la favorecen.
Meta Superintelligence Lab liberó Muse Glimmer este lunes: un modelo multimodal de unos 30 mil millones de parámetros, destilado de Muse Spark, el modelo cerrado que Meta presentó en abril. Los pesos, dos cuantizaciones de 4 bits, un borrador para decodificación especulativa y el codificador de visión salen todos bajo licencia Apache 2.0 en Hugging Face. El objetivo de diseño es acotado y llamativamente explícito: correr un agente que use herramientas, lea capturas de pantalla y edite código enteramente en una sola GPU de consumo, sin ida y vuelta por la red.
Ese encuadre importa más que la cantidad de parámetros. Meta no reclama un modelo de frontera: la ficha del modelo dice sin vueltas que Muse Glimmer no encuadra en la definición de “Frontier AI” de su Advanced AI Scaling Framework, porque es en general menos capaz que Muse Spark. Lo que afirma es algo más chico: que hoy entra un agente utilizable en el presupuesto de memoria del hardware que los desarrolladores ya tienen.
Qué incluye el lanzamiento
- Cerca de 29.600 millones de parámetros en total: un decodificador de texto denso de 52 capas más un codificador de percepción ViT-G/14 de unos 1.800 millones para imágenes.
- Un contexto de 131.072 tokens o más, con corte de conocimiento el 4 de enero de 2026.
- Entrada de texto e imagen, salida de texto. No soporta audio, y el video se procesa como fotogramas muestreados: Meta aclara que el modelo no está optimizado explícitamente para eso.
- Entrenamiento en más de 100 idiomas, con la salvedad, escrita en la ficha del modelo, de que Meta no evaluó todos.
- Apache 2.0 para los pesos en BF16, ambas variantes de 4 bits, el borrador DFlash y el codificador de visión congelado.
La ingeniería interesante es de memoria, no de escala
El decodificador alterna tres capas de ventana deslizante de 2.048 tokens contra una capa de atención completa, patrón que se repite trece veces hasta las 52 capas. Las capas locales llevan rotary position embeddings; la global no lleva ninguna, y así el modelo conserva el orden relativo de forma barata mientras cada tanto ve la secuencia entera. La atención agrupada por consultas comparte cada cabeza clave-valor entre 16 cabezas de consulta, lo que reduce la memoria del KV-cache 16 veces. Esa relación, más que cualquier decisión de entrenamiento, es lo que vuelve viable un contexto de 131K en una placa de escritorio.
La cuantización de 4 bits deja el modelo de lenguaje por debajo de 20 GB, con margen para el KV-cache, el codificador de percepción y el borrador dentro de un envoltorio de 24 o 32 GB. Meta ubica el costo en precisión en 0,2% para la variante de 32 GB y 1,0% para la de 24 GB, promediado sobre quince benchmarks. Son mediciones propias de Meta, no una auditoría externa.
La velocidad viene de DFlash, un borrador chico de difusión por bloques que propone dieciséis tokens de una y deja que el modelo principal los verifique en paralelo. En las corridas de Meta con batch de uno, una RTX 5090 pasa de 74,9 a 233,4 tokens por segundo, una Apple M4 Max de 23,7 a 37,8 y una M5 Max de 26,6 a 50,2. El 3,1x de la 5090 es el número de titular; el 1,5x a 1,8x en silicio de Apple es el que va a ver la mayoría de quienes trabajan en notebook.
La tabla propia de Meta no es un barrido limpio
La comparación es contra Gemma4-31B y Qwen3.6-27B en modo de razonamiento, y la ficha del modelo aclara que los puntajes están “reportados como fueron publicados”. Es decir: las columnas juntan números que produjo cada proveedor por separado, no una única corrida hecha por un tercero. Conviene leer toda la tabla como afirmaciones de proveedor, incluidas las de Meta.
En tareas con forma de agente, Muse Glimmer saca ventajas amplias: MCP Atlas 75,5 contra 54,2 y 62,5; DeepSearch QA 74,6; GAIA2 43,3; SWE-Bench Pro 51,2; y en contexto largo AA-LCR 80,0 contra 68,3 y 73,3.
Pero Qwen3.6-27B queda adelante justo donde el agente toca una máquina real: OSWorld-Verified 75,6 contra 65,9 de Glimmer; TerminalBench 2.1 60,7 contra 51,7; SWE-Bench Verified 77,2 contra 76,0; y GDPval-AA 1141 contra 953. Gemma4-31B se queda con GPQA Diamond y Humanity's Last Exam. Si tu carga de trabajo es uso de computadora o terminal, los propios números de Meta no apuntan a Glimmer.
El número de inyección de prompts merece atención
En Siren AgentDojo, Meta reporta una tasa de éxito de ataques de inyección indirecta de prompts del 28,4%, con utilidad 94,2. Gemma4-31B queda más abajo, en 25,6%, pero con menos utilidad; Qwen3.6-27B está peor, en 40,3%. Que entre aproximadamente una de cada cuatro inyecciones no es una nota al pie en un modelo cuya propuesta entera es leer tus archivos y capturas de pantalla y después actuar sobre eso. La propia guía de Meta lo admite: desplegarlo dentro de un sistema con barreras adicionales y exigir confirmación humana antes de acciones irreversibles.
Qué cambia si construís agentes
- El esfuerzo de razonamiento es un campo del prompt de sistema y no un parámetro de API — Reasoning strength: low / medium / high / xhigh — y Meta recomienda high o xhigh para código y tareas agénticas.
- La configuración de muestreo recomendada es temperatura 1,0, top_p 0,95 y top_k 64, más suelta que la que suele usarse por defecto para llamadas a herramientas.
- Está documentado como compatible con los andamiajes OpenClaw y Hermes Agent, y Hugging Face dice que el soporte de día cero llegó a transformers, llama.cpp y vLLM.
- Meta lista evaluación con LLM como juez y generación de datos sintéticos entre los usos previstos. Son los dos trabajos donde más duele el precio por token medido, y donde pasar a pesos locales cambia la aritmética, no solo la latencia.
Qué no pudimos verificar
Todas las cifras de rendimiento y seguridad de arriba salen de Meta, y a un día del lanzamiento no existe evaluación independiente. La metodología detallada de evaluación de Meta está en research.meta.ai, que resultó inalcanzable desde esta redacción, igual que la carta que publicó Mark Zuckerberg: la describimos solo según la reportó TechCrunch. Una distinción más que conviene sostener: Apache 2.0 cubre los pesos y los artefactos publicados, no los datos de entrenamiento, y Muse Spark, el modelo del que se destiló Glimmer, sigue cerrado.
Por qué importa
- Un modelo agéntico de 30B bajo Apache 2.0 que entra en 24 GB de VRAM corre toda una clase de trabajo — agentes con herramientas, LLM como juez, generación de datos sintéticos — desde APIs medidas hacia hardware que los desarrolladores ya tienen.
- La propia tabla de Meta muestra a Qwen3.6-27B adelante en uso de computadora y tareas de terminal: un correctivo útil al encuadre del lanzamiento y un insumo real para elegir modelo.
- Una tasa de éxito del 28,4% en inyección indirecta de prompts, en un modelo diseñado para leer archivos y capturas locales, fija el piso de seguridad para quien lo despliegue como agente personal.
Puntos clave
- Muse Glimmer tiene cerca de 29.600 millones de parámetros bajo Apache 2.0, contexto de 131.072 tokens y corte de conocimiento el 4 de enero de 2026.
- La cuantización de 4 bits deja el modelo de lenguaje por debajo de 20 GB; Meta reporta entre 0,2% y 1,0% de pérdida de precisión según la variante.
- El borrador especulativo DFlash da 3,1x en una RTX 5090 y entre 1,5x y 1,8x en silicio de Apple, según mediciones de Meta con batch de uno.
- Meta reclama ventajas en MCP Atlas, DeepSearch QA, GAIA2 y SWE-Bench Pro, pero queda detrás de Qwen3.6-27B en OSWorld-Verified, TerminalBench 2.1 y SWE-Bench Verified.
- Todas las cifras son del proveedor; no había evaluación independiente al momento de publicar, y Muse Spark sigue cerrado.
Fuentes
- Meta Superintelligence Lab (on Hugging Face)Fuente primariaMuse Glimmer Model Cardhuggingface.co
- Hugging FaceMeta is back with Muse Glimmer: local, agentic, multimodal, and open sourcehuggingface.co
- TechCrunchMeta's new Glimmer AI model offers a hint at Zuckerberg's personal intelligence visiontechcrunch.com
- open-weights
- local-inference
- agents
- quantization
- multimodal
- Meta
- Hugging Face
- Muse Glimmer
- Muse Spark
- Gemma4-31B
- Qwen3.6-27B