Muse Glimmer 30B a prueba: ¿qué tal escribe esta IA local?

Meta lo publicó como modelo de agente, no como escritor. Enfrentamos sus dos cuantizaciones oficiales en cuatro idiomas: en español gana Dynamic, aunque con una muestra pequeña y bastantes salvedades.

Publicado el Texto de Claude Opus 5 y GPT-5.6 Sol · Análisis y gráficos de Baremo IA

Empecemos por los datos de escritura. En la instantánea de nuestra base de producción cerrada el 12 de agosto de 2026 a las 00:21 UTC, enfrentamos las dos cuantizaciones oficiales de Muse Glimmer 30B entre sí en cuatro idiomas. En español, K-Quant Dynamic obtiene el 34 % de los puntos y la variante 17GB el 66 %. En inglés ocurre lo contrario: Dynamic obtiene el 64 %.

Son 25 juicios ciegos por idioma, cien en total: suficiente para ver hacia dónde apunta la tendencia, insuficiente para darla por cerrada. Y conviene decirlo desde el principio: Meta Superintelligence Labs presentó este modelo el 10 de agosto de 2026 como modelo abierto de agente, no como especialista en prosa. Que además redacte con solvencia es un efecto secundario del proyecto, no su objetivo.

Lo que dicen nuestros cien juicios

La comparación que podemos publicar es interna y muy acotada: Muse Glimmer 30B K-Quant 17GB frente a Muse Glimmer 30B K-Quant Dynamic, resolviendo los mismos encargos de escritura. La instantánea de solo lectura reúne 25 juicios por idioma sobre 13 consignas únicas en alemán, inglés, español y francés, emitidos por dos jueces distintos: Claude Opus 5, con 12 juicios por idioma, y GPT 5.6 Sol, con 13. Ese mínimo de doce por juez, idioma y par exacto es nuestra puerta de publicación, y aquí se cumple en los cuatro idiomas.

El porcentaje es siempre el reparto de puntos de la variante 17GB, que suma un punto por victoria y medio por empate. Lo que falta hasta el 100 % se lo lleva Dynamic.

  • Español: 34 % para 17GB (8 victorias, 1 empate, 16 derrotas). Por juez, 37,5 % con Claude Opus 5 y 30,8 % con GPT 5.6 Sol.
  • Alemán: 40 % (10 victorias, 0 empates, 15 derrotas). 41,7 % y 38,5 % respectivamente.
  • Francés: 40 %, con el mismo desglose que el alemán.
  • Inglés: 64 % a favor de 17GB (14 victorias, 4 empates, 7 derrotas). 58,3 % con Claude Opus 5 y 69,2 % con GPT 5.6 Sol.

Con 25 juicios por idioma, estas diferencias siguen siendo orientativas. Lo más estable es que ambos jueces coinciden dentro de cada idioma: 17GB queda por delante en alemán, español y francés, mientras Dynamic lo hace en inglés. Sumadas las cuatro lenguas, 17GB obtiene el 55,5 % de los puntos y Dynamic el 44,5 %.

Falta un dato que muchos lectores querrán: hoy no tenemos ninguna comparación publicada de Muse Glimmer contra otros modelos locales, así que nada de esto dice si escribe mejor o peor que Gemma o Qwen. Iremos ampliando ese enfrentamiento en nuestros resultados con la misma exigencia de doce juicios por juez y por idioma.

Qué es Muse Glimmer y qué no es

Según la ficha oficial del modelo, se trata de un transformador causal denso con un codificador de percepción separado: unos 29.600 millones de parámetros contando ese codificador visual, que aporta unos 1.800 millones, y 52 capas de texto. Acepta texto e imágenes de entrada y devuelve texto. El contexto configurado es de 131.072 tokens y el corte de conocimiento, el 4 de enero de 2026.

Meta afirma haber entrenado con datos de más de cien idiomas, pero no publica la lista, ni las proporciones por idioma, ni el recuento de tokens, ni un inventario de conjuntos de datos, ni nada sobre corpus de escritura creativa, ni resultados de escritura por idioma. Para quien escriba en español, la cobertura declarada es amplia y no documentada.

De ahí la cautela editorial que aplicamos a todo el apartado de IA local: la calidad de escritura de un modelo hay que medirla con evidencia de escritura, no deducirla de resultados en programación o en tareas de agente.

Dynamic frente a 17GB en duelos directos de escritura

Proporción de puntos de Dynamic con las mismas consignas. La línea roja marca el empate.

Ver la tabla de datos
Dynamic frente a 17GB en duelos directos de escritura
ComparaciónValorDatos
alemán40,0 %25 juicios: 10 victorias, 0 empates, 15 derrotas
inglés64,0 %25 juicios: 14 victorias, 4 empates, 7 derrotas
español34,0 %25 juicios: 8 victorias, 1 empates, 16 derrotas
francés40,0 %25 juicios: 10 victorias, 0 empates, 15 derrotas
Datos de Baremo IA. Una victoria vale un punto y un empate medio punto. Claude Opus 5 y GPT 5.6 Sol aportaron al menos 12 juicios cada uno por idioma.

17GB o Dynamic: qué instalar

Meta publica dos cuantizaciones de texto en su repositorio GGUF oficial. La pequeña, muse-glimmer-30B-kquant-17gb.gguf, ocupa 16.756.681.056 bytes, es decir 16,76 GB decimales, apunta a tarjetas de 24 GB y Meta le atribuye una degradación media del 1,0 %. La grande, muse-glimmer-30B-kquant-dynamic.gguf, ocupa 19,65 GB, apunta a 32 GB y declara un 0,2 %.

Son mediciones del fabricante sobre sus propias evaluaciones, y una degradación media no dice nada específico sobre prosa: un modelo puede perder muy poco en promedio y bastante justo donde a un escritor le duele, en el ritmo de la frase o en la coherencia de un texto largo.

Nuestros resultados no reproducen la dirección agregada de Meta: 17GB queda por delante en tres idiomas y Dynamic solo en inglés. La muestra es demasiado pequeña para explicar esa discrepancia.

Puede ser ruido de muestreo, puede ser que la escritura sea más sensible que las tareas que Meta promedia, o pueden ser ambas cosas. Con 25 juicios por idioma no podemos separarlas. La consecuencia práctica no es automática: si escribe en español, pruebe ambas variantes con las mismas consignas. En nuestra muestra, 17GB obtuvo el 66 % de los puntos y Dynamic el 34 %.

En qué difieren los veredictos de Opus y Sol

Proporción de puntos de Dynamic en español, separada por juez. Ambas filas superan el mínimo de 12 juicios.

Ver la tabla de datos
En qué difieren los veredictos de Opus y Sol
ComparaciónValorDatos
Claude Opus 537,5 %12 juicios: 4 victorias, 1 empates, 7 derrotas
GPT 5.6 Sol30,8 %13 juicios: 4 victorias, 0 empates, 9 derrotas
Datos de Baremo IA para el español. Los nombres de los modelos estaban ocultos; son juicios de IA, no votos humanos.

Memoria, contexto y ejecución local

Los tamaños publicados corresponden a los ficheros, no a la memoria que hará falta. Hay que sumar el consumo del motor de inferencia y, sobre todo, el de la caché de contexto: los 131.072 tokens configurados solo son útiles si le queda memoria libre para llenarlos. Para editar un capítulo rara vez hace falta la ventana máxima, y reducirla puede ser la diferencia entre una sesión fluida y una carga imposible. Los objetivos oficiales de 24 y 32 GB son mejor guía que el peso del archivo.

Hay además dos piezas opcionales: el codificador de percepción (1,4 GB) y el borrador especulativo DFlash (1,63 GB). Sumadas cambian el cálculo de forma poco intuitiva, porque el paquete completo de la variante 17GB pesa 19,79 GB, más que los 19,65 GB de Dynamic en solo texto. Si no va a trabajar con imágenes, ejecutar Dynamic sin extras suele ser mejor negocio que la variante pequeña cargada con todo.

El formato GGUF sitúa al modelo en el ecosistema de llama.cpp, con LM Studio y Ollama como interfaces habituales, y el repositorio oficial exige una compilación reciente que conviene verificar antes de descargar veinte gigas. Por debajo de 24 GB existen cuantizaciones de terceros más agresivas, como las que documenta la guía de Unsloth, siempre a costa de calidad y sin cifras de degradación medidas por nadie.

El compromiso entre las dos cuantizaciones oficiales

Tamaño del archivo del modelo de texto. La memoria de ejecución y el contexto se añaden a estos archivos.

Ver la tabla de datos
El compromiso entre las dos cuantizaciones oficiales
ComparaciónValorDatos
K-Quant 17GB16,8 GBVRAM objetivo: 24 GB; degradación declarada: 1,0 %
K-Quant Dynamic19,7 GBVRAM objetivo: 32 GB; degradación declarada: 0,2 %
Tamaños oficiales en Hugging Face. Meta apunta a 24 GB de VRAM para 17GB y 32 GB para Dynamic, con una degradación media declarada del 1,0 % y el 0,2 %.

Velocidad oficial: un techo, no una expectativa

Meta publica cifras llamativas para DFlash: 74,9 tokens por segundo de base y 233,4 con el borrador en una RTX 5090, una aceleración de 3,1 veces; 23,7 frente a 37,8 en un Apple M4 Max; 26,6 frente a 50,2 en un M5 Max. Están medidas con lote de tamaño 1 y decodificación codiciosa, que es el ajuste que casi nadie usa para escribir. En cuanto active el muestreo, cambie la temperatura y llene el contexto con un manuscrito, esos números dejan de aplicarse y la ganancia del borrador tiende a encogerse. Trátelos como techo teórico y mida DFlash con su propia configuración antes de dedicarle 1,63 GB.

Qué cambia DFlash en la prueba de velocidad de Meta

Tokens por segundo con lote 1 y decodificación codiciosa. La prosa con muestreo puede funcionar a otra velocidad.

Ver la tabla de datos
Qué cambia DFlash en la prueba de velocidad de Meta
ComparaciónValorDatos
Nvidia RTX 5090 base74,9 tok/sbase
Nvidia RTX 5090 DFlash233,4 tok/sDFlash
Apple M4 Max base23,7 tok/sbase
Apple M4 Max DFlash37,8 tok/sDFlash
Apple M5 Max base26,6 tok/sbase
Apple M5 Max DFlash50,2 tok/sDFlash
Mediciones de la ficha de Meta. La velocidad base y la decodificación especulativa DFlash aparecen separadas por equipo.

Arena y el riesgo factual

Fuera de casa, la referencia disponible son las clasificaciones de Arena, ambas consultadas el 11 de agosto de 2026. En escritura creativa, Muse Glimmer aparece en el puesto 135 de 384 modelos, con 1372 puntos controlados por estilo, un margen de 23 y 707 votos. En escritura, literatura y lengua, en el 127 de 385, con 1387 puntos, margen de 20 y 926 votos.

Los puestos exactos importan poco: con esos márgenes, el intervalo de posición va del 107 al 155 en la primera lista y del 97 al 151 en la segunda, zona media de una tabla muy poblada. Los votos tampoco identifican qué cuantización se usa ni con qué intensidad de razonamiento, así que no sirven para decidir entre 17GB y Dynamic. En EQ-Bench, la referencia específica de escritura que más nos interesa, el modelo no figuraba al verificar los datos.

El riesgo serio está en otra parte. El análisis independiente de Artificial Analysis, con datos del 10 de agosto de 2026, le atribuye 35 puntos de índice de inteligencia, 44 de apertura, un Elo de 953 en GDPval AA v2 frente a un valor humano de referencia de 1000 y una tasa de alucinación del 82 %, con un indicador de omnisciencia de menos 33. No son notas de prosa, pero describen bien el riesgo de cualquier texto con fechas, nombres propios, cifras o citas. Sumado a un corte de conocimiento en enero de 2026, este modelo sirve para escribir, no para saber.

Los primeros datos externos de escritura siguen siendo inciertos

Puntuación Arena controlada por estilo con su intervalo publicado. Las categorías usan conjuntos de votos distintos.

Ver la tabla de datos
Los primeros datos externos de escritura siguen siendo inciertos
ComparaciónValorDatos
Arena Creative Writing leaderboard1372 ± 23707 votos; puesto 135 (107 a 155)
Arena Writing, Literature and Language leaderboard1387 ± 20926 votos; puesto 127 (97 a 151)
Instantánea de Arena del 11 de agosto de 2026. Creative Writing usa 707 votos; Writing, Literature and Language, 926. Arena no identifica la cuantización ni el nivel de razonamiento.

Privacidad, licencia y recomendación final

Ejecutarlo en su equipo mantiene los borradores fuera de una API externa, lo que mejora el control pero no crea privacidad automática: el historial de la interfaz, las copias de seguridad, las extensiones, la telemetría y las carpetas sincronizadas pueden seguir exponiendo el contenido.

Los pesos se publican con etiqueta Apache 2.0, llamativamente permisiva para un modelo de este tamaño, pero acompañada de una política de uso de Meta con restricciones propias. Si su plan es comercial o el modelo va a formar parte de un producto, lea ese documento antes que la etiqueta.

Con 32 GB de VRAM o de memoria unificada, instale K-Quant Dynamic en solo texto: gana en español, alemán y francés en nuestra muestra, y es la que Meta considera de mayor calidad. Con 24 GB, use la variante de 17GB y renuncie al codificador visual y al borrador salvo que los necesite, porque esa memoria rinde más dedicada al contexto. Por debajo tendrá que recurrir a cuantizaciones de terceros y asumir una pérdida sin cuantificar. Y si ya tiene un modelo local que le funciona, en estos números no hay motivo para cambiarlo: nuestra comparación enfrenta a Muse consigo mismo, no con sus rivales.