¿Cuál es la mejor IA local para escribir en español?
La respuesta está en la tabla y cambia cuando entran nuevos modelos o nuevas comparaciones, así que no la fijamos por escrito.
Qué es la cuantización y qué efecto tiene
La cuantización consiste en representar los pesos del modelo con menos bits. El efecto inmediato es mecánico: el archivo ocupa menos y la huella en memoria baja. En inferencia local, donde el cuello de botella suele ser el ancho de banda de memoria, esa reducción también puede traducirse en más velocidad.
El efecto sobre la calidad es donde hay que ser honesto. La cuantización puede degradar el texto, y cuánto depende del modelo, del método, de la tarea, del idioma, de la longitud del contexto y del nivel de cuantización. No existe un porcentaje universal de «calidad conservada», y desconfía de cualquier cifra que se presente así.
Estos son los niveles que verás en el filtro:
- Q8 — variante de ocho bits. La usamos como referencia práctica de alta calidad, sin afirmar que sea matemáticamente idéntica a BF16/FP16; la diferencia real es una cuestión empírica, no un axioma.
- Q4 QAT — modelo preparado o entrenado teniendo en cuenta una ejecución en cuatro bits. Es un checkpoint distinto, no una conversión posterior, y por eso ocupa su propia fila.
- Q4_K_M — cuantización GGUF de cuatro bits aplicada después del entrenamiento, con precisión mixta según la capa. No es QAT, aunque ambas se anuncien como «4 bits».
- Q6 — punto intermedio que mostraremos en cuanto tengamos variantes evaluadas.
Las dos variantes K-Quant de Muse Glimmer
Meta publica Muse Glimmer 30B en dos archivos GGUF poco habituales, con aproximadamente cuatro bits por peso de media. K-Quant Dynamic conserva ciertos tensores con mayor precisión y apunta a 32 GB de VRAM; K-Quant 17GB comprime más y apunta a 24 GB. No son archivos Q4_K_M, así que mantenemos sus nombres exactos y los evaluamos como variantes separadas. Ambos aparecen bajo el filtro amplio Q4, que agrupa descargas de la clase de cuatro bits sin afirmar que usen una codificación idéntica.
Meta comunica una degradación media del 0,2 % y del 1,0 %, respectivamente, en quince benchmarks comunes. Son mediciones del editor, no puntuaciones de escritura de AIWB ni garantías para la prosa en español, inglés, francés o alemán. Nuestro ranking y la comparación directa miden los dos archivos por separado con consignas redactadas de forma nativa.
Recomendaciones por hardware
8 GB
Mejor calidad
Gemma 4 E2B 💡 🏠
17,0 · posición local 37
Alternativa medida más rápida
Gemma 4 E2B 💡 🏠
39,7 tok/s · medición de AIWB en Strix Halo
16 GB
Mejor calidad
Gemma 4 12B 💡 🏠
50,0 · posición local 15
Alternativa medida más rápida
Gemma 4 E2B 💡 🏠
39,7 tok/s · medición de AIWB en Strix Halo
32 GB
Mejor calidad
Gemma 4 26B A4B 💡 🏠
62,9 · posición local 3
Alternativa medida más rápida
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · medición de AIWB en Strix Halo
32 GB
Mejor calidad
Gemma 4 26B A4B 💡 🏠
62,9 · posición local 3
Alternativa medida más rápida
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · medición de AIWB en Strix Halo
64 GB
Mejor calidad
Qwen3.8 27B 💡 🏠
70,1 · posición local 1
Alternativa medida más rápida
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · medición de AIWB en Strix Halo
96 GB
Mejor calidad
Qwen3.8 27B 💡 🏠
70,1 · posición local 1
Alternativa medida más rápida
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · medición de AIWB en Strix Halo
128 GB
Mejor calidad
Qwen3.8 27B 💡 🏠
70,1 · posición local 1
Alternativa medida más rápida
Qwen3.6 35B A3B 💡 🏠
71,2 tok/s · medición de AIWB en Strix Halo
Son referencias de carga, no garantías: contexto, caché KV, lote y runtime cambian la huella. Las velocidades de AIWB se midieron en el equipo Strix Halo descrito en «Sobre el autor» y no predicen otra plataforma.
Calidad frente a velocidad
Son dos ejes independientes y esta página los mantiene separados a propósito. El ranking mide calidad de escritura en español; las pestañas de hardware hablan de si el modelo cabe y a qué ritmo genera. Un modelo excelente que produce texto muy despacio puede ser perfectamente razonable para redactar y revisar sin prisa, y un modelo más modesto pero fluido puede ser mejor compañero para el trabajo iterativo. Decidir cuál te conviene requiere ambos datos, no uno solo.
Por qué usar una IA local
Los motivos son concretos. Cuando el runtime y sus integraciones funcionan enteramente en local, tus textos no tienen por qué salir de tu equipo, lo que importa cuando trabajas con material confidencial, inédito o sujeto a acuerdos de cliente. Funciona sin conexión. No dependes de que un proveedor cambie el modelo bajo el mismo nombre, ajuste sus filtros o retire una versión. Y el coste de uso, una vez descargado el modelo, no está ligado al número de peticiones.
También hay una precisión de vocabulario que conviene hacer, porque en las búsquedas se usa «open source» para casi todo. El criterio técnico de esta página son los pesos abiertos: que puedas descargar y ejecutar el modelo. Eso no equivale por sí solo a una licencia open source; la aplicación de ese marco al conjunto de artefactos de un modelo sigue siendo objeto de debate, y muchas licencias restringen ciertos usos comerciales. La licencia es un asunto legal que debes comprobar para tu caso; no dice nada sobre la calidad del texto, y nosotros no la puntuamos.
Preguntas frecuentes
¿Qué modelo local escribe mejor en español? El que encabeza la tabla de esta página con los filtros por defecto. Cambia cuando se incorporan modelos o comparaciones nuevas, así que la respuesta vive en el ranking dinámico y no en este texto.
¿Cuánta VRAM necesito? Depende del modelo, de la cuantización y del contexto que quieras usar. La pestaña de GPU dedicada indica para 8, 16 y 32 GB si una variante evaluada cabe con el margen aplicado; si no hay una recomendación defendible, la tarjeta queda vacía.
¿La cuantización estropea el texto? Puede afectarlo, y el efecto varía según el modelo, el método, la tarea y el idioma. No damos porcentajes universales: solo publicamos conclusiones cuando disponemos de comparaciones emparejadas entre variantes del mismo modelo.
¿Q4 QAT y Q4_K_M son lo mismo? No. Q4 QAT es un checkpoint preparado o entrenado contando con la ejecución en cuatro bits; Q4_K_M es una cuantización GGUF aplicada después del entrenamiento, con precisión mixta. Van en filas separadas.
¿Por qué hay modelos en la nube entre los adversarios? Porque conservamos las puntuaciones del ranking general en español. Eso mantiene una escala común entre ambas páginas y aporta muchos más datos por modelo del que tendría un torneo cerrado entre modelos locales.
¿Puedo ejecutar un modelo con más de 256 000 millones de parámetros? Técnicamente sí, con hardware suficiente, pero queda fuera de esta página. El umbral marca lo que consideramos razonablemente ejecutable en un equipo personal.
¿Por qué algunos modelos aparecen sin puntuación? Porque cumplen los requisitos de admisión pero todavía no acumulan suficientes comparaciones. Están en la lista de modelos pendientes de evaluación, sin posición, para que su ausencia del ranking no se lea como un resultado negativo.
¿Qué significan los iconos 💡 y ↯? 💡 indica que el modelo generó con el razonamiento activado y ↯ que lo hizo sin él. Cuando las pruebas técnicas no permiten determinarlo, el estado queda como desconocido en lugar de asumirlo.