Los mejores LLM locales para escribir en español

Un ranking de modelos de pesos abiertos que puedes ejecutar en tu propio ordenador, ordenados por calidad de escritura en español y filtrables por cuantización, modo de razonamiento y memoria disponible.

La clasificación

Puntuaciones de la clasificación general en español, con posiciones recalculadas entre variantes locales admisibles.

Última actualización:

Clasificación de modelos locales por calidad de escritura
PuestoModeloPuntuación del juez de IADuelosParámetros (totales / activos)Memoria estimada
1 Gemma 4 31B Q8_0 💡 🏠 58,1 470 31B ≈ 48 GB
2 Gemma 4 26B A4B Q8_0 💡 🏠 55,9 293 26B / 4B ≈ 32 GB
3 Gemma 4 26B A4B QAT 💡 🏠 48,7 585 26B / 4B ≈ 24 GB
4 Gemma 4 31B QAT 💡 🏠 48,1 513 31B ≈ 24 GB
5 Gemma 4 12B Q8_0 💡 🏠 44,0 377 12B ≈ 16 GB
6 Gemma 4 31B QAT (sin razonamiento) 🏠 42,9 218 31B ≈ 24 GB
9 Qwen3.6 27B Q8_0 💡 🏠 34,5 354 27B ≈ 32 GB
10 Gemma 4 12B QAT 💡 🏠 32,9 463 12B ≈ 12 GB
11 Qwen3.6 35B A3B Q8_0 💡 🏠 32,6 355 35B / 3B ≈ 48 GB
12 Gemma 4 12B Q8_0 (sin razonamiento) 🏠 31,9 310 12B ≈ 16 GB
15 Qwen3.6 35B A3B Q8_0 (sin razonamiento) 🏠 13,8 291 35B / 3B ≈ 48 GB
16 Qwen3.6 27B Q8_0 (sin razonamiento) 🏠 11,6 292 27B ≈ 32 GB

18 variantes locales clasificadas8046 veredictos de IA publicados en la clasificación general

Cómo leer este ranking

Cada fila es una variante exacta, no una familia de modelos: checkpoint concreto + cuantización + modo de razonamiento (💡 activado o ↯ desactivado). Esa distinción no es un capricho de catalogación. El mismo modelo con dos cuantizaciones distintas puede escribir de forma distinta, y activar o no el razonamiento cambia el texto que sale. Por eso nunca fusionamos esas variantes bajo una puntuación media: al promediarlas se pierde justo la información que necesitas para decidir qué archivo descargar.

Los filtros se aplican solos y su estado queda reflejado en la URL, así que puedes compartir una vista concreta —por ejemplo, solo Q8 con razonamiento activado— tal y como la ves.

  • Cuantización (selección múltiple): Q8 y Q4 QAT vienen marcados por defecto; Q4 clásico está disponible pero desmarcado; Q6 aparecerá automáticamente en cuanto exista una variante evaluada.
  • Razonamiento: 💡 activado, ↯ desactivado y un tercer estado, desconocido, para los casos en que las pruebas técnicas no permiten concluir. Pedir un reasoning_effort alto no basta: si el runtime informa de cero tokens de razonamiento, no damos por hecho que el modo estuviera activo.

De dónde salen las puntuaciones

Conservamos las puntuaciones del ranking general en español en lugar de recalcular un torneo cerrado entre modelos locales. Eso significa que los resultados de un modelo local incluyen todos sus adversarios, también modelos en la nube. La ventaja es doble: mantiene una escala común entre ambas páginas y aprovecha muchos más enfrentamientos por modelo, lo que reduce el ruido. Los volúmenes de comparación y el acceso a los duelos están en la propia tabla, para que puedas ver de cuántos datos sale cada posición.

Un modelo es admisible aunque sus textos se generaran en un servidor y no en el ordenador de este proyecto. El criterio es que los pesos estén disponibles y que el modelo pueda ejecutarse en local, no el lugar donde se produjeron históricamente las respuestas.

Modelos admisibles todavía sin evaluar

Hay modelos que cumplen los requisitos pero aún no tienen suficientes comparaciones. Los listamos aparte, sin puntuación y sin posición, para que la ausencia no se interprete como un mal resultado.

Ahora mismo no hay ninguna variante admisible sin puntuación registrada en el corpus de respuestas.

¿Cuál es la mejor IA local para escribir en español?

La respuesta está en la tabla y cambia cuando entran nuevos modelos o nuevas comparaciones, así que no la fijamos por escrito.

Conviene leer esa respuesta con una advertencia: «el mejor» aquí significa «el que mejor escribe en español según comparaciones a ciegas», no «el más inteligente». Si tu equipo no puede con esa variante, el modelo que ocupa el segundo o el quinto puesto puede ser mucho mejor opción para ti. Por eso las secciones de hardware que vienen más abajo son parte de la respuesta, no un anexo.

¿Es complicado ejecutar una IA en local?

La instalación básica ya no lo es. Herramientas como Ollama resuelven la descarga y la ejecución con un par de órdenes, y llama.cpp ofrece un control más fino para quien lo quiera. A alto nivel el proceso siempre es el mismo:

  1. Instalar un runtime que sepa ejecutar modelos en tu sistema y tu GPU.
  2. Descargar la variante concreta del modelo: nombre, cuantización y, si existe, checkpoint específico.
  3. Ajustar la longitud de contexto y comprobar cuánta memoria queda libre al cargarlo.
  4. Escribir tu primer prompt y verificar que la velocidad te resulta usable.

Lo que sí exige atención es el paso dos y el tres. Elegir mal la cuantización, pedir un contexto enorme «por si acaso» o confundir la memoria disponible con el tamaño del archivo son los tres motivos habituales de que algo vaya lento o directamente no arranque. Nada de eso requiere conocimientos de programación, pero sí leer con un poco de cuidado.

Qué es la cuantización y qué efecto tiene

La cuantización consiste en representar los pesos del modelo con menos bits. El efecto inmediato es mecánico: el archivo ocupa menos y la huella en memoria baja. En inferencia local, donde el cuello de botella suele ser el ancho de banda de memoria, esa reducción también puede traducirse en más velocidad.

El efecto sobre la calidad es donde hay que ser honesto. La cuantización puede degradar el texto, y cuánto depende del modelo, del método, de la tarea, del idioma, de la longitud del contexto y del nivel de cuantización. No existe un porcentaje universal de «calidad conservada», y desconfía de cualquier cifra que se presente así.

Estos son los niveles que verás en el filtro:

  • Q8 — variante de ocho bits. La usamos como referencia práctica de alta calidad, sin afirmar que sea matemáticamente idéntica a BF16/FP16; la diferencia real es una cuestión empírica, no un axioma.
  • Q4 QAT — modelo preparado o entrenado teniendo en cuenta una ejecución en cuatro bits. Es un checkpoint distinto, no una conversión posterior, y por eso ocupa su propia fila.
  • Q4_K_M — cuantización GGUF de cuatro bits aplicada después del entrenamiento, con precisión mixta según la capa. No es QAT, aunque ambas se anuncien como «4 bits».
  • Q6 — punto intermedio que mostraremos en cuanto tengamos variantes evaluadas.

Qué podemos afirmar «en nuestras pruebas»

Solo comparamos cuantizaciones emparejadas: mismo modelo, mismo modo de razonamiento, mismo idioma, única diferencia la cuantización. Cuando no hay suficientes duelos o falta alguna de las variantes, lo decimos: el resultado queda como provisional o directamente no medible. Tampoco usamos MMLU, HumanEval, GPQA, AIME ni pruebas de código o matemáticas como evidencia de calidad de prosa; miden otra cosa.

Todavía no hay ningún par directo publicado que cumpla este protocolo para este idioma y selección.

Memoria: VRAM, RAM, memoria unificada y contexto

El error más extendido al elegir un modelo local es mirar el tamaño del archivo y suponer que si cabe en la memoria, funciona. No basta. Además de los pesos, hay que dejar sitio para el runtime, para la caché KV —la memoria donde el modelo guarda el estado de la conversación, que crece con la longitud del contexto— y para el propio contexto que le pases. El tamaño del lote, la arquitectura del modelo y la presencia de un componente de visión también mueven la cifra.

Conviene además distinguir cuatro cosas que a menudo se mezclan:

  • VRAM dedicada: la memoria de una GPU discreta, rápida y limitada.
  • RAM del sistema: mucha más capacidad, bastante menos ancho de banda.
  • Memoria unificada: un único bloque compartido entre CPU y GPU. Permite cargar modelos grandes, pero su rendimiento no equivale al de la VRAM dedicada.
  • Descarga a CPU (offload): repartir parte del modelo fuera de la GPU. A veces es lo que hace posible cargar un modelo mayor, siempre con una penalización de velocidad que puede ser considerable.

Dicho de otro modo: que un modelo quepa no significa que sea rápido. Nuestras recomendaciones por nivel de memoria dejan un margen realista en lugar de apurar hasta el último gigabyte.

Un apunte sobre los modelos MoE (mezcla de expertos): el límite de 256 000 millones de parámetros se aplica a los parámetros totales, porque son los que hay que cargar. Los parámetros activos, que explican la velocidad, se muestran aparte cuando se conocen. Usar los activos para estimar la memoria necesaria lleva sistemáticamente a error.

Recomendaciones por hardware

Hemos separado las recomendaciones en dos pestañas porque las restricciones no se parecen: una GPU dedicada da velocidad con poca capacidad, y una plataforma de memoria unificada da capacidad con menos ancho de banda. En cada nivel indicamos el mejor modelo por calidad de escritura que entra con margen y una alternativa más rápida, con velocidad medida cuando la tenemos; si no existe una medición propia, el campo queda vacío. No incluimos precios ni consumo.

GPU dedicada

Los niveles habituales son 8, 16 y 32 GB de VRAM. Con 8 GB se trabaja con modelos pequeños o cuantizaciones agresivas y contextos contenidos; a partir de 16 GB se abre el rango intermedio con margen para un contexto de trabajo cómodo; con 32 GB entran modelos claramente mayores sin recurrir a la descarga a CPU.

Memoria unificada

Aquí agrupamos Apple Silicon, AMD Strix Halo / Ryzen AI Max+ y NVIDIA DGX Spark. Estas plataformas comparten un mismo depósito de memoria entre CPU y GPU, lo que permite cargar modelos que no cabrían en la mayoría de las GPU de consumo. La contrapartida es el ancho de banda: no conviene leer «memoria unificada» como si fuera VRAM dedicada. Las capacidades disponibles y la parte asignable al acelerador dependen de la máquina y de la configuración, así que las mostramos en el componente dinámico en lugar de dejarlas escritas aquí, donde envejecerían mal.

Las mediciones de velocidad realizadas por este proyecto sobre AMD Strix Halo aparecen marcadas como mediciones AIWB. Las cifras de otras máquinas se etiquetan como fuente externa o estimación.

8 GB

Ninguna variante clasificada cabe con el margen aplicado.

16 GB

Mejor calidad

Gemma 4 12B Q8_0 💡 🏠

44,0 · posición local 5

Alternativa medida más rápida

Gemma 4 12B QAT 💡 🏠

25,2 tok/s · medición de AIWB en Strix Halo

32 GB

Mejor calidad

Gemma 4 26B A4B Q8_0 💡 🏠

55,9 · posición local 2

Alternativa medida más rápida

Gemma 4 26B A4B QAT 💡 🏠

61,6 tok/s · medición de AIWB en Strix Halo

Son referencias de carga, no garantías: contexto, caché KV, lote y runtime cambian la huella. Las velocidades de AIWB se midieron en el equipo Strix Halo descrito en «Sobre el autor» y no predicen otra plataforma.

Calidad frente a velocidad

Son dos ejes independientes y esta página los mantiene separados a propósito. El ranking mide calidad de escritura en español; las pestañas de hardware hablan de si el modelo cabe y a qué ritmo genera. Un modelo excelente que produce texto muy despacio puede ser perfectamente razonable para redactar y revisar sin prisa, y un modelo más modesto pero fluido puede ser mejor compañero para el trabajo iterativo. Decidir cuál te conviene requiere ambos datos, no uno solo.

Por qué usar una IA local

Los motivos son concretos. Cuando el runtime y sus integraciones funcionan enteramente en local, tus textos no tienen por qué salir de tu equipo, lo que importa cuando trabajas con material confidencial, inédito o sujeto a acuerdos de cliente. Funciona sin conexión. No dependes de que un proveedor cambie el modelo bajo el mismo nombre, ajuste sus filtros o retire una versión. Y el coste de uso, una vez descargado el modelo, no está ligado al número de peticiones.

También hay una precisión de vocabulario que conviene hacer, porque en las búsquedas se usa «open source» para casi todo. El criterio técnico de esta página son los pesos abiertos: que puedas descargar y ejecutar el modelo. Eso no equivale por sí solo a una licencia open source; la aplicación de ese marco al conjunto de artefactos de un modelo sigue siendo objeto de debate, y muchas licencias restringen ciertos usos comerciales. La licencia es un asunto legal que debes comprobar para tu caso; no dice nada sobre la calidad del texto, y nosotros no la puntuamos.

Límites de este ranking

Es una medida de calidad de escritura en español a partir de comparaciones a ciegas sobre un corpus nativo de consignas, no un ranking universal de inteligencia. Un modelo puede escribir muy bien en español y rendir peor en otro idioma, o al revés; por eso mantenemos rankings separados por lengua. Tampoco evaluamos programación, razonamiento matemático ni uso de herramientas. Y el hecho de que un modelo se haya desarrollado en un país hispanohablante no implica que escriba mejor en español: eso se mide, no se supone.

Las posiciones con pocos enfrentamientos son menos estables que las que acumulan muchos; los volúmenes están a la vista en la tabla precisamente para que puedas ponderarlo tú.

Preguntas frecuentes

¿Qué modelo local escribe mejor en español? El que encabeza la tabla de esta página con los filtros por defecto. Cambia cuando se incorporan modelos o comparaciones nuevas, así que la respuesta vive en el ranking dinámico y no en este texto.

¿Cuánta VRAM necesito? Depende del modelo, de la cuantización y del contexto que quieras usar. La pestaña de GPU dedicada indica para 8, 16 y 32 GB si una variante evaluada cabe con el margen aplicado; si no hay una recomendación defendible, la tarjeta queda vacía.

¿La cuantización estropea el texto? Puede afectarlo, y el efecto varía según el modelo, el método, la tarea y el idioma. No damos porcentajes universales: solo publicamos conclusiones cuando disponemos de comparaciones emparejadas entre variantes del mismo modelo.

¿Q4 QAT y Q4_K_M son lo mismo? No. Q4 QAT es un checkpoint preparado o entrenado contando con la ejecución en cuatro bits; Q4_K_M es una cuantización GGUF aplicada después del entrenamiento, con precisión mixta. Van en filas separadas.

¿Por qué hay modelos en la nube entre los adversarios? Porque conservamos las puntuaciones del ranking general en español. Eso mantiene una escala común entre ambas páginas y aporta muchos más datos por modelo del que tendría un torneo cerrado entre modelos locales.

¿Puedo ejecutar un modelo con más de 256 000 millones de parámetros? Técnicamente sí, con hardware suficiente, pero queda fuera de esta página. El umbral marca lo que consideramos razonablemente ejecutable en un equipo personal.

¿Por qué algunos modelos aparecen sin puntuación? Porque cumplen los requisitos de admisión pero todavía no acumulan suficientes comparaciones. Están en la lista de modelos pendientes de evaluación, sin posición, para que su ausencia del ranking no se lea como un resultado negativo.

¿Qué significan los iconos 💡 y ↯? 💡 indica que el modelo generó con el razonamiento activado y ↯ que lo hizo sin él. Cuando las pruebas técnicas no permiten determinarlo, el estado queda como desconocido en lugar de asumirlo.