Los modelos que mejor escriben en español

Baremo IA mide la calidad de escritura de los principales modelos de IA a partir de un corpus de consignas concebido directamente en español. Las respuestas a una misma consigna se comparan a ciegas, sin mostrar el nombre de los modelos, y los veredictos se agregan en una clasificación específica para el español.

En cabeza en el conjunto de categorías

Los 10 mejores modelos

Los diez mejores modelos para escribir en español
#ModeloScore
1Claude Opus 5 💡98,5
2Claude Fable 5 High 💡97,7
3Kimi K3 💡97,6
4Claude Opus 4.8 💡96,2
5GLM 5.3 💡95,6
6GPT-5.6 Sol 💡94,2
7Muse Spark 1.2 💡93,9
8GPT-5.6 Terra 💡88,7
9Claude Sonnet 5 💡87,5
10Gemini 3.6 Flash 💡87,4

Esta puntuación no es una nota porcentual: 50 equivale a una probabilidad estimada de una entre dos de superar al modelo medio en español.

Última actualización:

Ver la clasificación completa

Las 10 mejores variantes locales

La VRAM indicada es una estimación redondeada de la memoria gráfica necesaria para cargar el modelo completo.

Las diez mejores variantes ejecutadas en local
#ModeloScoreVRAM estimada
1Qwen3.8 27B Q8_0 💡 🏠80,8≈ 48 GB
2Gemma 4 31B Q8_0 💡 🏠72,0≈ 48 GB
3Gemma 4 31B Q6_K ↯ 🏠69,8≈ 32 GB
4Gemma 4 31B Q6_K 💡 🏠69,5≈ 32 GB
5Gemma 4 26B A4B QAT-Q4_0 💡 🏠66,5≈ 24 GB
6Qwen3.8 27B Q6_K 💡 🏠65,1≈ 32 GB
7Muse Glimmer 30B K-Quant 17GB 💡 🏠64,1≈ 24 GB
8Gemma 4 26B A4B Q6_K 💡 🏠62,9≈ 32 GB
9Gemma 4 31B QAT-Q4_0 💡 🏠62,8≈ 24 GB
10Muse Glimmer 30B K-Quant Dynamic 💡 🏠62,4≈ 32 GB

Según el programa utilizado, una parte del modelo puede permanecer en la memoria del sistema. Esto reduce la VRAM necesaria, pero suele ralentizar la ejecución.

86modelos comparados
38535veredictos de IA publicados

La clasificación evalúa únicamente la calidad de escritura. Las consignas se conciben en el idioma evaluado y los nombres de los modelos permanecen ocultos hasta el veredicto, para que su reputación no influya en la evaluación. Este sitio es un proyecto personal. Ningún proveedor de modelos me paga y no tengo ningún interés en favorecer a uno.

Para saber más

Muse Glimmer 30B a prueba: comparativa con otras IA locales

Meta lo presentó como modelo de agente, no como escritor. En español, Dynamic obtiene el 34,0 % frente a 17GB, mientras los duelos provisionales con cuatro rivales locales dibujan un panorama menos simple.

¿Escribe mejor la IA en español con o sin razonamiento?

En la muestra directa actual del benchmark, las respuestas escritas con razonamiento se llevaron el 61,4% de los puntos en español. El margen de incertidumbre es amplio, el efecto cambia según el modelo y todavía no hay ningún voto humano que compare las dos versiones.