Meta lo presentó como modelo de agente, no como escritor. En español, Dynamic obtiene el 34,0 % frente a 17GB, mientras los duelos provisionales con cuatro rivales locales dibujan un panorama menos simple.
Los modelos que mejor escriben en español
Baremo IA mide la calidad de escritura de los principales modelos de IA a partir de un corpus de consignas concebido directamente en español. Las respuestas a una misma consigna se comparan a ciegas, sin mostrar el nombre de los modelos, y los veredictos se agregan en una clasificación específica para el español.
En cabeza en el conjunto de categorías
Los 10 mejores modelos
| # | Modelo | Score |
|---|---|---|
| 1 | 98,5 | |
| 2 | 97,7 | |
| 3 | 97,6 | |
| 4 | 96,2 | |
| 5 | 95,6 | |
| 6 | 94,2 | |
| 7 | 93,9 | |
| 8 | 88,7 | |
| 9 | 87,5 | |
| 10 | 87,4 |
Esta puntuación no es una nota porcentual: 50 equivale a una probabilidad estimada de una entre dos de superar al modelo medio en español.
Última actualización:
Ver la clasificación completaLas 10 mejores variantes locales
La VRAM indicada es una estimación redondeada de la memoria gráfica necesaria para cargar el modelo completo.
| # | Modelo | Score | VRAM estimada |
|---|---|---|---|
| 1 | 80,8 | ≈ 48 GB | |
| 2 | 72,0 | ≈ 48 GB | |
| 3 | 69,8 | ≈ 32 GB | |
| 4 | 69,5 | ≈ 32 GB | |
| 5 | 66,5 | ≈ 24 GB | |
| 6 | 65,1 | ≈ 32 GB | |
| 7 | 64,1 | ≈ 24 GB | |
| 8 | 62,9 | ≈ 32 GB | |
| 9 | 62,8 | ≈ 24 GB | |
| 10 | 62,4 | ≈ 32 GB |
Según el programa utilizado, una parte del modelo puede permanecer en la memoria del sistema. Esto reduce la VRAM necesaria, pero suele ralentizar la ejecución.
La clasificación evalúa únicamente la calidad de escritura. Las consignas se conciben en el idioma evaluado y los nombres de los modelos permanecen ocultos hasta el veredicto, para que su reputación no influya en la evaluación. Este sitio es un proyecto personal. Ningún proveedor de modelos me paga y no tengo ningún interés en favorecer a uno.
Para saber más
En la muestra directa actual del benchmark, las respuestas escritas con razonamiento se llevaron el 61,4% de los puntos en español. El margen de incertidumbre es amplio, el efecto cambia según el modelo y todavía no hay ningún voto humano que compare las dos versiones.