Análisis
¿Escribe mejor la IA en español con o sin razonamiento?
En la muestra directa actual del benchmark, las respuestas escritas con razonamiento se llevaron el 61,4% de los puntos en español. El margen de incertidumbre es amplio, el efecto cambia según el modelo y todavía no hay ningún voto humano que compare las dos versiones.
El rumor circula en foros y redes: los modelos de lenguaje escriben mejor cuando se les desactiva el razonamiento, porque piensan menos y suenan más naturales. En la muestra directa de Baremo IA, el español no confirma esa idea, pero tampoco la desmiente.
Sobre 35 juicios de IA repartidos en 17 confrontaciones en español, las respuestas producidas con razonamiento activado sumaron el 61,4% de los puntos: 20 victorias, 3 empates y 12 derrotas. El intervalo exploratorio del 95%, calculado remuestreando confrontaciones, va del 40,0% al 82,3%, así que incluye el empate perfecto y también una ventaja considerable.
Dos matices pesan más que la cifra global. El promedio mezcla modelos que se comportan de forma opuesta. Y no existe todavía ningún voto humano publicado que compare la misma variante con el razonamiento activado y desactivado.
Qué se compara aquí, y qué se ha dejado fuera
El 29 de julio de 2026, a las 07:12 UTC, Baremo IA tenía 28.041 juicios de IA publicados y clasificables. Este artículo usa una fracción mínima de ese volumen, porque la pregunta exige un dato muy estrecho: la misma variante de modelo, la misma consigna, dos respuestas, una escrita tras una fase de razonamiento interno y otra sin ella.
Ese filtro deja 138 juicios sobre 75 confrontaciones y 26 pares de idioma y consigna en los cuatro idiomas del benchmark. Ahí el modo con razonamiento suma 85 victorias, 5 empates y 48 derrotas: el 63,4% de los puntos, con un intervalo exploratorio del 95% entre el 53,9% y el 72,3%. Una victoria vale 1 punto, un empate 0,5 y una derrota 0.
El intervalo procede de un bootstrap exploratorio que remuestrea confrontaciones y no juicios sueltos, porque varios jueces pueden evaluar la misma pareja de textos. Conviene precisar qué es aquí el razonamiento: una fase interna previa a la respuesta final, que ni lectores ni jueces llegan a ver. No mide la inteligencia general del modelo, es un ajuste de ejecución.
El español, en detalle
Los 35 juicios españoles salen de 17 confrontaciones y 6 consignas, repartidas en tres categorías: explicación y divulgación, comunicación personal, y escritura profesional y administrativa. No hay ficción ni escritura literaria en la muestra, un detalle que reaparecerá más adelante.
El dato que más choca con la intuición es la longitud. Las respuestas con razonamiento fueron más cortas: 182 palabras de media frente a 235, y 120 de mediana frente a 143. Aun así ganaron más veces. Si el rumor se apoya en la idea de que razonar hincha el texto, aquí ocurrió lo contrario.
El control de posición deja una señal menos tranquilizadora. El modo con razonamiento apareció en la posición A en 16 juicios y en la B en 19: obtuvo el 53,1% de los puntos en la primera y el 68,4% en la segunda. Con decenas de juicios, y no miles, resulta imposible separar un sesgo de posición del juez de la variación normal del azar. Queda anotado como límite, no como hallazgo.
El promedio esconde modelos que van en sentidos opuestos
Desglosado por variante, el resultado español se parte en dos.
- Gemma 4 12B Q8: 4 victorias con razonamiento, 1 empate y 5 sin razonamiento.
- Gemma 4 31B QAT Q4: ninguna victoria con razonamiento, 1 empate y 3 sin razonamiento.
- Qwen 3.6 27B Q8: 8 victorias con razonamiento, 1 empate y 2 sin razonamiento.
- Qwen 3.6 35B A3B Q8: 8 victorias con razonamiento y 2 sin razonamiento.
Ninguna línea se sostiene sola (la de Gemma 4 31B QAT Q4 descansa sobre cuatro juicios), pero la separación entre familias reaparece al sumar los cuatro idiomas: Gemma 4 12B Q8 se queda en el 47,5% de los puntos sobre 40 juicios y Gemma 4 31B QAT Q4 en el 43,8% sobre 16, mientras que Qwen 3.6 27B Q8 llega al 79,8% sobre 42 y Qwen 3.6 35B A3B Q8 al 70,0% sobre 40.
Ahí está el problema del rumor: no es falso en todas partes. Para las dos variantes de Gemma, apagar el razonamiento salió igual de bien o algo mejor. Para las dos de Qwen la diferencia va en sentido contrario, y es la que tira del promedio hacia arriba. Una regla única para todos los modelos acertaría la mitad de las veces por casualidad.
Cuatro idiomas, cuatro cifras
Por idioma, la proporción de puntos del modo con razonamiento queda así: alemán 54,3% sobre 35 juicios, español 61,4% sobre 35, inglés 66,2% sobre 34 y francés 72,1% sobre 34. Los cuatro intervalos son amplios. El alemán y el español incluyen el 50% con holgura. El inglés va aproximadamente del 48,6% al 80,6%, así que también roza el empate. Solo el intervalo exploratorio del francés queda por encima del 50% en este corte, y se apoya en 17 confrontaciones.
Con muestras de este tamaño, ordenar los idiomas de mejor a peor sería leer ruido. Lo defendible es que las cuatro cifras apuntan en la misma dirección y que ninguna, salvo quizá la francesa, se aleja del empate lo suficiente para sostener una conclusión.
La literatura tampoco se pone de acuerdo
WritingBench, de Yuning Wu y colaboradores (NeurIPS 2025), reúne 1.000 consignas en 6 dominios y 100 subdominios. En literatura y arte, varias arquitecturas con razonamiento superan a sus equivalentes sin él. Una ablación sobre Qwen 2.5 32B da 7,58 frente a 7,54 en el dominio D4 y 82,48 frente a 79,43 en EQBench al comparar la cadena de pensamiento con la variante que prescinde de ella. Favorable al razonamiento dentro de ese protocolo, con un margen minúsculo en la primera cifra.
AI Writers and Critics, de Shraddha Vijay Pawar y colaboradores (CREAI 2024), compara 11 modelos y varias estrategias en poesía, blogs, publicidad, guiones y noticias. En los blogs, la cadena de pensamiento rinde mal en su configuración: la planificación consume presupuesto de salida y deja textos más cortos y menos completos. El resultado puede darse la vuelta según cómo se fije ese presupuesto. En la muestra española ocurrió al revés, con los textos más breves del lado del razonamiento.
LitBench, de Daniel Fein y colaboradores (Stanford, 2025), mira el otro lado del problema: evaluar escritura creativa más que producirla. Ahí, las trazas de cadena de pensamiento destiladas pueden empeorar a un modelo que juzga textos creativos. Son dos razonamientos distintos, el del redactor y el del juez, y nada obliga a que se comporten igual.
Sobre los jueces automáticos, la referencia sigue siendo Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, de Lianmin Zheng y colaboradores (NeurIPS 2023): los jueces LLM potentes concuerdan bastante con las preferencias humanas, pero arrastran sesgos de posición, de verbosidad y de autoafirmación. Por eso publicamos el reparto entre posiciones y las longitudes, aunque la muestra sea demasiado pequeña para corregir nada con ellas.
Queda la documentación de los proveedores. OpenAI presenta el razonamiento como útil en problemas complejos, planificación y tareas de varios pasos, y aconseja calibrar el esfuerzo en cada uso. Anthropic explica cómo controlar el presupuesto de reflexión y el equilibrio entre profundidad, latencia y coste. Son manuales de uso, no estudios comparativos de calidad de escritura. La búsqueda tampoco encontró investigación primaria en español dedicada a esta comparación.
Los límites, en orden
- 35 juicios en español no son 35 textos independientes: proceden de 17 confrontaciones, 6 consignas y 4 variantes de modelo, y varios jueces evalúan la misma pareja.
- El intervalo del 40,0% al 82,3% es un bootstrap exploratorio, no una prueba de significación. Nada de lo que aparece aquí demuestra un efecto.
- Los cuatro jueces son Claude Fable 5, Claude Opus 4.8, Claude Opus 5 y GPT 5.6 Sol. Tres pertenecen a la misma familia, lo que puede correlacionar sus errores.
- Los candidatos son modelos locales cuantizados de dos familias, y no dicen nada sobre cómo escriben en español los grandes modelos comerciales.
- Las tres categorías presentes dejan fuera la escritura creativa, justo donde WritingBench encuentra su señal favorable al razonamiento.
- El desequilibrio entre las posiciones A y B queda sin resolver.
No existe todavía ningún voto humano publicado en Baremo IA que compare directamente la misma variante de modelo con el razonamiento activado y desactivado. Todas las cifras de este artículo proceden de jueces de IA, y las dos fuentes no se mezclan.
Qué hacer mientras tanto
La recomendación provisional no es activar ni desactivar el razonamiento por norma, sino medirlo en el par concreto que a cada quien le interese: este modelo, esta tarea, este idioma. El procedimiento cabe en una tarde. Se elige una consigna real, se generan dos respuestas con la misma variante, se alternan las posiciones al compararlas y se anota la longitud de cada texto. Diez o quince parejas dan una intuición mejor que cualquier regla heredada de un hilo de foro.
Baremo IA está en sus primeras semanas. Con más juicios acumulados, más consignas, más modelos y, sobre todo, con votos humanos sobre estas mismas parejas, la respuesta podrá afinarse. No ponemos fecha. Por ahora, la lectura honesta del español es que el razonamiento va ligeramente por delante y que el margen sigue siendo demasiado ancho para cerrar la discusión.