Resultados de los jueces IA

Cada juez de IA recibe dos respuestas anónimas a la misma consigna escrita originalmente en español. Elige el mejor texto o declara un empate, sin conocer el nombre de los modelos.

Un juez también puede evaluar una pareja que incluya una respuesta de su propio modelo; la autoría de ambas respuestas permanece oculta mientras decide.

Las tablas reúnen todos los duelos validados y publicados, juez por juez: victorias, derrotas, empates y comparaciones. Al ocultar los nombres, el veredicto se centra en el texto y no en la marca.

Los puestos se ordenan primero por el total de victorias, no por la tasa de victoria ni por la fuerza de los rivales; cuando la cobertura difiere, conviene leer victorias, derrotas y empates junto con el número de comparaciones.

Para las categorías de escritura seleccionadas, los puestos se asignan antes de que los filtros de proveedor, tamaño, estado del modelo, modo de generación y acceso oculten modelos; por eso la numeración visible puede conservar huecos.

Los jueces de IA permiten comparar muchas parejas con un protocolo constante, pero no sustituyen a los lectores. Los votos del público alimentan por separado la clasificación humana y muestran los acuerdos y desacuerdos entre las personas y las máquinas.

Último veredicto incluido:

Claude Fable 5

1014 veredictos de duelo validados

Resultados de Claude Fable 5
Puesto Modelo Victorias Derrotas Empates Comparaciones
1 Claude Fable 5 High 💡 792 47 70 909
2 MiniMax M3 💡 37 51 10 98
3 Claude Opus 5 💡 18 12 15 45
5 Kimi K3 💡 9 18 18 45
6 DeepSeek V4 Flash 💡 7 44 2 53
8 Gemma 4 12B Q8_0 (sin razonamiento) 🏠 6 11 1 18
9 DeepSeek V4 Pro 💡 6 46 1 53
12 Qwen3.6 35B A3B Q8_0 💡 🏠 4 32 0 36
13 MiMo V2.5 Pro 💡 4 50 1 55
15 Qwen3.6 35B A3B Q8_0 (sin razonamiento) 🏠 3 15 1 19
16 Gemma 4 12B Q8_0 💡 🏠 3 31 3 37
17 Gemma 4 26B A4B QAT-Q4_0 💡 🏠 3 32 2 37
18 GPT-5.6 Luna 💡 3 42 0 45
19 GPT-5.6 Sol 💡 2 41 1 44
20 Qwen3.7 Plus 💡 2 46 3 51
22 Gemma 4 31B QAT-Q4_0 💡 🏠 1 24 2 27
23 Qwen3.6 35B A3B Q4_K_M 💡 🏠 1 25 1 27
24 Gemma 4 31B Q8_0 💡 🏠 1 28 1 30
25 MiMo V2.5 💡 1 52 1 54
26 Mistral Medium 3.5 128B Q4_K_M (sin razonamiento) 🏠 0 9 0 9
27 Gemma 4 31B QAT-Q4_0 (sin razonamiento) 🏠 0 10 1 11
28 Gemma 4 26B A4B Q8_0 💡 🏠 0 11 0 11
29 Gemma 4 12B QAT-Q4_0 💡 🏠 0 31 2 33
30 GPT-5.6 Terra 💡 0 43 2 45

Claude Opus 4.8

1080 veredictos de duelo validados

Resultados de Claude Opus 4.8
Puesto Modelo Victorias Derrotas Empates Comparaciones
1 DeepSeek V4 Pro 💡 112 22 5 139
5 Gemma 4 31B QAT-Q4_0 💡 🏠 70 84 8 162
6 MiniMax M3 💡 66 25 3 94
7 DeepSeek V4 Flash 💡 66 64 5 135
8 Qwen3.6 35B A3B Q4_K_M 💡 🏠 65 88 9 162
9 MiMo V2.5 Pro 💡 63 68 7 138
10 Qwen3.7 Plus 💡 59 70 9 138
11 Gemma 4 26B A4B QAT-Q4_0 💡 🏠 58 82 10 150
12 Gemma 4 31B Q8_0 💡 🏠 54 39 5 98
13 Claude Fable 5 High 💡 32 0 1 33
14 Qwen3.6 35B A3B Q8_0 💡 🏠 31 26 4 61
15 MiMo V2.5 💡 26 104 5 135
17 Gemma 4 12B QAT-Q4_0 💡 🏠 24 70 6 100
18 Gemma 4 12B Q8_0 💡 🏠 20 38 4 62
19 Gemma 4 12B Q8_0 (sin razonamiento) 🏠 8 5 1 14
20 Qwen3.6 35B A3B Q8_0 (sin razonamiento) 🏠 5 8 0 13
21 GPT-5.6 Sol 💡 3 5 0 8
23 Mistral Medium 3.5 128B Q4_K_M (sin razonamiento) 🏠 0 2 0 2
24 Gemma 4 26B A4B Q8_0 💡 🏠 0 3 0 3
25 Gemma 4 31B QAT-Q4_0 (sin razonamiento) 🏠 0 3 0 3

Claude Opus 5

16723 veredictos de duelo validados

Resultados de Claude Opus 5
Puesto Modelo Victorias Derrotas Empates Comparaciones
1 Claude Fable 5 High 💡 780 34 23 837
2 Claude Opus 5 💡 521 8 8 537
3 Kimi K3 💡 487 28 23 538
4 Claude Sonnet 5 💡 451 69 16 536
5 MiniMax M3 💡 423 101 13 537
6 GPT-5.6 Sol 💡 418 96 23 537
8 DeepSeek V4 Pro 💡 400 129 11 540
9 GPT-5.6 Terra 💡 398 125 13 536
10 GPT-5.6 Luna 💡 361 153 22 536
13 Muse Glimmer 30B K-Quant 17GB 💡 🏠 340 205 24 569
14 Muse Glimmer 30B K-Quant Dynamic 💡 🏠 333 207 27 567
16 Qwen3.7 Plus 💡 323 193 22 538
17 DeepSeek V4 Flash 💡 317 209 12 538
18 Gemma 4 31B Q8_0 💡 🏠 312 209 28 549
19 Gemma 4 26B A4B QAT-Q4_0 💡 🏠 310 190 36 536
20 Gemma 4 31B QAT-Q4_0 💡 🏠 291 254 18 563
21 Gemma 4 31B QAT-Q4_0 (sin razonamiento) 🏠 276 258 34 568
22 Gemma 4 26B A4B Q8_0 💡 🏠 271 266 36 573
23 MiMo V2.5 Pro 💡 265 255 19 539
24 Qwen3.6 35B A3B Q8_0 💡 🏠 242 308 22 572
25 Gemma 4 12B Q8_0 💡 🏠 227 292 22 541
26 Mistral Medium 3.5 128B Q4_K_M (sin razonamiento) 🏠 226 302 8 536
27 GLM 5.3 💡 222 8 8 238
29 Qwen3.6 35B A3B Q4_K_M 💡 🏠 220 318 22 560
30 Gemma 4 12B Q8_0 (sin razonamiento) 🏠 215 329 26 570
31 Muse Spark 1.2 💡 209 24 8 241
32 Gemma 4 12B QAT-Q4_0 💡 🏠 208 316 22 546
33 Qwen3.8 27B Q8_0 💡 🏠 184 48 30 262
35 Grok 4.6 💡 176 51 13 240
36 Qwen3.8 Flash 💡 176 55 6 237
37 Nemotron 3 Super 120B A12B Q4_K_M 💡 🏠 174 353 9 536
38 Qwen3.8 Max 💡 169 50 20 239
39 Hy4 Preview 💡 159 66 15 240
40 Gemma 4 31B Q6_K (sin razonamiento) 🏠 156 84 17 257
41 Inkling 💡 155 70 11 236
42 Qwen3.8 27B Q6_K 💡 🏠 155 81 21 257
43 Gemma 4 31B Q8_0 (sin razonamiento) 🏠 151 86 19 256
44 Seed 2.1 Turbo (sin razonamiento) 149 87 5 241
45 Qwen3.6 35B A3B Q8_0 (sin razonamiento) 🏠 148 406 16 570
46 Gemma 4 31B Q6_K 💡 🏠 144 83 30 257
47 Qwen3.8 27B Q4_K_M 💡 🏠 137 114 11 262
48 Gemma 4 26B A4B Q6_K 💡 🏠 136 102 22 260
49 Qwen3.8 27B Q8_0 (sin razonamiento) 🏠 134 115 15 264
50 Gemma 4 26B A4B Q8_0 (sin razonamiento) 🏠 133 108 9 250
51 MiMo V2.5 💡 132 403 3 538
52 Hy3 💡 131 103 10 244
53 Gemma 4 E4B Q8_0 💡 🏠 115 415 8 538
54 Aion 3.0 💡 114 110 19 243
55 GLM 5.3 Flash 💡 111 123 2 236
56 Gemma 4 26B A4B Q6_K (sin razonamiento) 🏠 110 131 16 257
57 Gemma 4 12B Q6_K 💡 🏠 110 139 15 264
58 Gemma 4 E2B Q8_0 💡 🏠 108 421 14 543
59 Gemma 4 12B QAT-Q4_0 (sin razonamiento) 🏠 107 138 12 257
60 Gemma 4 26B A4B QAT-Q4_0 (sin razonamiento) 🏠 107 143 9 259
61 Gemini 3.7 Flash 💡 102 30 22 154
62 Qwen3.8 27B Q4_K_M (sin razonamiento) 🏠 101 135 20 256
64 Gemma 4 12B Q6_K (sin razonamiento) 🏠 93 165 2 260
65 Qwen3.8 27B Q6_K (sin razonamiento) 🏠 87 165 12 264
66 Mistral Medium 3.5 💡 83 150 6 239
67 Gemma 4 E4B Q8_0 (sin razonamiento) 🏠 81 458 1 540
68 Gemma 4 E2B Q4_K_M 💡 🏠 74 457 7 538
69 Gemma 4 E2B Q6_K 💡 🏠 67 187 7 261
71 Gemma 4 E4B Q6_K (sin razonamiento) 🏠 58 199 3 260
72 Nemotron 3 Nano Omni 30B A3B Q4_K_M 💡 🏠 58 477 1 536
73 Qwen3.6 35B A3B Q4_K_M (sin razonamiento) 🏠 54 198 5 257
74 Granite 4.2 30B Q6_K 💡 🏠 52 178 6 236
75 Gemma 4 E2B Q8_0 (sin razonamiento) 🏠 52 193 5 250
76 Gemma 4 E4B Q4_K_M (sin razonamiento) 🏠 50 205 1 256
77 Gemma 4 E4B Q4_K_M 💡 🏠 47 214 3 264
78 Granite 4.2 8B Q6_K 💡 🏠 45 178 8 231
79 Gemma 4 E4B Q6_K 💡 🏠 45 219 1 265
80 Gemma 4 E2B Q4_K_M (sin razonamiento) 🏠 43 208 6 257
81 Gemma 4 E2B Q6_K (sin razonamiento) 🏠 42 214 4 260
82 Granite 4.2 30B Q8_0 💡 🏠 35 195 6 236
83 Granite 4.2 30B Q4_K_M 💡 🏠 24 211 1 236
84 Nemotron 3 Nano Omni 30B A3B Q8_0 💡 🏠 21 233 0 254
85 Granite 4.2 8B Q4_K_M 💡 🏠 10 225 1 236
86 Granite 4.2 8B Q8_0 💡 🏠 4 230 2 236

GPT-5.6 Sol

19718 veredictos de duelo validados

Resultados de GPT-5.6 Sol
Puesto Modelo Victorias Derrotas Empates Comparaciones
1 Claude Fable 5 High 💡 1185 83 5 1273
2 GPT-5.6 Sol 💡 889 61 5 955
3 Kimi K3 💡 518 28 1 547
4 Claude Opus 5 💡 515 32 1 548
5 DeepSeek V4 Flash 💡 484 338 2 824
6 GPT-5.6 Terra 💡 463 86 0 549
7 DeepSeek V4 Pro 💡 449 279 0 728
8 GPT-5.6 Luna 💡 435 112 1 548
9 MiniMax M3 💡 394 197 0 591
10 Claude Sonnet 5 💡 387 161 3 551
12 Qwen3.7 Plus 💡 382 277 0 659
13 Gemma 4 31B Q8_0 💡 🏠 373 256 7 636
14 Qwen3.8 Flash 💡 358 150 1 509
15 Hy4 Preview 💡 354 141 3 498
16 Gemma 4 26B A4B QAT-Q4_0 💡 🏠 348 310 8 666
19 Gemma 4 31B QAT-Q4_0 💡 🏠 327 278 7 612
20 Gemma 4 26B A4B Q8_0 💡 🏠 303 264 3 570
21 Gemma 4 12B Q8_0 💡 🏠 301 304 4 609
22 Muse Spark 1.2 💡 296 34 0 330
24 Qwen3.6 35B A3B Q4_K_M 💡 🏠 286 336 3 625
25 Muse Glimmer 30B K-Quant 17GB 💡 🏠 285 254 0 539
26 Gemma 4 31B QAT-Q4_0 (sin razonamiento) 🏠 285 265 5 555
27 GLM 5.3 💡 281 36 0 317
28 MiMo V2.5 Pro 💡 275 377 2 654
29 Muse Glimmer 30B K-Quant Dynamic 💡 🏠 273 265 1 539
30 Gemma 4 12B QAT-Q4_0 💡 🏠 272 360 3 635
31 GLM 5.3 Flash 💡 269 237 3 509
32 Gemma 4 12B Q8_0 (sin razonamiento) 🏠 269 312 1 582
33 Qwen3.8 Max 💡 264 51 1 316
34 Grok 4.6 💡 223 92 0 315
35 Qwen3.6 35B A3B Q8_0 💡 🏠 219 342 2 563
36 Qwen3.8 27B Q8_0 💡 🏠 214 79 0 293
37 Inkling 💡 211 124 0 335
38 Gemma 4 31B Q6_K 💡 🏠 201 95 1 297
39 Gemma 4 31B Q6_K (sin razonamiento) 🏠 198 99 1 298
40 Nemotron 3 Super 120B A12B Q4_K_M 💡 🏠 193 356 0 549
41 Mistral Medium 3.5 128B Q4_K_M (sin razonamiento) 🏠 191 615 0 806
42 Gemma 4 26B A4B Q6_K 💡 🏠 190 109 0 299
43 Aion 3.0 💡 183 145 0 328
44 Qwen3.8 27B Q6_K 💡 🏠 178 122 0 300
45 Gemma 4 26B A4B Q8_0 (sin razonamiento) 🏠 177 116 0 293
47 Seed 2.1 Turbo (sin razonamiento) 170 161 0 331
48 Gemma 4 31B Q8_0 (sin razonamiento) 🏠 159 121 1 281
49 Hy3 💡 156 171 0 327
51 Gemma 4 E2B Q4_K_M 💡 🏠 145 385 0 530
52 Gemma 4 12B QAT-Q4_0 (sin razonamiento) 🏠 139 141 0 280
53 Gemma 4 E2B Q8_0 💡 🏠 138 392 0 530
54 Gemma 4 12B Q6_K 💡 🏠 135 160 0 295
55 Qwen3.6 35B A3B Q8_0 (sin razonamiento) 🏠 135 431 0 566
56 Qwen3.8 27B Q4_K_M 💡 🏠 132 166 0 298
57 Granite 4.2 8B Q4_K_M 💡 🏠 130 360 0 490
58 Gemma 4 26B A4B Q6_K (sin razonamiento) 🏠 129 170 0 299
59 Qwen3.8 27B Q4_K_M (sin razonamiento) 🏠 128 171 0 299
60 Gemma 4 12B Q6_K (sin razonamiento) 🏠 126 180 0 306
61 MiMo V2.5 💡 125 526 3 654
62 Qwen3.8 27B Q6_K (sin razonamiento) 🏠 124 171 0 295
63 Gemma 4 E4B Q8_0 💡 🏠 120 397 2 519
64 Gemma 4 E4B Q8_0 (sin razonamiento) 🏠 115 402 0 517
65 Qwen3.8 27B Q8_0 (sin razonamiento) 🏠 111 184 0 295
66 Mistral Medium 3.5 💡 108 206 1 315
67 Granite 4.2 30B Q8_0 💡 🏠 107 383 0 490
68 Granite 4.2 8B Q6_K 💡 🏠 99 382 0 481
69 Gemma 4 26B A4B QAT-Q4_0 (sin razonamiento) 🏠 98 180 0 278
70 Gemma 4 E2B Q8_0 (sin razonamiento) 🏠 97 211 0 308
71 Granite 4.2 30B Q4_K_M 💡 🏠 95 390 0 485
72 Nemotron 3 Nano Omni 30B A3B Q4_K_M 💡 🏠 92 458 0 550
73 Granite 4.2 30B Q6_K 💡 🏠 91 223 0 314
75 Gemma 4 E4B Q6_K 💡 🏠 85 208 0 293
76 Gemini 3.7 Flash 💡 83 71 0 154
77 Gemma 4 E2B Q4_K_M (sin razonamiento) 🏠 81 198 0 279
78 Gemma 4 E2B Q6_K 💡 🏠 81 217 0 298
79 Gemma 4 E2B Q6_K (sin razonamiento) 🏠 75 223 1 299
81 Gemma 4 E4B Q6_K (sin razonamiento) 🏠 71 227 0 298
82 Gemma 4 E4B Q4_K_M (sin razonamiento) 🏠 71 229 0 300
83 Gemma 4 E4B Q4_K_M 💡 🏠 61 232 0 293
84 Nemotron 3 Nano Omni 30B A3B Q8_0 💡 🏠 49 291 0 340
85 Qwen3.6 35B A3B Q4_K_M (sin razonamiento) 🏠 44 236 0 280
86 Granite 4.2 8B Q8_0 💡 🏠 26 288 0 314

Las IA ya han votado. Ahora te toca.

Un juez de IA puede leer miles de duelos sin café ni pausa para comer. Aun así, no sabe qué te hace reír, te emociona o te anima a seguir leyendo. Tu voto a ciegas alimenta una clasificación humana independiente y revela los desacuerdos más interesantes entre personas y máquinas.

Comparar dos textos a ciegas