Kimi K3, Opus 5 y los mejores modelos de julio 2026: código, imágenes y casos de uso.
Julio de 2026 fue un mes inusualmente movido: Moonshot AI liberó Kimi K3, el mayor modelo de pesos abiertos de la historia (2.8 billones de parámetros)[3] [4], y ocho días después Anthropic lanzó Claude Opus 5, que tomó el primer lugar del índice de inteligencia de Artificial Analysis a la mitad del costo de Fable 5[1] [8]. Aquí comparo, con fuentes citadas, quién lidera hoy en código, en generación de imágenes y en cada caso de uso.
61 vs 60
Opus 5 supera a Fable 5 por 1 punto en el AA Intelligence Index[8]
42/42
puntaje perfecto de Opus 5 en la IMO 2026 (oro: 29)[8]
2.8T
parámetros de Kimi K3, el mayor modelo abierto publicado[3]
Código: Opus 5 al frente, Kimi K3 pisándole los talones_
En SWE-bench Verified — resolver issues reales de GitHub de punta a punta — el podio de julio quedó así[5]:
Fuente: BenchLM.ai, jul 2026 [5]. DataCamp reporta 96.0% para Opus 5 [7] — discrepancia menor típica entre corridas y configuraciones.
En Terminal-Bench 2.1 — tareas agénticas reales en una terminal — la pelea es de décimas: los cuatro punteros caben en 1.1 puntos[6] [7]:
Fuente: CodingFleet, 25 jul 2026 [6]; Fable 5 según DataCamp [7]. Kimi K3 medido con KimiCode a razonamiento máximo.
El matiz interesante: en frontend, Kimi K3 quedó #1 del Frontend Code Arena con 1,679 puntos, por delante de Fable 5[4] — notable para un modelo cuyos pesos puedes descargar. Moonshot mismo admite, eso sí, una brecha de experiencia de uso frente a Fable 5 y GPT-5.6 Sol pese a los números[11] [12].
Imágenes: GPT Image 2 sin rival por ahora_
En generación de imágenes no hay pelea que contar: GPT Image 2 (OpenAI, abril 2026) lidera todas las arenas de votación humana ciega tres meses después de su salida, y la brecha no se ha cerrado[9] [10]. En la Image Arena de Artificial Analysis suma un Elo de 1,340 sobre 13,289 comparaciones a ciegas[10].
Fuente: LLM Stats, jul 2026 [9]. Los votantes eligen entre imágenes sin ver qué modelo las generó.
¿Cuál elegir? Depende del caso de uso_
Ningún modelo gana en todo. Esta tabla resume la recomendación por caso con su evidencia:
| Caso de uso | Recomendado | Evidencia |
|---|---|---|
| Código y agentes en terminal | Claude Opus 5 | 97.0% en SWE-bench Verified y 89.1% en Terminal-Bench 2.1[5] [6] |
| Frontend / UI | Kimi K3 | #1 en Frontend Code Arena (1,679), por delante de Fable 5[4] |
| Tareas largas con verificación | Claude Fable 5 | persistencia agéntica: itera hasta que la tarea realmente pasa; 80.3% en SWE-bench Pro[2] [7] |
| Generación de imágenes | GPT Image 2 | líder de todas las arenas desde abril; Elo 1,340 en AA Image Arena[9] [10] |
| Matemáticas | Claude Opus 5 | 42/42 en los problemas de la IMO 2026 (umbral de oro: 29)[8] |
| Computer use (control de PC) | Claude Opus 5 | 70.6% en OSWorld 2.0 vs 66.1% de Fable 5, a ~1/3 del costo[1] [7] |
| Open source / self-host | Kimi K3 | el mayor modelo de pesos abiertos (2.8T parámetros), 2–3× más fácil de correr que un frontier[3] [4] |
| Problemas nunca vistos | Claude Opus 5 | 30.2% en ARC-AGI-3, 3× el siguiente mejor (GPT-5.6 Sol: 7.8%)[7] |
El factor precio_
Parte del impacto de Opus 5 es económico: cuesta $5 / $25 por millón de tokens (entrada/salida) — la mitad que Fable 5 ($10 / $50) — y Anthropic reporta costos por tarea de ~50% frente a Fable en varios benchmarks[1] [7] [8]. Kimi K3 juega otra liga: los pesos son abiertos, así que el costo es tu infraestructura — y según Tom's Hardware corre 2–3× más fácil que un modelo frontier equivalente[4].
Conclusión_
Si programas, Opus 5 es hoy la referencia en precio/rendimiento; si haces frontend o quieres self-host, Kimi K3 cambió lo que se puede esperar de un modelo abierto; para imágenes, GPT Image 2 no tiene contendiente serio todavía. Y la lección transversal de julio: los leaderboards se mueven cada semana — por eso cada cifra de arriba lleva su fuente y su fecha.
Referencias
- [1]Anthropic (anuncio oficial) — “Introducing Claude Opus 5”, 24 jul 2026.
- [2]Anthropic (anuncio oficial) — “Claude Fable 5 and Claude Mythos 5”, 9 jun 2026.
- [3]VentureBeat — “Moonshot AI releases Kimi K3, the largest open-source model ever”, jul 2026.
- [4]Tom's Hardware — “China's 2.8-trillion-parameter Kimi K3 beats Claude Fable 5 in Frontend Code Arena”, jul 2026.
- [5]BenchLM.ai (leaderboard independiente) — “SWE-bench Verified Leaderboard (July 2026)”, jul 2026.
- [6]CodingFleet (leaderboard independiente) — “Terminal-Bench 2.1 Leaderboard: Claude Opus 5 Added”, 25 jul 2026.
- [7]DataCamp — “Claude Opus 5 vs Fable 5: Benchmarks and Pricing”, jul 2026.
- [8]MLQ.ai — “Anthropic Launches Claude Opus 5, Tops AI Benchmark Index at Half the Cost of Fable 5”, jul 2026.
- [9]LLM Stats (votación humana ciega) — “Best AI for Image Generation in 2026 — Ranked by Blind Human Votes”, jul 2026.
- [10]WaveSpeed / Artificial Analysis Image Arena — “LM Arena Text-to-Image Rankings 2026”, jul 2026.
- [11]Simon Willison (análisis independiente) — “Kimi K3, and what we can still learn from the pelican benchmark”, 16 jul 2026.
- [12]Kili Technology — “Kimi K3's Benchmarks and Hallucinations — What That Tells Us About AI Evaluation”, jul 2026.