Blog
8 min de lecturaIAComparativasBenchmarks

Kimi K3, Opus 5 y los mejores modelos de julio 2026: código, imágenes y casos de uso.

Julio de 2026 fue un mes inusualmente movido: Moonshot AI liberó Kimi K3, el mayor modelo de pesos abiertos de la historia (2.8 billones de parámetros)[3] [4], y ocho días después Anthropic lanzó Claude Opus 5, que tomó el primer lugar del índice de inteligencia de Artificial Analysis a la mitad del costo de Fable 5[1] [8]. Aquí comparo, con fuentes citadas, quién lidera hoy en código, en generación de imágenes y en cada caso de uso.

61 vs 60

Opus 5 supera a Fable 5 por 1 punto en el AA Intelligence Index[8]

42/42

puntaje perfecto de Opus 5 en la IMO 2026 (oro: 29)[8]

2.8T

parámetros de Kimi K3, el mayor modelo abierto publicado[3]

Código: Opus 5 al frente, Kimi K3 pisándole los talones_

En SWE-bench Verified — resolver issues reales de GitHub de punta a punta — el podio de julio quedó así[5]:

SWE-bench Verified · % de issues resueltos
Claude Opus 597.0%
GPT-5.6 Sol96.2%
Claude Fable 595.0%
Kimi K393.4%
GPT-5.6 Luna93.0%
Claude Opus 4.888.6%
Grok 4.586.6%

Fuente: BenchLM.ai, jul 2026 [5]. DataCamp reporta 96.0% para Opus 5 [7] — discrepancia menor típica entre corridas y configuraciones.

En Terminal-Bench 2.1 — tareas agénticas reales en una terminal — la pelea es de décimas: los cuatro punteros caben en 1.1 puntos[6] [7]:

Terminal-Bench 2.1 · % de tareas completadas
Claude Opus 589.1%
GPT-5.6 Sol88.8%
Kimi K388.3%
Claude Fable 588.0%

Fuente: CodingFleet, 25 jul 2026 [6]; Fable 5 según DataCamp [7]. Kimi K3 medido con KimiCode a razonamiento máximo.

El matiz interesante: en frontend, Kimi K3 quedó #1 del Frontend Code Arena con 1,679 puntos, por delante de Fable 5[4] — notable para un modelo cuyos pesos puedes descargar. Moonshot mismo admite, eso sí, una brecha de experiencia de uso frente a Fable 5 y GPT-5.6 Sol pese a los números[11] [12].

Imágenes: GPT Image 2 sin rival por ahora_

En generación de imágenes no hay pelea que contar: GPT Image 2 (OpenAI, abril 2026) lidera todas las arenas de votación humana ciega tres meses después de su salida, y la brecha no se ha cerrado[9] [10]. En la Image Arena de Artificial Analysis suma un Elo de 1,340 sobre 13,289 comparaciones a ciegas[10].

Generación de imágenes · puntaje de arena (votos humanos ciegos)
GPT Image 2446
GPT Image 1.5315
MAI-Image-2.5215

Fuente: LLM Stats, jul 2026 [9]. Los votantes eligen entre imágenes sin ver qué modelo las generó.

¿Cuál elegir? Depende del caso de uso_

Ningún modelo gana en todo. Esta tabla resume la recomendación por caso con su evidencia:

Caso de usoRecomendadoEvidencia
Código y agentes en terminalClaude Opus 597.0% en SWE-bench Verified y 89.1% en Terminal-Bench 2.1[5] [6]
Frontend / UIKimi K3#1 en Frontend Code Arena (1,679), por delante de Fable 5[4]
Tareas largas con verificaciónClaude Fable 5persistencia agéntica: itera hasta que la tarea realmente pasa; 80.3% en SWE-bench Pro[2] [7]
Generación de imágenesGPT Image 2líder de todas las arenas desde abril; Elo 1,340 en AA Image Arena[9] [10]
MatemáticasClaude Opus 542/42 en los problemas de la IMO 2026 (umbral de oro: 29)[8]
Computer use (control de PC)Claude Opus 570.6% en OSWorld 2.0 vs 66.1% de Fable 5, a ~1/3 del costo[1] [7]
Open source / self-hostKimi K3el mayor modelo de pesos abiertos (2.8T parámetros), 2–3× más fácil de correr que un frontier[3] [4]
Problemas nunca vistosClaude Opus 530.2% en ARC-AGI-3, 3× el siguiente mejor (GPT-5.6 Sol: 7.8%)[7]

El factor precio_

Parte del impacto de Opus 5 es económico: cuesta $5 / $25 por millón de tokens (entrada/salida) — la mitad que Fable 5 ($10 / $50) — y Anthropic reporta costos por tarea de ~50% frente a Fable en varios benchmarks[1] [7] [8]. Kimi K3 juega otra liga: los pesos son abiertos, así que el costo es tu infraestructura — y según Tom's Hardware corre 2–3× más fácil que un modelo frontier equivalente[4].

Conclusión_

Si programas, Opus 5 es hoy la referencia en precio/rendimiento; si haces frontend o quieres self-host, Kimi K3 cambió lo que se puede esperar de un modelo abierto; para imágenes, GPT Image 2 no tiene contendiente serio todavía. Y la lección transversal de julio: los leaderboards se mueven cada semana — por eso cada cifra de arriba lleva su fuente y su fecha.

Referencias

  1. [1]Anthropic (anuncio oficial) — “Introducing Claude Opus 5”, 24 jul 2026.
  2. [2]Anthropic (anuncio oficial) — “Claude Fable 5 and Claude Mythos 5”, 9 jun 2026.
  3. [3]VentureBeat — “Moonshot AI releases Kimi K3, the largest open-source model ever”, jul 2026.
  4. [4]Tom's Hardware — “China's 2.8-trillion-parameter Kimi K3 beats Claude Fable 5 in Frontend Code Arena”, jul 2026.
  5. [5]BenchLM.ai (leaderboard independiente) — “SWE-bench Verified Leaderboard (July 2026)”, jul 2026.
  6. [6]CodingFleet (leaderboard independiente) — “Terminal-Bench 2.1 Leaderboard: Claude Opus 5 Added”, 25 jul 2026.
  7. [7]DataCamp — “Claude Opus 5 vs Fable 5: Benchmarks and Pricing”, jul 2026.
  8. [8]MLQ.ai — “Anthropic Launches Claude Opus 5, Tops AI Benchmark Index at Half the Cost of Fable 5”, jul 2026.
  9. [9]LLM Stats (votación humana ciega) — “Best AI for Image Generation in 2026 — Ranked by Blind Human Votes”, jul 2026.
  10. [10]WaveSpeed / Artificial Analysis Image Arena — “LM Arena Text-to-Image Rankings 2026”, jul 2026.
  11. [11]Simon Willison (análisis independiente) — “Kimi K3, and what we can still learn from the pelican benchmark”, 16 jul 2026.
  12. [12]Kili Technology — “Kimi K3's Benchmarks and Hallucinations — What That Tells Us About AI Evaluation”, jul 2026.
Volver al blog