← SCRAM AI Lab

Herramientas IA

Kimi K3, GLM-5.3 y DeepSeek V4-Flash: la frontera abierta de agosto 2026

El ranking open-weight se reordenó en tres semanas: Kimi K3 (Moonshot, 27 jul) lidera como todo-terreno con 2.8T de parámetros, 1M de contexto y 88.3 en Terminal-Bench 2.1; Z.ai lanzó GLM-5.3 el 14 de agosto con post-training escalado; y DeepSeek V4-Flash queda a 2.3 puntos de Opus 4.8 costando $0.14/$0.28 por millón de tokens. Análisis de cuál conviene según tu carga — y qué licencia trae cada uno.

August 19, 2026

24 lecturas

Kimi K3, GLM-5.3 y DeepSeek V4-Flash: la frontera abierta de agosto 2026

Tres semanas que reordenaron el ranking

Entre el 27 de julio y el 14 de agosto de 2026, la frontera open-weight cambió de líder dos veces. El estado al 19 de agosto: Kimi K3 es el mejor todo-terreno abierto, GLM-5.2/5.3 el más fuerte bajo licencia MIT plana, y DeepSeek V4-Flash el piso de costo para API hosteada.

Kimi K3 — el nuevo líder todo-terreno

  • Lanzado el 27 de julio por Moonshot con pesos en Hugging Face.
  • 2.8T de parámetros totales, 104B activos (MoE) y 1M de tokens de contexto.
  • 88.3 en Terminal-Bench 2.1 — el mejor puntaje open-weight registrado a agosto 2026.
  • Licencia: "Kimi K3 License", texto tipo MIT con un gate comercial: si tu revenue model-as-a-service supera los $20M anuales, necesitas licencia aparte. Para self-hosting interno y productos normales, en la práctica es libre.

GLM-5.3 — Z.ai escala el post-training

Z.ai publicó GLM-5.3 el 14 de agosto: la misma base que GLM-5.2 con post-training escalado. La familia GLM mantiene sus dos cartas fuertes: 1M de contexto sin pérdida (desde 5.2) y agentes de coding de larga duración. GLM-5.2 sigue siendo el modelo más fuerte bajo licencia MIT plana (62.1% SWE-bench Pro) — sin gates comerciales de ningún tipo, lo que importa si tu asesoría legal es alérgica a licencias custom.

DeepSeek V4-Flash — el piso de costo

  • La variante V4-Flash-0731 (MIT) queda a 2.3 puntos de Claude Opus 4.8 en Terminal-Bench 2.1, por delante de GLM-5.2.
  • API oficial: $0.14 por millón de tokens de entrada (sin caché) y $0.28 de salida, con 1M de contexto. Ningún modelo cerrado se acerca a ese costo por punto de benchmark.

Y el tier compacto: Qwen3.6-27B

Para quien necesita correr en una sola GPU, Qwen3.6-27B alcanza 77.2% en benchmarks de coding con un modelo denso de 27B — el mejor ratio capacidad/VRAM del momento para inferencia local seria.

Cuál elegir según tu carga

  • Agente todo-terreno con contexto masivo → Kimi K3 (si el gate de $20M no te aplica).
  • Coding de larga duración + licencia MIT limpia → GLM-5.2/5.3.
  • Volumen extremo por API al menor costo → DeepSeek V4-Flash.
  • Inferencia local en hardware modesto → Qwen3.6-27B.

Conclusión

La conversación de 2025 era "¿los abiertos alcanzarán a los cerrados?". La de agosto 2026 es otra: a qué costo por token quieres capacidad casi-frontera, y con qué licencia. Para presupuesto y soberanía de datos, el cómputo propio no solo compite — en varias cargas ya gana.

open-weight
kimi-k3
glm-5-3
deepseek
qwen
self-hosting
benchmarks
← Volver a SCRAM AI Lab