Volver a Novedades
Nueva featureDestacado25 de julio de 2026

Kimi K3: el modelo open-weight más grande jamás lanzado, ya en Napsix

Moonshot AI lanzó Kimi K3: 2.8 billones de parámetros, 1M de contexto, visión nativa. Diseñó su propio chip en 48 horas y editó su propio video de lanzamiento. Ya integrado en el AI Gateway.

aimodelosmoonshotkimi-k3open-source
Kimi K3: el modelo open-weight más grande jamás lanzado, ya en Napsix

Moonshot AI lanzó Kimi K3 el 16 de julio de 2026 — el primer modelo open-weight de clase 3T jamás publicado — y ya está integrado en el AI Gateway de Napsix.

Por qué importa

Kimi K3 es un modelo de 2.8 billones de parámetros (Mixture-of-Experts, activa 16 de 896 expertos por token) construido sobre dos innovaciones de arquitectura propias — Kimi Delta Attention (KDA) y Attention Residuals (AttnRes) — que junto a un entrenamiento refinado logran una eficiencia de escalado ~2.5× mejor que la generación anterior (Kimi K2). Marca el último paso del push sostenido de Kimi en la frontera del escalado: durante 9 de los últimos 12 meses, los modelos de Kimi marcaron el límite superior de tamaño entre los modelos abiertos.

Aunque todavía queda por detrás de los modelos propietarios más fuertes (Claude Fable 5 y GPT-5.6 Sol), Kimi K3 mostró rendimiento de nivel frontier en la mayoría de las evaluaciones, superando de forma consistente a todos los demás modelos probados — y es primero entre los modelos abiertos en el índice de inteligencia de Artificial Analysis, además de liderar el ranking de Arena.ai para desarrollo web frontend (1679 Elo, primero en 6 de 7 dominios frontend).

Kimi K3: comparativa de benchmarks contra los modelos propietarios y abiertos líderes

Casos de uso reales que sorprendieron

Moonshot documentó varios estudios de caso que muestran hasta dónde llega la capacidad agéntica de larga duración de K3:

  • Optimización de kernels GPU: en una sandbox idéntica con hasta 24 horas para perfilar, reescribir y benchmarquear 4 tareas (AttnRes, KDA y un kernel MLA de 512 dimensiones por cabeza) sobre GPUs NVIDIA Hopper y una GPGPU alternativa, K3 rindió competitivo con Fable 5 (con fallback) y superó ampliamente a Opus 4.8, GPT 5.6 Sol y GPT 5.5.
  • Compilador de GPU desde cero: K3 desarrolló MiniTriton, un compilador compacto tipo Triton con su propia capa IR a nivel de tile sobre MLIR, pasos de optimización y un pipeline de generación de código PTX. En los benchmarks roofline soportados, MiniTriton rinde a la par o mejor que Triton y torch.compile — superando a Triton en ciertas cargas de trabajo — y sostiene entrenamiento completo de nanoGPT con convergencia estable.
  • Diseño de chips: como prueba de concepto, K3 diseñó un chip para servir un modelo nano construido sobre su propia arquitectura. En una corrida autónoma de 48 horas, construyó, optimizó y verificó el chip usando herramientas EDA open-source (librería Nangate 45nm). En apenas 4 mm², el chip cierra timing a 100 MHz y sostiene más de 8.700 tokens/s de decode throughput en simulación, empaquetando 1.46 millones de celdas estándar, 0.277 MB de SRAM y un array MAC INT4 con dequantización fusionada.
  • Coding para investigación: K3 completó en ~2 horas lo que normalmente tomaría 1-2 semanas de trabajo a un investigador experimentado — reprodujo las relaciones universales I-Love-Q en astrofísica computacional: revisó y validó de forma cruzada 20+ papers, implementó el pipeline numérico completo, evaluó 300+ ecuaciones de estado, identificó inconsistencias en fórmulas publicadas, generó 3.000+ líneas de código Python, y produjo un dashboard HTML interactivo para explorar los resultados.
  • Edición de video: en un ejemplo llamativo, K3 editó su propio video teaser desde 56 clips fuente, manejando selección de clips, cortes sincronizados con el movimiento, sincronización de beats cuadro por cuadro, procesamiento de audio y múltiples rondas de revisión — un video corto de esa densidad normalmente le tomaría a un editor experimentado entre 1 y 2 días de trabajo, o de 3 a 5 a un principiante.

Kimi K3 en acción: interfaz de trabajo con widgets y dashboards persistentes

Arquitectura

K3 combina Stable LatentMoE (activando 16 de 896 expertos) con Quantile Balancing (deriva la asignación de expertos directamente de los cuantiles del router, sin heurísticas ni hiperparámetros de balanceo sensibles) y Per-Head Muon (optimiza cada cabeza de atención de forma independiente). Sigmoid Tanh Unit (SiTU) y Gated MLA mejoran el control de activaciones y la selectividad de la atención respectivamente. El entrenamiento aplica cuantización MXFP4 (pesos) + MXFP8 (activaciones) desde la etapa de fine-tuning, y Moonshot contribuyó una implementación de cache de prefill para KDA a la comunidad vLLM, disponible junto con el modelo.

Precio y disponibilidad

$0.30 por millón de tokens en cache-hit de entrada, $3.00 por millón en cache-miss de entrada, y $15.00 por millón de tokens de salida — potenciado por la arquitectura de inferencia desagregada de Mooncake, que logra una tasa de acierto de cache superior al 90% en cargas de trabajo de coding.

Disponible hoy en Kimi.com, Kimi Work, Kimi Code y la API de Kimi (Kimi Platform). Los pesos completos del modelo se publican el 27 de julio de 2026 — lo que lo convierte en el modelo open-weight más grande jamás publicado. Moonshot compartió el video oficial de lanzamiento en X.

⚠️ Limitaciones que documenta el propio Moonshot: K3 es sensible al historial de pensamiento (usar un harness que preserve el thinking completo, como Kimi Code) y puede mostrar proactividad excesiva en tareas ambiguas de larga duración — conviene imponer restricciones de comportamiento explícitas en el prompt del sistema si tu aplicación necesita límites bien definidos.

En Napsix

Kimi K3 ya está activo en el catálogo de modelos de Napsix (servido vía OpenRouter, con Moonshot directo como camino futuro más barato). Elegilo desde el selector de modelos del chat de XIA para tareas de coding de larga duración, trabajo de conocimiento o razonamiento profundo.

XIA
público