Guías
11 min min de lectura
AI Observer

Kimi K3 en Ollama y VRAM: ¿se puede correr en local ya?

Hub de Kimi K3: Specs, precio, id de API → /kimi-k3. Timeline → /kimi-k3-status. Calendario de open weights → chequeo del 27 de julio.

Escribiste kimi k3 ollama, kimi k3 vram o kimi k3 download porque el feed decía que el modelo es «open». Luego abriste Hugging Face o la librería de Ollama y… no hay un camino limpio de instalación.

Ese vacío no es culpa tuya. Es la diferencia entre «open» de marketing y archivos que de verdad puedas cargar.

Esta guía responde solo a las preguntas locales: ¿Puedes correr Kimi K3 en tu máquina ya? ¿Cuánta VRAM? ¿Cuándo llegarán Ollama/GGUF? ¿Qué hacer esta semana en su lugar?

Este sitio es independiente de Moonshot. Los hechos de abajo siguen la documentación pública a 21 de julio de 2026—vuelve a mirar el blog oficial de K3 y Moonshot en Hugging Face antes de comprar GPUs o confiar en un repo random.

Respuesta corta (léela primero)

  1. Aún no hay un dump público fiable de pesos completos de K3 (a fecha de este texto). Producto + API están vivos; la empresa dijo pesos completos para el 27 de julio de 2026. Hasta que aparezca un repo real de Moonshot con archivos, no puedes hacer un ollama pull honesto del K3 completo.
  2. La escala es de unos 2.8 billones de parámetros (2.8T) con sparsity al estilo MoE (oficial: activar 16 de 896 expertos). Eso puede ayudar a la eficiencia de serving frente a un denso de 2.8T—no convierte a K3 en un juguete de portátil con 24 GB.
  3. La propia nota de serving de Moonshot apunta a un despliegue tipo supernodo con 64+ aceleradores. Léelo así: forma de datacenter, no «una tarjeta gaming y un sueño».
  4. Lo que sí funciona hoy: kimi.com, Kimi Work, Kimi Code y el id de API kimi-k3 en platform.kimi.ai. Para pesos open ya descargables, quédate en las fichas de la familia K2.6 / K2.7 Code—no en K3.

En una frase: usa la API o la app esta semana; trata el K3 local como un evento de finales de julio que re-verificas, no como un comando que funciona esta noche.

Tarjeta de lanzamiento de open weights de Kimi K3: 2.8T de parámetros, contexto de 1M, pesos previstos para el 27 de julio

Fuente: compartido comunitario del mensaje oficial de lanzamiento de K3; cruzar con el blog técnico de Kimi K3, Moonshot AI, 16 de julio de 2026.

Qué busca la gente de verdad (cuatro trabajos distintos)

Los buscadores meten todo esto en un solo blob. Sepáralos:

Lo que escribisteLo que probablemente quieres¿Disponible hoy?
kimi k3 huggingface / downloadArchivos oficiales de pesosNo como checkpoint público acabado de K3 (re-revisa cerca del 27 de julio)
kimi k3 ollama / ggufChat local con un solo comandoAún no—hacen falta pesos + empaquetado de comunidad/runtime
kimi k3 vram / local requirements«¿Cabe en mi GPU?»Todavía no hay tabla honesta de GB fijos—solo escala + guía oficial multi-acelerador
kimi k3 self hostCorrerlo en tu VPC/clusterDespués de pesos + soporte de stack (vLLM / partners); planifica hierro de clase cluster

Si te quedas con una sola fila: intención de download ≠ intención de Ollama ≠ «ilimitado y gratis en mi PC».

Para el calendario amplio de open weights (no solo hardware local), ver nuestro post de open weights del 27 de julio. Esta página profundiza en la realidad de Ollama / VRAM / self-host.

Qué ha dicho Moonshot de verdad (lo relevante en local)

Del anuncio oficial de Kimi K3 (16 de julio de 2026):

HechoPor qué importa en local
2.8T de parámetros, primer claim open de clase 3TTu modelo mental de «modelo open grande» acaba de saltar otra vez
Contexto de 1M tokens, visión nativaContexto largo + multimodalidad suben el dolor de memoria e I/O al self-hostear
MoE: en la práctica 16 de 896 expertos + framing Stable LatentMoELa activación sparse ayuda al cómputo, no magia de «el portátil cabe con el total de params»
Entrenamiento quantization-aware: pesos MXFP4 / activaciones MXFP8 (su wording)Sugiere que les importa el serving eficiente—no una ficha de quant de consumo publicada
Pesos completos para el 27 de julio de 2026 + tech report alrededor de esa fechaEvento de calendario, no un botón de descarga hoy
Alineación con partners de inference y mantenedores open-sourceEspera lag del stack (vLLM, etc.) incluso después de que aparezcan los archivos
Recomiendan deploy tipo supernodo con 64+ aceleradoresEl chequeo de hardware oficial más cercano—no una guía de instalación en un 4090

Precio de lista de la API (USD / 1M tokens) mientras esperas: input cache-hit $0.30, input cache-miss $3.00, output $15.00. El thinking de lanzamiento va a max effort por defecto—prompts cortos igual pueden quemar tokens serios de razonamiento.

Gráfica oficial de benchmarks de coding de Kimi K3 (max effort)

Fuente: medios oficiales de lanzamiento de K3 / blog de Kimi K3, 16 de julio de 2026.

Realidad de VRAM (sin inventar una tabla de GB)

La gente quiere un cuadro limpio: «Q4 = XX GB, Q5 = YY GB, hace falta 2×H100».

No vamos a inventar uno.

Por qué sería deshonesto ahora mismo:

  • Los pesos públicos completos de K3 aún no están confirmados en disco para la comunidad.
  • La receta oficial de quant para tu máquina no es una página de producto de consumo acabada.
  • Los builds de comunidad GGUF/AWQ/EXL2—si aparecen—suelen retrasarse respecto al dump del día 0, y la calidad varía.
  • Expertos activados ≠ parámetros totales en disco. La sparsity MoE puede recortar cómputo activo; no implica automáticamente «solo almacenas 16 expertos».

Lo que puedes usar como chequeo de realidad:

  1. 2.8T en total está en otro universo respecto a «pequeño coder open que corre en un portátil».
  2. La recomendación de Moonshot de 64+ aceleradores es la forma de serving de la propia empresa para throughput competitivo—no una nota al pie para aficionados.
  3. Si no operas ya clusters multi-nodo de GPU (o pagas a quien lo hace), tus caminos prácticos son API, apps de producto o un host gestionado futuro—no «lo quantizo el fin de semana y me olvido de la luz».

Cuando aterricen los pesos, los artefactos útiles serán: id del repo, LICENSE, tamaños de archivo, notas oficiales de serving, endpoints de partners y los primeros README de quant de confianza. Hasta que existan, cualquier post de «VRAM exacta de K3 en un 5090» es fan fiction.

Ollama, GGUF y plazos de «cómo correrlo en local»

Hoy (21 de julio de 2026):

  • No hay una entrada verificada de un solo paso en la librería de Ollama para el Kimi K3 completo a la que podamos apuntarte con confianza.
  • Los packs GGUF requieren pesos base + pipeline de conversión + alguien que los publique. Nada de eso está «listo» hasta que existan el dump oficial (y el tooling de comunidad).
  • Los modelos open más viejos de Kimi (por ejemplo K2.6, K2.7 Code) son los que ya puedes bajar de Hugging Face y cablear a stacks locales—no confundas sus tags con K3.

Después de que caigan los pesos (mira el calendario; no celebres antes de tiempo):

  1. Confirma un repo de Moonshot (o claramente oficial) con archivos reales—no un placeholder, no un mirror con nombre raro.
  2. Lee la LICENSE de ese repo (líneas open anteriores de Kimi solían usar una licencia estilo Modified MIT; K3 no está cerrado hasta que el archivo salga).
  3. Revisa las notas de soporte de vLLM / SGLang / otros—Moonshot ya dijo que la alineación del ecosistema importa para la arquitectura de K3 (incluido trabajo de serving relacionado con KDA mencionado en su blog).
  4. Solo entonces busques ports de comunidad de Ollama / GGUF. Espera días o semanas de lag para blogs de «me funciona en mi máquina», y más para quants de calidad.
  5. Reevalúa el coste: cluster self-host + luz + ops vs API $3/$15 (más cache hits). Muchos equipos mantendrán la API para el pico de inteligencia y hostearán modelos open más pequeños para bulk offline.

Gráfica oficial de benchmarks de agentes / capacidad general de Kimi K3 en el lanzamiento

Fuente: medios oficiales de lanzamiento de K3 / blog de Kimi K3, 16 de julio de 2026.

Checklist del 27 de julio (para gente de local / self-host)

Úsalo solo cuando aparezca algo real—no como invitación a fiesta con calendarios vacíos.

  • Confirmación oficial de que los pesos están fuera (blog/X/HF), no solo «pronto»
  • Repo en Hugging Face (u otro) bajo Moonshot con shards descargables
  • LICENSE leída de cabo a rabo
  • README: camino de serving (vLLM / otro), límites conocidos, notas multimodales
  • Tamaños de archivo / opciones de quant listados por alguien creíble (preferir oficial o hosts grandes primero)
  • Si Ollama / llama.cpp / etc. tiene un camino de soporte real y versionado
  • Tu árbol de decisión: API por defecto vs host gestionado vs cluster self-host
  • Presupuesto de tiempo de ops—no solo de GPUs

Seguiremos el estado de alto nivel en /kimi-k3-status. Confía en fuentes primarias más que en capturas.

Qué correr esta semana en su lugar

Tu objetivoHaz esto
Sentir la calidad de K3 en una tarea duraApp / API kimi-k3 con presupuesto piloto fijo
Enviar código cada díaKimi Code + mantén caliente el camino de K2.7 Code
Quedarte en local yaSelf-hostea pesos ya open de K2.x (K2.6 / K2.7 Code)—no K3
Experimentos de producto «gratis»Ver opciones free con honestidad—cupos de producto ≠ API free ≠ self-host free
Qué SKU para qué trabajoK2.6 vs K2.7 vs K3

Si los altas nuevas o la capacidad de membresía van justas (Moonshot ha gestionado picos de demanda en público tras el lanzamiento), la API y los caminos de acceso existentes siguen importando más que un binario local que falta.

Filtros de ruido (edición local)

«Ya está en Ollama.»
Trata nombres de librería sin verificar y tags de mirrors como sospechosos hasta que apunten a un checkpoint real de Moonshot (o claramente derivado) y a un runbook que funcione.

«Open weights = K3 local ilimitado y gratis.»
Los open weights quitan un candado del vendor. No quitan la física, la electricidad, las ops multi-GPU ni los límites de licencia.

«MoE significa que mi tarjeta de 24 GB va bien.»
La sparsity ayuda al cómputo activo. El almacenamiento total, el routing de expertos, el contexto largo y la visión siguen doliendo. La guía oficial de serving es multi-acelerador.

«La ficha de HF llamada kimi-k3 tiene que ser oficial.»
Mira org, archivos, licencia, enlace del anuncio. Prefiere huggingface.co/moonshotai a renombres random.

«Espero y me salto la API para siempre.»
Vale para curiosidad de investigación. Malo para deadlines de producto. Pilota K3 donde el razonamiento premium pague; mantén SKUs más baratos/open para el bulk.

FAQ

¿Puedo descargar Kimi K3 hoy?
Planifica un no para un dump público oficial completo a 21 de julio de 2026. Promesa oficial: pesos completos para el 27 de julio de 2026. Re-revisa la org de Moonshot y el blog de K3.

¿Puedo correr Kimi K3 en Ollama hoy?
No de ninguna forma completa y de confianza que podamos recomendar. Sin pesos → no hay camino honesto de Ollama.

¿Cuánta VRAM necesito?
Desconocida como número preciso de consumo. Usa la escala oficial + la guía de serving de 64+ aceleradores como brújula: si no corres ya GPUs en cluster, presupuesta API o inference hospedada.

¿K3 es open source u open weight?
El lenguaje de lanzamiento enfatiza open weights para un modelo de clase 3T. El texto final de licencia sale con los archivos—léelo entonces. «Open» en un titular no sustituye a la LICENSE.

¿Y los modelos K2 en local?
Las líneas open anteriores de Kimi (p. ej. K2.6, K2.7 Code) son las opciones prácticas de self-host hoy. No pegues un tag de K2 en un script y lo llames K3.

¿Este sitio es oficial de Moonshot?
No. Cruza con kimi.com/blog/kimi-k3 y platform.kimi.ai antes de gastar dinero o rackear hardware.

En resumen

Quien busca en local no está loco—la demanda de HF / download / Ollama / VRAM es real. Lo que falta es el artefacto: un release público de pesos de K3 que puedas verificar, más un stack que de verdad lo cargue.

Hasta que aterrice, la jugada inteligente es aburrida:

  • Pilota K3 en el producto o la API donde una tarea dura valga la factura de tokens.
  • Self-hostea los modelos open K2.x que ya puedes bajar si necesitas hierro offline.
  • Ignora las guías de «instala K3 en el portátil esta noche» que nunca muestran un repo real.
  • Re-revisa alrededor del 27 de julio—con el checklist de arriba, no solo con esperanza.

Siguientes lecturas: open weights 27 de julio · guía de lanzamiento de K3 · opciones free · qué modelo · hub de estado.

Artículos relacionados

¿Quieres Kimi K3 sin factura gorda? Qué es gratis hoy: recompensas al registrarte, límites del free tier, lo que sigue de pago y qué cambia de verdad el «open weights del 27 de julio».
Kimi K3 vs Claude y GPT no es “borra tus API keys”. La regla práctica de cambio: precio de lista, señales de coding y cuándo quedarte en Sonnet o Sol.
El feed grita “modelo open de clase 3T”, pero Hugging Face sigue vacío. Qué prometió Moonshot de verdad para el 27 de julio—y qué conviene correr esta semana en vez de soñar con la GPU del portátil.