Kimi K3 en Ollama y VRAM: ¿se puede correr en local ya?
Hub de Kimi K3: Specs, precio, id de API → /kimi-k3. Timeline → /kimi-k3-status. Calendario de open weights → chequeo del 27 de julio.
Escribiste kimi k3 ollama, kimi k3 vram o kimi k3 download porque el feed decía que el modelo es «open». Luego abriste Hugging Face o la librería de Ollama y… no hay un camino limpio de instalación.
Ese vacío no es culpa tuya. Es la diferencia entre «open» de marketing y archivos que de verdad puedas cargar.
Esta guía responde solo a las preguntas locales: ¿Puedes correr Kimi K3 en tu máquina ya? ¿Cuánta VRAM? ¿Cuándo llegarán Ollama/GGUF? ¿Qué hacer esta semana en su lugar?
Este sitio es independiente de Moonshot. Los hechos de abajo siguen la documentación pública a 21 de julio de 2026—vuelve a mirar el blog oficial de K3 y Moonshot en Hugging Face antes de comprar GPUs o confiar en un repo random.
Respuesta corta (léela primero)
- Aún no hay un dump público fiable de pesos completos de K3 (a fecha de este texto). Producto + API están vivos; la empresa dijo pesos completos para el 27 de julio de 2026. Hasta que aparezca un repo real de Moonshot con archivos, no puedes hacer un
ollama pullhonesto del K3 completo. - La escala es de unos 2.8 billones de parámetros (2.8T) con sparsity al estilo MoE (oficial: activar 16 de 896 expertos). Eso puede ayudar a la eficiencia de serving frente a un denso de 2.8T—no convierte a K3 en un juguete de portátil con 24 GB.
- La propia nota de serving de Moonshot apunta a un despliegue tipo supernodo con 64+ aceleradores. Léelo así: forma de datacenter, no «una tarjeta gaming y un sueño».
- Lo que sí funciona hoy: kimi.com, Kimi Work, Kimi Code y el id de API
kimi-k3en platform.kimi.ai. Para pesos open ya descargables, quédate en las fichas de la familia K2.6 / K2.7 Code—no en K3.
En una frase: usa la API o la app esta semana; trata el K3 local como un evento de finales de julio que re-verificas, no como un comando que funciona esta noche.

Fuente: compartido comunitario del mensaje oficial de lanzamiento de K3; cruzar con el blog técnico de Kimi K3, Moonshot AI, 16 de julio de 2026.
Qué busca la gente de verdad (cuatro trabajos distintos)
Los buscadores meten todo esto en un solo blob. Sepáralos:
| Lo que escribiste | Lo que probablemente quieres | ¿Disponible hoy? |
|---|---|---|
| kimi k3 huggingface / download | Archivos oficiales de pesos | No como checkpoint público acabado de K3 (re-revisa cerca del 27 de julio) |
| kimi k3 ollama / gguf | Chat local con un solo comando | Aún no—hacen falta pesos + empaquetado de comunidad/runtime |
| kimi k3 vram / local requirements | «¿Cabe en mi GPU?» | Todavía no hay tabla honesta de GB fijos—solo escala + guía oficial multi-acelerador |
| kimi k3 self host | Correrlo en tu VPC/cluster | Después de pesos + soporte de stack (vLLM / partners); planifica hierro de clase cluster |
Si te quedas con una sola fila: intención de download ≠ intención de Ollama ≠ «ilimitado y gratis en mi PC».
Para el calendario amplio de open weights (no solo hardware local), ver nuestro post de open weights del 27 de julio. Esta página profundiza en la realidad de Ollama / VRAM / self-host.
Qué ha dicho Moonshot de verdad (lo relevante en local)
Del anuncio oficial de Kimi K3 (16 de julio de 2026):
| Hecho | Por qué importa en local |
|---|---|
| 2.8T de parámetros, primer claim open de clase 3T | Tu modelo mental de «modelo open grande» acaba de saltar otra vez |
| Contexto de 1M tokens, visión nativa | Contexto largo + multimodalidad suben el dolor de memoria e I/O al self-hostear |
| MoE: en la práctica 16 de 896 expertos + framing Stable LatentMoE | La activación sparse ayuda al cómputo, no magia de «el portátil cabe con el total de params» |
| Entrenamiento quantization-aware: pesos MXFP4 / activaciones MXFP8 (su wording) | Sugiere que les importa el serving eficiente—no una ficha de quant de consumo publicada |
| Pesos completos para el 27 de julio de 2026 + tech report alrededor de esa fecha | Evento de calendario, no un botón de descarga hoy |
| Alineación con partners de inference y mantenedores open-source | Espera lag del stack (vLLM, etc.) incluso después de que aparezcan los archivos |
| Recomiendan deploy tipo supernodo con 64+ aceleradores | El chequeo de hardware oficial más cercano—no una guía de instalación en un 4090 |
Precio de lista de la API (USD / 1M tokens) mientras esperas: input cache-hit $0.30, input cache-miss $3.00, output $15.00. El thinking de lanzamiento va a max effort por defecto—prompts cortos igual pueden quemar tokens serios de razonamiento.

Fuente: medios oficiales de lanzamiento de K3 / blog de Kimi K3, 16 de julio de 2026.
Realidad de VRAM (sin inventar una tabla de GB)
La gente quiere un cuadro limpio: «Q4 = XX GB, Q5 = YY GB, hace falta 2×H100».
No vamos a inventar uno.
Por qué sería deshonesto ahora mismo:
- Los pesos públicos completos de K3 aún no están confirmados en disco para la comunidad.
- La receta oficial de quant para tu máquina no es una página de producto de consumo acabada.
- Los builds de comunidad GGUF/AWQ/EXL2—si aparecen—suelen retrasarse respecto al dump del día 0, y la calidad varía.
- Expertos activados ≠ parámetros totales en disco. La sparsity MoE puede recortar cómputo activo; no implica automáticamente «solo almacenas 16 expertos».
Lo que sí puedes usar como chequeo de realidad:
- 2.8T en total está en otro universo respecto a «pequeño coder open que corre en un portátil».
- La recomendación de Moonshot de 64+ aceleradores es la forma de serving de la propia empresa para throughput competitivo—no una nota al pie para aficionados.
- Si no operas ya clusters multi-nodo de GPU (o pagas a quien lo hace), tus caminos prácticos son API, apps de producto o un host gestionado futuro—no «lo quantizo el fin de semana y me olvido de la luz».
Cuando aterricen los pesos, los artefactos útiles serán: id del repo, LICENSE, tamaños de archivo, notas oficiales de serving, endpoints de partners y los primeros README de quant de confianza. Hasta que existan, cualquier post de «VRAM exacta de K3 en un 5090» es fan fiction.
Ollama, GGUF y plazos de «cómo correrlo en local»
Hoy (21 de julio de 2026):
- No hay una entrada verificada de un solo paso en la librería de Ollama para el Kimi K3 completo a la que podamos apuntarte con confianza.
- Los packs GGUF requieren pesos base + pipeline de conversión + alguien que los publique. Nada de eso está «listo» hasta que existan el dump oficial (y el tooling de comunidad).
- Los modelos open más viejos de Kimi (por ejemplo K2.6, K2.7 Code) son los que ya puedes bajar de Hugging Face y cablear a stacks locales—no confundas sus tags con K3.
Después de que caigan los pesos (mira el calendario; no celebres antes de tiempo):
- Confirma un repo de Moonshot (o claramente oficial) con archivos reales—no un placeholder, no un mirror con nombre raro.
- Lee la LICENSE de ese repo (líneas open anteriores de Kimi solían usar una licencia estilo Modified MIT; K3 no está cerrado hasta que el archivo salga).
- Revisa las notas de soporte de vLLM / SGLang / otros—Moonshot ya dijo que la alineación del ecosistema importa para la arquitectura de K3 (incluido trabajo de serving relacionado con KDA mencionado en su blog).
- Solo entonces busques ports de comunidad de Ollama / GGUF. Espera días o semanas de lag para blogs de «me funciona en mi máquina», y más para quants de calidad.
- Reevalúa el coste: cluster self-host + luz + ops vs API $3/$15 (más cache hits). Muchos equipos mantendrán la API para el pico de inteligencia y hostearán modelos open más pequeños para bulk offline.

Fuente: medios oficiales de lanzamiento de K3 / blog de Kimi K3, 16 de julio de 2026.
Checklist del 27 de julio (para gente de local / self-host)
Úsalo solo cuando aparezca algo real—no como invitación a fiesta con calendarios vacíos.
- Confirmación oficial de que los pesos están fuera (blog/X/HF), no solo «pronto»
- Repo en Hugging Face (u otro) bajo Moonshot con shards descargables
- LICENSE leída de cabo a rabo
- README: camino de serving (vLLM / otro), límites conocidos, notas multimodales
- Tamaños de archivo / opciones de quant listados por alguien creíble (preferir oficial o hosts grandes primero)
- Si Ollama / llama.cpp / etc. tiene un camino de soporte real y versionado
- Tu árbol de decisión: API por defecto vs host gestionado vs cluster self-host
- Presupuesto de tiempo de ops—no solo de GPUs
Seguiremos el estado de alto nivel en /kimi-k3-status. Confía en fuentes primarias más que en capturas.
Qué correr esta semana en su lugar
| Tu objetivo | Haz esto |
|---|---|
| Sentir la calidad de K3 en una tarea dura | App / API kimi-k3 con presupuesto piloto fijo |
| Enviar código cada día | Kimi Code + mantén caliente el camino de K2.7 Code |
| Quedarte en local ya | Self-hostea pesos ya open de K2.x (K2.6 / K2.7 Code)—no K3 |
| Experimentos de producto «gratis» | Ver opciones free con honestidad—cupos de producto ≠ API free ≠ self-host free |
| Qué SKU para qué trabajo | K2.6 vs K2.7 vs K3 |
Si los altas nuevas o la capacidad de membresía van justas (Moonshot ha gestionado picos de demanda en público tras el lanzamiento), la API y los caminos de acceso existentes siguen importando más que un binario local que falta.
Filtros de ruido (edición local)
«Ya está en Ollama.»
Trata nombres de librería sin verificar y tags de mirrors como sospechosos hasta que apunten a un checkpoint real de Moonshot (o claramente derivado) y a un runbook que funcione.
«Open weights = K3 local ilimitado y gratis.»
Los open weights quitan un candado del vendor. No quitan la física, la electricidad, las ops multi-GPU ni los límites de licencia.
«MoE significa que mi tarjeta de 24 GB va bien.»
La sparsity ayuda al cómputo activo. El almacenamiento total, el routing de expertos, el contexto largo y la visión siguen doliendo. La guía oficial de serving es multi-acelerador.
«La ficha de HF llamada kimi-k3 tiene que ser oficial.»
Mira org, archivos, licencia, enlace del anuncio. Prefiere huggingface.co/moonshotai a renombres random.
«Espero y me salto la API para siempre.»
Vale para curiosidad de investigación. Malo para deadlines de producto. Pilota K3 donde el razonamiento premium pague; mantén SKUs más baratos/open para el bulk.
FAQ
¿Puedo descargar Kimi K3 hoy?
Planifica un no para un dump público oficial completo a 21 de julio de 2026. Promesa oficial: pesos completos para el 27 de julio de 2026. Re-revisa la org de Moonshot y el blog de K3.
¿Puedo correr Kimi K3 en Ollama hoy?
No de ninguna forma completa y de confianza que podamos recomendar. Sin pesos → no hay camino honesto de Ollama.
¿Cuánta VRAM necesito?
Desconocida como número preciso de consumo. Usa la escala oficial + la guía de serving de 64+ aceleradores como brújula: si no corres ya GPUs en cluster, presupuesta API o inference hospedada.
¿K3 es open source u open weight?
El lenguaje de lanzamiento enfatiza open weights para un modelo de clase 3T. El texto final de licencia sale con los archivos—léelo entonces. «Open» en un titular no sustituye a la LICENSE.
¿Y los modelos K2 en local?
Las líneas open anteriores de Kimi (p. ej. K2.6, K2.7 Code) son las opciones prácticas de self-host hoy. No pegues un tag de K2 en un script y lo llames K3.
¿Este sitio es oficial de Moonshot?
No. Cruza con kimi.com/blog/kimi-k3 y platform.kimi.ai antes de gastar dinero o rackear hardware.
En resumen
Quien busca en local no está loco—la demanda de HF / download / Ollama / VRAM es real. Lo que falta es el artefacto: un release público de pesos de K3 que puedas verificar, más un stack que de verdad lo cargue.
Hasta que aterrice, la jugada inteligente es aburrida:
- Pilota K3 en el producto o la API donde una tarea dura valga la factura de tokens.
- Self-hostea los modelos open K2.x que ya puedes bajar si necesitas hierro offline.
- Ignora las guías de «instala K3 en el portátil esta noche» que nunca muestran un repo real.
- Re-revisa alrededor del 27 de julio—con el checklist de arriba, no solo con esperanza.
Siguientes lecturas: open weights 27 de julio · guía de lanzamiento de K3 · opciones free · qué modelo · hub de estado.