Precio de la API de Kimi K3: caché, OpenRouter y control de coste
Hub de Kimi K3: Specs, model id, cuándo cambiar → /kimi-k3. Probar el producto gratis → cómo usar K3 gratis. Puertas prácticas esta semana → cómo usar Kimi K3.
Buscaste kimi k3 free api o kimi k3 pricing después de un post que decía que el modelo es “open”. Abriste la consola de desarrollador y viste una tarifa que no se parece en nada a “gratis para siempre”.
Ese desfase es normal. El free del producto y las API keys de pago son puertas distintas. Esta guía habla solo de la factura que te llega cuando llamas a kimi-k3.
Respuesta corta (léela primero)
- No hay una API de producción gratis y permanente para el
kimi-k3completo. El chat free / las recompensas viven en el producto (kimi.com). Las keys en platform.kimi.ai son pay-as-you-go. - Precio de lista (USD / 1M tokens, docs públicas de finales de julio de 2026): input cache-hit $0.30 · input cache-miss $3.00 · output $15.00. Plano en la ventana de contexto de 1M—sin “recargo por contexto largo” en la tarjeta pública de K3.
- El ahorro real viene del caché + del enrutado de modelos, no de cazar keys free falsas. Reutiliza system prompts largos y contexto de repo; manda el trabajo rutinario a modelos más baratos; reserva K3 para trabajos duros y largos.
- El thinking a máximo esfuerzo va por defecto en K3 (aún no hay un interruptor de “modo barato” en las docs públicas). Un prompt trivial puede seguir quemando tokens caros de razonamiento—no uses K3 como tostadora.
En una frase: usa el producto free para sentir el modelo; usa la API de pago cuando necesites automatización—y trata los $15/M de output + el thinking siempre activo como una feature de presupuesto, no como un detalle.
Este sitio es independiente de Moonshot. Precios y capacidad cambian—confirma en precio de K3 y en el quickstart de K3 antes de poner un equipo en piloto automático.

Fuente: medios oficiales de lanzamiento de K3 en @Kimi_Moonshot, 16 de julio de 2026; mismas gráficas que el blog de Kimi K3.
La tarifa en castellano claro
| Concepto | Qué significa en la práctica | USD / 1M tokens |
|---|---|---|
| Input cache-hit | “Ya pagaste por enviar este contexto hace poco; lo reutilizamos.” | $0.30 |
| Input cache-miss | Tokens frescos que el modelo no tiene en caché para esta ruta de request | $3.00 |
| Output | Tokens que el modelo escribe de vuelta—incluidos los traces largos de razonamiento | $15.00 |
| Ventana de contexto | Cuánto proyecto puedes meter en una sola llamada | 1M tokens (precio plano en la tarjeta pública) |
| Model id | Lo que pones en la request de la API | kimi-k3 |
Tres traducciones que la gente se salta:
- $3 / $15 es “nivel Sonnet”, no “precio promo de K2”. Si tu tarea es un refactor de 20 líneas, un modelo de coding más barato suele ganar en coste.
- Los $0.30 de cache hit son el héroe silencioso. Los agents que reenvían el mismo system prompt, guía de estilo o snapshot de monorepo se llevan un 90% de descuento en input sobre la parte repetida—cuando el caché funciona como documenta la plataforma.
- El output es donde explota la factura. Loops largos de tools + chain-of-thought largo = muchos tokens a $15/M. Un “test simple” que se pasa de listo puede costar de verdad.
Enlaces oficiales: platform.kimi.ai · pricing/chat-k3 · guía de context caching.
Producto free vs API de pago (deja de mezclarlos)
| Camino | Qué obtienes | Qué pagas |
|---|---|---|
| kimi.com / app free + recompensas | Chat / UX de agent con cuotas | $0 hasta los límites; la membresía puede desbloquear más |
| Membresía / Code membership | Entitlements del producto (no es lo mismo que el metering crudo de la API) | Precio del plan (mira membership pricing) |
API kimi-k3 | Keys, tools, automatización, base URL compatible con OpenAI | Contador de tokens — $0.30 / $3 / $15 |
OpenRouter moonshotai/kimi-k3 | El mismo modelo vía un router multi-modelo | Misma banda $3 / $15 en listados públicos; la capacidad puede hacer throttle |
Buscar “kimi k3 free api key” suele ser uno de estos tres errores:
- Quieres chat free del producto (puerta correcta: guía free)
- Quieres keys de producción a $0 para siempre (no es una promesa pública)
- Caíste en dumps de keys de scam (nunca pegues keys de gists random en producción)
Si las suscripciones nuevas están en pausa en el lado consumer, la API puede seguir siendo una puerta aparte—ver guía de la pausa de suscripción.

Fuente: medios oficiales de lanzamiento de K3 en @Kimi_Moonshot, 16 de julio de 2026.
Por qué la primera factura se siente peor que la tarifa
K3 está pensado para coding de horizonte largo, knowledge work y razonamiento profundo. Eso se nota así:
- Thinking siempre activo (max effort en el lanzamiento). Las docs públicas dicen que no puedes simplemente “apagar” el chain-of-thought en K3 como en modelos con low/medium effort. Los “hola” baratos siguen siendo un mal hábito.
- 1M de contexto es una herramienta de potencia, no un snack gratis. Meter medio monorepo en cada llamada sin caché es cómo el input a $3 se convierte en el plato principal.
- Los loops de agent multiplican el output. Plan → tool → patch → releer → planear otra vez. Cada paso escribe tokens a $15/M.
Cuentas mentales aproximadas (solo ilustrativas—no es un presupuesto):
| Trabajo de juguete | Inputs que importan | A qué prestar atención |
|---|---|---|
| Prompt de 2k tokens, respuesta de 500, sin caché | Pequeño | Sigue prefiriendo un modelo barato si la tarea es trivial |
| 100k de contexto de repo, 80% cache hit en el siguiente turno | Caché | El input se desploma hacia $0.30 en la porción hit |
| Agent de varias horas, 200k tokens de output de razonamiento | Output | $15 × 0.2 = $3 solo por ese tramo—antes del input |
Para producción, lee siempre los dashboards de uso, no la aritmética del blog.
OpenRouter vs Moonshot directo
| Moonshot directo | OpenRouter | |
|---|---|---|
| Model id | kimi-k3 | moonshotai/kimi-k3 (puede haber aliases) |
| Base URL | https://api.moonshot.ai/v1 | Endpoint compatible OpenAI de OpenRouter |
| Banda de precio | Oficial $0.30 / $3 / $15 | Listados públicos suelen ir a $3 / $15 con campos de caché |
| Por qué elegirlo | Menos overhead, docs oficiales, ruta de prompt caching | Una key para muchos modelos; experimentos rápidos |
| Cuidado con | Setup de cuenta + billing | Capacidad upstream / 429s cuando K3 está caliente |
Ningún camino es “API free”. Ambos son routers hacia un flagship medido por tokens.
Forma mínima de una llamada directa (guarda las keys en env, nunca en git):
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{
"role": "user",
"content": "Propose a migration plan for a 200-file TypeScript monorepo. Keep the plan under 800 words.",
}],
)
print(resp.choices[0].message.content)
Fíjate en la última frase del prompt: pon techo a lo que pides. En un modelo que piensa a fondo por defecto, los “hazlo todo” vagos son cómo la factura se pone a andar sola.
Control de coste que de verdad funciona
1. Enruta por trabajo, no por hype
| Trabajo | Prefiere | Por qué |
|---|---|---|
| Edits rutinarios, PRs pequeños, loops tipo autocomplete | K2.7 Code (y familia) | SKU más barato, orientado a coding; ver /kimi-k27 · /kimi-code |
| Clasificación en masa, borradores, resúmenes “good enough” | K2.6 u otros de menor coste | Guarda el presupuesto de K3 para el 10% duro |
| Arquitectura multi-archivo, agent largo, screenshot→UI, pack de research profundo | kimi-k3 | Para eso es el premium |
Selector de familia: K2.6 vs K2.7 vs K3.
2. Haz que el caché trabaje por ti
- Mantén system prompts estables y tool schemas estables
- Reutiliza el mismo bundle grande de documento/repo entre turnos cuando la plataforma pueda cachearlo
- No metas ruido aleatorio al prefijo en cada request (eso mata el hit rate)
- Lee la guía de caching de Moonshot—los detalles de implementación ganan a las vibes
3. Encoge el output a propósito
- Pide planes en bullets, no novelas
- Pon techo a los pasos: “tres opciones, una recomendación”
- Para los loops de agent cuando pasen los tests—no dejes que “una mejora más” corra toda la noche sin supervisión
- Loguea tokens de output por tarea exitosa, no solo “llamadas al día”
4. Pon techo de gasto en la plataforma
- Configura alertas de presupuesto duro en platform.kimi.ai / OpenRouter
- Usa keys separadas para prod vs playground
- Mata los cron jobs olvidados que aún apuntan a
kimi-k3

Fuente: materiales oficiales de lanzamiento de K3 vía @Kimi_Moonshot / blog de Kimi K3, 16 de julio de 2026.
Mitos que vacían la cartera
| Mito | Realidad |
|---|---|
| “Open weights = API free” | Los planes de descarga de pesos open ≠ inferencia hosted ilimitada. Timeline de pesos: chequeo de realidad del 27 de julio. |
“Encontré una key free de kimi-k3 online” | Casi siempre robada, falsa o cebo. Crea la tuya. |
| “1M de contexto significa que siempre debo pegar el monorepo entero” | Puedes; también pagas por lo que pegas (salvo que esté en caché). |
| “K3 siempre es más barato que Claude/OpenAI” | Compara tu workload. Un agent pesado en output puede borrar el ahorro del titular. |
| “Uso K3 para todo el autocomplete” | Así es como descubres los $15/M a la mala. Enruta el bulk a otro lado. |
Self-hostear cuando aterricen los pesos es una factura de hardware + ops, no un cupón de API free—ver realidad de VRAM / Ollama.
Qué deberías hacer esta semana
Si solo quieres probar el modelo: quédate en la ruta del producto—opciones free y cómo usar K3 esta semana. No fuerces una API key por curiosidad.
Si envías software a producción:
- Crea una key en platform.kimi.ai (o OpenRouter si ya vives ahí).
- Cablea
kimi-k3solo en la ruta de “trabajo duro”. - Activa caching donde las docs lo permitan; mide el hit rate al día siguiente.
- Pon un tope de gasto diario antes de dejar un agent corriendo.
- Deja el precio oficial abierto en una pestaña—los posts envejecen; la tarifa es el contrato.
A dónde ir después
- Hub con specs + reglas de cambio → /kimi-k3
- Status / timeline → /kimi-k3-status
- Honestidad del producto free → /blog/33-kimi-k3-free-how-to
- Puertas app vs API → /blog/36-how-to-use-kimi-k3
- Calendario de open weights → /blog/31-kimi-k3-open-weights-july-27
- Hub del SKU de coding → /kimi-code · /kimi-k27
En resumen: la API de Kimi K3 es una herramienta a precio frontier con un descuento de caché enorme y un output caro. Úsala donde se gane la factura—y deja de tratar los resultados de búsqueda de “free api” como si fueran la página de precios.