Guides
11 min min de lectura
AI Observer

Precio de la API de Kimi K3: caché, OpenRouter y control de coste

Hub de Kimi K3: Specs, model id, cuándo cambiar → /kimi-k3. Probar el producto gratis → cómo usar K3 gratis. Puertas prácticas esta semana → cómo usar Kimi K3.

Buscaste kimi k3 free api o kimi k3 pricing después de un post que decía que el modelo es “open”. Abriste la consola de desarrollador y viste una tarifa que no se parece en nada a “gratis para siempre”.

Ese desfase es normal. El free del producto y las API keys de pago son puertas distintas. Esta guía habla solo de la factura que te llega cuando llamas a kimi-k3.

Respuesta corta (léela primero)

  1. No hay una API de producción gratis y permanente para el kimi-k3 completo. El chat free / las recompensas viven en el producto (kimi.com). Las keys en platform.kimi.ai son pay-as-you-go.
  2. Precio de lista (USD / 1M tokens, docs públicas de finales de julio de 2026): input cache-hit $0.30 · input cache-miss $3.00 · output $15.00. Plano en la ventana de contexto de 1M—sin “recargo por contexto largo” en la tarjeta pública de K3.
  3. El ahorro real viene del caché + del enrutado de modelos, no de cazar keys free falsas. Reutiliza system prompts largos y contexto de repo; manda el trabajo rutinario a modelos más baratos; reserva K3 para trabajos duros y largos.
  4. El thinking a máximo esfuerzo va por defecto en K3 (aún no hay un interruptor de “modo barato” en las docs públicas). Un prompt trivial puede seguir quemando tokens caros de razonamiento—no uses K3 como tostadora.

En una frase: usa el producto free para sentir el modelo; usa la API de pago cuando necesites automatización—y trata los $15/M de output + el thinking siempre activo como una feature de presupuesto, no como un detalle.

Este sitio es independiente de Moonshot. Precios y capacidad cambian—confirma en precio de K3 y en el quickstart de K3 antes de poner un equipo en piloto automático.

Benchmarks oficiales de coding de Kimi K3 (max effort) frente a modelos punteros—por qué existe el tramo premium

Fuente: medios oficiales de lanzamiento de K3 en @Kimi_Moonshot, 16 de julio de 2026; mismas gráficas que el blog de Kimi K3.

La tarifa en castellano claro

ConceptoQué significa en la prácticaUSD / 1M tokens
Input cache-hit“Ya pagaste por enviar este contexto hace poco; lo reutilizamos.”$0.30
Input cache-missTokens frescos que el modelo no tiene en caché para esta ruta de request$3.00
OutputTokens que el modelo escribe de vuelta—incluidos los traces largos de razonamiento$15.00
Ventana de contextoCuánto proyecto puedes meter en una sola llamada1M tokens (precio plano en la tarjeta pública)
Model idLo que pones en la request de la APIkimi-k3

Tres traducciones que la gente se salta:

  • $3 / $15 es “nivel Sonnet”, no “precio promo de K2”. Si tu tarea es un refactor de 20 líneas, un modelo de coding más barato suele ganar en coste.
  • Los $0.30 de cache hit son el héroe silencioso. Los agents que reenvían el mismo system prompt, guía de estilo o snapshot de monorepo se llevan un 90% de descuento en input sobre la parte repetida—cuando el caché funciona como documenta la plataforma.
  • El output es donde explota la factura. Loops largos de tools + chain-of-thought largo = muchos tokens a $15/M. Un “test simple” que se pasa de listo puede costar de verdad.

Enlaces oficiales: platform.kimi.ai · pricing/chat-k3 · guía de context caching.

Producto free vs API de pago (deja de mezclarlos)

CaminoQué obtienesQué pagas
kimi.com / app free + recompensasChat / UX de agent con cuotas$0 hasta los límites; la membresía puede desbloquear más
Membresía / Code membershipEntitlements del producto (no es lo mismo que el metering crudo de la API)Precio del plan (mira membership pricing)
API kimi-k3Keys, tools, automatización, base URL compatible con OpenAIContador de tokens — $0.30 / $3 / $15
OpenRouter moonshotai/kimi-k3El mismo modelo vía un router multi-modeloMisma banda $3 / $15 en listados públicos; la capacidad puede hacer throttle

Buscar “kimi k3 free api key” suele ser uno de estos tres errores:

  1. Quieres chat free del producto (puerta correcta: guía free)
  2. Quieres keys de producción a $0 para siempre (no es una promesa pública)
  3. Caíste en dumps de keys de scam (nunca pegues keys de gists random en producción)

Si las suscripciones nuevas están en pausa en el lado consumer, la API puede seguir siendo una puerta aparte—ver guía de la pausa de suscripción.

Benchmarks de agent y visual-agent de Kimi K3—en los tool loops largos es donde suman los tokens de output

Fuente: medios oficiales de lanzamiento de K3 en @Kimi_Moonshot, 16 de julio de 2026.

Por qué la primera factura se siente peor que la tarifa

K3 está pensado para coding de horizonte largo, knowledge work y razonamiento profundo. Eso se nota así:

  • Thinking siempre activo (max effort en el lanzamiento). Las docs públicas dicen que no puedes simplemente “apagar” el chain-of-thought en K3 como en modelos con low/medium effort. Los “hola” baratos siguen siendo un mal hábito.
  • 1M de contexto es una herramienta de potencia, no un snack gratis. Meter medio monorepo en cada llamada sin caché es cómo el input a $3 se convierte en el plato principal.
  • Los loops de agent multiplican el output. Plan → tool → patch → releer → planear otra vez. Cada paso escribe tokens a $15/M.

Cuentas mentales aproximadas (solo ilustrativas—no es un presupuesto):

Trabajo de jugueteInputs que importanA qué prestar atención
Prompt de 2k tokens, respuesta de 500, sin cachéPequeñoSigue prefiriendo un modelo barato si la tarea es trivial
100k de contexto de repo, 80% cache hit en el siguiente turnoCachéEl input se desploma hacia $0.30 en la porción hit
Agent de varias horas, 200k tokens de output de razonamientoOutput$15 × 0.2 = $3 solo por ese tramo—antes del input

Para producción, lee siempre los dashboards de uso, no la aritmética del blog.

OpenRouter vs Moonshot directo

Moonshot directoOpenRouter
Model idkimi-k3moonshotai/kimi-k3 (puede haber aliases)
Base URLhttps://api.moonshot.ai/v1Endpoint compatible OpenAI de OpenRouter
Banda de precioOficial $0.30 / $3 / $15Listados públicos suelen ir a $3 / $15 con campos de caché
Por qué elegirloMenos overhead, docs oficiales, ruta de prompt cachingUna key para muchos modelos; experimentos rápidos
Cuidado conSetup de cuenta + billingCapacidad upstream / 429s cuando K3 está caliente

Ningún camino es “API free”. Ambos son routers hacia un flagship medido por tokens.

Forma mínima de una llamada directa (guarda las keys en env, nunca en git):

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{
        "role": "user",
        "content": "Propose a migration plan for a 200-file TypeScript monorepo. Keep the plan under 800 words.",
    }],
)
print(resp.choices[0].message.content)

Fíjate en la última frase del prompt: pon techo a lo que pides. En un modelo que piensa a fondo por defecto, los “hazlo todo” vagos son cómo la factura se pone a andar sola.

Control de coste que de verdad funciona

1. Enruta por trabajo, no por hype

TrabajoPrefierePor qué
Edits rutinarios, PRs pequeños, loops tipo autocompleteK2.7 Code (y familia)SKU más barato, orientado a coding; ver /kimi-k27 · /kimi-code
Clasificación en masa, borradores, resúmenes “good enough”K2.6 u otros de menor costeGuarda el presupuesto de K3 para el 10% duro
Arquitectura multi-archivo, agent largo, screenshot→UI, pack de research profundokimi-k3Para eso es el premium

Selector de familia: K2.6 vs K2.7 vs K3.

2. Haz que el caché trabaje por ti

  • Mantén system prompts estables y tool schemas estables
  • Reutiliza el mismo bundle grande de documento/repo entre turnos cuando la plataforma pueda cachearlo
  • No metas ruido aleatorio al prefijo en cada request (eso mata el hit rate)
  • Lee la guía de caching de Moonshot—los detalles de implementación ganan a las vibes

3. Encoge el output a propósito

  • Pide planes en bullets, no novelas
  • Pon techo a los pasos: “tres opciones, una recomendación”
  • Para los loops de agent cuando pasen los tests—no dejes que “una mejora más” corra toda la noche sin supervisión
  • Loguea tokens de output por tarea exitosa, no solo “llamadas al día”

4. Pon techo de gasto en la plataforma

  • Configura alertas de presupuesto duro en platform.kimi.ai / OpenRouter
  • Usa keys separadas para prod vs playground
  • Mata los cron jobs olvidados que aún apuntan a kimi-k3

Gráfico de arquitectura de Kimi K3—escala e intención de diseño, no un SKU de portátil gratis

Fuente: materiales oficiales de lanzamiento de K3 vía @Kimi_Moonshot / blog de Kimi K3, 16 de julio de 2026.

Mitos que vacían la cartera

MitoRealidad
“Open weights = API free”Los planes de descarga de pesos open ≠ inferencia hosted ilimitada. Timeline de pesos: chequeo de realidad del 27 de julio.
“Encontré una key free de kimi-k3 online”Casi siempre robada, falsa o cebo. Crea la tuya.
“1M de contexto significa que siempre debo pegar el monorepo entero”Puedes; también pagas por lo que pegas (salvo que esté en caché).
“K3 siempre es más barato que Claude/OpenAI”Compara tu workload. Un agent pesado en output puede borrar el ahorro del titular.
“Uso K3 para todo el autocomplete”Así es como descubres los $15/M a la mala. Enruta el bulk a otro lado.

Self-hostear cuando aterricen los pesos es una factura de hardware + ops, no un cupón de API free—ver realidad de VRAM / Ollama.

Qué deberías hacer esta semana

Si solo quieres probar el modelo: quédate en la ruta del producto—opciones free y cómo usar K3 esta semana. No fuerces una API key por curiosidad.

Si envías software a producción:

  1. Crea una key en platform.kimi.ai (o OpenRouter si ya vives ahí).
  2. Cablea kimi-k3 solo en la ruta de “trabajo duro”.
  3. Activa caching donde las docs lo permitan; mide el hit rate al día siguiente.
  4. Pon un tope de gasto diario antes de dejar un agent corriendo.
  5. Deja el precio oficial abierto en una pestaña—los posts envejecen; la tarifa es el contrato.

A dónde ir después

En resumen: la API de Kimi K3 es una herramienta a precio frontier con un descuento de caché enorme y un output caro. Úsala donde se gane la factura—y deja de tratar los resultados de búsqueda de “free api” como si fueran la página de precios.

Artículos relacionados

El feed está lleno de Kimi K3. Mapa práctico para esta semana: app o prueba gratis, qué hacer si la suscripción está en pausa, cuándo vale la API y qué ignorar hasta los pesos del 27 de julio.
¿Intentaste pagar por Kimi K3 y te frenaron? Quién está afectado, qué sigue funcionando (prueba gratis, API, planes activos) y cómo el open weights del 27 de julio cambia el plan.
¿Buscas Ollama, GGUF o VRAM para Kimi K3? El panorama local sin maquillaje: qué falta hoy, qué implica de verdad 2.8T y qué usar hasta que salgan los pesos.