Preço da API Kimi K3: cache, OpenRouter e controle de custo
Hub Kimi K3: specs, model id, quando trocar → /kimi-k3. Teste grátis no produto → como usar K3 de graça. Portas práticas desta semana → como usar Kimi K3.
Você digitou kimi k3 free api ou kimi k3 pricing depois que o feed falou que o modelo é “open”. Aí abriu o console de desenvolvedor e a tabela de preços não tem nada de “grátis pra sempre”.
Esse gap é normal. Camada grátis do produto e chave de API paga são portas diferentes. Este guia fala só da conta que chega quando você chama kimi-k3.
Resposta curta (leia isto primeiro)
- Não existe API de produção permanente e gratuita para o
kimi-k3completo. Chat grátis / rewards ficam na superfície do produto (kimi.com). Chaves em platform.kimi.ai são pay-as-you-go. - Preço de lista (USD / 1M tokens, docs públicas de fim de julho de 2026): input com cache hit $0,30 · input com cache miss $3,00 · output $15,00. Flat na janela de 1M—sem “surcharge de contexto longo” no card público do K3.
- A alavanca real de economia é cache + roteamento de modelo, não caçar chave free fake. Reaproveite system prompts longos e contexto de repo; mande trabalho rotineiro para modelos mais baratos; reserve K3 para jobs difíceis e longos.
- Thinking em max effort vem ligado por padrão no K3 (ainda não há um switch público de “modo barato” nos docs). Prompt trivial ainda pode queimar tokens caros de raciocínio—não use K3 como torradeira.
Em uma frase: use o produto grátis para sentir o modelo; use a API paga quando precisar de automação—e trate $15/M de output + thinking sempre ligado como feature de orçamento, não detalhe de rodapé.
Este site é independente da Moonshot. Preços e capacidade mudam—confirme em preços do K3 e no quickstart do K3 antes de colocar o time em piloto automático.

Fonte: mídia oficial de lançamento do K3 em @Kimi_Moonshot, 16 de julho de 2026; mesmos gráficos do blog Kimi K3.
A tabela de preços em português claro
| Item | O que significa, na prática | USD / 1M tokens |
|---|---|---|
| Input cache-hit | “Você já pagou por esse contexto há pouco; estamos reusando.” | $0,30 |
| Input cache-miss | Tokens novos que o modelo ainda não cacheou nesse caminho | $3,00 |
| Output | Tokens que o modelo escreve de volta—incluindo raciocínio longo | $15,00 |
| Janela de contexto | Quanto de um projeto cabe numa chamada | 1M tokens (preço flat no card público) |
| Model id | O que você manda no request da API | kimi-k3 |
Três traduções que o pessoal costuma errar:
- $3 / $15 é faixa “tipo Sonnet”, não “promo do K2”. Se o job é um refactor de 20 linhas, um modelo de coding mais barato costuma vencer no custo.
- Cache hit a $0,30 é o herói quieto. Agentes que reenviam o mesmo system prompt, style guide ou snapshot de monorepo pegam 90% de desconto no input da parte repetida—quando o cache funciona como a doc descreve.
- Output é onde a fatura explode. Loops longos de tool + chain-of-thought longo = muitos tokens a $15/M. Um “teste simples” que pensa demais ainda custa dinheiro de verdade.
Links oficiais: platform.kimi.ai · pricing/chat-k3 · guia de context caching.
Produto grátis vs API paga (pare de misturar)
| Caminho | O que você ganha | O que você paga |
|---|---|---|
| kimi.com / app grátis + rewards | Chat / agent UX com cotas | $0 até o limite; membership pode liberar mais |
| Membership / Code membership | Entitlements de produto (não é a mesma medição crua da API) | Preço do plano (veja membership pricing) |
API kimi-k3 | Chaves, tools, automação, base URL compatível com OpenAI | Medidor de tokens — $0,30 / $3 / $15 |
OpenRouter moonshotai/kimi-k3 | O mesmo modelo via router multi-modelo | Mesma faixa $3 / $15 nas listagens públicas; capacidade pode throttle |
Buscar “kimi k3 free api key” costuma cair em um de três erros:
- Querer chat grátis no produto (porta certa: guia grátis)
- Querer chave de produção a $0 para sempre (não é promessa pública)
- Cair em dump de chave scam (nunca cole chave de gist aleatório em produção)
Se novas assinaturas estão pausadas no lado consumer, a API ainda pode ser uma porta separada—veja guia de pausa de subscription.

Fonte: mídia oficial de lançamento do K3 em @Kimi_Moonshot, 16 de julho de 2026.
Por que a primeira fatura parece pior que a tabela
O K3 foi feito para coding de longo horizonte, knowledge work e raciocínio profundo. Isso aparece como:
- Thinking sempre ligado (max effort no lançamento). Docs públicas dizem que você não “desliga” o chain-of-thought no K3 como em modelos com low/medium effort. Prompt barato de “oi” ainda é mau hábito.
- 1M de contexto é ferramenta de potência, não lanche grátis. Enfiar meio monorepo em toda chamada sem cache é como o input a $3 vira o evento principal.
- Loops de agent multiplicam output. Planejar → tool → patch → reler → planejar de novo. Cada passo escreve tokens a $15/M.
Conta mental aproximada (só ilustrativo—não é orçamento):
| Job de brinquedo | Inputs que importam | O que vigiar |
|---|---|---|
| Prompt de 2k tokens, resposta de 500, sem cache | Pequeno | Ainda prefira modelo barato se a tarefa for trivial |
| Contexto de repo de 100k, 80% cache hit no próximo turn | Cache | Input cai em direção a $0,30 na parte com hit |
| Agent multi-hora, 200k tokens de output de raciocínio | Output | $15 × 0,2 = $3 só nessa fatia—antes do input |
Em produção, leia o dashboard de uso, não a aritmética de blog.
OpenRouter vs Moonshot direto
| Moonshot direto | OpenRouter | |
|---|---|---|
| Model id | kimi-k3 | moonshotai/kimi-k3 (pode haver aliases) |
| Base URL | https://api.moonshot.ai/v1 | endpoint OpenAI-compatible do OpenRouter |
| Faixa de preço | Oficial $0,30 / $3 / $15 | Listagens públicas costumam $3 / $15 com campos de cache |
| Por que escolher | Menos overhead, docs oficiais, caminho de prompt caching | Uma chave para muitos modelos; experimentos rápidos |
| Atenção | Setup de conta + billing | Capacidade / 429s upstream quando o K3 está quente |
Nenhum dos dois é “API grátis”. Os dois são rotas para um flagship medido por token.
Formato mínimo de chamada direta (guarde chaves em env, nunca no git):
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{
"role": "user",
"content": "Propose a migration plan for a 200-file TypeScript monorepo. Keep the plan under 800 words.",
}],
)
print(resp.choices[0].message.content)
Note a última frase do prompt: limite o pedido. Num modelo que pensa pesado por padrão, pedido vago de “faz tudo” é como a fatura ganha pernas.
Controle de custo que de fato funciona
1. Roteie por job, não por hype
| Job | Prefira | Por quê |
|---|---|---|
| Edições rotineiras, PRs pequenos, loops estilo autocomplete | K2.7 Code (e afins) | SKU mais barato, focado em coding; veja /kimi-k27 · /kimi-code |
| Classificação em lote, rascunhos, resumo “bom o bastante” | K2.6 ou outros de menor custo | Guarde o orçamento do K3 para os 10% difíceis |
| Arquitetura multi-arquivo, agent longo, screenshot→UI, pacote de research profunda | kimi-k3 | É pra isso que o premium existe |
Seletor da família: K2.6 vs K2.7 vs K3.
2. Faça o cache trabalhar a seu favor
- Mantenha system prompts estáveis e schemas de tool estáveis
- Reutilize o mesmo bundle grande de doc/repo entre turns quando a plataforma puder cachear
- Não embaralhe ruído aleatório no prefixo a cada request (isso mata a taxa de hit)
- Leia o guia de caching da Moonshot—detalhe de implementação vence vibe
3. Encolha o output de propósito
- Peça planos em bullet, não romances
- Limite passos: “três opções, uma recomendação”
- Pare loops de agent quando os testes passam—não deixe “mais uma melhoria” rodar a noite inteira sem supervisão
- Meça tokens de output por tarefa bem-sucedida, não só “chamadas por dia”
4. Limite gasto na plataforma
- Configure alertas rígidos de budget em platform.kimi.ai / OpenRouter
- Use chaves separadas para prod vs playground
- Mate cron jobs esquecidos que ainda apontam para
kimi-k3

Fonte: materiais oficiais de lançamento do K3 via @Kimi_Moonshot / blog Kimi K3, 16 de julho de 2026.
Mitos que esvaziam a carteira
| Mito | Realidade |
|---|---|
| “Open weights = API grátis” | Planos de download de pesos ≠ inference hospedada ilimitada. Timeline de pesos: reality check de 27 de julho. |
“Achei uma chave free de kimi-k3 online” | Quase sempre roubada, fake ou isca. Crie a sua. |
| “1M de contexto = sempre colar o monorepo inteiro” | Você pode; você também paga pelo que cola (salvo cache). |
| “K3 é sempre mais barato que Claude/OpenAI” | Compare sua carga. Agents pesados em output podem apagar a economia de headline. |
| “Uso K3 em todo autocomplete” | É assim que você descobre $15/M do jeito difícil. Roteie volume em outro lugar. |
Self-host depois que os pesos saírem é conta de hardware + ops, não cupom de API grátis—veja realidade de VRAM / Ollama.
O que fazer nesta semana
Se você só quer experimentar o modelo: fique no caminho do produto—opções grátis e como usar K3 nesta semana. Não force chave de API por curiosidade.
Se você entrega software:
- Crie uma chave em platform.kimi.ai (ou OpenRouter se você já vive lá).
- Ligue
kimi-k3só no caminho de “job difícil”. - Ative caching onde a doc permitir; meça a taxa de hit depois de um dia.
- Coloque um teto diário de gasto antes de deixar um agent rodando.
- Deixe preços oficiais abertos numa aba—posts de blog envelhecem; o rate card é o contrato.
Para onde ir depois
- Hub com specs + regras de troca → /kimi-k3
- Status / timeline → /kimi-k3-status
- Honestidade sobre produto grátis → /blog/33-kimi-k3-free-how-to
- Portas app vs API → /blog/36-how-to-use-kimi-k3
- Calendário de open weights → /blog/31-kimi-k3-open-weights-july-27
- Hub do SKU de coding → /kimi-code · /kimi-k27
Resumo final: a API do Kimi K3 é uma ferramenta de preço frontier com desconto grande de cache e output caro. Use onde ela paga a fatura—e pare de tratar resultado de busca por “free api” como página de preços.