Guides
11 min min de leitura
AI Observer

Preço da API Kimi K3: cache, OpenRouter e controle de custo

Hub Kimi K3: specs, model id, quando trocar → /kimi-k3. Teste grátis no produto → como usar K3 de graça. Portas práticas desta semana → como usar Kimi K3.

Você digitou kimi k3 free api ou kimi k3 pricing depois que o feed falou que o modelo é “open”. Aí abriu o console de desenvolvedor e a tabela de preços não tem nada de “grátis pra sempre”.

Esse gap é normal. Camada grátis do produto e chave de API paga são portas diferentes. Este guia fala só da conta que chega quando você chama kimi-k3.

Resposta curta (leia isto primeiro)

  1. Não existe API de produção permanente e gratuita para o kimi-k3 completo. Chat grátis / rewards ficam na superfície do produto (kimi.com). Chaves em platform.kimi.ai são pay-as-you-go.
  2. Preço de lista (USD / 1M tokens, docs públicas de fim de julho de 2026): input com cache hit $0,30 · input com cache miss $3,00 · output $15,00. Flat na janela de 1M—sem “surcharge de contexto longo” no card público do K3.
  3. A alavanca real de economia é cache + roteamento de modelo, não caçar chave free fake. Reaproveite system prompts longos e contexto de repo; mande trabalho rotineiro para modelos mais baratos; reserve K3 para jobs difíceis e longos.
  4. Thinking em max effort vem ligado por padrão no K3 (ainda não há um switch público de “modo barato” nos docs). Prompt trivial ainda pode queimar tokens caros de raciocínio—não use K3 como torradeira.

Em uma frase: use o produto grátis para sentir o modelo; use a API paga quando precisar de automação—e trate $15/M de output + thinking sempre ligado como feature de orçamento, não detalhe de rodapé.

Este site é independente da Moonshot. Preços e capacidade mudam—confirme em preços do K3 e no quickstart do K3 antes de colocar o time em piloto automático.

Benchmarks oficiais de coding do Kimi K3 (max effort) vs modelos líderes—por que a faixa premium existe

Fonte: mídia oficial de lançamento do K3 em @Kimi_Moonshot, 16 de julho de 2026; mesmos gráficos do blog Kimi K3.

A tabela de preços em português claro

ItemO que significa, na práticaUSD / 1M tokens
Input cache-hit“Você já pagou por esse contexto há pouco; estamos reusando.”$0,30
Input cache-missTokens novos que o modelo ainda não cacheou nesse caminho$3,00
OutputTokens que o modelo escreve de volta—incluindo raciocínio longo$15,00
Janela de contextoQuanto de um projeto cabe numa chamada1M tokens (preço flat no card público)
Model idO que você manda no request da APIkimi-k3

Três traduções que o pessoal costuma errar:

  • $3 / $15 é faixa “tipo Sonnet”, não “promo do K2”. Se o job é um refactor de 20 linhas, um modelo de coding mais barato costuma vencer no custo.
  • Cache hit a $0,30 é o herói quieto. Agentes que reenviam o mesmo system prompt, style guide ou snapshot de monorepo pegam 90% de desconto no input da parte repetida—quando o cache funciona como a doc descreve.
  • Output é onde a fatura explode. Loops longos de tool + chain-of-thought longo = muitos tokens a $15/M. Um “teste simples” que pensa demais ainda custa dinheiro de verdade.

Links oficiais: platform.kimi.ai · pricing/chat-k3 · guia de context caching.

Produto grátis vs API paga (pare de misturar)

CaminhoO que você ganhaO que você paga
kimi.com / app grátis + rewardsChat / agent UX com cotas$0 até o limite; membership pode liberar mais
Membership / Code membershipEntitlements de produto (não é a mesma medição crua da API)Preço do plano (veja membership pricing)
API kimi-k3Chaves, tools, automação, base URL compatível com OpenAIMedidor de tokens — $0,30 / $3 / $15
OpenRouter moonshotai/kimi-k3O mesmo modelo via router multi-modeloMesma faixa $3 / $15 nas listagens públicas; capacidade pode throttle

Buscar “kimi k3 free api key” costuma cair em um de três erros:

  1. Querer chat grátis no produto (porta certa: guia grátis)
  2. Querer chave de produção a $0 para sempre (não é promessa pública)
  3. Cair em dump de chave scam (nunca cole chave de gist aleatório em produção)

Se novas assinaturas estão pausadas no lado consumer, a API ainda pode ser uma porta separada—veja guia de pausa de subscription.

Benchmarks de agent e visual-agent do Kimi K3—loops longos de tool são onde tokens de output se acumulam

Fonte: mídia oficial de lançamento do K3 em @Kimi_Moonshot, 16 de julho de 2026.

Por que a primeira fatura parece pior que a tabela

O K3 foi feito para coding de longo horizonte, knowledge work e raciocínio profundo. Isso aparece como:

  • Thinking sempre ligado (max effort no lançamento). Docs públicas dizem que você não “desliga” o chain-of-thought no K3 como em modelos com low/medium effort. Prompt barato de “oi” ainda é mau hábito.
  • 1M de contexto é ferramenta de potência, não lanche grátis. Enfiar meio monorepo em toda chamada sem cache é como o input a $3 vira o evento principal.
  • Loops de agent multiplicam output. Planejar → tool → patch → reler → planejar de novo. Cada passo escreve tokens a $15/M.

Conta mental aproximada (só ilustrativo—não é orçamento):

Job de brinquedoInputs que importamO que vigiar
Prompt de 2k tokens, resposta de 500, sem cachePequenoAinda prefira modelo barato se a tarefa for trivial
Contexto de repo de 100k, 80% cache hit no próximo turnCacheInput cai em direção a $0,30 na parte com hit
Agent multi-hora, 200k tokens de output de raciocínioOutput$15 × 0,2 = $3 só nessa fatia—antes do input

Em produção, leia o dashboard de uso, não a aritmética de blog.

OpenRouter vs Moonshot direto

Moonshot diretoOpenRouter
Model idkimi-k3moonshotai/kimi-k3 (pode haver aliases)
Base URLhttps://api.moonshot.ai/v1endpoint OpenAI-compatible do OpenRouter
Faixa de preçoOficial $0,30 / $3 / $15Listagens públicas costumam $3 / $15 com campos de cache
Por que escolherMenos overhead, docs oficiais, caminho de prompt cachingUma chave para muitos modelos; experimentos rápidos
AtençãoSetup de conta + billingCapacidade / 429s upstream quando o K3 está quente

Nenhum dos dois é “API grátis”. Os dois são rotas para um flagship medido por token.

Formato mínimo de chamada direta (guarde chaves em env, nunca no git):

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{
        "role": "user",
        "content": "Propose a migration plan for a 200-file TypeScript monorepo. Keep the plan under 800 words.",
    }],
)
print(resp.choices[0].message.content)

Note a última frase do prompt: limite o pedido. Num modelo que pensa pesado por padrão, pedido vago de “faz tudo” é como a fatura ganha pernas.

Controle de custo que de fato funciona

1. Roteie por job, não por hype

JobPrefiraPor quê
Edições rotineiras, PRs pequenos, loops estilo autocompleteK2.7 Code (e afins)SKU mais barato, focado em coding; veja /kimi-k27 · /kimi-code
Classificação em lote, rascunhos, resumo “bom o bastante”K2.6 ou outros de menor custoGuarde o orçamento do K3 para os 10% difíceis
Arquitetura multi-arquivo, agent longo, screenshot→UI, pacote de research profundakimi-k3É pra isso que o premium existe

Seletor da família: K2.6 vs K2.7 vs K3.

2. Faça o cache trabalhar a seu favor

  • Mantenha system prompts estáveis e schemas de tool estáveis
  • Reutilize o mesmo bundle grande de doc/repo entre turns quando a plataforma puder cachear
  • Não embaralhe ruído aleatório no prefixo a cada request (isso mata a taxa de hit)
  • Leia o guia de caching da Moonshot—detalhe de implementação vence vibe

3. Encolha o output de propósito

  • Peça planos em bullet, não romances
  • Limite passos: “três opções, uma recomendação”
  • Pare loops de agent quando os testes passam—não deixe “mais uma melhoria” rodar a noite inteira sem supervisão
  • Meça tokens de output por tarefa bem-sucedida, não só “chamadas por dia”

4. Limite gasto na plataforma

  • Configure alertas rígidos de budget em platform.kimi.ai / OpenRouter
  • Use chaves separadas para prod vs playground
  • Mate cron jobs esquecidos que ainda apontam para kimi-k3

Gráfico de arquitetura do Kimi K3—escala e intenção de design, não SKU de notebook grátis

Fonte: materiais oficiais de lançamento do K3 via @Kimi_Moonshot / blog Kimi K3, 16 de julho de 2026.

Mitos que esvaziam a carteira

MitoRealidade
“Open weights = API grátis”Planos de download de pesos ≠ inference hospedada ilimitada. Timeline de pesos: reality check de 27 de julho.
“Achei uma chave free de kimi-k3 online”Quase sempre roubada, fake ou isca. Crie a sua.
“1M de contexto = sempre colar o monorepo inteiro”Você pode; você também paga pelo que cola (salvo cache).
“K3 é sempre mais barato que Claude/OpenAI”Compare sua carga. Agents pesados em output podem apagar a economia de headline.
“Uso K3 em todo autocomplete”É assim que você descobre $15/M do jeito difícil. Roteie volume em outro lugar.

Self-host depois que os pesos saírem é conta de hardware + ops, não cupom de API grátis—veja realidade de VRAM / Ollama.

O que fazer nesta semana

Se você só quer experimentar o modelo: fique no caminho do produto—opções grátis e como usar K3 nesta semana. Não force chave de API por curiosidade.

Se você entrega software:

  1. Crie uma chave em platform.kimi.ai (ou OpenRouter se você já vive lá).
  2. Ligue kimi-k3 só no caminho de “job difícil”.
  3. Ative caching onde a doc permitir; meça a taxa de hit depois de um dia.
  4. Coloque um teto diário de gasto antes de deixar um agent rodando.
  5. Deixe preços oficiais abertos numa aba—posts de blog envelhecem; o rate card é o contrato.

Para onde ir depois

Resumo final: a API do Kimi K3 é uma ferramenta de preço frontier com desconto grande de cache e output caro. Use onde ela paga a fatura—e pare de tratar resultado de busca por “free api” como página de preços.

Artigos relacionados

O feed está cheio de Kimi K3. O mapa prático desta semana: app ou trial grátis, o que fazer se a assinatura estiver pausada, quando a API vale a pena e o que ignorar até os pesos de 27 de julho.
Tentou pagar o Kimi K3 e bateu na parede? Quem está afetado, o que ainda funciona (trial grátis, API, planos atuais) e como 27 de julho com open weights muda o plano.
Buscando Ollama, GGUF ou VRAM pro Kimi K3? O quadro local honesto—o que falta hoje, o que 2.8T realmente implica, e o que usar até os pesos saírem.