Kimi K3 API-prijzen: cache hits, OpenRouter en kosten in de hand
Kimi K3-hub: Specs, model-id, wanneer switchen → /kimi-k3. Gratis product proberen → K3 gratis gebruiken. Praktische deuren deze week → Kimi K3 gebruiken.
Je zocht op kimi k3 free api of kimi k3 pricing nadat een feed schreeuwde dat het model “open” is. Daarna opende je de developer console en zag een tariefkaart die nergens op “gratis voor altijd” lijkt.
Dat gat is normaal. Gratis productlagen en betaalde API-keys zijn verschillende deuren. Deze gids gaat alleen over de rekening die je krijgt als je kimi-k3 aanroept.
Het korte antwoord (lees dit eerst)
- Er is geen permanente gratis productie-API voor full
kimi-k3. Gratis chat / rewards zitten op de productkant (kimi.com). Keys op platform.kimi.ai zijn pay-as-you-go. - Lijstprijs (USD / 1M tokens, publieke docs eind juli 2026): cache-hit input $0.30 · cache-miss input $3.00 · output $15.00. Vlak over het 1M-contextvenster—geen “long context surcharge” op de publieke K3-kaart.
- De echte besparingshefboom is cache + modelrouting, niet jagen op nep-gratis keys. Hergebruik lange system prompts en repo-context; stuur routinewerk naar goedkopere modellen; reserveer K3 voor zware, lange jobs.
- Max-effort thinking staat standaard aan op K3 (je kunt in publieke docs nog geen “cheap mode”-knop omzetten). Triviale prompts kunnen alsnog dure reasoning-tokens verbranden—gebruik K3 niet als broodrooster.
In één zin: probeer het model gratis via het product; gebruik de betaalde API als je automatisering nodig hebt—en behandel $15/M output + always-on thinking als een budgetfeature, niet als detail.
Deze site is onafhankelijk van Moonshot. Prijzen en capaciteit wijzigen—check K3 pricing en K3 quickstart voordat je een team op autopilot zet.

Bron: Officiële @Kimi_Moonshot K3-launchmedia, 16 juli 2026; dezelfde charts als de Kimi K3-blog.
De tariefkaart in mensentaal
| Post | Ongeveer de betekenis | USD / 1M tokens |
|---|---|---|
| Cache-hit input | “Je hebt deze context recent al betaald; we hergebruiken ’m.” | $0.30 |
| Cache-miss input | Verse tokens die het model voor dit request-pad niet heeft gecached | $3.00 |
| Output | Tokens die het model terugschrijft—inclusief lange reasoning-traces | $15.00 |
| Context window | Hoeveel project je in één call kunt vasthouden | 1M tokens (vlakke prijs op de publieke kaart) |
| Model id | Wat je in de API-request zet | kimi-k3 |
Drie vertalingen die mensen missen:
- $3 / $15 is “Sonnet-niveau,” geen “K2-promoprijs.” Is je job een refactor van 20 regels, dan wint een goedkoper coding-model vaak op kosten.
- $0.30 cache hits zijn de stille held. Agents die dezelfde system prompt, style guide of monorepo-snapshot opnieuw sturen, krijgen een 90% input-korting op het herhaalde deel—als caching werkt zoals gedocumenteerd.
- Output is waar rekeningen exploderen. Lange tool-loops + lange chain-of-thought = veel $15/M-tokens. Een “simpele test” die te diep nadenkt kan alsnog serieus geld kosten.
Officiële deeplinks: platform.kimi.ai · pricing/chat-k3 · context caching-gids.
Gratis product vs betaalde API (niet door elkaar gooien)
| Pad | Wat je krijgt | Wat je betaalt |
|---|---|---|
| kimi.com / app gratis + rewards | Chat / agent-UX met quota’s | $0 tot de limieten; membership kan meer ontgrendelen |
| Membership / Code membership | Productrechten (niet hetzelfde als pure API-metering) | Planprijs (check membership pricing) |
API kimi-k3 | Keys, tools, automatisering, OpenAI-compatibele base URL | Tokenmeter — $0.30 / $3 / $15 |
OpenRouter moonshotai/kimi-k3 | Hetzelfde model via een multi-model router | Zelfde $3 / $15-band op publieke listings; capaciteit kan throttlen |
Zoeken op “kimi k3 free api key” betekent meestal één van drie missers:
- Je wilt gratis productchat (juiste deur: gratis-gids)
- Je wilt eeuwig-$0 productiekeys (geen publieke belofte)
- Je landt op scam key dumps (plak nooit keys van willekeurige gists in productie)
Als nieuwe abonnementen aan de consumentenkant gepauzeerd zijn, kan de API nog steeds een aparte deur zijn—zie abonnement-pauze-gids.

Bron: Officiële @Kimi_Moonshot K3-launchmedia, 16 juli 2026.
Waarom je eerste factuur erger voelt dan de tariefkaart
K3 is gebouwd voor langetermijn coderen, kenniswerk en diep redeneren. Dat merk je zo:
- Always-on thinking (max effort bij launch). Publieke docs zeggen dat je chain-of-thought op K3 niet zomaar “uit” zet zoals sommige modellen low/medium effort tonen. Goedkope “hoi”-prompts blijven een slechte gewoonte.
- 1M context is een power tool, geen gratis snack. Halve monorepo’s in elke call proppen zonder caching is hoe $3-input het hoofdnummer wordt.
- Agent-loops vermenigvuldigen output. Plan → tool → patch → opnieuw lezen → weer plannen. Elke stap schrijft tokens tegen $15/M.
Ruwe mentale rekenkunde (alleen illustratief—geen offerte):
| Voorbeeldklus | Inputs die ertoe doen | Waar je op let |
|---|---|---|
| 2k-token prompt, 500-token antwoord, geen cache | Klein | Nog steeds liever een goedkoop model als de taak triviaal is |
| 100k-token repo-context, 80% cache hit volgende turn | Cache | Input valt richting $0.30 op het hit-deel |
| Multi-uur agent, 200k outputtokens aan reasoning | Output | $15 × 0.2 = $3 alleen voor die slice—vóór input |
Lees voor productie altijd usage-dashboards, niet blog-rekenkunde.
OpenRouter vs direct Moonshot
| Direct Moonshot | OpenRouter | |
|---|---|---|
| Model id | kimi-k3 | moonshotai/kimi-k3 (aliases kunnen bestaan) |
| Base URL | https://api.moonshot.ai/v1 | OpenRouters OpenAI-compatibele endpoint |
| Prijsband | Officieel $0.30 / $3 / $15 | Publieke listings vaak $3 / $15 met cache-velden |
| Waarom kiezen | Minste overhead, officiële docs, prompt-caching-pad | Eén key voor veel modellen; snelle experimenten |
| Let op | Account + billing setup | Upstream capaciteit / 429s als K3 hot is |
Geen van beide paden is “gratis API.” Beide zijn routers naar een gemeten flagship.
Minimale directe call-vorm (keys in env, nooit in git):
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{
"role": "user",
"content": "Propose a migration plan for a 200-file TypeScript monorepo. Keep the plan under 800 words.",
}],
)
print(resp.choices[0].message.content)
Let op de laatste zin: beperk de vraag. Op een model dat standaard hard nadenkt, groeien vage “doe alles”-prompts rekeningen poten aan.
Kostenbeheersing die écht werkt
1. Routeer op job, niet op hype
| Job | Liever | Waarom |
|---|---|---|
| Routine-edits, kleine PR’s, autocomplete-achtige loops | K2.7 Code (en vrienden) | Goedkoper SKU, coding-gericht; zie /kimi-k27 · /kimi-code |
| Bulk classificatie, concepten, “goed genoeg”-samenvatting | K2.6 of andere lagere-kostenmodellen | Spaar K3-budget voor de harde 10% |
| Multi-file architectuur, lange agent, screenshot→UI, deep research-pack | kimi-k3 | Daarvoor betaal je de premium |
Familiekiezer: K2.6 vs K2.7 vs K3.
2. Laat cache voor je werken
- Houd stabiele system prompts en stabiele tool schemas
- Hergebruik hetzelfde grote document/repo-bundel over turns wanneer het platform kan cachen
- Gooi niet bij elk request willekeurige ruis in de prefix (dat doodt de hit rate)
- Lees Moonshots caching-gids—implementatiedetails winnen van vibes
3. Krimp output met opzet
- Vraag om bullet-plannen, geen romans
- Beperk stappen: “drie opties, één aanbeveling”
- Stop agent-loops als tests slagen—laat “nog één verbetering” niet onbewaakt de nacht doorlopen
- Log outputtokens per geslaagde taak, niet alleen “calls per dag”
4. Zet een plafond in het platform
- Stel harde budgetalerts in op platform.kimi.ai / OpenRouter
- Gebruik aparte keys voor prod vs playground
- Kill vergeten cronjobs die nog naar
kimi-k3wijzen

Bron: Officiële K3-launchmaterialen via @Kimi_Moonshot / Kimi K3-blog, 16 juli 2026.
Mythes die portemonnees leegtrekken
| Mythe | Realiteit |
|---|---|
| “Open weights = gratis API” | Open-weight downloadplannen ≠ onbeperkte hosted inference. Weights-tijdlijn: 27 juli reality check. |
“Ik vond een gratis kimi-k3-key online” | Bijna altijd gestolen, nep of aas. Maak je eigen key. |
| “1M context betekent: altijd de hele monorepo plakken” | Dat kan; je betaalt ook voor wat je plakt (tenzij gecached). |
| “K3 is altijd goedkoper dan Claude/OpenAI” | Vergelijk jouw workload. Output-zware agents kunnen headline-besparingen wegvagen. |
| “Ik gebruik K3 gewoon voor elke autocomplete” | Zo ontdek je $15/M op de harde manier. Routeer bulk elders. |
Self-hosten nadat weights landen is een hardware + ops-rekening, geen gratis-API-kortingsbon—zie VRAM / Ollama-realiteit.
Wat je deze week doet
Wil je alleen het model proberen: blijf op het productpad—gratis opties en K3 gebruiken deze week. Forceer geen API-key uit nieuwsgierigheid.
Ship je software:
- Maak een key op platform.kimi.ai (of OpenRouter als je daar al woont).
- Koppel
kimi-k3alleen op het “zware job”-pad. - Zet caching aan waar docs dat toelaten; meet de hit rate na een dag.
- Zet een dagelijks spend-cap voordat je een agent laat lopen.
- Houd officiële pricing open in een tab—blogposts verouderen; de tariefkaart is het contract.
Verder lezen
- Hub met specs + switchregels → /kimi-k3
- Status / tijdlijn → /kimi-k3-status
- Eerlijk over gratis product → /blog/33-kimi-k3-free-how-to
- App vs API-deuren → /blog/36-how-to-use-kimi-k3
- Open-weights-kalender → /blog/31-kimi-k3-open-weights-july-27
- Coding-SKU-hub → /kimi-code · /kimi-k27
Kortom: de Kimi K3-API is een frontier-geprijsd gereedschap met een stevige cache-korting en dure output. Gebruik ’m waar de rekening terecht is—en stop met “free api”-zoekresultaten als pricingpagina te behandelen.