Kimi K3 API-Preise: Cache-Hits, OpenRouter & Kostenkontrolle
Kimi-K3-Hub: Specs, Model-ID, wann umschalten → /kimi-k3. Produkt gratis testen → K3 kostenlos nutzen. Praktische Türen diese Woche → Kimi K3 nutzen.
Du hast kimi k3 free api oder kimi k3 pricing getippt, weil irgendein Feed behauptete, das Modell sei „open“. Dann hast du die Developer Console geöffnet — und eine Preisliste gesehen, die mit „für immer gratis“ nichts zu tun hat.
Diese Lücke ist normal. Gratis-Produktstufen und bezahlte API-Keys sind verschiedene Türen. Dieser Guide geht nur um die Rechnung, die anfällt, wenn du kimi-k3 aufrufst.
Kurzantwort (zuerst lesen)
- Es gibt keine dauerhaft kostenlose Production-API für volles
kimi-k3. Free Chat und Rewards laufen über die Produktfläche (kimi.com). Keys auf platform.kimi.ai sind Pay-as-you-go. - Listenpreis (USD / 1M Tokens, öffentliche Docs Ende Juli 2026): Cache-Hit-Input $0.30 · Cache-Miss-Input $3.00 · Output $15.00. Flat über das 1M-Context-Fenster — kein „Long-Context-Aufschlag“ auf der öffentlichen K3-Karte.
- Der echte Hebel zum Sparen ist Cache plus Model-Routing, nicht die Jagd nach Fake-Free-Keys. Lange System-Prompts und Repo-Kontext wiederverwenden; Routine-Jobs an günstigere Modelle schicken; K3 für harte, lange Aufgaben reservieren.
- Max-Effort-Thinking ist bei K3 standardmäßig an (in den öffentlichen Docs gibt es noch keinen „Cheap Mode“-Schalter). Triviale Prompts können trotzdem teure Reasoning-Tokens verbrennen — nutze K3 nicht als Toaster.
Ein Satz: Gratis-Produkt zum Kennenlernen; bezahlte API, wenn du Automation brauchst — und behandle $15/M Output plus Always-on-Thinking als Budget-Feature, nicht als Detail.
Diese Seite ist unabhängig von Moonshot. Preise und Kapazität ändern sich — prüfe K3-Preise und K3-Quickstart, bevor du ein Team auf Autopilot setzt.

Quelle: Offizielle @Kimi_Moonshot-K3-Launch-Medien, 16. Juli 2026; dieselben Charts wie im Kimi-K3-Blog.
Die Preisliste auf Deutsch
| Position | Was das ungefähr heißt | USD / 1M Tokens |
|---|---|---|
| Cache-Hit-Input | „Diesen Kontext hast du kürzlich schon bezahlt; wir nutzen ihn wieder.“ | $0.30 |
| Cache-Miss-Input | Frische Tokens, die für diesen Request-Pfad noch nicht gecacht sind | $3.00 |
| Output | Tokens, die das Modell zurückschreibt — inklusive langer Reasoning-Spuren | $15.00 |
| Context-Fenster | Wie viel Projekt du in einem Call halten kannst | 1M Tokens (Flat-Pricing auf der öffentlichen Karte) |
| Model-ID | Was in den API-Request gehört | kimi-k3 |
Drei Übersetzungen, die viele überlesen:
- $3 / $15 ist „Sonnet-Klasse“, nicht „K2-Promo-Preis“. Bei einem 20-Zeilen-Refactor gewinnt oft ein günstigeres Coding-Modell auf der Kostenrechnung.
- $0.30-Cache-Hits sind der stille Held. Agents, die denselben System-Prompt, Style Guide oder Monorepo-Snapshot erneut schicken, holen sich 90 % Input-Rabatt auf den wiederholten Teil — wenn Caching wie dokumentiert greift.
- Output ist, wo Rechnungen explodieren. Lange Tool-Loops plus lange Chain-of-Thought = viele Tokens zu $15/M. Ein „einfacher Test“, der überdenkt, kostet trotzdem echtes Geld.
Offizielle Deep Links: platform.kimi.ai · pricing/chat-k3 · Context-Caching-Guide.
Gratis-Produkt vs. bezahlte API (nicht vermischen)
| Pfad | Was du bekommst | Was du zahlst |
|---|---|---|
| kimi.com / App Free + Rewards | Chat-/Agent-UX mit Kontingenten | $0 bis zu den Limits; Membership kann mehr freischalten |
| Membership / Code Membership | Produkt-Entitlements (nicht dasselbe wie rohe API-Metering) | Planpreis (siehe Membership-Preise) |
API kimi-k3 | Keys, Tools, Automation, OpenAI-kompatible Base-URL | Token-Zähler — $0.30 / $3 / $15 |
OpenRouter moonshotai/kimi-k3 | Dasselbe Modell über einen Multi-Model-Router | Öffentlich oft dieselbe $3 / $15-Bandbreite; Kapazität kann drosseln |
Wer „kimi k3 free api key“ sucht, landet meist in einem von drei Fehlern:
- Will gratis Produkt-Chat (richtige Tür: Free-Guide)
- Will für immer $0 Production-Keys (kein öffentliches Versprechen)
- Trifft auf Scam-Key-Dumps (nie Keys aus wilden Gists in Production pasten)
Wenn neue Consumer-Abos pausiert sind, kann die API trotzdem eine separate Tür bleiben — siehe Abo-Pause-Guide.

Quelle: Offizielle @Kimi_Moonshot-K3-Launch-Medien, 16. Juli 2026.
Warum die erste Rechnung härter wirkt als die Preisliste
K3 ist für langfristiges Coding, Knowledge Work und tiefes Reasoning gebaut. Das zeigt sich so:
- Always-on-Thinking (Max Effort beim Launch). Öffentliche Docs: Du kannst Chain-of-Thought bei K3 nicht einfach „ausschalten“ wie bei manchen Modellen mit Low/Medium Effort. Billige „hi“-Prompts bleiben eine schlechte Angewohnheit.
- 1M Context ist ein Power-Tool, kein Free-Snack. Bei jedem Call die halbe Monorepo reinpacken — ohne Caching — macht $3-Input zum Hauptevent.
- Agent-Loops multiplizieren Output. Plan → Tool → Patch → erneut lesen → wieder planen. Jeder Schritt schreibt Tokens zu $15/M.
Grobe Kopfrechnung (nur illustrativ — kein Angebot):
| Spiel-Job | Inputs, die zählen | Worauf achten |
|---|---|---|
| 2k-Token-Prompt, 500-Token-Antwort, kein Cache | Klein | Trotzdem günstiges Modell, wenn der Job trivial ist |
| 100k-Token-Repo-Kontext, 80 % Cache-Hit nächster Turn | Cache | Input fällt auf dem Hit-Anteil Richtung $0.30 |
| Mehrstündiger Agent, 200k Output-Tokens Reasoning | Output | $15 × 0.2 = $3 nur für diesen Slice — vor Input |
Für Production immer Usage-Dashboards lesen, nicht Blog-Arithmetik.
OpenRouter vs. direkt Moonshot
| Direkt Moonshot | OpenRouter | |
|---|---|---|
| Model-ID | kimi-k3 | moonshotai/kimi-k3 (Aliase möglich) |
| Base-URL | https://api.moonshot.ai/v1 | OpenRouters OpenAI-kompatibler Endpoint |
| Preisband | Offiziell $0.30 / $3 / $15 | Öffentliche Listings oft $3 / $15 mit Cache-Feldern |
| Warum wählen | Wenig Overhead, offizielle Docs, Prompt-Caching-Pfad | Ein Key für viele Modelle; schnelle Experimente |
| Achtung | Account- + Billing-Setup | Upstream-Kapazität / 429s, wenn K3 heiß ist |
Kein Pfad ist „Free API“. Beide sind Router zu einem gemessenen Flagship.
Minimale direkte Call-Form (Keys in Env, nie in Git):
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{
"role": "user",
"content": "Propose a migration plan for a 200-file TypeScript monorepo. Keep the plan under 800 words.",
}],
)
print(resp.choices[0].message.content)
Achte auf den letzten Satz: die Anfrage deckeln. Bei einem Modell, das standardmäßig hart denkt, wachsen Rechnungen mit vagen „mach alles“-Prompts Beine.
Kostenkontrolle, die wirklich greift
1. Nach Job routen, nicht nach Hype
| Job | Bevorzuge | Warum |
|---|---|---|
| Routine-Edits, kleine PRs, Autocomplete-Loops | K2.7 Code (und Verwandte) | Günstigeres SKU, coding-fokussiert; siehe /kimi-k27 · /kimi-code |
| Massen-Klassifikation, Drafts, „gut genug“-Summaries | K2.6 oder andere günstigere Modelle | K3-Budget für die harten 10 % sparen |
| Multi-File-Architektur, langer Agent, Screenshot→UI, tiefes Research-Pack | kimi-k3 | Dafür ist der Premium-Preis da |
Familien-Picker: K2.6 vs. K2.7 vs. K3.
2. Cache für dich arbeiten lassen
- Stabile System-Prompts und stabile Tool-Schemas halten
- Dasselbe große Dokument-/Repo-Bundle über Turns wiederverwenden, wenn die Plattform cachen kann
- Keinen Zufalls-Noise in den Prefix jedes Requests mischen (das killt die Hit-Rate)
- Moonshots Caching-Guide lesen — Implementierungsdetails schlagen Vibes
3. Output bewusst schrumpfen
- Bullet-Pläne fordern, keine Romane
- Schritte deckeln: „drei Optionen, eine Empfehlung“
- Agent-Loops stoppen, wenn Tests grün sind — „noch eine Verbesserung“ nicht über Nacht unbeaufsichtigt laufen lassen
- Output-Tokens pro erfolgreichem Task loggen, nicht nur „Calls pro Tag“
4. Spend in der Plattform deckeln
- Harte Budget-Alerts auf platform.kimi.ai / OpenRouter setzen
- Getrennte Keys für Prod vs. Playground
- Vergessene Cron-Jobs killen, die noch auf
kimi-k3zeigen

Quelle: Offizielle K3-Launch-Materialien über @Kimi_Moonshot / Kimi-K3-Blog, 16. Juli 2026.
Mythen, die Geldbörsen leeren
| Mythos | Realität |
|---|---|
| „Open Weights = Free API“ | Open-Weight-Download-Pläne ≠ unbegrenzte gehostete Inference. Weights-Timeline: Realitätscheck 27. Juli. |
„Ich hab online einen Free-kimi-k3-Key gefunden“ | Fast immer gestohlen, fake oder Köder. Eigenen Key anlegen. |
| „1M Context heißt: immer die ganze Monorepo pasten“ | Du kannst; du zahlst auch für das, was du pastest (außer es ist gecacht). |
| „K3 ist immer billiger als Claude/OpenAI“ | Mit deinem Workload vergleichen. Output-schwere Agents können Headline-Ersparnisse auslöschen. |
| „Ich nehme K3 für jedes Autocomplete“ | So entdeckst du $15/M auf die harte Tour. Bulk woanders routen. |
Self-Host nach Weights-Release ist eine Hardware- + Ops-Rechnung, kein Free-API-Gutschein — siehe VRAM / Ollama-Realität.
Was du diese Woche tun solltest
Nur das Modell ausprobieren? Bleib auf dem Produktpfad — Free-Optionen und K3 diese Woche nutzen. Keinen API-Key aus Neugier erzwingen.
Du shipst Software:
- Key auf platform.kimi.ai anlegen (oder OpenRouter, wenn du dort schon lebst).
kimi-k3nur auf dem „harter Job“-Pfad verdrahten.- Caching aktivieren, wo Docs es erlauben; Hit-Rate nach einem Tag messen.
- Tägliches Spend-Cap setzen, bevor ein Agent über Nacht läuft.
- Offizielle Preise in einem Tab offen halten — Blogposts veralten; die Preiskarte ist der Vertrag.
Weiterführend
- Hub mit Specs + Switch-Regeln → /kimi-k3
- Status / Timeline → /kimi-k3-status
- Free-Produkt ehrlich → /blog/33-kimi-k3-free-how-to
- App- vs. API-Türen → /blog/36-how-to-use-kimi-k3
- Open-Weights-Kalender → /blog/31-kimi-k3-open-weights-july-27
- Coding-SKU-Hub → /kimi-code · /kimi-k27
Fazit: Die Kimi-K3-API ist ein Frontier-Preis-Tool mit großem Cache-Rabatt und teurem Output. Nutze sie dort, wo sie die Rechnung verdient — und behandle „free api“-Suchergebnisse nicht als Preisseite.