Guides
11 min Min. Lesezeit
AI Observer

Kimi K3 API-Preise: Cache-Hits, OpenRouter & Kostenkontrolle

Kimi-K3-Hub: Specs, Model-ID, wann umschalten → /kimi-k3. Produkt gratis testen → K3 kostenlos nutzen. Praktische Türen diese Woche → Kimi K3 nutzen.

Du hast kimi k3 free api oder kimi k3 pricing getippt, weil irgendein Feed behauptete, das Modell sei „open“. Dann hast du die Developer Console geöffnet — und eine Preisliste gesehen, die mit „für immer gratis“ nichts zu tun hat.

Diese Lücke ist normal. Gratis-Produktstufen und bezahlte API-Keys sind verschiedene Türen. Dieser Guide geht nur um die Rechnung, die anfällt, wenn du kimi-k3 aufrufst.

Kurzantwort (zuerst lesen)

  1. Es gibt keine dauerhaft kostenlose Production-API für volles kimi-k3. Free Chat und Rewards laufen über die Produktfläche (kimi.com). Keys auf platform.kimi.ai sind Pay-as-you-go.
  2. Listenpreis (USD / 1M Tokens, öffentliche Docs Ende Juli 2026): Cache-Hit-Input $0.30 · Cache-Miss-Input $3.00 · Output $15.00. Flat über das 1M-Context-Fenster — kein „Long-Context-Aufschlag“ auf der öffentlichen K3-Karte.
  3. Der echte Hebel zum Sparen ist Cache plus Model-Routing, nicht die Jagd nach Fake-Free-Keys. Lange System-Prompts und Repo-Kontext wiederverwenden; Routine-Jobs an günstigere Modelle schicken; K3 für harte, lange Aufgaben reservieren.
  4. Max-Effort-Thinking ist bei K3 standardmäßig an (in den öffentlichen Docs gibt es noch keinen „Cheap Mode“-Schalter). Triviale Prompts können trotzdem teure Reasoning-Tokens verbrennen — nutze K3 nicht als Toaster.

Ein Satz: Gratis-Produkt zum Kennenlernen; bezahlte API, wenn du Automation brauchst — und behandle $15/M Output plus Always-on-Thinking als Budget-Feature, nicht als Detail.

Diese Seite ist unabhängig von Moonshot. Preise und Kapazität ändern sich — prüfe K3-Preise und K3-Quickstart, bevor du ein Team auf Autopilot setzt.

Offizielle Kimi-K3-Coding-Benchmarks (max effort) gegen führende Modelle—warum die Premium-Stufe existiert

Quelle: Offizielle @Kimi_Moonshot-K3-Launch-Medien, 16. Juli 2026; dieselben Charts wie im Kimi-K3-Blog.

Die Preisliste auf Deutsch

PositionWas das ungefähr heißtUSD / 1M Tokens
Cache-Hit-Input„Diesen Kontext hast du kürzlich schon bezahlt; wir nutzen ihn wieder.“$0.30
Cache-Miss-InputFrische Tokens, die für diesen Request-Pfad noch nicht gecacht sind$3.00
OutputTokens, die das Modell zurückschreibt — inklusive langer Reasoning-Spuren$15.00
Context-FensterWie viel Projekt du in einem Call halten kannst1M Tokens (Flat-Pricing auf der öffentlichen Karte)
Model-IDWas in den API-Request gehörtkimi-k3

Drei Übersetzungen, die viele überlesen:

  • $3 / $15 ist „Sonnet-Klasse“, nicht „K2-Promo-Preis“. Bei einem 20-Zeilen-Refactor gewinnt oft ein günstigeres Coding-Modell auf der Kostenrechnung.
  • $0.30-Cache-Hits sind der stille Held. Agents, die denselben System-Prompt, Style Guide oder Monorepo-Snapshot erneut schicken, holen sich 90 % Input-Rabatt auf den wiederholten Teil — wenn Caching wie dokumentiert greift.
  • Output ist, wo Rechnungen explodieren. Lange Tool-Loops plus lange Chain-of-Thought = viele Tokens zu $15/M. Ein „einfacher Test“, der überdenkt, kostet trotzdem echtes Geld.

Offizielle Deep Links: platform.kimi.ai · pricing/chat-k3 · Context-Caching-Guide.

Gratis-Produkt vs. bezahlte API (nicht vermischen)

PfadWas du bekommstWas du zahlst
kimi.com / App Free + RewardsChat-/Agent-UX mit Kontingenten$0 bis zu den Limits; Membership kann mehr freischalten
Membership / Code MembershipProdukt-Entitlements (nicht dasselbe wie rohe API-Metering)Planpreis (siehe Membership-Preise)
API kimi-k3Keys, Tools, Automation, OpenAI-kompatible Base-URLToken-Zähler — $0.30 / $3 / $15
OpenRouter moonshotai/kimi-k3Dasselbe Modell über einen Multi-Model-RouterÖffentlich oft dieselbe $3 / $15-Bandbreite; Kapazität kann drosseln

Wer „kimi k3 free api key“ sucht, landet meist in einem von drei Fehlern:

  1. Will gratis Produkt-Chat (richtige Tür: Free-Guide)
  2. Will für immer $0 Production-Keys (kein öffentliches Versprechen)
  3. Trifft auf Scam-Key-Dumps (nie Keys aus wilden Gists in Production pasten)

Wenn neue Consumer-Abos pausiert sind, kann die API trotzdem eine separate Tür bleiben — siehe Abo-Pause-Guide.

Kimi-K3-Agent- und Visual-Agent-Benchmarks—lange Tool-Loops sind, wo Output-Tokens summieren

Quelle: Offizielle @Kimi_Moonshot-K3-Launch-Medien, 16. Juli 2026.

Warum die erste Rechnung härter wirkt als die Preisliste

K3 ist für langfristiges Coding, Knowledge Work und tiefes Reasoning gebaut. Das zeigt sich so:

  • Always-on-Thinking (Max Effort beim Launch). Öffentliche Docs: Du kannst Chain-of-Thought bei K3 nicht einfach „ausschalten“ wie bei manchen Modellen mit Low/Medium Effort. Billige „hi“-Prompts bleiben eine schlechte Angewohnheit.
  • 1M Context ist ein Power-Tool, kein Free-Snack. Bei jedem Call die halbe Monorepo reinpacken — ohne Caching — macht $3-Input zum Hauptevent.
  • Agent-Loops multiplizieren Output. Plan → Tool → Patch → erneut lesen → wieder planen. Jeder Schritt schreibt Tokens zu $15/M.

Grobe Kopfrechnung (nur illustrativ — kein Angebot):

Spiel-JobInputs, die zählenWorauf achten
2k-Token-Prompt, 500-Token-Antwort, kein CacheKleinTrotzdem günstiges Modell, wenn der Job trivial ist
100k-Token-Repo-Kontext, 80 % Cache-Hit nächster TurnCacheInput fällt auf dem Hit-Anteil Richtung $0.30
Mehrstündiger Agent, 200k Output-Tokens ReasoningOutput$15 × 0.2 = $3 nur für diesen Slice — vor Input

Für Production immer Usage-Dashboards lesen, nicht Blog-Arithmetik.

OpenRouter vs. direkt Moonshot

Direkt MoonshotOpenRouter
Model-IDkimi-k3moonshotai/kimi-k3 (Aliase möglich)
Base-URLhttps://api.moonshot.ai/v1OpenRouters OpenAI-kompatibler Endpoint
PreisbandOffiziell $0.30 / $3 / $15Öffentliche Listings oft $3 / $15 mit Cache-Feldern
Warum wählenWenig Overhead, offizielle Docs, Prompt-Caching-PfadEin Key für viele Modelle; schnelle Experimente
AchtungAccount- + Billing-SetupUpstream-Kapazität / 429s, wenn K3 heiß ist

Kein Pfad ist „Free API“. Beide sind Router zu einem gemessenen Flagship.

Minimale direkte Call-Form (Keys in Env, nie in Git):

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{
        "role": "user",
        "content": "Propose a migration plan for a 200-file TypeScript monorepo. Keep the plan under 800 words.",
    }],
)
print(resp.choices[0].message.content)

Achte auf den letzten Satz: die Anfrage deckeln. Bei einem Modell, das standardmäßig hart denkt, wachsen Rechnungen mit vagen „mach alles“-Prompts Beine.

Kostenkontrolle, die wirklich greift

1. Nach Job routen, nicht nach Hype

JobBevorzugeWarum
Routine-Edits, kleine PRs, Autocomplete-LoopsK2.7 Code (und Verwandte)Günstigeres SKU, coding-fokussiert; siehe /kimi-k27 · /kimi-code
Massen-Klassifikation, Drafts, „gut genug“-SummariesK2.6 oder andere günstigere ModelleK3-Budget für die harten 10 % sparen
Multi-File-Architektur, langer Agent, Screenshot→UI, tiefes Research-Packkimi-k3Dafür ist der Premium-Preis da

Familien-Picker: K2.6 vs. K2.7 vs. K3.

2. Cache für dich arbeiten lassen

  • Stabile System-Prompts und stabile Tool-Schemas halten
  • Dasselbe große Dokument-/Repo-Bundle über Turns wiederverwenden, wenn die Plattform cachen kann
  • Keinen Zufalls-Noise in den Prefix jedes Requests mischen (das killt die Hit-Rate)
  • Moonshots Caching-Guide lesen — Implementierungsdetails schlagen Vibes

3. Output bewusst schrumpfen

  • Bullet-Pläne fordern, keine Romane
  • Schritte deckeln: „drei Optionen, eine Empfehlung“
  • Agent-Loops stoppen, wenn Tests grün sind — „noch eine Verbesserung“ nicht über Nacht unbeaufsichtigt laufen lassen
  • Output-Tokens pro erfolgreichem Task loggen, nicht nur „Calls pro Tag“

4. Spend in der Plattform deckeln

  • Harte Budget-Alerts auf platform.kimi.ai / OpenRouter setzen
  • Getrennte Keys für Prod vs. Playground
  • Vergessene Cron-Jobs killen, die noch auf kimi-k3 zeigen

Kimi-K3-Architektur-Grafik—Scale und Design-Intent, kein Free-Laptop-SKU

Quelle: Offizielle K3-Launch-Materialien über @Kimi_Moonshot / Kimi-K3-Blog, 16. Juli 2026.

Mythen, die Geldbörsen leeren

MythosRealität
„Open Weights = Free API“Open-Weight-Download-Pläne ≠ unbegrenzte gehostete Inference. Weights-Timeline: Realitätscheck 27. Juli.
„Ich hab online einen Free-kimi-k3-Key gefunden“Fast immer gestohlen, fake oder Köder. Eigenen Key anlegen.
„1M Context heißt: immer die ganze Monorepo pasten“Du kannst; du zahlst auch für das, was du pastest (außer es ist gecacht).
„K3 ist immer billiger als Claude/OpenAI“Mit deinem Workload vergleichen. Output-schwere Agents können Headline-Ersparnisse auslöschen.
„Ich nehme K3 für jedes Autocomplete“So entdeckst du $15/M auf die harte Tour. Bulk woanders routen.

Self-Host nach Weights-Release ist eine Hardware- + Ops-Rechnung, kein Free-API-Gutschein — siehe VRAM / Ollama-Realität.

Was du diese Woche tun solltest

Nur das Modell ausprobieren? Bleib auf dem Produktpfad — Free-Optionen und K3 diese Woche nutzen. Keinen API-Key aus Neugier erzwingen.

Du shipst Software:

  1. Key auf platform.kimi.ai anlegen (oder OpenRouter, wenn du dort schon lebst).
  2. kimi-k3 nur auf dem „harter Job“-Pfad verdrahten.
  3. Caching aktivieren, wo Docs es erlauben; Hit-Rate nach einem Tag messen.
  4. Tägliches Spend-Cap setzen, bevor ein Agent über Nacht läuft.
  5. Offizielle Preise in einem Tab offen halten — Blogposts veralten; die Preiskarte ist der Vertrag.

Weiterführend

Fazit: Die Kimi-K3-API ist ein Frontier-Preis-Tool mit großem Cache-Rabatt und teurem Output. Nutze sie dort, wo sie die Rechnung verdient — und behandle „free api“-Suchergebnisse nicht als Preisseite.

Verwandte Artikel

Dein Feed ist voll mit Kimi K3. Die praktische Karte für diese Woche: App oder Free-Try, was tun wenn Subscribe pausiert ist, wann die API sich lohnt — und was bis zu den Weights am 27. Juli warten kann.
Wolltest du für Kimi K3 zahlen und bist am Checkout hängen geblieben? Wer betroffen ist, was noch geht (gratis testen, API, bestehende Pläne) und was Open Weights am 27. Juli ändern.
Suchst du Ollama, GGUF oder VRAM zu Kimi K3? Ehrlicher Lokal-Check: was heute fehlt, was 2.8T wirklich heißt, und was du nutzt, bis die Weights da sind.