Guides
11 min min läsning
AI Observer

Kimi K3 API-pris: cacheträffar, OpenRouter och kostnadskontroll

Kimi K3-hub: Specs, modell-id, när du ska byta → /kimi-k3. Gratis produktprov → så använder du K3 gratis. Praktiska dörrar den här veckan → så använder du Kimi K3.

Du sökte kimi k3 free api eller kimi k3 pricing efter att flödet sa att modellen är «öppen.» Sedan öppnade du utvecklarpanelen och såg en prislista som inte liknar «gratis för evigt.»

Det gapet är normalt. Gratis produkttiers och betalda API-nycklar är olika dörrar. Den här guiden handlar bara om notan du får när du anropar kimi-k3.

Kort svar (läs det här först)

  1. Det finns ingen permanent gratis produktions-API för full kimi-k3. Gratis chatt / belöningar lever i produktytan (kimi.com). Nycklar på platform.kimi.ai är pay-as-you-go.
  2. Listpris (USD / 1M tokens, publika docs sent juli 2026): cacheträff-input $0.30 · cachemiss-input $3.00 · output $15.00. Platt över hela 1M-kontextfönstret—ingen «lång-kontext-tilläggsavgift» på det publika K3-kortet.
  3. Den verkliga sparspaken är cache + modellrouting, inte jakt på bluff-gratisnycklar. Återanvänd långa systemprompter och repokontext; skicka rutinjobb till billigare modeller; spara K3 till hårda, långa jobb.
  4. Max-effort thinking är på som standard på K3 (du kan inte slå om en «billig-läge»-brytare än enligt publika docs). Triviala prompter kan ändå bränna dyra resonemangstokens—använd inte K3 som brödrost.

En mening: använd gratisprodukten för att känna på modellen; använd det betalda API:t när du behöver automation—och behandla $15/M output + alltid-på thinking som en budgetfunktion, inte en detalj.

Den här sajten är oberoende av Moonshot. Priser och kapacitet ändras—bekräfta på K3-priser och K3 quickstart innan du sätter ett team på autopilot.

Kimi K3 officiella codingbenchmarks (max effort) mot ledande modeller—varför premiumnivån finns

Källa: Officiell @Kimi_Moonshot K3-lanseringsmedia, 16 juli 2026; samma diagram som Kimi K3-bloggen.

Prislistan på klar svenska

PostUngefärlig betydelseUSD / 1M tokens
Cacheträff-input«Du har nyss betalat för att skicka den här kontexten; vi återanvänder den.»$0.30
Cachemiss-inputFärska tokens som modellen inte cachar för den här requestvägen$3.00
OutputTokens modellen skriver tillbaka—inklusive långa resonemangsspår$15.00
KontextfönsterHur mycket av ett projekt du kan hålla i ett anrop1M tokens (platt prissättning på det publika kortet)
Modell-idDet du lägger i API-anropetkimi-k3

Tre översättningar folk missar:

  • $3 / $15 är «Sonnet-nivå,» inte «K2-kampanjpris.» Om jobbet är en 20-raders refaktor vinner en billigare kodmodell ofta på kostnad.
  • $0.30-cacheträffar är den tysta hjälten. Agenter som skickar om samma systemprompt, style guide eller monorepo-snapshot får 90 % rabatt på input på den upprepade delen—när cachen funkar som dokumenterat.
  • Output är där notan exploderar. Långa verktygsslingor + lång chain-of-thought = många tokens à $15/M. Ett «enkelt test» som tänker för mycket kan fortfarande kosta på riktigt.

Officiella djuplänkar: platform.kimi.ai · pricing/chat-k3 · guide för context caching.

Gratis produkt vs betalt API (sluta blanda ihop dem)

VägVad du fårVad du betalar
kimi.com / app gratis + belöningarChatt / agent-UX med kvoter$0 tills gränserna; medlemskap kan låsa upp mer
Medlemskap / Code membershipProduktförmåner (inte samma sak som ren API-mätning)Planpris (kolla medlemspriser)
API kimi-k3Nycklar, verktyg, automation, OpenAI-kompatibel base URLTokenmätare — $0.30 / $3 / $15
OpenRouter moonshotai/kimi-k3Samma modell via en multimodell-routerSamma $3 / $15-band i publika listor; kapacitet kan strypas

Söker du «kimi k3 free api key» är det oftast ett av tre misstag:

  1. Vill ha gratis produktchatt (rätt dörr: gratisguide)
  2. Vill ha för-evigt-$0-produktionsnycklar (inget publikt löfte)
  3. Hamnar på bluff-nyckeldumpar (klistra aldrig in nycklar från slumpmässiga gists i produktion)

Om nya prenumerationer är pausade på konsumentsidan kan API:t fortfarande vara en separat dörr—se guide om prenumerationspaus.

Kimi K3 agent- och visual-agent-benchmarks—långa verktygsslingor är där output-tokens summerar

Källa: Officiell @Kimi_Moonshot K3-lanseringsmedia, 16 juli 2026.

Varför första fakturan känns värre än prislistan

K3 är byggt för långsiktig kodning, knowledge work och djupt resonemang. Det syns som:

  • Alltid-på thinking (max effort vid lansering). Publika docs säger att du inte enkelt kan «stänga av» chain-of-thought på K3 som vissa modeller exponerar low/medium effort. Billiga «hej»-prompter är fortfarande en dålig vana.
  • 1M-kontext är ett kraftverktyg, inte en gratis snacks. Att proppa in halva monorepot i varje anrop utan cache är hur $3-input blir huvudnumret.
  • Agentslingor multiplicerar output. Plan → verktyg → patch → läs om → planera igen. Varje steg skriver tokens à $15/M.

Ungefärlig huvudräkning (bara illustration—inte en offert):

LeksaksjobbInputs som spelar rollVad du ska hålla öga på
2k-token-prompt, 500-token-svar, ingen cacheLitetFöredra ändå en billig modell om uppgiften är trivial
100k-token-repokontext, 80 % cacheträff nästa turCacheInput kollapsar mot $0.30 på träffdelen
Multi-timmes-agent, 200k output-tokens av resonemangOutput$15 × 0.2 = $3 bara för den skivan—före input

Läs alltid användningsdashboards, inte blogg-aritmetik, för produktion.

OpenRouter vs direkt Moonshot

Direkt MoonshotOpenRouter
Modell-idkimi-k3moonshotai/kimi-k3 (alias kan finnas)
Base URLhttps://api.moonshot.ai/v1OpenRouters OpenAI-kompatibla endpoint
PrisbandOfficiellt $0.30 / $3 / $15Publika listor vanligen $3 / $15 med cachefält
Varför välja detLägst overhead, officiella docs, prompt-caching-vägEn nyckel för många modeller; snabba experiment
VarningarKonto + faktureringssetupUpstream kapacitet / 429:or när K3 är hett

Ingen av vägarna är «gratis API.» Båda är routrar till ett mätat flaggskepp.

Minimal form för direkt anrop (lagra nycklar i env, aldrig i git):

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{
        "role": "user",
        "content": "Propose a migration plan for a 200-file TypeScript monorepo. Keep the plan under 800 words.",
    }],
)
print(resp.choices[0].message.content)

Lägg märke till sista meningen: begränsa frågan. På en modell som tänker hårt som standard är vaga «gör allt»-prompter hur fakturor får ben.

Kostnadskontroll som faktiskt funkar

1. Routa efter jobb, inte hype

JobbFöredraVarför
Rutinredigeringar, små PR:er, autocomplete-liknande looparK2.7 Code (och vänner)Billigare SKU, kodfokuserad; se /kimi-k27 · /kimi-code
Bulkklassning, utkast, «good enough»-sammanfattningK2.6 eller andra lågkostnadsmodellerSpara K3-budgeten till de hårda 10 %
Multifilsarkitektur, lång agent, skärmdump→UI, djup research-packkimi-k3Det är vad premiumet är till för

Familjeväljare: K2.6 vs K2.7 vs K3.

2. Få cachen att jobba för dig

  • Håll stabila systemprompter och stabila verktygsscheman
  • Återanvänd samma stora dokument/repo-bundle över turer när plattformen kan cacha det
  • Blanda inte in slumpmässigt brus i prefixet varje request (det dödar träffprocenten)
  • Läs Moonshots caching-guide—implementationsdetaljer slår vibbar

3. Krymp output med flit

  • Be om punktlistplaner, inte romaner
  • Begränsa steg: «tre alternativ, en rekommendation»
  • Stoppa agentslingor när testerna går grönt—låt inte «en förbättring till» köra över natten obevakat
  • Logga output-tokens per lyckad uppgift, inte bara «anrop per dag»

4. Tak på utgifter i plattformen

  • Sätt hårda budgetlarm på platform.kimi.ai / OpenRouter
  • Använd separata nycklar för prod vs playground
  • Döda glömda cron-jobb som fortfarande pekar på kimi-k3

Kimi K3-arkitekturgrafik—skala och designavsikt, inte en gratis laptop-SKU

Källa: Officiellt K3-lanseringsmaterial via @Kimi_Moonshot / Kimi K3-bloggen, 16 juli 2026.

Myter som tömmer plånboken

MytVerklighet
«Öppna vikter = gratis API»Open-weight-nedladdningsplaner ≠ obegränsad hostad inferens. Vikttidslinje: verklighetskoll 27 juli.
«Jag hittade en gratis kimi-k3-nyckel online»Nästan alltid stulen, fejkad eller bete. Skapa din egen nyckel.
«1M-kontext betyder att jag alltid ska klistra in hela monorepot»Du kan; du betalar också för det du klistrar in (om det inte är cachat).
«K3 är alltid billigare än Claude/OpenAI»Jämför din workload. Output-tunga agenter kan radera rubrikbesparingar.
«Jag kör bara K3 för varje autocomplete»Så upptäcker du $15/M den hårda vägen. Routa bulk någon annanstans.

Self-host efter att vikterna landar är en hårdvaru- + driftnota, inte en gratis API-kupong—se VRAM / Ollama-verklighet.

Vad du bör göra den här veckan

Om du bara vill prova modellen: stanna på produktvägen—gratisalternativ och så använder du K3 den här veckan. Tvinga inte fram en API-nyckel av nyfikenhet.

Om du shippar mjukvara:

  1. Skapa en nyckel på platform.kimi.ai (eller OpenRouter om du redan bor där).
  2. Koppla kimi-k3 bara på «hårt jobb»-vägen.
  3. Sätt på caching där docs tillåter; mät träffprocent efter en dag.
  4. Lägg ett dagligt utgiftstak innan du lämnar en agent igång.
  5. Håll officiella priser öppna i en flik—blogginlägg blir gamla; prislistan är kontraktet.

Nästa steg

Bottom line: Kimi K3:s API är ett frontier-prissatt verktyg med stor cacherabatt och dyr output. Använd det där det tjänar in notan—och sluta behandla sökresultat om «free api» som en prissida.

Relaterade artiklar

Flödena svämmar över av Kimi K3. Här är den praktiska kartan för veckan—app eller gratisprov, vad du gör om prenumerationen är pausad, när API:t lönar sig, och vad du kan strunta i tills vikterna 27 juli.
Försökte betala för Kimi K3 och körde i väggen? Vem som påverkas, vad som fortfarande funkar (gratisprov, API, befintliga planer) och hur öppna vikter 27 juli ändrar planen.
Söker du Ollama, GGUF eller VRAM för Kimi K3? Här är den ärliga lokala bilden—vad som saknas i dag, vad 2.8T faktiskt betyder, och vad du bör använda tills vikterna landar.