Prezzi API Kimi K3: cache hit, OpenRouter e controllo costi
Hub Kimi K3: Specs, model id, quando passare → /kimi-k3. Prova free sul prodotto → come usare K3 gratis. Porte pratiche di questa settimana → come usare Kimi K3.
Hai cercato kimi k3 free api o kimi k3 pricing dopo un post che diceva che il modello è «open». Poi hai aperto la console developer e hai trovato un listino che non ha niente a che fare con «gratis per sempre».
Quel dislivello è normale. Free tier di prodotto e chiavi API a pagamento sono porte diverse. Questa guida parla solo della bolletta che arriva quando chiami kimi-k3.
Risposta breve (leggi prima questa)
- Non esiste un’API di produzione free permanente per il
kimi-k3pieno. Chat free / premi vivono sulla superficie prodotto (kimi.com). Le chiavi su platform.kimi.ai sono pay-as-you-go. - Listino (USD / 1M token, doc pubbliche di fine luglio 2026): input cache-hit $0.30 · input cache-miss $3.00 · output $15.00. Flat su tutta la finestra da 1M—niente «sovrapprezzo long context» sul listino pubblico K3.
- La leva vera di risparmio è cache + routing dei modelli, non cacciare chiavi free fasulle. Riutilizza system prompt lunghi e contesto di repo; manda il lavoro di routine a modelli più economici; tieni K3 per i job difficili e lunghi.
- Il thinking a max effort è attivo di default su K3 (nelle doc pubbliche non c’è ancora uno switch «modalità economica»). Prompt banali possono comunque bruciare token di ragionamento cari—non usare K3 come un tostapane.
In una riga: usa il prodotto free per sentire il modello; usa l’API a pagamento quando ti serve automazione—e tratta $15/M di output + thinking sempre acceso come una feature di budget, non un dettaglio.
Questo sito è indipendente da Moonshot. Prezzi e capacità cambiano—conferma su prezzi K3 e quickstart K3 prima di mettere un team in autopilot.

Fonte: Media ufficiali di lancio K3 di @Kimi_Moonshot, 16 luglio 2026; stessi grafici del blog Kimi K3.
Il listino in chiaro
| Voce | Significato grezzo | USD / 1M token |
|---|---|---|
| Input cache-hit | «Hai già pagato per mandare questo contesto di recente; lo riusiamo.» | $0.30 |
| Input cache-miss | Token freschi che il modello non ha in cache su questo path di request | $3.00 |
| Output | Token che il modello scrive indietro—incluse le trace di ragionamento lunghe | $15.00 |
| Finestra di contesto | Quanto di un progetto puoi tenere in una chiamata | 1M token (prezzo flat sul listino pubblico) |
| Model id | Cosa metti nella request API | kimi-k3 |
Tre letture del listino che quasi nessuno fa:
- $3 / $15 è fascia «Sonnet-tier», non «prezzo promo K2». Se il job è un refactor da 20 righe, un modello coding più economico spesso vince sul costo.
- I cache hit a $0.30 sono l’eroe silenzioso. Gli agent che re-inviano lo stesso system prompt, style guide o snapshot di monorepo prendono uno sconto ~90% sull’input sulla parte ripetuta—quando la cache funziona come documentato.
- L’output è dove le bollette esplodono. Loop di tool lunghi + chain-of-thought lunga = tanti token a $15/M. Un «test semplice» che ragiona troppo può costare soldi veri.
Deep link ufficiali: platform.kimi.ai · pricing/chat-k3 · guida context caching.
Prodotto free vs API a pagamento (smetti di mescolarli)
| Percorso | Cosa ottieni | Cosa paghi |
|---|---|---|
| kimi.com / app free + premi | Chat / UX agent con quote | $0 fino ai limiti; la membership può sbloccare di più |
| Membership / Code membership | Diritti di prodotto (non è la stessa cosa del metering API grezzo) | Prezzo del piano (vedi prezzi membership) |
API kimi-k3 | Chiavi, tool, automazione, base URL compatibile OpenAI | Contatore token — $0.30 / $3 / $15 |
OpenRouter moonshotai/kimi-k3 | Stesso modello via un router multi-modello | Stessa fascia $3 / $15 sui listing pubblici; la capacità può throttlare |
Cercare «kimi k3 free api key» di solito è uno di tre errori:
- Volevi la chat free di prodotto (porta giusta: guida free)
- Volevi chiavi di produzione a $0 per sempre (non è una promessa pubblica)
- Sei finito su dump di chiavi scam (non incollare mai chiavi da gist a caso in produzione)
Se le nuove iscrizioni lato consumer sono in pausa, l’API può restare una porta separata—vedi guida pausa abbonamento.

Fonte: Media ufficiali di lancio K3 di @Kimi_Moonshot, 16 luglio 2026.
Perché la prima fattura fa più male del listino
K3 è costruito per coding a lungo orizzonte, knowledge work e ragionamento profondo. Si vede così:
- Thinking sempre acceso (max effort al lancio). Le doc pubbliche dicono che non puoi semplicemente «spegnere» la chain-of-thought su K3 come su alcuni modelli con effort low/medium. I prompt «ciao» a basso costo restano una cattiva abitudine.
- 1M di contesto è un power tool, non uno snack gratis. Infilare mezzo monorepo in ogni call senza caching è come far diventare l’input a $3 il protagonista della bolletta.
- I loop agent moltiplicano l’output. Piano → tool → patch → rileggi → di nuovo piano. Ogni step scrive token a $15/M.
Matematica grezza da tenere a mente (solo illustrativa—non è un preventivo):
| Scenario di esempio | Input che contano | A cosa stare attenti |
|---|---|---|
| Prompt da 2k token, risposta da 500, niente cache | Piccoli | Preferisci comunque un modello economico se il task è banale |
| Contesto repo da 100k token, 80% cache hit al turno dopo | Cache | L’input collassa verso $0.30 sulla porzione in hit |
| Agent multi-ora, 200k token di output di ragionamento | Output | $15 × 0.2 = $3 solo per quella fetta—prima dell’input |
Per la produzione leggi sempre le dashboard di usage, non l’aritmetica da blog.
OpenRouter vs Moonshot diretto
| Moonshot diretto | OpenRouter | |
|---|---|---|
| Model id | kimi-k3 | moonshotai/kimi-k3 (possono esistere alias) |
| Base URL | https://api.moonshot.ai/v1 | Endpoint OpenAI-compatible di OpenRouter |
| Fascia prezzo | Ufficiale $0.30 / $3 / $15 | Listing pubblici di solito $3 / $15 con campi cache |
| Perché sceglierlo | Overhead minimo, doc ufficiali, path di prompt caching | Una chiave per tanti modelli; esperimenti rapidi |
| Attenzioni | Setup account + billing | Capacità upstream / 429 quando K3 è caldo |
Nessuno dei due path è «API free». Entrambi sono router verso un flagship a metering.
Forma minima di una call diretta (chiavi in env, mai in git):
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{
"role": "user",
"content": "Propose a migration plan for a 200-file TypeScript monorepo. Keep the plan under 800 words.",
}],
)
print(resp.choices[0].message.content)
Nota l’ultima frase: metti un tetto alla richiesta. Su un modello che pensa duro di default, i prompt vaghi da «fai tutto» sono il modo più semplice per far crescere le bollette.
Controllo costi che funziona davvero
1. Instrada per job, non per hype
| Job | Preferisci | Perché |
|---|---|---|
| Edit di routine, PR piccole, loop stile autocomplete | K2.7 Code (e affini) | SKU più economico, orientato al coding; vedi /kimi-k27 · /kimi-code |
| Classificazione bulk, bozze, summary «abbastanza buono» | K2.6 o altri modelli low-cost | Risparmia il budget K3 per il 10% difficile |
| Architettura multi-file, agent lunghi, screenshot→UI, pack di research profondo | kimi-k3 | È per questo che paghi il premium |
Selettore di famiglia: K2.6 vs K2.7 vs K3.
2. Fai lavorare la cache per te
- Tieni system prompt stabili e schema tool stabili
- Riusa lo stesso bundle grande di documento/repo tra un turno e l’altro quando la piattaforma può cachearlo
- Non rimescolare rumore random nel prefisso a ogni request (ammazza l’hit rate)
- Leggi la guida caching di Moonshot—i dettagli di implementazione battono le vibes
3. Stringi l’output di proposito
- Chiedi piani a bullet, non romanzi
- Metti un cap agli step: «tre opzioni, una raccomandazione»
- Ferma i loop agent quando i test passano—non lasciare «un altro miglioramento» girare tutta la notte incustodito
- Logga i token di output per task riuscito, non solo le «call al giorno»
4. Metti un tetto di spend sulla piattaforma
- Imposta alert di budget hard su platform.kimi.ai / OpenRouter
- Usa chiavi separate per prod vs playground
- Spegni i cron dimenticati che puntano ancora a
kimi-k3

Fonte: Materiali ufficiali di lancio K3 via @Kimi_Moonshot / blog Kimi K3, 16 luglio 2026.
Miti che svuotano il portafoglio
| Mito | Realtà |
|---|---|
| «Open weights = API free» | I piani di download open-weight ≠ inference hosted illimitata. Timeline pesi: reality check 27 luglio. |
«Ho trovato una chiave free kimi-k3 online» | Quasi sempre rubata, fake o esca. Crea la tua chiave. |
| «1M di contesto significa che devo sempre incollare tutto il monorepo» | Puoi; paghi anche per ciò che incolli (salvo cache). |
| «K3 è sempre più economico di Claude/OpenAI» | Confronta il tuo workload. Gli agent pesanti in output possono cancellare il risparmio da headline. |
| «Uso K3 per ogni autocomplete» | È così che scopri i $15/M a tue spese. Instrada il bulk altrove. |
Self-host dopo che arrivano i pesi è una bolletta di hardware + ops, non un coupon API free—vedi realtà VRAM / Ollama.
Cosa fare questa settimana
Se vuoi solo provare il modello: resta sul path prodotto—opzioni free e come usare K3 questa settimana. Non forzare una chiave API per curiosità.
Se shippi software:
- Crea una chiave su platform.kimi.ai (o OpenRouter se ci vivi già).
- Collega
kimi-k3solo sul path dei «job difficili». - Accendi la caching dove le doc lo permettono; misura l’hit rate dopo un giorno.
- Metti un cap di spend giornaliero prima di lasciare un agent in corsa.
- Tieni aperti i prezzi ufficiali in una tab—i post da blog invecchiano; il listino è il contratto.
Dove andare dopo
- Hub con specs + regole di switch → /kimi-k3
- Status / timeline → /kimi-k3-status
- Onestà sul prodotto free → /blog/33-kimi-k3-free-how-to
- Porte app vs API → /blog/36-how-to-use-kimi-k3
- Calendario open weights → /blog/31-kimi-k3-open-weights-july-27
- Hub SKU coding → /kimi-code · /kimi-k27
In sintesi: l’API di Kimi K3 è uno strumento a prezzo frontier, con un grosso sconto cache e un output costoso. Usalo dove guadagna la bolletta—e smetti di trattare i risultati di ricerca «free api» come una pagina prezzi.