Guide
11 min min di lettura
AI Observer

Prezzi API Kimi K3: cache hit, OpenRouter e controllo costi

Hub Kimi K3: Specs, model id, quando passare → /kimi-k3. Prova free sul prodotto → come usare K3 gratis. Porte pratiche di questa settimana → come usare Kimi K3.

Hai cercato kimi k3 free api o kimi k3 pricing dopo un post che diceva che il modello è «open». Poi hai aperto la console developer e hai trovato un listino che non ha niente a che fare con «gratis per sempre».

Quel dislivello è normale. Free tier di prodotto e chiavi API a pagamento sono porte diverse. Questa guida parla solo della bolletta che arriva quando chiami kimi-k3.

Risposta breve (leggi prima questa)

  1. Non esiste un’API di produzione free permanente per il kimi-k3 pieno. Chat free / premi vivono sulla superficie prodotto (kimi.com). Le chiavi su platform.kimi.ai sono pay-as-you-go.
  2. Listino (USD / 1M token, doc pubbliche di fine luglio 2026): input cache-hit $0.30 · input cache-miss $3.00 · output $15.00. Flat su tutta la finestra da 1M—niente «sovrapprezzo long context» sul listino pubblico K3.
  3. La leva vera di risparmio è cache + routing dei modelli, non cacciare chiavi free fasulle. Riutilizza system prompt lunghi e contesto di repo; manda il lavoro di routine a modelli più economici; tieni K3 per i job difficili e lunghi.
  4. Il thinking a max effort è attivo di default su K3 (nelle doc pubbliche non c’è ancora uno switch «modalità economica»). Prompt banali possono comunque bruciare token di ragionamento cari—non usare K3 come un tostapane.

In una riga: usa il prodotto free per sentire il modello; usa l’API a pagamento quando ti serve automazione—e tratta $15/M di output + thinking sempre acceso come una feature di budget, non un dettaglio.

Questo sito è indipendente da Moonshot. Prezzi e capacità cambiano—conferma su prezzi K3 e quickstart K3 prima di mettere un team in autopilot.

Benchmark ufficiali di coding di Kimi K3 (max effort) vs modelli leader—perché esiste il tier premium

Fonte: Media ufficiali di lancio K3 di @Kimi_Moonshot, 16 luglio 2026; stessi grafici del blog Kimi K3.

Il listino in chiaro

VoceSignificato grezzoUSD / 1M token
Input cache-hit«Hai già pagato per mandare questo contesto di recente; lo riusiamo.»$0.30
Input cache-missToken freschi che il modello non ha in cache su questo path di request$3.00
OutputToken che il modello scrive indietro—incluse le trace di ragionamento lunghe$15.00
Finestra di contestoQuanto di un progetto puoi tenere in una chiamata1M token (prezzo flat sul listino pubblico)
Model idCosa metti nella request APIkimi-k3

Tre letture del listino che quasi nessuno fa:

  • $3 / $15 è fascia «Sonnet-tier», non «prezzo promo K2». Se il job è un refactor da 20 righe, un modello coding più economico spesso vince sul costo.
  • I cache hit a $0.30 sono l’eroe silenzioso. Gli agent che re-inviano lo stesso system prompt, style guide o snapshot di monorepo prendono uno sconto ~90% sull’input sulla parte ripetuta—quando la cache funziona come documentato.
  • L’output è dove le bollette esplodono. Loop di tool lunghi + chain-of-thought lunga = tanti token a $15/M. Un «test semplice» che ragiona troppo può costare soldi veri.

Deep link ufficiali: platform.kimi.ai · pricing/chat-k3 · guida context caching.

Prodotto free vs API a pagamento (smetti di mescolarli)

PercorsoCosa ottieniCosa paghi
kimi.com / app free + premiChat / UX agent con quote$0 fino ai limiti; la membership può sbloccare di più
Membership / Code membershipDiritti di prodotto (non è la stessa cosa del metering API grezzo)Prezzo del piano (vedi prezzi membership)
API kimi-k3Chiavi, tool, automazione, base URL compatibile OpenAIContatore token — $0.30 / $3 / $15
OpenRouter moonshotai/kimi-k3Stesso modello via un router multi-modelloStessa fascia $3 / $15 sui listing pubblici; la capacità può throttlare

Cercare «kimi k3 free api key» di solito è uno di tre errori:

  1. Volevi la chat free di prodotto (porta giusta: guida free)
  2. Volevi chiavi di produzione a $0 per sempre (non è una promessa pubblica)
  3. Sei finito su dump di chiavi scam (non incollare mai chiavi da gist a caso in produzione)

Se le nuove iscrizioni lato consumer sono in pausa, l’API può restare una porta separata—vedi guida pausa abbonamento.

Benchmark agent e visual-agent di Kimi K3—i loop di tool lunghi sono dove i token di output si accumulano

Fonte: Media ufficiali di lancio K3 di @Kimi_Moonshot, 16 luglio 2026.

Perché la prima fattura fa più male del listino

K3 è costruito per coding a lungo orizzonte, knowledge work e ragionamento profondo. Si vede così:

  • Thinking sempre acceso (max effort al lancio). Le doc pubbliche dicono che non puoi semplicemente «spegnere» la chain-of-thought su K3 come su alcuni modelli con effort low/medium. I prompt «ciao» a basso costo restano una cattiva abitudine.
  • 1M di contesto è un power tool, non uno snack gratis. Infilare mezzo monorepo in ogni call senza caching è come far diventare l’input a $3 il protagonista della bolletta.
  • I loop agent moltiplicano l’output. Piano → tool → patch → rileggi → di nuovo piano. Ogni step scrive token a $15/M.

Matematica grezza da tenere a mente (solo illustrativa—non è un preventivo):

Scenario di esempioInput che contanoA cosa stare attenti
Prompt da 2k token, risposta da 500, niente cachePiccoliPreferisci comunque un modello economico se il task è banale
Contesto repo da 100k token, 80% cache hit al turno dopoCacheL’input collassa verso $0.30 sulla porzione in hit
Agent multi-ora, 200k token di output di ragionamentoOutput$15 × 0.2 = $3 solo per quella fetta—prima dell’input

Per la produzione leggi sempre le dashboard di usage, non l’aritmetica da blog.

OpenRouter vs Moonshot diretto

Moonshot direttoOpenRouter
Model idkimi-k3moonshotai/kimi-k3 (possono esistere alias)
Base URLhttps://api.moonshot.ai/v1Endpoint OpenAI-compatible di OpenRouter
Fascia prezzoUfficiale $0.30 / $3 / $15Listing pubblici di solito $3 / $15 con campi cache
Perché sceglierloOverhead minimo, doc ufficiali, path di prompt cachingUna chiave per tanti modelli; esperimenti rapidi
AttenzioniSetup account + billingCapacità upstream / 429 quando K3 è caldo

Nessuno dei due path è «API free». Entrambi sono router verso un flagship a metering.

Forma minima di una call diretta (chiavi in env, mai in git):

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{
        "role": "user",
        "content": "Propose a migration plan for a 200-file TypeScript monorepo. Keep the plan under 800 words.",
    }],
)
print(resp.choices[0].message.content)

Nota l’ultima frase: metti un tetto alla richiesta. Su un modello che pensa duro di default, i prompt vaghi da «fai tutto» sono il modo più semplice per far crescere le bollette.

Controllo costi che funziona davvero

1. Instrada per job, non per hype

JobPreferisciPerché
Edit di routine, PR piccole, loop stile autocompleteK2.7 Code (e affini)SKU più economico, orientato al coding; vedi /kimi-k27 · /kimi-code
Classificazione bulk, bozze, summary «abbastanza buono»K2.6 o altri modelli low-costRisparmia il budget K3 per il 10% difficile
Architettura multi-file, agent lunghi, screenshot→UI, pack di research profondokimi-k3È per questo che paghi il premium

Selettore di famiglia: K2.6 vs K2.7 vs K3.

2. Fai lavorare la cache per te

  • Tieni system prompt stabili e schema tool stabili
  • Riusa lo stesso bundle grande di documento/repo tra un turno e l’altro quando la piattaforma può cachearlo
  • Non rimescolare rumore random nel prefisso a ogni request (ammazza l’hit rate)
  • Leggi la guida caching di Moonshot—i dettagli di implementazione battono le vibes

3. Stringi l’output di proposito

  • Chiedi piani a bullet, non romanzi
  • Metti un cap agli step: «tre opzioni, una raccomandazione»
  • Ferma i loop agent quando i test passano—non lasciare «un altro miglioramento» girare tutta la notte incustodito
  • Logga i token di output per task riuscito, non solo le «call al giorno»

4. Metti un tetto di spend sulla piattaforma

  • Imposta alert di budget hard su platform.kimi.ai / OpenRouter
  • Usa chiavi separate per prod vs playground
  • Spegni i cron dimenticati che puntano ancora a kimi-k3

Grafica architettura Kimi K3—scala e intento di design, non uno SKU da laptop free

Fonte: Materiali ufficiali di lancio K3 via @Kimi_Moonshot / blog Kimi K3, 16 luglio 2026.

Miti che svuotano il portafoglio

MitoRealtà
«Open weights = API free»I piani di download open-weight ≠ inference hosted illimitata. Timeline pesi: reality check 27 luglio.
«Ho trovato una chiave free kimi-k3 online»Quasi sempre rubata, fake o esca. Crea la tua chiave.
«1M di contesto significa che devo sempre incollare tutto il monorepo»Puoi; paghi anche per ciò che incolli (salvo cache).
«K3 è sempre più economico di Claude/OpenAI»Confronta il tuo workload. Gli agent pesanti in output possono cancellare il risparmio da headline.
«Uso K3 per ogni autocomplete»È così che scopri i $15/M a tue spese. Instrada il bulk altrove.

Self-host dopo che arrivano i pesi è una bolletta di hardware + ops, non un coupon API free—vedi realtà VRAM / Ollama.

Cosa fare questa settimana

Se vuoi solo provare il modello: resta sul path prodotto—opzioni free e come usare K3 questa settimana. Non forzare una chiave API per curiosità.

Se shippi software:

  1. Crea una chiave su platform.kimi.ai (o OpenRouter se ci vivi già).
  2. Collega kimi-k3 solo sul path dei «job difficili».
  3. Accendi la caching dove le doc lo permettono; misura l’hit rate dopo un giorno.
  4. Metti un cap di spend giornaliero prima di lasciare un agent in corsa.
  5. Tieni aperti i prezzi ufficiali in una tab—i post da blog invecchiano; il listino è il contratto.

Dove andare dopo

In sintesi: l’API di Kimi K3 è uno strumento a prezzo frontier, con un grosso sconto cache e un output costoso. Usalo dove guadagna la bolletta—e smetti di trattare i risultati di ricerca «free api» come una pagina prezzi.

Articoli correlati

Il feed è pieno di Kimi K3. Ecco la mappa pratica di questa settimana: app o prova free, cosa fare se l’abbonamento è in pausa, quando l’API ha senso, e cosa ignorare fino ai pesi del 27 luglio.
Hai provato a pagare per Kimi K3 e ti sei scontrato con un muro? Chi è colpito, cosa funziona ancora (prova free, API, piani esistenti) e come cambia il piano con gli open weights del 27 luglio.
Cerchi Ollama, GGUF o VRAM per Kimi K3? Il quadro locale onesto: cosa manca oggi, cosa implica davvero 2.8T, e cosa usare finché non escono i pesi.