Kimi K3 Ollama e VRAM: si può usare in locale?
Hub Kimi K3: Specs, prezzi, id API → /it/kimi-k3. Timeline → /it/kimi-k3-status. Calendario open-weights → reality check del 27 luglio.
Hai digitato kimi k3 ollama, kimi k3 vram o kimi k3 download perché un feed ha detto che il modello è «open». Poi hai aperto Hugging Face o la libreria Ollama e… nessuna installazione pulita.
Quel buco non è colpa tua. È la differenza tra «open» da marketing e file che puoi caricare davvero.
Questa guida risponde solo alle domande locali: Puoi far girare Kimi K3 sulla tua macchina già oggi? Quanta VRAM serve? Quando arriveranno Ollama/GGUF? Cosa fare questa settimana al posto di sognare il download?
Questo sito è indipendente da Moonshot. I fatti sotto seguono le doc pubbliche al 21 luglio 2026—ricontrolla il blog ufficiale K3 e Moonshot su Hugging Face prima di comprare GPU o fidarti di un repo a caso.
Risposta breve (leggi prima questa)
- Ancora nessun dump pubblico affidabile dei pesi completi di K3 (al momento in cui scriviamo). Prodotto + API sono live; l’azienda ha detto pesi completi entro il 27 luglio 2026. Finché non compare un repo Moonshot reale con i file, non puoi onestamente fare
ollama pulldel K3 pieno. - Scala ~2.8 trilioni di parametri con sparsità stile MoE (ufficiale: attivano 16 su 896 expert). Aiuta l’efficienza di serving rispetto a un dense 2.8T—non fa di K3 un giocattolo da laptop da 24GB.
- La nota di serving di Moonshot punta a un deploy stile supernode con 64+ acceleratori. Leggilo così: forma da datacenter, non «una scheda gaming e un sogno».
- Cosa funziona oggi: kimi.com, Kimi Work, Kimi Code, e l’id API
kimi-k3su platform.kimi.ai. Per pesi open già scaricabili, resta sulla famiglia K2.6 / K2.7 Code—non K3.
Una frase: questa settimana usa API o app; tratta il K3 locale come un evento di fine luglio da ricontrollare, non come un comando che funziona stasera.

Fonte: Share community del messaging ufficiale di lancio K3; incrocia con tech blog Kimi K3, Moonshot AI, 16 luglio 2026.
Cosa cercano davvero le persone (quattro lavori diversi)
I motori di ricerca schiacciano tutto in un blob. Separali:
| Cosa digiti | Cosa vuoi di solito | Disponibile oggi? |
|---|---|---|
| kimi k3 huggingface / download | File ufficiali dei pesi | Non come checkpoint K3 pubblico finito (ricontrolla vicino al 27 luglio) |
| kimi k3 ollama / gguf | Chat locale a un comando | Non ancora—servono pesi + packaging community/runtime |
| kimi k3 vram / requisiti locali | «Ci sta nella mia GPU?» | Nessuna tabella GB onesta e fissa ancora—solo scala + guida multi-acceleratore ufficiale |
| kimi k3 self host | Farlo girare nella tua VPC/cluster | Dopo pesi + supporto stack (vLLM / partner); pianifica ferro da cluster |
Se ti resta una sola riga: intento download ≠ intento Ollama ≠ «gratis illimitato sul mio PC».
Per il calendario open-weights più ampio (non solo hardware locale), vedi il nostro post open weights 27 luglio. Questa pagina scende nel dettaglio su Ollama / VRAM / realtà self-host.
Cosa ha detto davvero Moonshot (i pezzi utili al locale)
Dall’annuncio ufficiale Kimi K3 (16 luglio 2026):
| Fatto | Perché interessa a chi fa locale |
|---|---|
| 2.8T parametri, primo claim open di classe 3T | Il tuo modello mentale di «modello open grosso» è appena saltato di un altro gradino |
| Contesto 1M token, vision nativa | Long context + multimodalità alzano memoria e dolore I/O in self-host |
| MoE: di fatto 16 su 896 expert + framing Stable LatentMoE | L’attivazione sparsa aiuta il compute, non magia «il laptop tiene tutti i parametri» |
| Training quantization-aware: pesi MXFP4 / attivazioni MXFP8 (loro formulazione) | Segnala attenzione al serving efficiente—non una scheda quant consumer pubblicata |
| Pesi completi entro il 27 luglio 2026 + tech report intorno a quella data | Evento da calendario, non un bottone download oggi |
| Allineamento con partner di inference e maintainer open-source | Aspettati lag dello stack (vLLM, ecc.) anche dopo che i file compaiono |
| Raccomandano deploy stile supernode con 64+ acceleratori | Il check hardware ufficiale più vicino—non una guida d’installazione per 4090 |
Listino API (USD / 1M token) mentre aspetti: input cache-hit $0.30, input cache-miss $3.00, output $15.00. Il thinking al lancio è max effort di default—anche prompt corti possono bruciare token di reasoning seri.

Fonte: Media ufficiali di lancio K3 / blog Kimi K3, 16 luglio 2026.
La realtà sulla VRAM (senza tabelle GB inventate)
La gente vuole un grafico ordinato: «Q4 = XX GB, Q5 = YY GB, servono 2×H100.»
Non ne inventiamo uno.
Perché sarebbe disonesto adesso:
- I pesi pubblici completi di K3 non sono ancora confermati su disco per la community.
- La ricetta quant ufficiale per la tua macchina non è una pagina prodotto consumer finita.
- Build community GGUF/AWQ/EXL2—se spuntano—di solito restano indietro rispetto al dump day-0, e la qualità varia.
- Expert attivati ≠ parametri totali su disco. La sparsità MoE può tagliare il compute attivo; non significa automaticamente «memorizzi solo 16 expert».
Cosa puoi usare come reality check:
- 2.8T totali stanno in un universo diverso da «piccolo coder open che gira sul laptop».
- La raccomandazione Moonshot di 64+ acceleratori è la forma di serving dell’azienda per throughput competitivo—non una nota a piè di pagina per hobbisti.
- Se non gestisci già cluster GPU multi-nodo (o non paghi chi lo fa), le strade pratiche sono API, app prodotto, o un futuro host gestito—non «lo quantizzo nel weekend e dimentico la bolletta elettrica».
Quando i pesi atterrano, gli artefatti utili saranno: repo id, LICENSE, dimensioni file, note di serving ufficiali, endpoint partner, e primi README quant affidabili. Finché non esistono, ogni post su «VRAM esatta di K3 su una 5090» è fan fiction.
Ollama, GGUF e le timeline del «come girarlo in locale»
Oggi (21 luglio 2026):
- Nessuna entry Ollama verificata a un colpo per il Kimi K3 pieno a cui possiamo puntarti con fiducia.
- I pack GGUF richiedono pesi base + pipeline di conversione + qualcuno che li pubblica. Niente di tutto ciò è «fatto» finché non esistono dump ufficiale (e tooling community).
- I modelli open Kimi più vecchi (per esempio K2.6, K2.7 Code) sono quelli che puoi già tirare da Hugging Face e cablare in stack locali—non confondere i loro tag con K3.
Dopo il drop dei pesi (guarda il calendario, non festeggiare in anticipo):
- Conferma un repo di proprietà Moonshot (o chiaramente ufficiale) con file reali—non un placeholder, non un mirror con un nome strano.
- Leggi la LICENSE su quel repo (le linee open Kimi precedenti usavano spesso una licenza stile Modified MIT; K3 non è fissata finché il file non esce).
- Controlla le note di supporto vLLM / SGLang / altri—Moonshot ha già detto che l’allineamento ecosystem conta per l’architettura di K3 (incluso lavoro di serving legato a KDA menzionato sul loro blog).
- Solo allora cerca port community Ollama / GGUF. Aspettati giorni-settimane di lag per i blog «works on my machine», e di più per quant di qualità.
- Rivaluta il costo: cluster self-host + corrente + ops vs API $3/$15 (più cache hit). Molti team terranno l’API per il picco di intelligence e hosteranno modelli open più piccoli per bulk offline.

Fonte: Media ufficiali di lancio K3 / blog Kimi K3, 16 luglio 2026.
Checklist del 27 luglio (per chi fa local / self-host)
Usala solo quando compare qualcosa di reale—non come invito a festa per calendari vuoti.
- Conferma ufficiale che i pesi sono usciti (blog/X/HF), non solo «presto»
- Repo Hugging Face (o altro) sotto Moonshot con shard scaricabili
- LICENSE letta da cima a fondo
- README: percorso di serving (vLLM / altro), limiti noti, note multimodali
- Dimensioni file / opzioni quant elencate da qualcuno credibile (preferisci ufficiale o host grandi prima)
- Se Ollama / llama.cpp / ecc. ha un percorso di supporto reale e versionato
- Il tuo albero decisionale: API di default vs host gestito vs cluster self-host
- Budget per tempo ops—non solo GPU
Seguiamo lo stato di alto livello su /it/kimi-k3-status. Fidati delle fonti primarie, non degli screenshot.
Cosa far girare questa settimana al posto di K3
| Il tuo obiettivo | Fai questo |
|---|---|
| Sentire la qualità K3 su un task duro | App / API kimi-k3 con un budget pilota fisso |
| Spedire codice ogni giorno | Kimi Code + tieni calda la strada K2.7 Code |
| Restare locale adesso | Self-host pesi K2.x già open (K2.6 / K2.7 Code)—non K3 |
| Esperimenti prodotto «gratis» | Vedi opzioni free oneste—quote prodotto ≠ API free ≠ self-host free |
| Quale SKU per quale lavoro | K2.6 vs K2.7 vs K3 |
Se le nuove signup o la capacità membership sono strette (Moonshot ha gestito pubblicamente i picchi di domanda post-lancio), API e percorsi di accesso già esistenti contano ancora più di un binario locale mancante.
Filtri anti-rumore (edizione locale)
«È già su Ollama.»
Tratta nomi di libreria non verificati e tag mirror come sospetti finché non puntano a un checkpoint Moonshot reale (o chiaramente derivato) e a un runbook che funziona.
«Open weights = K3 locale gratis e illimitato.»
Gli open weights tolgono un gate del vendor. Non tolgono fisica, elettricità, ops multi-GPU o limiti di licenza.
«MoE significa che la mia scheda da 24GB va bene.»
La sparsità aiuta il compute attivo. Storage totale, routing degli expert, long context e vision fanno ancora male. La guida di serving ufficiale è multi-acceleratore.
«Una card HF chiamata kimi-k3 dev’essere ufficiale.»
Controlla org, file, licenza, link all’annuncio. Preferisci huggingface.co/moonshotai a rename a caso.
«Aspetto e salto l’API per sempre.»
Ok per curiosità di ricerca. Male per le deadline di prodotto. Pilota K3 dove il reasoning premium paga; tieni SKU più economici/open per il bulk.
FAQ
Posso scaricare Kimi K3 oggi?
Conta su no per un dump pubblico ufficiale completo al 21 luglio 2026. Promessa ufficiale: pesi completi entro il 27 luglio 2026. Ricontrolla l’org Moonshot e il blog K3.
Posso far girare Kimi K3 su Ollama oggi?
Non in nessuna forma completa e affidabile che possiamo consigliare. Niente pesi → niente percorso Ollama onesto.
Quanta VRAM mi serve?
Sconosciuta come numero consumer preciso. Usa scala ufficiale + guida di serving 64+ acceleratori come check di pancia: se non gestisci già GPU da cluster, metti budget su API o inference hosted.
K3 è open source o open weight?
Il linguaggio di lancio insiste su open weights per un modello di classe 3T. Il testo finale della licenza esce con i file—leggilo allora. «Open» in un titolo non sostituisce la LICENSE.
E i modelli K2 in locale?
Le linee open Kimi precedenti (es. K2.6, K2.7 Code) sono le opzioni self-host pratiche oggi. Non incollare un tag K2 in uno script e chiamarlo K3.
Questo sito è ufficiale Moonshot?
No. Incrocia kimi.com/blog/kimi-k3 e platform.kimi.ai prima di spendere soldi o rackare hardware.
In sintesi
Chi cerca in locale non è matto—la domanda su HF / download / Ollama / VRAM è reale. Cosa manca è l’artefatto: un release pubblico dei pesi K3 che puoi verificare, più uno stack che lo carica davvero.
Finché non atterra, la mossa smart è noiosa:
- Pilota K3 su prodotto o API dove un task duro vale la bolletta token.
- Self-host i modelli open K2.x che puoi già tirare se ti serve ferro offline.
- Ignora le guide «installa K3 sul laptop stasera» che non mostrano mai un repo reale.
- Ricontrolla intorno al 27 luglio—con la checklist sopra, non solo con la speranza.
Prossime letture: open weights 27 luglio · guida al rilascio K3 · opzioni free · quale modello · hub stato.