Guide
11 min min di lettura
AI Observer

Kimi K3 Ollama e VRAM: si può usare in locale?

Hub Kimi K3: Specs, prezzi, id API → /it/kimi-k3. Timeline → /it/kimi-k3-status. Calendario open-weights → reality check del 27 luglio.

Hai digitato kimi k3 ollama, kimi k3 vram o kimi k3 download perché un feed ha detto che il modello è «open». Poi hai aperto Hugging Face o la libreria Ollama e… nessuna installazione pulita.

Quel buco non è colpa tua. È la differenza tra «open» da marketing e file che puoi caricare davvero.

Questa guida risponde solo alle domande locali: Puoi far girare Kimi K3 sulla tua macchina già oggi? Quanta VRAM serve? Quando arriveranno Ollama/GGUF? Cosa fare questa settimana al posto di sognare il download?

Questo sito è indipendente da Moonshot. I fatti sotto seguono le doc pubbliche al 21 luglio 2026—ricontrolla il blog ufficiale K3 e Moonshot su Hugging Face prima di comprare GPU o fidarti di un repo a caso.

Risposta breve (leggi prima questa)

  1. Ancora nessun dump pubblico affidabile dei pesi completi di K3 (al momento in cui scriviamo). Prodotto + API sono live; l’azienda ha detto pesi completi entro il 27 luglio 2026. Finché non compare un repo Moonshot reale con i file, non puoi onestamente fare ollama pull del K3 pieno.
  2. Scala ~2.8 trilioni di parametri con sparsità stile MoE (ufficiale: attivano 16 su 896 expert). Aiuta l’efficienza di serving rispetto a un dense 2.8T—non fa di K3 un giocattolo da laptop da 24GB.
  3. La nota di serving di Moonshot punta a un deploy stile supernode con 64+ acceleratori. Leggilo così: forma da datacenter, non «una scheda gaming e un sogno».
  4. Cosa funziona oggi: kimi.com, Kimi Work, Kimi Code, e l’id API kimi-k3 su platform.kimi.ai. Per pesi open già scaricabili, resta sulla famiglia K2.6 / K2.7 Code—non K3.

Una frase: questa settimana usa API o app; tratta il K3 locale come un evento di fine luglio da ricontrollare, non come un comando che funziona stasera.

Card di lancio open-weights Kimi K3: 2.8T parametri, contesto 1M, pesi previsti per il 27 luglio

Fonte: Share community del messaging ufficiale di lancio K3; incrocia con tech blog Kimi K3, Moonshot AI, 16 luglio 2026.

Cosa cercano davvero le persone (quattro lavori diversi)

I motori di ricerca schiacciano tutto in un blob. Separali:

Cosa digitiCosa vuoi di solitoDisponibile oggi?
kimi k3 huggingface / downloadFile ufficiali dei pesiNon come checkpoint K3 pubblico finito (ricontrolla vicino al 27 luglio)
kimi k3 ollama / ggufChat locale a un comandoNon ancora—servono pesi + packaging community/runtime
kimi k3 vram / requisiti locali«Ci sta nella mia GPU?»Nessuna tabella GB onesta e fissa ancora—solo scala + guida multi-acceleratore ufficiale
kimi k3 self hostFarlo girare nella tua VPC/clusterDopo pesi + supporto stack (vLLM / partner); pianifica ferro da cluster

Se ti resta una sola riga: intento download ≠ intento Ollama ≠ «gratis illimitato sul mio PC».

Per il calendario open-weights più ampio (non solo hardware locale), vedi il nostro post open weights 27 luglio. Questa pagina scende nel dettaglio su Ollama / VRAM / realtà self-host.

Cosa ha detto davvero Moonshot (i pezzi utili al locale)

Dall’annuncio ufficiale Kimi K3 (16 luglio 2026):

FattoPerché interessa a chi fa locale
2.8T parametri, primo claim open di classe 3TIl tuo modello mentale di «modello open grosso» è appena saltato di un altro gradino
Contesto 1M token, vision nativaLong context + multimodalità alzano memoria e dolore I/O in self-host
MoE: di fatto 16 su 896 expert + framing Stable LatentMoEL’attivazione sparsa aiuta il compute, non magia «il laptop tiene tutti i parametri»
Training quantization-aware: pesi MXFP4 / attivazioni MXFP8 (loro formulazione)Segnala attenzione al serving efficiente—non una scheda quant consumer pubblicata
Pesi completi entro il 27 luglio 2026 + tech report intorno a quella dataEvento da calendario, non un bottone download oggi
Allineamento con partner di inference e maintainer open-sourceAspettati lag dello stack (vLLM, ecc.) anche dopo che i file compaiono
Raccomandano deploy stile supernode con 64+ acceleratoriIl check hardware ufficiale più vicino—non una guida d’installazione per 4090

Listino API (USD / 1M token) mentre aspetti: input cache-hit $0.30, input cache-miss $3.00, output $15.00. Il thinking al lancio è max effort di default—anche prompt corti possono bruciare token di reasoning seri.

Grafico benchmark coding ufficiali Kimi K3 (max effort)

Fonte: Media ufficiali di lancio K3 / blog Kimi K3, 16 luglio 2026.

La realtà sulla VRAM (senza tabelle GB inventate)

La gente vuole un grafico ordinato: «Q4 = XX GB, Q5 = YY GB, servono 2×H100.»

Non ne inventiamo uno.

Perché sarebbe disonesto adesso:

  • I pesi pubblici completi di K3 non sono ancora confermati su disco per la community.
  • La ricetta quant ufficiale per la tua macchina non è una pagina prodotto consumer finita.
  • Build community GGUF/AWQ/EXL2—se spuntano—di solito restano indietro rispetto al dump day-0, e la qualità varia.
  • Expert attivati ≠ parametri totali su disco. La sparsità MoE può tagliare il compute attivo; non significa automaticamente «memorizzi solo 16 expert».

Cosa puoi usare come reality check:

  1. 2.8T totali stanno in un universo diverso da «piccolo coder open che gira sul laptop».
  2. La raccomandazione Moonshot di 64+ acceleratori è la forma di serving dell’azienda per throughput competitivo—non una nota a piè di pagina per hobbisti.
  3. Se non gestisci già cluster GPU multi-nodo (o non paghi chi lo fa), le strade pratiche sono API, app prodotto, o un futuro host gestito—non «lo quantizzo nel weekend e dimentico la bolletta elettrica».

Quando i pesi atterrano, gli artefatti utili saranno: repo id, LICENSE, dimensioni file, note di serving ufficiali, endpoint partner, e primi README quant affidabili. Finché non esistono, ogni post su «VRAM esatta di K3 su una 5090» è fan fiction.

Ollama, GGUF e le timeline del «come girarlo in locale»

Oggi (21 luglio 2026):

  • Nessuna entry Ollama verificata a un colpo per il Kimi K3 pieno a cui possiamo puntarti con fiducia.
  • I pack GGUF richiedono pesi base + pipeline di conversione + qualcuno che li pubblica. Niente di tutto ciò è «fatto» finché non esistono dump ufficiale (e tooling community).
  • I modelli open Kimi più vecchi (per esempio K2.6, K2.7 Code) sono quelli che puoi già tirare da Hugging Face e cablare in stack locali—non confondere i loro tag con K3.

Dopo il drop dei pesi (guarda il calendario, non festeggiare in anticipo):

  1. Conferma un repo di proprietà Moonshot (o chiaramente ufficiale) con file reali—non un placeholder, non un mirror con un nome strano.
  2. Leggi la LICENSE su quel repo (le linee open Kimi precedenti usavano spesso una licenza stile Modified MIT; K3 non è fissata finché il file non esce).
  3. Controlla le note di supporto vLLM / SGLang / altri—Moonshot ha già detto che l’allineamento ecosystem conta per l’architettura di K3 (incluso lavoro di serving legato a KDA menzionato sul loro blog).
  4. Solo allora cerca port community Ollama / GGUF. Aspettati giorni-settimane di lag per i blog «works on my machine», e di più per quant di qualità.
  5. Rivaluta il costo: cluster self-host + corrente + ops vs API $3/$15 (più cache hit). Molti team terranno l’API per il picco di intelligence e hosteranno modelli open più piccoli per bulk offline.

Grafico benchmark agent / capacità generali Kimi K3 dal lancio ufficiale

Fonte: Media ufficiali di lancio K3 / blog Kimi K3, 16 luglio 2026.

Checklist del 27 luglio (per chi fa local / self-host)

Usala solo quando compare qualcosa di reale—non come invito a festa per calendari vuoti.

  • Conferma ufficiale che i pesi sono usciti (blog/X/HF), non solo «presto»
  • Repo Hugging Face (o altro) sotto Moonshot con shard scaricabili
  • LICENSE letta da cima a fondo
  • README: percorso di serving (vLLM / altro), limiti noti, note multimodali
  • Dimensioni file / opzioni quant elencate da qualcuno credibile (preferisci ufficiale o host grandi prima)
  • Se Ollama / llama.cpp / ecc. ha un percorso di supporto reale e versionato
  • Il tuo albero decisionale: API di default vs host gestito vs cluster self-host
  • Budget per tempo ops—non solo GPU

Seguiamo lo stato di alto livello su /it/kimi-k3-status. Fidati delle fonti primarie, non degli screenshot.

Cosa far girare questa settimana al posto di K3

Il tuo obiettivoFai questo
Sentire la qualità K3 su un task duroApp / API kimi-k3 con un budget pilota fisso
Spedire codice ogni giornoKimi Code + tieni calda la strada K2.7 Code
Restare locale adessoSelf-host pesi K2.x già open (K2.6 / K2.7 Code)—non K3
Esperimenti prodotto «gratis»Vedi opzioni free oneste—quote prodotto ≠ API free ≠ self-host free
Quale SKU per quale lavoroK2.6 vs K2.7 vs K3

Se le nuove signup o la capacità membership sono strette (Moonshot ha gestito pubblicamente i picchi di domanda post-lancio), API e percorsi di accesso già esistenti contano ancora più di un binario locale mancante.

Filtri anti-rumore (edizione locale)

«È già su Ollama.»
Tratta nomi di libreria non verificati e tag mirror come sospetti finché non puntano a un checkpoint Moonshot reale (o chiaramente derivato) e a un runbook che funziona.

«Open weights = K3 locale gratis e illimitato.»
Gli open weights tolgono un gate del vendor. Non tolgono fisica, elettricità, ops multi-GPU o limiti di licenza.

«MoE significa che la mia scheda da 24GB va bene.»
La sparsità aiuta il compute attivo. Storage totale, routing degli expert, long context e vision fanno ancora male. La guida di serving ufficiale è multi-acceleratore.

«Una card HF chiamata kimi-k3 dev’essere ufficiale.»
Controlla org, file, licenza, link all’annuncio. Preferisci huggingface.co/moonshotai a rename a caso.

«Aspetto e salto l’API per sempre.»
Ok per curiosità di ricerca. Male per le deadline di prodotto. Pilota K3 dove il reasoning premium paga; tieni SKU più economici/open per il bulk.

FAQ

Posso scaricare Kimi K3 oggi?
Conta su no per un dump pubblico ufficiale completo al 21 luglio 2026. Promessa ufficiale: pesi completi entro il 27 luglio 2026. Ricontrolla l’org Moonshot e il blog K3.

Posso far girare Kimi K3 su Ollama oggi?
Non in nessuna forma completa e affidabile che possiamo consigliare. Niente pesi → niente percorso Ollama onesto.

Quanta VRAM mi serve?
Sconosciuta come numero consumer preciso. Usa scala ufficiale + guida di serving 64+ acceleratori come check di pancia: se non gestisci già GPU da cluster, metti budget su API o inference hosted.

K3 è open source o open weight?
Il linguaggio di lancio insiste su open weights per un modello di classe 3T. Il testo finale della licenza esce con i file—leggilo allora. «Open» in un titolo non sostituisce la LICENSE.

E i modelli K2 in locale?
Le linee open Kimi precedenti (es. K2.6, K2.7 Code) sono le opzioni self-host pratiche oggi. Non incollare un tag K2 in uno script e chiamarlo K3.

Questo sito è ufficiale Moonshot?
No. Incrocia kimi.com/blog/kimi-k3 e platform.kimi.ai prima di spendere soldi o rackare hardware.

In sintesi

Chi cerca in locale non è matto—la domanda su HF / download / Ollama / VRAM è reale. Cosa manca è l’artefatto: un release pubblico dei pesi K3 che puoi verificare, più uno stack che lo carica davvero.

Finché non atterra, la mossa smart è noiosa:

  • Pilota K3 su prodotto o API dove un task duro vale la bolletta token.
  • Self-host i modelli open K2.x che puoi già tirare se ti serve ferro offline.
  • Ignora le guide «installa K3 sul laptop stasera» che non mostrano mai un repo reale.
  • Ricontrolla intorno al 27 luglio—con la checklist sopra, non solo con la speranza.

Prossime letture: open weights 27 luglio · guida al rilascio K3 · opzioni free · quale modello · hub stato.

Articoli correlati

Vuoi Kimi K3 senza bruciare il budget? Cosa è gratis oggi: premi di registrazione, limiti del free tier, cosa costa ancora, e cosa cambia davvero con gli «open weights del 27 luglio».
Kimi K3 vs Claude e GPT non è “cancella le API key”. Ecco la regola pratica—listino, segnali sul coding e quando tenere Sonnet o Sol.
I feed dicono “modello open da 3T”, ma Hugging Face è ancora vuoto. Cosa ha promesso davvero Moonshot per il 27 luglio—e cosa conviene far girare questa settimana invece di sognare la GPU locale.