Kimi K3 Ollama & VRAM: kun je het al lokaal draaien?
Kimi K3-hub: Specs, prijs, API-id → /nl/kimi-k3. Tijdlijn → /nl/kimi-k3-status. Open-weights-kalender → realiteitscheck 27 juli.
Je typte kimi k3 ollama, kimi k3 vram of kimi k3 download omdat een feed zei dat het model “open” is. Daarna opende je Hugging Face of de Ollama-library en… geen schoon installatiepad.
Dat gat is niet jouw schuld. Het is het verschil tussen marketing-“open” en bestanden die je écht kunt laden.
Deze gids beantwoordt alleen de lokale vragen: Kun je Kimi K3 al op je machine draaien? Hoeveel VRAM? Wanneer komen Ollama/GGUF? Wat doe je deze week wél?
Deze site is onafhankelijk van Moonshot. Feiten hieronder volgen openbare docs per 21 juli 2026—check de officiële K3-blog en Moonshot op Hugging Face opnieuw voordat je GPU’s koopt of een random repo vertrouwt.
Kort antwoord (lees dit eerst)
- Nog geen betrouwbare publieke full-weight dump voor K3 (op moment van schrijven). Product + API zijn live; het bedrijf zei volledige weights uiterlijk 27 juli 2026. Tot er een echte Moonshot-repo met bestanden is, kun je eerlijk gezegd geen full K3
ollama pull-en. - Schaal is ~2.8T parameters met MoE-achtige sparsity (officieel: activeer 16 van 896 experts). Dat helpt serving-efficiency ten opzichte van een dense 2.8T—het maakt van K3 geen 24GB-laptop-speeltje.
- Moonshots eigen serving-notitie wijst op supernode-achtige deploy met 64+ accelerators. Lees dat als: datacenter-formaat, niet “één gamingkaart en een droom.”
- Wat vandaag wél werkt: kimi.com, Kimi Work, Kimi Code, en API-model-id
kimi-k3op platform.kimi.ai. Voor al downloadbare open weights: blijf bij K2.6 / K2.7 Code-familiekaarten—niet K3.
Eén zin: gebruik deze week de API of de app; behandel lokale K3 als een late-juli-event dat je opnieuw checkt, niet als een commando dat vannacht al werkt.

Bron: Community-share van officiële K3-launchmessaging; cross-check Kimi K3 tech blog, Moonshot AI, 16 juli 2026.
Wat mensen écht zoeken (vier verschillende jobs)
Zoekmachines gooien dit op één hoop. Houd ze uit elkaar:
| Wat je typt | Wat je waarschijnlijk wilt | Vandaag beschikbaar? |
|---|---|---|
| kimi k3 huggingface / download | Officiële weight-bestanden | Nog geen afgeronde publieke K3-checkpoint (check opnieuw rond 27 juli) |
| kimi k3 ollama / gguf | Lokale chat in één commando | Nog niet—heeft weights + community/runtime-packaging nodig |
| kimi k3 vram / local requirements | “Past dit op mijn GPU?” | Nog geen eerlijke vaste GB-tabel—alleen schaal + officiële multi-accelerator-richtlijn |
| kimi k3 self host | Draaien in jouw VPC/cluster | Na weights + stack-support (vLLM / partners); plan cluster-klasse ijzer |
Onthoud één rij: download-intent ≠ Ollama-intent ≠ “gratis onbeperkt op mijn pc.”
Voor de bredere open-weights-kalender (niet alleen lokaal hardware): zie onze open weights 27 juli-post. Deze pagina gaat dieper in op Ollama / VRAM / self-host-realiteit.
Wat Moonshot écht heeft gezegd (lokaal relevante bits)
Uit de officiële Kimi K3-aankondiging (16 juli 2026):
| Feit | Waarom locals dit interesseren |
|---|---|
| 2.8T parameters, eerste open 3T-class-claim | Je mentale model van “groot open model” is weer een trap omhoog |
| 1M-token context, native vision | Lange context + multimodaliteit verhogen geheugen- en I/O-pijn bij self-host |
| MoE: effectief 16 van 896 experts + Stable LatentMoE-framing | Sparse activatie helpt compute, niet magische “laptop past totale params” |
| Quantization-aware training: MXFP4-weights / MXFP8-activaties (hun formulering) | Ze denken na over efficiënte serving—geen gepubliceerde consumer-quant-kaart |
| Volledige weights uiterlijk 27 juli 2026 + tech report rond die tijd | Kalenderevent, geen downloadknop vandaag |
| Afstemming met inference partners en open-source maintainers | Verwacht stack-lag (vLLM e.d.) zelfs nádat bestanden verschijnen |
| Aanbeveling 64+ accelerator supernode-achtige deploy | Dichtstbijzijnde officiële hardware-vibe-check—geen 4090-installgids |
API-lijstprijs (USD / 1M tokens) terwijl je wacht: cache-hit input $0.30, cache-miss input $3.00, output $15.00. Launch-thinking is max effort standaard—korte prompts kunnen nog steeds serieuze reasoning-tokens verbranden.

Bron: Officiële K3-launchmedia / Kimi K3-blog, 16 juli 2026.
VRAM-realiteit (zonder nep-GB-tabel)
Mensen willen een net schema: “Q4 = XX GB, Q5 = YY GB, heeft 2×H100 nodig.”
Die verzinnen we niet.
Waarom dat nu oneerlijk zou zijn:
- Volledige publieke K3-weights staan nog niet bevestigd op schijf voor de community.
- Officieel quant-recept voor jouw machine is geen afgeronde consumer-productpagina.
- Community GGUF/AWQ/EXL2-builds—als ze komen—lopen meestal achter op de day-0 dump, en kwaliteit wisselt.
- Geactiveerde experts ≠ totale parameters op schijf. MoE-sparsity kan actieve compute snijden; het betekent niet automatisch “sla alleen 16 experts op.”
Wat je wél als reality check kunt gebruiken:
- 2.8T totaal leeft in een ander universum dan “kleine open coder die op een laptop draait.”
- Moonshots 64+ accelerators-aanbeveling is de eigen serving-vorm van het bedrijf voor concurrerende throughput—geen hobbyvoetnoot.
- Als je niet al multi-node GPU-clusters runt (of iemand betaalt die dat doet), zijn je praktische paden API, product-apps, of een toekomstige managed host—niet “ik quantize het in het weekend en vergeet de stroomrekening.”
Wanneer weights landen, zijn de nuttige artefacten: repo-id, LICENSE, bestandsgroottes, officiële serving-notities, partner-endpoints, en eerste betrouwbare quant-README’s. Tot die er zijn, is elke post met “exacte VRAM voor K3 op een 5090” fanfiction.
Ollama, GGUF en “hoe lokaal draaien”-tijdlijnen
Vandaag (21 juli 2026):
- Geen geverifieerde one-shot Ollama-library entry voor full Kimi K3 die we met vertrouwen kunnen aanwijzen.
- GGUF-packs hebben base weights + een conversion-pipeline + iemand die ze publiceert nodig. Niets daarvan is “klaar” tot de officiële dump (én community-tooling) bestaat.
- Oudere open Kimi-modellen (bijv. K2.6, K2.7 Code) kun je al van Hugging Face trekken en in lokale stacks hangen—verwar hun tags niet met K3.
Nadat weights droppen (volg de kalender, vier niet te vroeg):
- Bevestig een Moonshot-owned (of duidelijk officiële) repo met echte bestanden—geen placeholder, geen mirror met een grappige naam.
- Lees de LICENSE op die repo (eerdere open Kimi-lijnen gebruikten vaak een Modified MIT-achtige licentie; K3 is niet vast tot het bestand meekomt).
- Check vLLM / SGLang / andere support-notities—Moonshot zei al dat ecosystem-alignment ertoe doet voor K3’s architectuur (inclusief KDA-gerelateerd serving-werk op hun blog).
- Kijk pas daarna naar Ollama / GGUF-communityports. Reken op dagen tot weken lag voor “werkt op mijn machine”-blogs, en langer voor kwaliteitsquants.
- Herbekijk de kosten: self-host cluster + stroom + ops vs API $3/$15 (plus cache hits). Veel teams houden API voor piek-intelligentie en hosten kleinere open modellen voor offline bulk.

Bron: Officiële K3-launchmedia / Kimi K3-blog, 16 juli 2026.
Checklist 27 juli (voor local / self-host-mensen)
Gebruik dit alleen wanneer er iets echts verschijnt—niet als feestuitnodiging voor lege kalenders.
- Officiële bevestiging dat weights er zijn (blog/X/HF), niet alleen “binnenkort”
- Hugging Face (of andere) repo onder Moonshot met downloadbare shards
- LICENSE van begin tot eind gelezen
- README: serving-pad (vLLM / ander), bekende limieten, multimodale notities
- Bestandsgroottes / quant-opties door iemand geloofwaardig (liever officieel of grote hosts eerst)
- Of Ollama / llama.cpp / etc. een echt supportpad met vaste tags/releases heeft
- Jouw besluitboom: API standaard vs managed host vs self-host cluster
- Budget voor ops-tijd—niet alleen GPU’s
We volgen high-level status op /nl/kimi-k3-status. Vertrouw primary sources boven screenshots.
Wat je deze week wél draait
| Jouw doel | Doe dit |
|---|---|
| K3-kwaliteit voelen op een zware taak | App / kimi-k3 API met een vast pilotbudget |
| Elke dag code shippen | Kimi Code + houd K2.7 Code warm |
| Nu al lokaal blijven | Self-host al open K2.x-weights (K2.6 / K2.7 Code)—niet K3 |
| “Gratis” productexperimenten | Zie eerlijke gratis opties—productquota’s ≠ gratis API ≠ gratis self-host |
| Welke SKU voor welke job | K2.6 vs K2.7 vs K3 |
Als nieuwe signups of membership-capaciteit krap zijn (Moonshot heeft publiek demand spikes na launch beheerd), wegen API en bestaande toegangspaden zwaarder dan een ontbrekende lokale binary.
Ruisfilters (local-editie)
“Het staat al op Ollama.”
Behandel ongeverifieerde library-namen en mirror-tags als verdacht tot ze wijzen naar een echte Moonshot- (of duidelijk afgeleide) checkpoint én een werkende runbook.
“Open weights = gratis onbeperkte lokale K3.”
Open weights halen een vendor-gate weg. Ze halen natuurkunde, stroom, multi-GPU-ops of licentielimieten niet weg.
“MoE betekent dat mijn 24GB-kaart prima is.”
Sparsity helpt actieve compute. Totale opslag, expert routing, lange context en vision doen nog steeds pijn. Officiële serving-richtlijn is multi-accelerator.
“Iemands HF-kaart genaamd kimi-k3 moet officieel zijn.”
Check org, files, license, announcement-link. Liever huggingface.co/moonshotai dan random renames.
“Ik wacht gewoon en sla de API voor altijd over.”
Prima voor research-nieuwsgierigheid. Slecht voor productdeadlines. Pilot K3 waar premium reasoning loont; houd goedkopere/open SKU’s voor bulk.
FAQ
Kan ik Kimi K3 vandaag downloaden?
Reken op nee voor een complete officiële publieke dump per 21 juli 2026. Officiële belofte: volledige weights uiterlijk 27 juli 2026. Check Moonshots org en de K3-blog opnieuw.
Kan ik Kimi K3 vandaag op Ollama draaien?
Niet in een betrouwbare, complete vorm die we aanraden. Geen weights → geen eerlijk Ollama-pad.
Hoeveel VRAM heb ik nodig?
Onbekend als precies consumer-getal. Gebruik officiële schaal + 64+ accelerator-serving-richtlijn als realiteitscheck: als je niet al cluster-GPU’s runt, budgetteer voor API of hosted inference.
Is K3 open source of open weight?
Launch-taal benadrukt open weights voor een 3T-class model. Definitieve licentietekst komt mee met de bestanden—lees die dan. “Open” in een headline vervangt geen LICENSE.
En K2-modellen lokaal?
Eerdere open Kimi-lijnen (bijv. K2.6, K2.7 Code) zijn de praktische self-host-opties vandaag. Plak geen K2-tag in een script en noem het K3.
Is deze site officieel Moonshot?
Nee. Cross-check kimi.com/blog/kimi-k3 en platform.kimi.ai voordat je geld uitgeeft of hardware aanschaft.
Onder de streep
Lokale zoekers zijn niet gek—HF / download / Ollama / VRAM-vraag is echt. Wat ontbreekt is het artefact: een publieke K3-weight-release die je kunt verifiëren, plus een stack die ’m écht laadt.
Tot die landt, is de slimme zet saai:
- Pilot K3 op product of API waar een zware taak de tokenrekening waard is.
- Self-host de open K2.x-modellen die je al kunt pullen als je offline ijzer nodig hebt.
- Negeer “installeer K3 vannacht op een laptop”-gidsen die nooit een echte repo tonen.
- Check opnieuw rond 27 juli—met de checklist hierboven, niet met hoop alleen.
Verder lezen: open weights 27 juli · K3 release-gids · gratis opties · welk model · status-hub.