Handleidingen
11 min min lezen
AI Observer

Kimi K3 Ollama & VRAM: kun je het al lokaal draaien?

Kimi K3-hub: Specs, prijs, API-id → /nl/kimi-k3. Tijdlijn → /nl/kimi-k3-status. Open-weights-kalender → realiteitscheck 27 juli.

Je typte kimi k3 ollama, kimi k3 vram of kimi k3 download omdat een feed zei dat het model “open” is. Daarna opende je Hugging Face of de Ollama-library en… geen schoon installatiepad.

Dat gat is niet jouw schuld. Het is het verschil tussen marketing-“open” en bestanden die je écht kunt laden.

Deze gids beantwoordt alleen de lokale vragen: Kun je Kimi K3 al op je machine draaien? Hoeveel VRAM? Wanneer komen Ollama/GGUF? Wat doe je deze week wél?

Deze site is onafhankelijk van Moonshot. Feiten hieronder volgen openbare docs per 21 juli 2026—check de officiële K3-blog en Moonshot op Hugging Face opnieuw voordat je GPU’s koopt of een random repo vertrouwt.

Kort antwoord (lees dit eerst)

  1. Nog geen betrouwbare publieke full-weight dump voor K3 (op moment van schrijven). Product + API zijn live; het bedrijf zei volledige weights uiterlijk 27 juli 2026. Tot er een echte Moonshot-repo met bestanden is, kun je eerlijk gezegd geen full K3 ollama pull-en.
  2. Schaal is ~2.8T parameters met MoE-achtige sparsity (officieel: activeer 16 van 896 experts). Dat helpt serving-efficiency ten opzichte van een dense 2.8T—het maakt van K3 geen 24GB-laptop-speeltje.
  3. Moonshots eigen serving-notitie wijst op supernode-achtige deploy met 64+ accelerators. Lees dat als: datacenter-formaat, niet “één gamingkaart en een droom.”
  4. Wat vandaag wél werkt: kimi.com, Kimi Work, Kimi Code, en API-model-id kimi-k3 op platform.kimi.ai. Voor al downloadbare open weights: blijf bij K2.6 / K2.7 Code-familiekaarten—niet K3.

Eén zin: gebruik deze week de API of de app; behandel lokale K3 als een late-juli-event dat je opnieuw checkt, niet als een commando dat vannacht al werkt.

Kimi K3 open-weights-lanceringskaart: 2.8T parameters, 1M context, weights gepland voor 27 juli

Bron: Community-share van officiële K3-launchmessaging; cross-check Kimi K3 tech blog, Moonshot AI, 16 juli 2026.

Wat mensen écht zoeken (vier verschillende jobs)

Zoekmachines gooien dit op één hoop. Houd ze uit elkaar:

Wat je typtWat je waarschijnlijk wiltVandaag beschikbaar?
kimi k3 huggingface / downloadOfficiële weight-bestandenNog geen afgeronde publieke K3-checkpoint (check opnieuw rond 27 juli)
kimi k3 ollama / ggufLokale chat in één commandoNog niet—heeft weights + community/runtime-packaging nodig
kimi k3 vram / local requirements“Past dit op mijn GPU?”Nog geen eerlijke vaste GB-tabel—alleen schaal + officiële multi-accelerator-richtlijn
kimi k3 self hostDraaien in jouw VPC/clusterNa weights + stack-support (vLLM / partners); plan cluster-klasse ijzer

Onthoud één rij: download-intent ≠ Ollama-intent ≠ “gratis onbeperkt op mijn pc.”

Voor de bredere open-weights-kalender (niet alleen lokaal hardware): zie onze open weights 27 juli-post. Deze pagina gaat dieper in op Ollama / VRAM / self-host-realiteit.

Wat Moonshot écht heeft gezegd (lokaal relevante bits)

Uit de officiële Kimi K3-aankondiging (16 juli 2026):

FeitWaarom locals dit interesseren
2.8T parameters, eerste open 3T-class-claimJe mentale model van “groot open model” is weer een trap omhoog
1M-token context, native visionLange context + multimodaliteit verhogen geheugen- en I/O-pijn bij self-host
MoE: effectief 16 van 896 experts + Stable LatentMoE-framingSparse activatie helpt compute, niet magische “laptop past totale params”
Quantization-aware training: MXFP4-weights / MXFP8-activaties (hun formulering)Ze denken na over efficiënte serving—geen gepubliceerde consumer-quant-kaart
Volledige weights uiterlijk 27 juli 2026 + tech report rond die tijdKalenderevent, geen downloadknop vandaag
Afstemming met inference partners en open-source maintainersVerwacht stack-lag (vLLM e.d.) zelfs nádat bestanden verschijnen
Aanbeveling 64+ accelerator supernode-achtige deployDichtstbijzijnde officiële hardware-vibe-check—geen 4090-installgids

API-lijstprijs (USD / 1M tokens) terwijl je wacht: cache-hit input $0.30, cache-miss input $3.00, output $15.00. Launch-thinking is max effort standaard—korte prompts kunnen nog steeds serieuze reasoning-tokens verbranden.

Officiële Kimi K3 coding-benchmarkgrafiek (max effort)

Bron: Officiële K3-launchmedia / Kimi K3-blog, 16 juli 2026.

VRAM-realiteit (zonder nep-GB-tabel)

Mensen willen een net schema: “Q4 = XX GB, Q5 = YY GB, heeft 2×H100 nodig.”

Die verzinnen we niet.

Waarom dat nu oneerlijk zou zijn:

  • Volledige publieke K3-weights staan nog niet bevestigd op schijf voor de community.
  • Officieel quant-recept voor jouw machine is geen afgeronde consumer-productpagina.
  • Community GGUF/AWQ/EXL2-builds—als ze komen—lopen meestal achter op de day-0 dump, en kwaliteit wisselt.
  • Geactiveerde experts ≠ totale parameters op schijf. MoE-sparsity kan actieve compute snijden; het betekent niet automatisch “sla alleen 16 experts op.”

Wat je wél als reality check kunt gebruiken:

  1. 2.8T totaal leeft in een ander universum dan “kleine open coder die op een laptop draait.”
  2. Moonshots 64+ accelerators-aanbeveling is de eigen serving-vorm van het bedrijf voor concurrerende throughput—geen hobbyvoetnoot.
  3. Als je niet al multi-node GPU-clusters runt (of iemand betaalt die dat doet), zijn je praktische paden API, product-apps, of een toekomstige managed host—niet “ik quantize het in het weekend en vergeet de stroomrekening.”

Wanneer weights landen, zijn de nuttige artefacten: repo-id, LICENSE, bestandsgroottes, officiële serving-notities, partner-endpoints, en eerste betrouwbare quant-README’s. Tot die er zijn, is elke post met “exacte VRAM voor K3 op een 5090” fanfiction.

Ollama, GGUF en “hoe lokaal draaien”-tijdlijnen

Vandaag (21 juli 2026):

  • Geen geverifieerde one-shot Ollama-library entry voor full Kimi K3 die we met vertrouwen kunnen aanwijzen.
  • GGUF-packs hebben base weights + een conversion-pipeline + iemand die ze publiceert nodig. Niets daarvan is “klaar” tot de officiële dump (én community-tooling) bestaat.
  • Oudere open Kimi-modellen (bijv. K2.6, K2.7 Code) kun je al van Hugging Face trekken en in lokale stacks hangen—verwar hun tags niet met K3.

Nadat weights droppen (volg de kalender, vier niet te vroeg):

  1. Bevestig een Moonshot-owned (of duidelijk officiële) repo met echte bestanden—geen placeholder, geen mirror met een grappige naam.
  2. Lees de LICENSE op die repo (eerdere open Kimi-lijnen gebruikten vaak een Modified MIT-achtige licentie; K3 is niet vast tot het bestand meekomt).
  3. Check vLLM / SGLang / andere support-notities—Moonshot zei al dat ecosystem-alignment ertoe doet voor K3’s architectuur (inclusief KDA-gerelateerd serving-werk op hun blog).
  4. Kijk pas daarna naar Ollama / GGUF-communityports. Reken op dagen tot weken lag voor “werkt op mijn machine”-blogs, en langer voor kwaliteitsquants.
  5. Herbekijk de kosten: self-host cluster + stroom + ops vs API $3/$15 (plus cache hits). Veel teams houden API voor piek-intelligentie en hosten kleinere open modellen voor offline bulk.

Officiële Kimi K3 agent-/general-capability-benchmarkgrafiek van de launch

Bron: Officiële K3-launchmedia / Kimi K3-blog, 16 juli 2026.

Checklist 27 juli (voor local / self-host-mensen)

Gebruik dit alleen wanneer er iets echts verschijnt—niet als feestuitnodiging voor lege kalenders.

  • Officiële bevestiging dat weights er zijn (blog/X/HF), niet alleen “binnenkort”
  • Hugging Face (of andere) repo onder Moonshot met downloadbare shards
  • LICENSE van begin tot eind gelezen
  • README: serving-pad (vLLM / ander), bekende limieten, multimodale notities
  • Bestandsgroottes / quant-opties door iemand geloofwaardig (liever officieel of grote hosts eerst)
  • Of Ollama / llama.cpp / etc. een echt supportpad met vaste tags/releases heeft
  • Jouw besluitboom: API standaard vs managed host vs self-host cluster
  • Budget voor ops-tijd—niet alleen GPU’s

We volgen high-level status op /nl/kimi-k3-status. Vertrouw primary sources boven screenshots.

Wat je deze week wél draait

Jouw doelDoe dit
K3-kwaliteit voelen op een zware taakApp / kimi-k3 API met een vast pilotbudget
Elke dag code shippenKimi Code + houd K2.7 Code warm
Nu al lokaal blijvenSelf-host al open K2.x-weights (K2.6 / K2.7 Code)—niet K3
“Gratis” productexperimentenZie eerlijke gratis opties—productquota’s ≠ gratis API ≠ gratis self-host
Welke SKU voor welke jobK2.6 vs K2.7 vs K3

Als nieuwe signups of membership-capaciteit krap zijn (Moonshot heeft publiek demand spikes na launch beheerd), wegen API en bestaande toegangspaden zwaarder dan een ontbrekende lokale binary.

Ruisfilters (local-editie)

“Het staat al op Ollama.”
Behandel ongeverifieerde library-namen en mirror-tags als verdacht tot ze wijzen naar een echte Moonshot- (of duidelijk afgeleide) checkpoint én een werkende runbook.

“Open weights = gratis onbeperkte lokale K3.”
Open weights halen een vendor-gate weg. Ze halen natuurkunde, stroom, multi-GPU-ops of licentielimieten niet weg.

“MoE betekent dat mijn 24GB-kaart prima is.”
Sparsity helpt actieve compute. Totale opslag, expert routing, lange context en vision doen nog steeds pijn. Officiële serving-richtlijn is multi-accelerator.

“Iemands HF-kaart genaamd kimi-k3 moet officieel zijn.”
Check org, files, license, announcement-link. Liever huggingface.co/moonshotai dan random renames.

“Ik wacht gewoon en sla de API voor altijd over.”
Prima voor research-nieuwsgierigheid. Slecht voor productdeadlines. Pilot K3 waar premium reasoning loont; houd goedkopere/open SKU’s voor bulk.

FAQ

Kan ik Kimi K3 vandaag downloaden?
Reken op nee voor een complete officiële publieke dump per 21 juli 2026. Officiële belofte: volledige weights uiterlijk 27 juli 2026. Check Moonshots org en de K3-blog opnieuw.

Kan ik Kimi K3 vandaag op Ollama draaien?
Niet in een betrouwbare, complete vorm die we aanraden. Geen weights → geen eerlijk Ollama-pad.

Hoeveel VRAM heb ik nodig?
Onbekend als precies consumer-getal. Gebruik officiële schaal + 64+ accelerator-serving-richtlijn als realiteitscheck: als je niet al cluster-GPU’s runt, budgetteer voor API of hosted inference.

Is K3 open source of open weight?
Launch-taal benadrukt open weights voor een 3T-class model. Definitieve licentietekst komt mee met de bestanden—lees die dan. “Open” in een headline vervangt geen LICENSE.

En K2-modellen lokaal?
Eerdere open Kimi-lijnen (bijv. K2.6, K2.7 Code) zijn de praktische self-host-opties vandaag. Plak geen K2-tag in een script en noem het K3.

Is deze site officieel Moonshot?
Nee. Cross-check kimi.com/blog/kimi-k3 en platform.kimi.ai voordat je geld uitgeeft of hardware aanschaft.

Onder de streep

Lokale zoekers zijn niet gek—HF / download / Ollama / VRAM-vraag is echt. Wat ontbreekt is het artefact: een publieke K3-weight-release die je kunt verifiëren, plus een stack die ’m écht laadt.

Tot die landt, is de slimme zet saai:

  • Pilot K3 op product of API waar een zware taak de tokenrekening waard is.
  • Self-host de open K2.x-modellen die je al kunt pullen als je offline ijzer nodig hebt.
  • Negeer “installeer K3 vannacht op een laptop”-gidsen die nooit een echte repo tonen.
  • Check opnieuw rond 27 juli—met de checklist hierboven, niet met hoop alleen.

Verder lezen: open weights 27 juli · K3 release-gids · gratis opties · welk model · status-hub.

Gerelateerde artikelen

Kimi K3 zonder dikke rekening? Wat is vandaag gratis—signup-beloningen, free-tier-limieten, wat nog kost, en wat “open weights 27 juli” écht verandert.
Kimi K3 vs Claude en GPT is niet ‘gooi je API-keys weg’. De praktische switchregel—listprijs, coding-signalen, en wanneer Sonnet of Sol blijven.
Feeds schreeuwen om een open 3T-model, maar Hugging Face is nog leeg. Wat Moonshot écht belooft voor 27 juli—en wat je deze week draait in plaats van te wachten op een lokale GPU-fantasie.