Self-host Kimi K3 op day 0: vLLM-pad vs de Ollama-laptopmythe
Kimi K3-hub: Specs, prijs, API-id → /kimi-k3. Tijdlijn → /kimi-k3-status. Ollama/VRAM-realiteit → /blog/34-kimi-k3-vram-ollama-local-requirements. Open-weights-kalender → /blog/31-kimi-k3-open-weights-july-27.
Je feed zegt: Kimi K3 open weights droppen op 27 juli. Iemand reageert met een Mac Mini-screenshot. Iemand anders plakt een mysterie-GGUF met “one-click Ollama.” Jij probeert ondertussen een simpelere vraag te beantwoorden: kan mijn team dit self-hosten, of is dat pure hype?
Kort samengevat: behandel self-hosting als een cluster- / vLLM-probleem, niet als een laptop-chat-app-probleem. Product en API zijn al live. Volledige publieke weights zijn nog een kalenderafspraak die je opnieuw checkt op Hugging Face—geen garantie dat ollama pull vannacht al werkt.
Deze site is onafhankelijk van Moonshot. Specs en data hieronder volgen openbare docs en partnerblogs per 27 juli 2026; check de Kimi K3-blog, platformdocs en vLLM’s K3-preview opnieuw voordat je hardware koopt of een random repo vertrouwt.
Kort antwoord (lees dit eerst)
- Twee verschillende jobs.
- “Ik wil vandaag K3-kwaliteit” → kimi.com, Kimi Code, of API-id
kimi-k3op platform.kimi.ai. - “Ik wil weights in mijn VPC” → wacht op een Moonshot-eigen HF-repo met echte bestanden + een day-0 serving stack (vLLM is het publieke pad waar Moonshot en partners op voorbereiden).
- “Ik wil vandaag K3-kwaliteit” → kimi.com, Kimi Code, of API-id
- Op moment van schrijven is HF
moonshotai/Kimi-K3nog een Upcoming release-pagina (countdown / notify)—geen afgeronde download met safetensors. Social posts die “al open” roepen, lezen meestal de belofte, niet de Files-tab. - Ollama op één gaming-GPU is het verkeerde denkkader voor full 2.8T-klasse K3. Officiële serving-taal wijst op supernode- / multi-accelerator-deploy, niet op een 24GB-speeltje.
- vLLM’s preview van 22 juli is de beste publieke “zo gaat de industrie dit serveren”-notitie: day-0 modelpad, KDA-aware prefix caching, Docker-recepten, NVIDIA + eerste AMD-werk—geen consumer one-liner.
- Al downloadbare open Kimi-lijnen (bijv. K2.6 / K2.7 Code op Hugging Face) zijn wat je vandaag kunt self-hosten als je offline weights nodig hebt terwijl K3-bestanden nog pending zijn.
Eén zin: gebruik API of product voor intelligentie deze week; gebruik vLLM + echte weights voor self-host zodra de Files-tab echt is—haal die twee deuren niet door elkaar.

Bron: Officiële K3-launchmessaging / Kimi K3 tech blog, Moonshot AI, 16 juli 2026.
Voor wie deze gids is (en voor wie niet)
| Jij bent… | Lees dit als… | Laat de fantasie varen van… |
|---|---|---|
| Infra- / platform engineer die een GPU-fleet klaarzet | Day-0-checklist + stack-pointers | Instant Ollama op een laptop |
| Founder die hoorde “open = voor altijd gratis op mijn Mac” | Kosten- + ops-realiteitscheck | Full K3 offline op één consumercard |
| Developer die vooral coding-hulp wil | Product / API eerst | Dagen wachten op een perfecte lokale stack |
| Research lab dat weights nodig heeft voor audit / fine-tune | HF + LICENSE + modelcard-verificatie | Hernoemde community-mirrors vertrouwen |
Heb je alleen gezocht op “kimi k3 ollama”, lees ook onze VRAM- & Ollama-post—die pagina is de lokale-hardware-eerlijkheidscheck. Deze pagina is het self-host- / serving-pad.
Wat “open weights day 0” écht betekent
Moonshots publieke verhaal (zie de K3-aankondiging):
- Product + API eerst (live sinds ~16 juli 2026): chat, Work, Code,
kimi-k3-API. - Volledige modelweights uiterlijk 27 juli 2026—een commitment om bestanden te shippen, geen magische claim “al op elke mirror.”
- Architectuur die serving verandert: Kimi Delta Attention (KDA), Attention Residuals, sparse MoE (officiële framing: 16 van 896 experts actief per token), ~2.8T totaal params, 1M context, native vision.
- Expliciete notitie dat ze KDA-gerelateerd prefix-cache-werk aan de vLLM-community hebben bijgedragen, om samen met het model te releasen—omdat KDA zich niet gedraagt als klassieke full-attention KV-cache.
“Day 0” voor self-hosters is dus echt twee drops:
- Weights + LICENSE + modelcard (meestal Hugging Face onder
moonshotai/…). - Serving-code die K3 snapt (vLLM-preview wijst op modelpad, parsers, kernels, Docker, recepten).
Eén van de twee zonder de ander is een halfopen deur.
Pad A — Product & API (wat de meesten vandaag moeten openen)
Je hebt geen self-host nodig om frontier K3-kwaliteit te proeven:
| Deur | Goed voor | Let op |
|---|---|---|
| kimi.com / app | Het model voelen, kenniswerk | Quota’s, membership-capaciteit (zie subscription pause-notitie) |
| Kimi Code | IDE- / terminal-codingagents | Kies het juiste model voor de job (welk model) |
API kimi-k3 | Automatisering, tools, OpenAI-compatibele clients | Pay-as-you-go: cache-hit $0.30 / miss $3 / output $15 per 1M tokens op publieke kaarten—zie API-prijsgids |
Is je doel “deze sprint een feature shippen,” dan winnen API + product. Self-host is voor data residency, air-gap, custom fine-tune of unit economics bij enorm volume—niet voor FOMO.

Bron: Officiële K3-launchmedia / Kimi K3-blog, 16 juli 2026.
Pad B — Self-host via vLLM (het serieuze day-0-pad)
Wat vLLM publiek beloofde (22 juli 2026)
De vLLM-teampreview is de duidelijkste “ecosystem readiness”-post die we hebben vóór full open-source day. In mensentaal zeggen ze dat ze voorbereiden:
- Day-0 open-source serving bij de weight-release: modelimplementatie, Docker-images, deployment-recipes, productievalidatie
- KDA-aware prefix caching (klassieke paged-KV-trucs volstaan niet voor recurrent KDA-state)
- Kernel- / performance-werk over KDA prefill & decode, Attention Residuals, MoE (MXFP4-pad in hun releaseframing), multimodale stukken
- NVIDIA-recepten in de laatste fine-tuning + een eerste AMD-pad
Dat is infra-taal. Het is niet “plak dit in Ollama op Windows en chat.”
Hoe je over day-0 serving moet denken (checklist, geen bevroren CLI)
Zodra weights verschijnen, ziet een nuchtere self-host-runbook er zo uit—geef altijd de voorkeur aan de officiële modelcard en vLLM-docs boven elke blog, inclusief deze:
- Verifieer de repo
- Org hoort
moonshotaite zijn (of een andere bron die Moonshot vanuit de officiële blog linkt). - Echte Files (shards), niet alleen “Upcoming release”-marketing.
- LICENSE van begin tot eind gelezen (eerdere open Kimi-lijnen gebruikten vaak een Modified MIT-stijl licentie; neem K3 niet aan tot het bestand landt).
- Org hoort
- Pin een serving-build die K3- / KDA-support claimt
- Volg vLLM’s post en de versie die ze voor day-0 taggen—nightly/main-branches bewegen.
- Reken op tool-call- / reasoning-parsers en multimodale flags specifiek voor Kimi, vergelijkbaar met eerdere K2-family-recepten.
- Plan parallellisme als een MoE-reus
- 2.8T-klasse sparse MoE gaat over expert parallelism + bandwidth, niet over één
tensor-parallel-size 1-experiment. - Officiële productdocs wijzen op supernode-achtige multi-accelerator-serving voor concurrente throughput—lees dat als datacenter-vorm.
- 2.8T-klasse sparse MoE gaat over expert parallelism + bandwidth, niet over één
- Blijf nuchter over 1M context
- Cloud-API “1M flat” is niet hetzelfde als “ik zet
--max-model-len 1048576op dag één en het vliegt.” - Begin met een kortere max length, meet prefill/decode, rek daarna op.
- Cloud-API “1M flat” is niet hetzelfde als “ik zet
- Scheid “weights op disk” van “productie-SLO”
- Day-0 betekent vaak: het start. Productie betekent monitoring, PD-disaggregatie, cache-hit-rates, failure domains—vLLM’s post spreekt expliciet over die harde stukken.
We plakken hier geen copy-paste vllm serve …-regel met nep-flags alsof die gezegend is. Verkeerde flags rotten in uren; de modelcard + vLLM release notes zijn de bron van waarheid op de dag dat bestanden landen.
Hardware-realiteit (zonder een nep-GB-tabel te verzinnen)
Mensen willen: “K3 Q4 = XX GB op een 4090.”
Die tabel verzinnen we niet.
Wat je wél kunt vasthouden:
- Totale schaal (~2.8T) en sparse activatie (16/896-framing) betekenen niet “laptop past alle params.” Je moet nog steeds een enorm weight-footprint opslaan; je activeert alleen een subset per token.
- Community-schattingen voor weight-downloads landen vaak in de band honderden GB tot ~1+ TB, afhankelijk van het quant-verhaal (MXFP4 vs hogere precisie)—behandel elk getal als officieus tot de modelcard file sizes noemt.
- Moonshots eigen 64+ accelerator- / supernode-achtige taal is een serving-vorm, geen hobbyvoetnoot.
- Draai je nog geen multi-node GPU-clusters (of koop je managed inference), dan wint API of een managed host van een heroïsche weekend-build voor de meeste teams.
Voor Ollama/GGUF-tijdlijnen en “kan ik het al lokaal draaien,” blijf bij de VRAM-gids.

Bron: Officiële K3-launchmedia / Kimi K3-blog, 16 juli 2026.
Pad C — De Ollama- / “Mac Mini”-mythe (beleefd om zeep helpen)
Zoekvraag naar ollama, gguf, local, self host is echt. De fout is ze tot één fantasie stapelen:
| Mythe | Realiteit |
|---|---|
| “Open weights = gratis en onbeperkt op mijn pc” | Open weights betekenen: je mag downloaden en draaien onder een licentie—niet gratis stroom, gratis ops, of gratis VRAM |
| “Als het op HF staat, heeft Ollama het vannacht” | Ollama/llama.cpp-ports lopen meestal achter op officiële dumps; quality quants nog meer |
| “2.8T MoE past wel als een 30B Q4” | Sparse compute ≠ kleine disk / RAM |
| “Elke GGUF met K3 in de naam is oké” | Kies officiële org + hashes; nep- of abliterated packs zijn echte ruis op weight-drop-dagen |
| “Self-host is altijd goedkoper dan API” | Alleen nadat je GPU’s, stroom, idle time, on-call en mislukte experimenten afzet tegen $3 / $15 API |
Gezond lokaal pad terwijl je wacht: self-host K2.6 / K2.7 Code (al op HF) voor offline codingagents; gebruik K3 via API voor de zware jobs. Hybride stacks winnen van reinheidswedstrijden.
Day-of-checklist (als de kalendercel écht raakt)
Gebruik dit wanneer er echt iets verschijnt—niet wanneer een repost “dropping” roept.
Weights
- Officiële blog/X of HF-pagina schuift van Upcoming naar downloadbare Files
- Repo onder
moonshotai(of duidelijk gelinkt vanaf kimi.com/blog/kimi-k3) - LICENSE + modelcard + vermelde shard-sizes
- Geen afhankelijkheid van een random third-party “Kimi-K3-abliterated” als enige kopie
Serving
- vLLM (of andere engine die Moonshot noemt) versie / image die K3 documenteert
- Tool-call- / reasoning-parsers matchen de card
- Parallelism-plan gereviewd door iemand die grote MoE heeft gedraaid
- Smoke test: health-endpoint, korte prompt, één tool call, één long-context prefill
Business
- Beslisboom: API default vs self-host pilot vs managed host
- Security: weights access control, eval voor hallucinatie / tool safety—niet “open = dezelfde nacht naar prod”
Wat te doen deze week (beslisboom)
Als je K3-kwaliteit vóór de lunch nodig hebt
→ Product of API. Blokkeer niet op weights.
Als je een self-host-pilot bouwt
→ Lees vLLM’s K3-preview; reserveer clustercapaciteit; draft de checklist hierboven; oefen op K2.6 / K2.7 Code-weights zodat de pipeline saai is zodra K3-bestanden landen.
Als je alleen een gaminglaptop hebt
→ Geniet van K3 in het cloud product/API. Gebruik kleinere open modellen lokaal. Negeer “full K3 op 24GB”-thumbnails.
Als je compliance-team open weights nodig heeft
→ Bookmark HF moonshotai/Kimi-K3 en de officiële blog; geen productiedesign tot LICENSE + bestanden echt zijn.
Valkuilen (ruisfilter)
- Belofte-datum ≠ Files-tab. 27 juli is Moonshots publieke target; verifieer artifacts.
- Hallucinatie- / onafhankelijke benchmark-threads op social media wisselen—plak geen third-party % in je runbook als “officieel.”
- Architectuur-keywords (KDA, AttnRes, MXFP4) zijn echte engineering; ze zijn geen bewijs dat consumer-runtimes op dag één bestaan.
- Deze site is geen Moonshot-support. Bij twijfel winnen officiële docs.
Waarheen verder
- Status-hub: /kimi-k3-status · product-hub: /kimi-k3
- Open-weights-kalender: /blog/31-kimi-k3-open-weights-july-27
- Lokaal / Ollama-eerlijkheid: /blog/34-kimi-k3-vram-ollama-local-requirements
- Gratis proberen: /blog/33-kimi-k3-free-how-to · hoe te gebruiken: /blog/36-how-to-use-kimi-k3
- Rekening in de hand: /blog/37-kimi-k3-api-pricing-cost-control
- Officieel: Kimi K3-blog · vLLM K3-preview · HF moonshotai
Bottom line: self-hosting van Kimi K3 is een serieus serving-project (vLLM + multi-accelerator-realiteit), geen Ollama-parttruc. Gebruik de clouddeuren zolang de Upcoming-pagina nog Upcoming is—en als de Files-tab echt wordt, verifieer org, licentie en stack voordat je een download vertrouwt.