Kimi K3 Ollama & VRAM: Läuft es lokal schon?
Kimi-K3-Hub: Specs, Preise, API-ID → /de/kimi-k3. Timeline → /de/kimi-k3-status. Open-Weights-Kalender → Realitätscheck 27. Juli.
Du hast kimi k3 ollama, kimi k3 vram oder kimi k3 download getippt, weil irgendwo stand, das Modell sei „open“. Dann hast du Hugging Face oder die Ollama-Library geöffnet und… keinen sauberen Install-Pfad gefunden.
Das ist nicht dein Fehler. Das ist der Abstand zwischen Marketing-„open“ und Dateien, die du wirklich laden kannst.
Dieser Guide beantwortet nur die lokalen Fragen: Kannst du Kimi K3 schon auf deiner Maschine fahren? Wie viel VRAM? Wann kommen Ollama/GGUF? Was machst du diese Woche stattdessen?
Diese Seite ist unabhängig von Moonshot. Die Fakten unten folgen öffentlichen Docs Stand 21. Juli 2026 — prüfe den offiziellen K3-Blog und Moonshot auf Hugging Face, bevor du GPUs kaufst oder einem Random-Repo vertraust.
Kurzantwort (zuerst lesen)
- Noch kein verlässlicher öffentlicher Full-Weight-Dump für K3 (Stand dieses Texts). Produkt + API sind live; das Unternehmen hat volle Weights bis 27. Juli 2026 zugesagt. Solange kein echtes Moonshot-Repo mit Dateien da ist, kannst du ehrlich kein
ollama pullfür volles K3 fahren. - Scale liegt bei ~2.8T Parametern mit MoE-artiger Sparsity (offiziell: aktiv 16 von 896 Experts). Das kann Serving-Effizienz relativ zu einem dichten 2.8T verbessern — es macht K3 nicht zum 24-GB-Laptop-Spielzeug.
- Moonshots eigene Serving-Notiz zielt auf Supernode-Deployment mit 64+ Accelerators. Lies das so: Rechenzentrums-förmig, nicht „eine Gaming-Karte und ein Traum“.
- Was heute läuft: kimi.com, Kimi Work, Kimi Code und die API-Model-ID
kimi-k3auf platform.kimi.ai. Für bereits downloadbare Open Weights bleib bei K2.6 / K2.7 Code — nicht K3.
Ein Satz: diese Woche API oder App nutzen; lokales K3 als Late-July-Event behandeln, das du nochmal verifizierst — nicht als Befehl, der heute Nacht klappt.

Quelle: Community-Share der offiziellen K3-Launch-Messaging; gegenprüfen im Kimi-K3-Tech-Blog, Moonshot AI, 16. Juli 2026.
Was Leute wirklich suchen (vier verschiedene Jobs)
Suchmaschinen knallen das zu einem Brei. Trenne sie:
| Was du tippst | Was du vermutlich willst | Heute verfügbar? |
|---|---|---|
| kimi k3 huggingface / download | Offizielle Weight-Dateien | Noch kein fertiger öffentlicher K3-Checkpoint (nochmal checken um den 27. Juli) |
| kimi k3 ollama / gguf | One-Command lokaler Chat | Noch nicht — braucht Weights + Community-/Runtime-Packaging |
| kimi k3 vram / local requirements | „Passt meine GPU?“ | Noch keine ehrliche feste GB-Tabelle — nur Scale + offizielle Multi-Accelerator-Hinweise |
| kimi k3 self host | In deiner VPC/Cluster fahren | Nach Weights + Stack-Support (vLLM / Partner); plane Cluster-Klasse |
Wenn du dir nur eine Zeile merkst: Download-Intent ≠ Ollama-Intent ≠ „gratis unbegrenzt auf meinem PC“.
Zum breiteren Open-Weights-Kalender (nicht nur lokale Hardware) siehe unseren Open-Weights-Post zum 27. Juli. Diese Seite geht tiefer in die Ollama- / VRAM- / Self-Host-Realität.
Was Moonshot wirklich gesagt hat (lokal relevant)
Aus der offiziellen Kimi-K3-Ankündigung (16. Juli 2026):
| Fakt | Warum Locals das interessiert |
|---|---|
| 2.8T Parameter, erster offener 3T-Klasse-Claim | Dein mentales Modell von „großes Open Model“ springt wieder |
| 1M-Token-Kontext, native Vision | Langer Kontext + Multimodalität treiben Memory und I/O beim Self-Host |
| MoE: effektiv 16 von 896 Experts + Stable-LatentMoE-Framing | Sparse Activation hilft Compute, nicht magisches „Laptop speichert Total-Params“ |
| Quantization-aware Training: MXFP4-Weights / MXFP8-Activations (ihre Formulierung) | Zeigt Fokus auf effizientes Serving — kein fertiges Consumer-Quant-Datenblatt |
| Volle Weights bis 27. Juli 2026 + Tech Report drumherum | Kalender-Event, kein Download-Button heute |
| Abstimmung mit Inference-Partnern und Open-Source-Maintainern | Erwarte Stack-Lag (vLLM usw.) selbst nachdem Dateien da sind |
| Empfehlung: 64+ Accelerator, supernode-artiges Deploy | Nächster offizieller Hardware-Vibe-Check — kein 4090-Install-Guide |
API-Listenpreise (USD / 1M Tokens), während du wartest: Cache-Hit Input $0.30, Cache-Miss Input $3.00, Output $15.00. Launch-Thinking ist max effort by default — kurze Prompts können trotzdem ordentlich Reasoning-Tokens fressen.

Quelle: Offizielle K3-Launch-Medien / Kimi-K3-Blog, 16. Juli 2026.
VRAM-Realität (ohne erfundene GB-Tabelle)
Leute wollen eine saubere Chart: „Q4 = XX GB, Q5 = YY GB, braucht 2×H100.“
Wir erfinden keine.
Warum das gerade unehrlich wäre:
- Volle öffentliche K3-Weights sind in der Community noch nicht bestätigt auf Disk.
- Ein offizielles Quant-Rezept für deine Maschine ist keine fertige Consumer-Produktseite.
- Community-GGUF/AWQ/EXL2-Builds — falls sie kommen — hinken dem Day-0-Dump meist hinterher, und die Qualität schwankt.
- Aktivierte Experts ≠ Total-Parameter auf Disk. MoE-Sparsity kann aktiven Compute senken; sie heißt nicht automatisch „nur 16 Experts speichern“.
Was du als Reality-Check nutzen kannst:
- 2.8T total lebt in einem anderen Universum als „kleiner Open Coder, der auf dem Laptop läuft“.
- Moonshots 64+ Accelerators-Empfehlung ist die firmeneigene Serving-Form für wettbewerbsfähigen Throughput — keine Hobby-Fußnote.
- Betreibst du nicht schon Multi-Node-GPU-Cluster (oder bezahlst jemanden, der es tut), sind deine praktischen Pfade API, Produkt-Apps oder später ein Managed Host — nicht „am Wochenende quantisieren und den Strom vergessen“.
Wenn die Weights landen, zählen die nützlichen Artefakte: Repo-ID, LICENSE, Dateigrößen, offizielle Serving-Notes, Partner-Endpoints und erste vertrauenswürdige Quant-READMEs. Solange die fehlen, ist jeder Post mit „exakte VRAM für K3 auf einer 5090“ Fan-Fiction.
Ollama, GGUF und „lokal laufen lassen“-Timelines
Heute (21. Juli 2026):
- Kein verifizierter One-Shot-Ollama-Library-Eintrag für volles Kimi K3, den wir dir mit gutem Gewissen zeigen können.
- GGUF-Packs brauchen Base Weights + Conversion-Pipeline + jemanden, der sie published. Nichts davon ist „fertig“, bis der offizielle Dump (und Community-Tooling) existieren.
- Ältere offene Kimi-Modelle (z. B. K2.6, K2.7 Code) sind die, die du schon von Hugging Face ziehen und in lokale Stacks hängen kannst — verwechsle ihre Tags nicht mit K3.
Nach dem Weight-Drop (Kalender beobachten, nicht vorfeiern):
- Bestätige ein Moonshot-eigenes (oder klar offizielles) Repo mit echten Dateien — kein Placeholder, kein Mirror mit komischem Namen.
- Lies die LICENSE in dem Repo (frühere offene Kimi-Linien nutzten oft eine Modified-MIT-ähnliche Lizenz; bei K3 gilt das erst, wenn die Datei da ist).
- Checke vLLM- / SGLang- / andere Support-Notes — Moonshot hat gesagt, Ecosystem-Alignment zählt für K3s Architektur (inkl. KDA-bezogener Serving-Arbeit im Blog).
- Erst dann nach Ollama- / GGUF-Community-Ports schauen. Erwarte Tage bis Wochen Lag für „works on my machine“-Blogs, und länger für gute Quants.
- Kosten neu rechnen: Self-Host-Cluster + Strom + Ops vs API $3/$15 (plus Cache-Hits). Viele Teams behalten die API für Peak-Intelligence und hosten kleinere Open Models für Offline-Bulk.

Quelle: Offizielle K3-Launch-Medien / Kimi-K3-Blog, 16. Juli 2026.
Checkliste 27. Juli (für Local- / Self-Host-Leute)
Nutze das nur, wenn wirklich etwas erscheint — nicht als Party-Einladung für leere Kalender.
- Offizielle Bestätigung, dass Weights draußen sind (Blog/X/HF), nicht nur „bald“
- Hugging Face (oder anderes) Repo unter Moonshot mit downloadbaren Shards
- LICENSE end-to-end gelesen
- README: Serving-Pfad (vLLM / anderes), bekannte Limits, Multimodal-Notes
- Dateigrößen / Quant-Optionen von jemandem Glaubwürdigen gelistet (zuerst offiziell oder große Hosts)
- Ob Ollama / llama.cpp / etc. einen echten, versionierten Support-Pfad hat
- Dein Decision Tree: API default vs Managed Host vs Self-Host-Cluster
- Budget für Ops-Zeit — nicht nur GPUs
High-Level-Status tracken wir auf /de/kimi-k3-status. Primärquellen schlagen Screenshots.
Was du diese Woche stattdessen fährst
| Dein Ziel | Mach das |
|---|---|
| K3-Qualität an einer harten Aufgabe spüren | App / kimi-k3-API mit festem Pilot-Budget |
| Täglich Code shippen | Kimi Code + K2.7-Code-Pfad warm halten |
| Jetzt lokal bleiben | Self-Host bereits offener K2.x-Weights (K2.6 / K2.7 Code) — nicht K3 |
| „Gratis“-Produktexperimente | Siehe ehrliche Free-Optionen — Produkt-Quotas ≠ Free-API ≠ Free-Self-Host |
| Welches SKU für welchen Job | K2.6 vs K2.7 vs K3 |
Wenn neue Signups oder Membership-Kapazität eng sind (Moonshot hat Demand-Spikes nach dem Launch öffentlich gesteuert), zählen API und bestehende Access-Pfade immer noch mehr als ein fehlendes Local-Binary.
Noise-Filter (Local-Edition)
„Ist schon auf Ollama.“
Unverifizierte Library-Namen und Mirror-Tags sind verdächtig, bis sie auf einen echten Moonshot- (oder klar abgeleiteten) Checkpoint und ein funktionierendes Runbook zeigen.
„Open Weights = gratis unbegrenztes lokales K3.“
Open Weights entfernen ein Vendor-Gate. Sie entfernen nicht Physik, Strom, Multi-GPU-Ops oder Lizenzlimits.
„MoE heißt, meine 24-GB-Karte reicht.“
Sparsity hilft aktivem Compute. Total-Storage, Expert-Routing, langer Kontext und Vision tun immer noch weh. Offizielle Serving-Guidance ist Multi-Accelerator.
„Irgendeine HF-Card namens kimi-k3 muss offiziell sein.“
Checke Org, Dateien, Lizenz, Announcement-Link. Bevorzuge huggingface.co/moonshotai vor Random-Renames.
„Ich warte einfach und skippe die API für immer.“
Ok für Research-Neugier. Schlecht für Product-Deadlines. Pilote K3 dort, wo Premium-Reasoning sich lohnt; halte günstigere/offene SKUs für Bulk.
FAQ
Kann ich Kimi K3 heute downloaden?
Plane mit nein für einen kompletten offiziellen öffentlichen Dump Stand 21. Juli 2026. Offizielles Versprechen: volle Weights bis 27. Juli 2026. Nochmal Moonshots Org und den K3-Blog checken.
Kann ich Kimi K3 heute auf Ollama fahren?
Nicht in einer vertrauenswürdigen, vollständigen Form, die wir empfehlen können. Keine Weights → kein ehrlicher Ollama-Pfad.
Wie viel VRAM brauche ich?
Unbekannt als präzise Consumer-Zahl. Nutze offizielle Scale + 64+ Accelerator-Serving-Guidance als Bauchcheck: betreibst du nicht schon Cluster-GPUs, budgetiere API oder gehostete Inference.
Ist K3 Open Source oder Open Weight?
Launch-Sprache betont Open Weights für ein 3T-Klasse-Modell. Finaler Lizenztext kommt mit den Dateien — dann lesen. „Open“ in einer Headline ersetzt keine LICENSE.
Was ist mit K2-Modellen lokal?
Frühere offene Kimi-Linien (z. B. K2.6, K2.7 Code) sind die praktischen Self-Host-Optionen heute. Kleb keinen K2-Tag in ein Script und nenn es K3.
Ist diese Seite offizielles Moonshot?
Nein. Gegenprüfe kimi.com/blog/kimi-k3 und platform.kimi.ai, bevor du Geld ausgibst oder Hardware rackst.
Fazit
Local-Searcher sind nicht verrückt — HF / Download / Ollama / VRAM-Demand ist real. Was fehlt, ist das Artefakt: ein öffentlicher K3-Weight-Release, den du verifizieren kannst, plus ein Stack, der ihn wirklich lädt.
Bis das landet, ist der smarte Move langweilig:
- K3 piloten im Produkt oder über die API, wo eine harte Aufgabe die Token-Rechnung wert ist.
- Die offenen K2.x-Modelle self-hosten, die du schon pullen kannst, wenn du Offline-Eisen brauchst.
- Ignorieren von „K3 heute Nacht auf dem Laptop installieren“-Guides, die nie ein echtes Repo zeigen.
- Um den 27. Juli nochmal checken — mit der Checkliste oben, nicht nur mit Hoffnung.
Weiterlesen: Open Weights 27. Juli · K3-Release-Guide · Free-Optionen · Welches Modell · Status-Hub.