Guides
12 dk dakika okuma
AI Observer

Kimi K3'ü Day 0'da self-host: vLLM yolu vs Ollama laptop efsanesi

Kimi K3 hub: Spec, fiyat, API id → /kimi-k3. Zaman çizelgesi → /kimi-k3-status. Ollama/VRAM gerçeği → /blog/34-kimi-k3-vram-ollama-local-requirements. Open-weights takvimi → /blog/31-kimi-k3-open-weights-july-27.

Akışın diyor ki Kimi K3 open weight'leri 27 Temmuz'da düşüyor. Biri Mac Mini ekran görüntüsü atıyor. Başkası esrarengiz bir GGUF «tek tık Ollama» yapıştırıyor. Sen ise daha sade bir işi cevaplamaya çalışıyorsun: ekibim bunu self-host edebilir mi, yoksa bu sadece hype mı?

Kısa hali: self-host'u cluster / vLLM problemi olarak ele al; laptop sohbet uygulaması gibi değil. Ürün ve API zaten canlı. Tam kamuya açık weight'ler hâlâ Hugging Face üzerinde yeniden doğrulayacağın bir takvim olayı—bu gece ollama pull çalışır garantisi değil.

Bu site Moonshot'tan bağımsız. Aşağıdaki spec ve tarihler 27 Temmuz 2026 itibarıyla kamuya açık dokümanlar ve partner blog'larını takip eder; demir almadan veya rastgele bir repoya güvenmeden önce Kimi K3 blog, platform docs ve vLLM'in K3 preview yazısını yeniden kontrol et.

Kısa cevap (önce bunu oku)

  1. İki farklı iş.
    • «Bugün K3 kalitesi istiyorum»kimi.com, Kimi Code veya platform.kimi.ai üzerinde API id kimi-k3.
    • «Weight'ler benim VPC'imde olsun» → gerçek dosyalı Moonshot'a ait bir HF repo + day-0 serving stack bekle (vLLM, Moonshot ve partner'ların hazırladığı kamuya açık yol).
  2. Bu yazı itibarıyla HF moonshotai/Kimi-K3 hâlâ bir Upcoming release sayfası (geri sayım / bildir)—safetensors'lı bitmiş bir indirme değil. «Zaten açık» diyen sosyal medya postları genelde vaadi okuyor, Files sekmesini değil.
  3. Tek oyun GPU'sunda Ollama, tam 2.8T sınıfı K3 için yanlış zihinsel model. Resmi serving dili supernode / multi-accelerator dağıtıma işaret ediyor; 24GB oyuncağa değil.
  4. vLLM'in 22 Temmuz preview'ı, endüstrinin bunu nasıl serve edeceğine dair en net kamuya açık not: day-0 model path, KDA-aware prefix caching, Docker tarifleri, NVIDIA + ilk AMD çalışması—tüketici tek satırı değil.
  5. Zaten indirilebilir açık Kimi hatları (ör. Hugging Face'teki K2.6 / K2.7 Code) K3 dosyaları hâlâ beklerken bugün offline weight self-host etmek istiyorsan gidebileceğin yer.

Tek cümle: bu hafta zekâ için API veya ürünü kullan; self-host için Files sekmesi gerçek olunca vLLM + gerçek weight'lere geç—iki kapıyı karıştırma.

Kimi K3 launch card: 2.8T parameters, 1M context, open weights planned around July 27

Kaynak: Resmi K3 lansman mesajı / Kimi K3 tech blog, Moonshot AI, 16 Temmuz 2026.

Bu rehber kime (ve kime değil)

Sen…Bunu şöyle oku…Şu fanteziyi bırak…
Infra / platform mühendisi, GPU filosu hazırlıyorsunDay-0 checklist + stack işaretleriLaptop'ta anında Ollama
Kurucu, «open = Mac'imde sonsuza bedava» duydunMaliyet + ops gerçeklik kontrolüTek tüketici kartta full K3 offline
Geliştirici, sadece kod yardım istiyorsunÜrün / API önceMükemmel local stack için günlerce beklemek
Araştırma lab'ı, audit / fine-tune için weight lazımHF + LICENSE + model card doğrulamaYeniden adlandırılmış community mirror'lara güvenmek

Yalnızca «kimi k3 ollama» aradıysan, VRAM & Ollama yazımızı da oku—o sayfa local donanım dürüstlük kontrolü. Bu sayfa self-host / serving yolu.

«Open weights day 0» aslında ne demek

Moonshot'un kamuya açık hikâyesi (bkz. K3 duyurusu):

  • Önce ürün + API (~16 Temmuz 2026'dan beri canlı): chat, Work, Code, kimi-k3 API.
  • 27 Temmuz 2026'ya kadar tam model weight'leri—bu bir dosya gönderme taahhüdü, «her mirror'da zaten var» sihri değil.
  • Serving'i değiştiren mimari: Kimi Delta Attention (KDA), Attention Residuals, seyrek MoE (resmi çerçeve: token başına 896 uzmandan 16'sı aktif), toplam ~2.8T param, 1M context, native vision.
  • Açık not: KDA ile ilgili prefix-cache çalışmasını vLLM community'sine katkı olarak model yanında bırakacaklar—çünkü KDA, klasik full-attention KV cache gibi davranmıyor.

Yani self-host'çular için «day 0» aslında iki drop:

  1. Weight'ler + LICENSE + model card (genelde Hugging Face'te moonshotai/… altında).
  2. K3'ü anlayan serving kodu (vLLM preview model path, parser'lar, kernel'ler, Docker, tariflere işaret ediyor).

Birinin diğeri olmadan yarım açık kapı.

Yol A — Ürün & API (çoğu kişinin bugün açması gereken)

Frontier K3 kalitesini denemek için self-host gerekmez:

KapıNe için iyiDikkat
kimi.com / appModeli hissetmek, bilgi işiKota, üyelik kapasitesi (bkz. abonelik duraklatma notu)
Kimi CodeIDE / terminal coding agent'larıİşe uygun modeli seç (hangi model)
API kimi-k3Otomasyon, tool'lar, OpenAI-uyumlu client'larPay-as-you-go: cache-hit $0.30 / miss $3 / output $15 per 1M token kamu kartlarında—bkz. API fiyat rehberi

Hedefin «bu sprint'te özellik ship etmek»se API + ürün kazanır. Self-host veri ikameti, air-gap, özel fine-tune veya dev hacimde birim ekonomi içindir—FOMO için değil.

Kimi K3 coding benchmark chart (max effort)—why teams care about serving quality, not only download size

Kaynak: Resmi K3 lansman medyası / Kimi K3 blog, 16 Temmuz 2026.

Yol B — vLLM ile self-host (ciddi day-0 yolu)

vLLM kamuya ne vaat etti (22 Temmuz 2026)

vLLM ekibinin preview'ı, tam open-source gününden önce elimizdeki en net «ekosistem hazırlığı» yazısı. Sade dille, şunları hazırladıklarını söylüyorlar:

  • Weight release için day-0 open-source serving: model implementasyonu, Docker image'ları, deployment tarifleri, production doğrulama
  • KDA-aware prefix caching (klasik paged KV hileleri, recurrent KDA state için yetmez)
  • KDA prefill & decode, Attention Residuals, MoE (MXFP4 yolu release çerçevelerinde), multimodal parçalar üzerinde kernel / performans işi
  • Son ayarda NVIDIA tarifleri + ilk AMD yolu

Bu infra dili. «Windows'ta Ollama'ya yapıştır ve sohbet et» değil.

Day-0 serving nasıl düşünülür (checklist, donmuş CLI değil)

Weight'ler göründüğünde sağlıklı bir self-host runbook şöyle görünür—her zaman resmi model card ve vLLM docs'u bu blog dahil her blog'a tercih et:

  1. Repo'yu doğrula
    • Org moonshotai olmalı (veya resmi blog'dan Moonshot'un bağladığı başka kaynak).
    • Gerçek Files (shard'lar), yalnızca «Upcoming release» pazarlaması değil.
    • LICENSE'ı baştan sona oku (önceki açık Kimi hatları sıkça Modified MIT tarzı kullandı; dosya gelene kadar K3 için varsayma).
  2. K3 / KDA desteği iddia eden bir serving build'e pin at
    • vLLM'in yazısını ve day-0 için etiketledikleri sürümü takip et—nightly/main branch'ler hareket eder.
    • Daha önceki K2 ailesi tariflerine benzer şekilde Kimi'ye özgü tool-call / reasoning parser'lar ve multimodal bayraklar bekle.
  3. Paralelliği bir MoE devi gibi planla
    • 2.8T sınıfı seyrek MoE, tek tensor-parallel-size 1 deneyi değil; expert parallelism + bant genişliği meselesi.
    • Resmi ürün dokümanları rekabetçi throughput için supernode tarzı multi-accelerator serving'e işaret etti—bunu veri merkezi şekli diye oku.
  4. 1M context konusunda alçakgönüllü ol
    • Cloud API'deki «1M düz» ile «day one'da --max-model-len 1048576 koydum, uçuyor» aynı şey değil.
    • Daha kısa max length ile başla, prefill/decode ölç, sonra uzat.
  5. «Diskteki weight'ler» ile «production SLO»yu ayır
    • Day-0 çoğu zaman boot oluyor demektir. Production demek monitoring, PD disaggregation, cache hit oranları, failure domain'ler—vLLM yazısı bu zor parçalardan açıkça bahsediyor.

Kutsanmış gibi sahte bayraklı kopyala-yapıştır bir vllm serve … satırı yapıştırmayacağız. Yanlış bayraklar saatler içinde bayatlar; dosyalar indiği gün model card + vLLM release notes tek doğru kaynaktır.

Donanım gerçeği (sahte GB tablosu uydurmadan)

İnsanlar şunu ister: «K3 Q4 = 4090'da XX GB.»

O tabloyu uydurmayacağız.

Tutunabileceğin şeyler:

  • Toplam ölçek (~2.8T) ve seyrek aktivasyon (16/896 çerçevesi) «laptop toplam param'a sığar» demek değildir. Hâlâ dev bir weight ayak izi saklarsın; token başına yalnızca bir alt küme aktive edersin.
  • Weight indirme boyutu için community tahminleri quant hikâyesine (MXFP4 vs daha yüksek precision) göre genelde yüzlerce GB ile ~1+ TB bandına düşer—herhangi bir sayıyı model card dosya boyutlarını listeleyene kadar resmi olmayan say.
  • Moonshot'un kendi 64+ accelerator / supernode tarzı dili bir serving şekli, hobi dipnotu değil.
  • Zaten multi-node GPU cluster çalıştırmıyorsan (veya managed inference almıyorsan), çoğu ekip için API veya managed host, kahramanca bir hafta sonu kurulumunu yener.

Ollama/GGUF zaman çizelgesi ve «henüz yerelde çalışır mı» için VRAM rehberinde kal.

Kimi K3 agent / capability charts—long-horizon work is why serving architecture (KDA cache, MoE routing) matters

Kaynak: Resmi K3 lansman medyası / Kimi K3 blog, 16 Temmuz 2026.

Yol C — Ollama / «Mac Mini» efsanesi (nazikçe öldür)

ollama, gguf, local, self host arama talebi gerçek. Hata, bunları tek bir fanteziye yığmak:

EfsaneGerçek
«Open weight = PC'mde bedava sınırsız»Open weight lisans altında indirip çalıştırabileceğin demektir—bedava elektrik, bedava ops veya bedava VRAM değil
«HF'deyse bu gece Ollama'da vardır»Ollama/llama.cpp portları genelde resmi dump'ların gerisinde kalır; kaliteli quant'lar daha da geride
«2.8T MoE, 30B Q4 gibi sığmalı»Seyrek compute ≠ minik disk / RAM
«K3 adlı her GGUF tamam»Resmi org + hash tercih et; sahte veya abliterated paketler weight-drop günlerinde gerçek gürültü kaynağı
«Self-host her zaman API'den ucuz»Ancak GPU, elektrik, idle süre, on-call ve başarısız deneyleri $3 / $15 API ile fiyatladıktan sonra

Beklerken sağlıklı local yol: offline coding agent'lar için K2.6 / K2.7 Code self-host et (zaten HF'de); zor işler için K3'ü API ile kullan. Hibrit yığınlar saflık yarışını yener.

Gün-içi checklist (takvim hücresi vurunca)

Bunu bir şey gerçekten göründüğünde kullan—bir repost «düşüyor» dediğinde değil.

Weight'ler

  • Resmi blog/X veya HF sayfası Upcoming'den indirilebilir Files'a geçer
  • Repo moonshotai altında (veya kimi.com/blog/kimi-k3'ten net bağlantılı)
  • LICENSE + model card + listelenmiş shard boyutları
  • Tek kopyan olarak rastgele üçüncü taraf «Kimi-K3-abliterated»'e bağımlılık yok

Serving

  • K3'ü belgeleyen vLLM (veya Moonshot'un adlandırdığı başka engine) sürüm / image
  • Tool-call / reasoning parser'lar card ile eşleşir
  • Paralellik planı büyük MoE çalıştırmış biri tarafından gözden geçirildi
  • Smoke test: health endpoint, kısa prompt, bir tool call, bir uzun-context prefill

İş

  • Karar ağacı: API varsayılan vs self-host pilot vs managed host
  • Güvenlik: weight erişim kontrolü, hallucination / tool güvenliği eval'i—«open = aynı gece prod'a deploy» değil

Bu hafta ne yapmalı (karar ağacı)

Öğle yemeğinden önce K3 kalitesi lazımsa
→ Ürün veya API. Weight'lere bloke olma.

Self-host pilot kuruyorsan
vLLM'in K3 preview'ını oku; cluster kapasitesi ayır; yukarıdaki checklist'i taslakla; K3 dosyaları indiğinde pipeline sıkıcı olsun diye K2.6 / K2.7 Code weight'lerinde pratik yap.

Yalnızca oyun laptopun varsa
→ K3'ün tadını cloud ürün/API'de çıkar. Yerelde daha küçük açık modeller kullan. «24GB'da full K3» thumbnail'lerini yok say.

Compliance ekibin open weight istiyorsa
HF moonshotai/Kimi-K3 ve resmi blog'u yer imine al; LICENSE + dosyalar gerçek olana kadar production tasarımı yok.

Dikkat (gürültü filtresi)

  1. Vaad tarihi ≠ Files sekmesi. 27 Temmuz Moonshot'un kamuya açık hedefi; artifact'leri doğrula.
  2. Sosyal medyadaki hallucination / bağımsız benchmark thread'leri değişken—üçüncü taraf %'leri runbook'una «resmi» diye yapıştırma.
  3. Mimari anahtar kelimeler (KDA, AttnRes, MXFP4) gerçek mühendislik; day one'da tüketici runtime'ların var olduğunun kanıtı değil.
  4. Bu site Moonshot destek değil. Şüphede resmi docs kazanır.

Sıradaki

Alt çizgi: Kimi K3 self-host ciddi bir serving projesidir (vLLM + multi-accelerator gerçeği), Ollama parti numarası değil. Upcoming sayfası hâlâ Upcoming iken cloud kapılarını kullan—Files sekmesi gerçek olunca herhangi bir indirmeye güvenmeden önce org, lisans ve stack'i doğrula.

İlgili Makaleler

K3 ücretsiz sohbet kapısı değil. $0.30 / $3 / $15 kartı sade dille—cache ne zaman kurtarır, max thinking faturayı nasıl şişirir, ucuz Kimi modelleri ne zaman daha mantıklı.
Akışlar Kimi K3 dolu. Bu haftanın pratik haritası—app veya ücretsiz deneme, abonelik duraklatılmışsa ne yapılır, API ne zaman değer, 27 Temmuz weight’lerine kadar neyi yok say.
Kimi K3 için ödeme denedin, kapı kapandı mı? Kim etkileniyor, hâlâ ne çalışıyor (ücretsiz deneme, API, mevcut planlar) ve 27 Temmuz open weights planı ne değiştiriyor.