Kimi K3 Ollama & VRAM : peut-on le lancer en local ?
Hub Kimi K3 : Specs, prix, id API → /fr/kimi-k3. Timeline → /fr/kimi-k3-status. Calendrier open weights → check de réalité du 27 juillet.
Tu as tapé kimi k3 ollama, kimi k3 vram ou kimi k3 download parce qu’un fil a dit que le modèle est « open ». Puis tu as ouvert Hugging Face ou la librairie Ollama et… aucun chemin d’install propre.
Ce trou n’est pas de ta faute. C’est l’écart entre le « open » marketing et des fichiers que tu peux vraiment charger.
Ce guide ne répond qu’aux questions locales : Peut-on faire tourner Kimi K3 sur sa machine aujourd’hui ? Combien de VRAM ? Quand Ollama/GGUF arriveront-ils ? Que faire cette semaine à la place ?
Ce site est indépendant de Moonshot. Les faits ci-dessous collent à la doc publique au 21 juillet 2026 — revérifie le blog officiel K3 et Moonshot sur Hugging Face avant d’acheter des GPU ou de faire confiance à un repo random.
Réponse courte (lis ça d’abord)
- Pas de dump public fiable des poids complets de K3 pour l’instant (à l’heure où on écrit). Produit + API sont live ; l’entreprise a annoncé les poids complets d’ici le 27 juillet 2026. Tant qu’un vrai repo Moonshot avec des fichiers n’apparaît pas, tu ne peux pas honnêtement faire un
ollama pulldu K3 complet. - L’échelle est ~2,8 billions de paramètres avec une sparsité type MoE (officiel : activer 16 experts sur 896). Ça peut aider l’efficacité de serving par rapport à un dense 2,8T — ça ne fait pas de K3 un jouet pour laptop 24 Go.
- La note de serving de Moonshot pointe vers un déploiement type supernode avec 64+ accélérateurs. À lire comme : forme datacenter, pas « une carte gaming et un rêve ».
- Ce qui marche aujourd’hui : kimi.com, Kimi Work, Kimi Code, et l’id API
kimi-k3sur platform.kimi.ai. Pour des poids open déjà téléchargeables, reste sur la famille K2.6 / K2.7 Code — pas K3.
En une phrase : utilise l’API ou l’app cette semaine ; traite le K3 local comme un événement fin juillet à revérifier, pas comme une commande qui marche ce soir.

Source : partage communautaire des messages de lancement officiels K3 ; croiser avec le blog tech Kimi K3, Moonshot AI, 16 juillet 2026.
Ce que les gens cherchent vraiment (quatre jobs différents)
Les moteurs collent tout ça en une bouillie. Sépare-les :
| Ce que tu as tapé | Ce que tu veux probablement | Dispo aujourd’hui ? |
|---|---|---|
| kimi k3 huggingface / download | Fichiers de poids officiels | Pas comme un checkpoint public K3 fini (revérifie vers le 27 juillet) |
| kimi k3 ollama / gguf | Chat local en une commande | Pas encore — il faut les poids + un packaging communauté/runtime |
| kimi k3 vram / local requirements | « Est-ce que mon GPU passe ? » | Pas de tableau honnête en Go fixe pour l’instant — seulement l’échelle + le guide multi-accélérateurs officiel |
| kimi k3 self host | Tourner dans ton VPC/cluster | Après les poids + le support stack (vLLM / partenaires) ; prévois du fer de type cluster |
Si tu ne retiens qu’une ligne : intention téléchargement ≠ intention Ollama ≠ « illimité gratuit sur mon PC ».
Pour le calendrier open weights plus large (pas seulement le hardware local), voir notre post open weights du 27 juillet. Cette page creuse la réalité Ollama / VRAM / self-host.
Ce que Moonshot a réellement dit (points utiles en local)
D’après l’annonce officielle Kimi K3 (16 juillet 2026) :
| Fait | Pourquoi ça compte en local |
|---|---|
| 2,8T paramètres, première revendication open classe 3T | Ton modèle mental du « gros modèle open » vient encore de monter d’un cran |
| Contexte 1M tokens, vision native | Long contexte + multimodalité augmentent la douleur mémoire et I/O en self-host |
| MoE : effectivement 16 experts sur 896 + framing Stable LatentMoE | L’activation sparse aide le compute, pas la magie « mon laptop stocke tous les params » |
| Entraînement quantization-aware : poids MXFP4 / activations MXFP8 (leur formulation) | Ils pensent serving efficace — pas une fiche quant grand public publiée |
| Poids complets d’ici le 27 juillet 2026 + rapport tech autour de là | Événement calendrier, pas un bouton download aujourd’hui |
| Alignement avec partenaires d’inférence et mainteneurs open source | Attends un lag stack (vLLM, etc.) même après l’apparition des fichiers |
| Recommandation 64+ accélérateurs en déploiement type supernode | Le vibe check hardware le plus proche du officiel — pas un guide install 4090 |
Prix catalogue API (USD / 1M tokens) en attendant : input cache-hit 0,30 $, input cache-miss 3,00 $, output 15,00 $. Au lancement, le thinking est en effort max par défaut — un prompt court peut quand même brûler un volume sérieux de tokens de raisonnement.

Source : médias de lancement officiels K3 / blog Kimi K3, 16 juillet 2026.
Réalité VRAM (sans tableau de Go inventé)
Les gens veulent un joli graphique : « Q4 = XX Go, Q5 = YY Go, il faut 2×H100. »
On n’en inventera pas.
Pourquoi ce serait malhonnête maintenant :
- Les poids publics complets de K3 ne sont pas confirmés sur disque pour la communauté.
- La recette quant officielle pour ta machine n’est pas une page produit grand public terminée.
- Les builds GGUF/AWQ/EXL2 communautaires — s’ils apparaissent — arrivent en général après le dump jour 0, et la qualité varie.
- Experts activés ≠ paramètres totaux sur disque. La sparsité MoE peut réduire le compute actif ; ça ne veut pas dire automatiquement « ne stocker que 16 experts ».
Ce que tu peux utiliser comme check de réalité :
- 2,8T au total, c’est un autre univers que le « petit coder open qui tourne sur un laptop ».
- La recommandation Moonshot 64+ accélérateurs, c’est la forme de serving de l’entreprise pour un débit compétitif — pas une note de bas de page hobbyiste.
- Si tu n’opères pas déjà des clusters GPU multi-nœuds (ou que tu ne paies pas quelqu’un qui le fait), tes chemins pratiques sont API, apps produit, ou un futur host managé — pas « je quantize le week-end et j’oublie l’électricité ».
Quand les poids arrivent, les artefacts utiles seront : id de repo, LICENSE, tailles de fichiers, notes de serving officielles, endpoints partenaires, et premiers README quant dignes de confiance. Tant qu’ils n’existent pas, tout post « VRAM exacte de K3 sur une 5090 » est de la fan fiction.
Ollama, GGUF et le calendrier « comment lancer en local »
Aujourd’hui (21 juillet 2026) :
- Pas d’entrée librairie Ollama vérifiée en one-shot pour le Kimi K3 complet vers laquelle on peut te pointer avec confiance.
- Les packs GGUF demandent des poids de base + un pipeline de conversion + quelqu’un qui les publie. Rien de tout ça n’est « fait » tant que le dump officiel (et les outils communauté) n’existent pas.
- Les modèles open Kimi plus anciens (par ex. K2.6, K2.7 Code) sont ceux que tu peux déjà tirer de Hugging Face et brancher dans des stacks locaux — ne confonds pas leurs tags avec K3.
Après le drop des poids (regarde le calendrier, ne pré-célèbre pas) :
- Confirme un repo appartenant à Moonshot (ou clairement officiel) avec de vrais fichiers — pas un placeholder, pas un miroir au nom bizarre.
- Lis la LICENSE de ce repo (les lignes open Kimi précédentes utilisaient souvent une licence style Modified MIT ; K3 n’est pas tranché tant que le fichier n’est pas sorti).
- Vérifie les notes de support vLLM / SGLang / autres — Moonshot a déjà dit que l’alignement écosystème compte pour l’archi de K3 (y compris le travail de serving lié à KDA mentionné sur leur blog).
- Seulement ensuite cherche les ports communauté Ollama / GGUF. Attends des jours à des semaines de lag pour les blogs « ça marche sur ma machine », et plus long pour des quants de qualité.
- Recalcule le coût : cluster self-host + électricité + ops vs API 3 $/15 $ (plus les cache hits). Beaucoup d’équipes garderont l’API pour le pic d’intelligence et hébergeront des modèles open plus petits pour le volume offline.

Source : médias de lancement officiels K3 / blog Kimi K3, 16 juillet 2026.
Checklist du 27 juillet (pour le local / self-host)
Utilise ça seulement quand quelque chose de réel apparaît — pas comme une invitation de fête pour des calendriers vides.
- Confirmation officielle que les poids sont sortis (blog/X/HF), pas juste « bientôt »
- Repo Hugging Face (ou autre) sous Moonshot avec des shards téléchargeables
- LICENSE lue de bout en bout
- README : chemin de serving (vLLM / autre), limites connues, notes multimodales
- Tailles de fichiers / options quant listées par quelqu’un de crédible (préfère officiel ou gros hosts d’abord)
- Présence d’un vrai chemin de support versionné pour Ollama / llama.cpp / etc.
- Ton arbre de décision : API par défaut vs host managé vs cluster self-host
- Budget pour le temps d’ops — pas seulement les GPU
On suit le statut de haut niveau sur /fr/kimi-k3-status. Fais confiance aux sources primaires plus qu’aux captures d’écran.
Quoi lancer cette semaine à la place
| Ton objectif | Fais ça |
|---|---|
| Sentir la qualité K3 sur une tâche dure | App / API kimi-k3 avec un budget pilote fixe |
| Ship du code tous les jours | Kimi Code + garde le chemin K2.7 Code au chaud |
| Rester local maintenant | Self-host les poids déjà open K2.x (K2.6 / K2.7 Code) — pas K3 |
| Expériences produit « gratuites » | Voir les options gratuites honnêtes — quotas produit ≠ API gratuite ≠ self-host gratuit |
| Quelle SKU pour quel job | K2.6 vs K2.7 vs K3 |
Si les nouvelles inscriptions ou la capacité membership sont tendues (Moonshot a géré publiquement des pics de demande après le lancement), l’API et les chemins d’accès existants comptent encore plus qu’un binaire local manquant.
Filtres anti-bruit (édition locale)
« C’est déjà sur Ollama. »
Traite les noms de librairie non vérifiés et les tags miroir comme suspects tant qu’ils ne pointent pas vers un vrai checkpoint Moonshot (ou clairement dérivé) et un runbook qui marche.
« Open weights = K3 local illimité gratuit. »
Les open weights enlèvent une barrière vendeur. Elles n’enlèvent pas la physique, l’électricité, les ops multi-GPU, ni les limites de licence.
« MoE veut dire que ma carte 24 Go suffit. »
La sparsité aide le compute actif. Le stockage total, le routage d’experts, le long contexte et la vision font encore mal. Le guide de serving officiel est multi-accélérateurs.
« Une carte HF nommée kimi-k3 doit être officielle. »
Vérifie l’org, les fichiers, la licence, le lien d’annonce. Préfère huggingface.co/moonshotai aux renommages random.
« J’attends et je saute l’API pour toujours. »
OK pour la curiosité recherche. Mauvais pour les deadlines produit. Pilote K3 là où le raisonnement premium paie ; garde les SKU moins chères/open pour le volume.
FAQ
Puis-je télécharger Kimi K3 aujourd’hui ?
Compte sur non pour un dump public officiel complet au 21 juillet 2026. Promesse officielle : poids complets d’ici le 27 juillet 2026. Revérifie l’org Moonshot et le blog K3.
Puis-je lancer Kimi K3 sur Ollama aujourd’hui ?
Pas sous une forme fiable et complète qu’on puisse recommander. Pas de poids → pas de chemin Ollama honnête.
Combien de VRAM me faut-il ?
Inconnu en tant que chiffre grand public précis. Utilise l’échelle officielle + le guide de serving 64+ accélérateurs comme sanity check : si tu ne fais pas déjà tourner des GPU en cluster, budgète API ou inférence hébergée.
K3 est-il open source ou open weight ?
Le langage de lancement insiste sur des open weights pour un modèle classe 3T. Le texte de licence final voyage avec les fichiers — lis-le alors. « Open » dans un titre n’est pas un substitut à la LICENSE.
Et les modèles K2 en local ?
Les lignes open Kimi antérieures (ex. K2.6, K2.7 Code) sont les options self-host pratiques aujourd’hui. Ne colle pas un tag K2 dans un script en l’appelant K3.
Ce site est-il officiel Moonshot ?
Non. Croise kimi.com/blog/kimi-k3 et platform.kimi.ai avant de dépenser de l’argent ou de racker du hardware.
En résumé
Les gens qui cherchent en local n’ont pas tort — la demande HF / download / Ollama / VRAM est réelle. Ce qui manque, c’est l’artefact : une release publique de poids K3 que tu peux vérifier, plus un stack qui le charge vraiment.
Jusqu’à ce que ça atterrisse, le coup malin est ennuyeux :
- Pilote K3 sur le produit ou l’API là où une tâche dure vaut la facture tokens.
- Self-host les modèles open K2.x que tu peux déjà tirer si tu as besoin de fer offline.
- Ignore les guides « installe K3 sur un laptop ce soir » qui ne montrent jamais de vrai repo.
- Revérifie autour du 27 juillet — avec la checklist ci-dessus, pas avec l’espoir seul.
À lire ensuite : open weights 27 juillet · guide de sortie K3 · options gratuites · quel modèle · hub statut.