Guides
11 min min de lecture
AI Observer

Kimi K3 Ollama & VRAM : peut-on le lancer en local ?

Hub Kimi K3 : Specs, prix, id API → /fr/kimi-k3. Timeline → /fr/kimi-k3-status. Calendrier open weights → check de réalité du 27 juillet.

Tu as tapé kimi k3 ollama, kimi k3 vram ou kimi k3 download parce qu’un fil a dit que le modèle est « open ». Puis tu as ouvert Hugging Face ou la librairie Ollama et… aucun chemin d’install propre.

Ce trou n’est pas de ta faute. C’est l’écart entre le « open » marketing et des fichiers que tu peux vraiment charger.

Ce guide ne répond qu’aux questions locales : Peut-on faire tourner Kimi K3 sur sa machine aujourd’hui ? Combien de VRAM ? Quand Ollama/GGUF arriveront-ils ? Que faire cette semaine à la place ?

Ce site est indépendant de Moonshot. Les faits ci-dessous collent à la doc publique au 21 juillet 2026 — revérifie le blog officiel K3 et Moonshot sur Hugging Face avant d’acheter des GPU ou de faire confiance à un repo random.

Réponse courte (lis ça d’abord)

  1. Pas de dump public fiable des poids complets de K3 pour l’instant (à l’heure où on écrit). Produit + API sont live ; l’entreprise a annoncé les poids complets d’ici le 27 juillet 2026. Tant qu’un vrai repo Moonshot avec des fichiers n’apparaît pas, tu ne peux pas honnêtement faire un ollama pull du K3 complet.
  2. L’échelle est ~2,8 billions de paramètres avec une sparsité type MoE (officiel : activer 16 experts sur 896). Ça peut aider l’efficacité de serving par rapport à un dense 2,8T — ça ne fait pas de K3 un jouet pour laptop 24 Go.
  3. La note de serving de Moonshot pointe vers un déploiement type supernode avec 64+ accélérateurs. À lire comme : forme datacenter, pas « une carte gaming et un rêve ».
  4. Ce qui marche aujourd’hui : kimi.com, Kimi Work, Kimi Code, et l’id API kimi-k3 sur platform.kimi.ai. Pour des poids open déjà téléchargeables, reste sur la famille K2.6 / K2.7 Code — pas K3.

En une phrase : utilise l’API ou l’app cette semaine ; traite le K3 local comme un événement fin juillet à revérifier, pas comme une commande qui marche ce soir.

Carte de lancement open weights Kimi K3 : 2,8T paramètres, contexte 1M, poids prévus pour le 27 juillet

Source : partage communautaire des messages de lancement officiels K3 ; croiser avec le blog tech Kimi K3, Moonshot AI, 16 juillet 2026.

Ce que les gens cherchent vraiment (quatre jobs différents)

Les moteurs collent tout ça en une bouillie. Sépare-les :

Ce que tu as tapéCe que tu veux probablementDispo aujourd’hui ?
kimi k3 huggingface / downloadFichiers de poids officielsPas comme un checkpoint public K3 fini (revérifie vers le 27 juillet)
kimi k3 ollama / ggufChat local en une commandePas encore — il faut les poids + un packaging communauté/runtime
kimi k3 vram / local requirements« Est-ce que mon GPU passe ? »Pas de tableau honnête en Go fixe pour l’instant — seulement l’échelle + le guide multi-accélérateurs officiel
kimi k3 self hostTourner dans ton VPC/clusterAprès les poids + le support stack (vLLM / partenaires) ; prévois du fer de type cluster

Si tu ne retiens qu’une ligne : intention téléchargement ≠ intention Ollama ≠ « illimité gratuit sur mon PC ».

Pour le calendrier open weights plus large (pas seulement le hardware local), voir notre post open weights du 27 juillet. Cette page creuse la réalité Ollama / VRAM / self-host.

Ce que Moonshot a réellement dit (points utiles en local)

D’après l’annonce officielle Kimi K3 (16 juillet 2026) :

FaitPourquoi ça compte en local
2,8T paramètres, première revendication open classe 3TTon modèle mental du « gros modèle open » vient encore de monter d’un cran
Contexte 1M tokens, vision nativeLong contexte + multimodalité augmentent la douleur mémoire et I/O en self-host
MoE : effectivement 16 experts sur 896 + framing Stable LatentMoEL’activation sparse aide le compute, pas la magie « mon laptop stocke tous les params »
Entraînement quantization-aware : poids MXFP4 / activations MXFP8 (leur formulation)Ils pensent serving efficace — pas une fiche quant grand public publiée
Poids complets d’ici le 27 juillet 2026 + rapport tech autour de làÉvénement calendrier, pas un bouton download aujourd’hui
Alignement avec partenaires d’inférence et mainteneurs open sourceAttends un lag stack (vLLM, etc.) même après l’apparition des fichiers
Recommandation 64+ accélérateurs en déploiement type supernodeLe vibe check hardware le plus proche du officiel — pas un guide install 4090

Prix catalogue API (USD / 1M tokens) en attendant : input cache-hit 0,30 $, input cache-miss 3,00 $, output 15,00 $. Au lancement, le thinking est en effort max par défaut — un prompt court peut quand même brûler un volume sérieux de tokens de raisonnement.

Graphique officiel de benchmarks coding Kimi K3 (max effort)

Source : médias de lancement officiels K3 / blog Kimi K3, 16 juillet 2026.

Réalité VRAM (sans tableau de Go inventé)

Les gens veulent un joli graphique : « Q4 = XX Go, Q5 = YY Go, il faut 2×H100. »

On n’en inventera pas.

Pourquoi ce serait malhonnête maintenant :

  • Les poids publics complets de K3 ne sont pas confirmés sur disque pour la communauté.
  • La recette quant officielle pour ta machine n’est pas une page produit grand public terminée.
  • Les builds GGUF/AWQ/EXL2 communautaires — s’ils apparaissent — arrivent en général après le dump jour 0, et la qualité varie.
  • Experts activés ≠ paramètres totaux sur disque. La sparsité MoE peut réduire le compute actif ; ça ne veut pas dire automatiquement « ne stocker que 16 experts ».

Ce que tu peux utiliser comme check de réalité :

  1. 2,8T au total, c’est un autre univers que le « petit coder open qui tourne sur un laptop ».
  2. La recommandation Moonshot 64+ accélérateurs, c’est la forme de serving de l’entreprise pour un débit compétitif — pas une note de bas de page hobbyiste.
  3. Si tu n’opères pas déjà des clusters GPU multi-nœuds (ou que tu ne paies pas quelqu’un qui le fait), tes chemins pratiques sont API, apps produit, ou un futur host managé — pas « je quantize le week-end et j’oublie l’électricité ».

Quand les poids arrivent, les artefacts utiles seront : id de repo, LICENSE, tailles de fichiers, notes de serving officielles, endpoints partenaires, et premiers README quant dignes de confiance. Tant qu’ils n’existent pas, tout post « VRAM exacte de K3 sur une 5090 » est de la fan fiction.

Ollama, GGUF et le calendrier « comment lancer en local »

Aujourd’hui (21 juillet 2026) :

  • Pas d’entrée librairie Ollama vérifiée en one-shot pour le Kimi K3 complet vers laquelle on peut te pointer avec confiance.
  • Les packs GGUF demandent des poids de base + un pipeline de conversion + quelqu’un qui les publie. Rien de tout ça n’est « fait » tant que le dump officiel (et les outils communauté) n’existent pas.
  • Les modèles open Kimi plus anciens (par ex. K2.6, K2.7 Code) sont ceux que tu peux déjà tirer de Hugging Face et brancher dans des stacks locaux — ne confonds pas leurs tags avec K3.

Après le drop des poids (regarde le calendrier, ne pré-célèbre pas) :

  1. Confirme un repo appartenant à Moonshot (ou clairement officiel) avec de vrais fichiers — pas un placeholder, pas un miroir au nom bizarre.
  2. Lis la LICENSE de ce repo (les lignes open Kimi précédentes utilisaient souvent une licence style Modified MIT ; K3 n’est pas tranché tant que le fichier n’est pas sorti).
  3. Vérifie les notes de support vLLM / SGLang / autres — Moonshot a déjà dit que l’alignement écosystème compte pour l’archi de K3 (y compris le travail de serving lié à KDA mentionné sur leur blog).
  4. Seulement ensuite cherche les ports communauté Ollama / GGUF. Attends des jours à des semaines de lag pour les blogs « ça marche sur ma machine », et plus long pour des quants de qualité.
  5. Recalcule le coût : cluster self-host + électricité + ops vs API 3 $/15 $ (plus les cache hits). Beaucoup d’équipes garderont l’API pour le pic d’intelligence et hébergeront des modèles open plus petits pour le volume offline.

Graphique officiel des benchmarks agent / capacités générales Kimi K3 au lancement

Source : médias de lancement officiels K3 / blog Kimi K3, 16 juillet 2026.

Checklist du 27 juillet (pour le local / self-host)

Utilise ça seulement quand quelque chose de réel apparaît — pas comme une invitation de fête pour des calendriers vides.

  • Confirmation officielle que les poids sont sortis (blog/X/HF), pas juste « bientôt »
  • Repo Hugging Face (ou autre) sous Moonshot avec des shards téléchargeables
  • LICENSE lue de bout en bout
  • README : chemin de serving (vLLM / autre), limites connues, notes multimodales
  • Tailles de fichiers / options quant listées par quelqu’un de crédible (préfère officiel ou gros hosts d’abord)
  • Présence d’un vrai chemin de support versionné pour Ollama / llama.cpp / etc.
  • Ton arbre de décision : API par défaut vs host managé vs cluster self-host
  • Budget pour le temps d’ops — pas seulement les GPU

On suit le statut de haut niveau sur /fr/kimi-k3-status. Fais confiance aux sources primaires plus qu’aux captures d’écran.

Quoi lancer cette semaine à la place

Ton objectifFais ça
Sentir la qualité K3 sur une tâche dureApp / API kimi-k3 avec un budget pilote fixe
Ship du code tous les joursKimi Code + garde le chemin K2.7 Code au chaud
Rester local maintenantSelf-host les poids déjà open K2.x (K2.6 / K2.7 Code) — pas K3
Expériences produit « gratuites »Voir les options gratuites honnêtes — quotas produit ≠ API gratuite ≠ self-host gratuit
Quelle SKU pour quel jobK2.6 vs K2.7 vs K3

Si les nouvelles inscriptions ou la capacité membership sont tendues (Moonshot a géré publiquement des pics de demande après le lancement), l’API et les chemins d’accès existants comptent encore plus qu’un binaire local manquant.

Filtres anti-bruit (édition locale)

« C’est déjà sur Ollama. »
Traite les noms de librairie non vérifiés et les tags miroir comme suspects tant qu’ils ne pointent pas vers un vrai checkpoint Moonshot (ou clairement dérivé) et un runbook qui marche.

« Open weights = K3 local illimité gratuit. »
Les open weights enlèvent une barrière vendeur. Elles n’enlèvent pas la physique, l’électricité, les ops multi-GPU, ni les limites de licence.

« MoE veut dire que ma carte 24 Go suffit. »
La sparsité aide le compute actif. Le stockage total, le routage d’experts, le long contexte et la vision font encore mal. Le guide de serving officiel est multi-accélérateurs.

« Une carte HF nommée kimi-k3 doit être officielle. »
Vérifie l’org, les fichiers, la licence, le lien d’annonce. Préfère huggingface.co/moonshotai aux renommages random.

« J’attends et je saute l’API pour toujours. »
OK pour la curiosité recherche. Mauvais pour les deadlines produit. Pilote K3 là où le raisonnement premium paie ; garde les SKU moins chères/open pour le volume.

FAQ

Puis-je télécharger Kimi K3 aujourd’hui ?
Compte sur non pour un dump public officiel complet au 21 juillet 2026. Promesse officielle : poids complets d’ici le 27 juillet 2026. Revérifie l’org Moonshot et le blog K3.

Puis-je lancer Kimi K3 sur Ollama aujourd’hui ?
Pas sous une forme fiable et complète qu’on puisse recommander. Pas de poids → pas de chemin Ollama honnête.

Combien de VRAM me faut-il ?
Inconnu en tant que chiffre grand public précis. Utilise l’échelle officielle + le guide de serving 64+ accélérateurs comme sanity check : si tu ne fais pas déjà tourner des GPU en cluster, budgète API ou inférence hébergée.

K3 est-il open source ou open weight ?
Le langage de lancement insiste sur des open weights pour un modèle classe 3T. Le texte de licence final voyage avec les fichiers — lis-le alors. « Open » dans un titre n’est pas un substitut à la LICENSE.

Et les modèles K2 en local ?
Les lignes open Kimi antérieures (ex. K2.6, K2.7 Code) sont les options self-host pratiques aujourd’hui. Ne colle pas un tag K2 dans un script en l’appelant K3.

Ce site est-il officiel Moonshot ?
Non. Croise kimi.com/blog/kimi-k3 et platform.kimi.ai avant de dépenser de l’argent ou de racker du hardware.

En résumé

Les gens qui cherchent en local n’ont pas tort — la demande HF / download / Ollama / VRAM est réelle. Ce qui manque, c’est l’artefact : une release publique de poids K3 que tu peux vérifier, plus un stack qui le charge vraiment.

Jusqu’à ce que ça atterrisse, le coup malin est ennuyeux :

  • Pilote K3 sur le produit ou l’API là où une tâche dure vaut la facture tokens.
  • Self-host les modèles open K2.x que tu peux déjà tirer si tu as besoin de fer offline.
  • Ignore les guides « installe K3 sur un laptop ce soir » qui ne montrent jamais de vrai repo.
  • Revérifie autour du 27 juillet — avec la checklist ci-dessus, pas avec l’espoir seul.

À lire ensuite : open weights 27 juillet · guide de sortie K3 · options gratuites · quel modèle · hub statut.

Articles associés

Envie de Kimi K3 sans grosse facture ? Ce qui est vraiment gratuit aujourd’hui — bonus d’inscription, limites du free tier, ce qui reste payant, et ce que change vraiment le « open weights le 27 juillet ».
Kimi K3 vs Claude et GPT, ce n’est pas « supprime tes clés API ». La règle pratique pour basculer — prix catalogue, signaux coding, et quand garder Sonnet ou Sol.
Les feeds crient « modèle open 3T-class », mais Hugging Face est encore vide. Ce que Moonshot a vraiment promis pour le 27 juillet — et quoi lancer cette semaine au lieu d’attendre un fantasme GPU local.