Tarifs API Kimi K3 : cache, OpenRouter et maîtrise des coûts
Hub Kimi K3 : Specs, id modèle, quand basculer → /kimi-k3. Essai produit gratuit → utiliser K3 gratuitement. Portes pratiques de la semaine → comment utiliser Kimi K3.
Tu as tapé kimi k3 free api ou kimi k3 pricing après un fil qui annonçait le modèle « open ». Puis tu as ouvert la console dev et découvert une grille tarifaire qui n’a rien à voir avec « gratuit pour toujours ».
Ce décalage est normal. Les paliers gratuits du produit et les clés API payantes, ce n’est pas la même porte. Ce guide ne parle que de la facture quand tu appelles kimi-k3.
Réponse courte (lis ça d’abord)
- Il n’existe pas d’API de production gratuite permanente pour le
kimi-k3complet. Chat gratuit / récompenses : surface produit (kimi.com). Clés sur platform.kimi.ai : pay-as-you-go. - Prix catalogue (USD / 1M tokens, doc publique fin juillet 2026) : input cache-hit 0,30 $ · input cache-miss 3,00 $ · output 15,00 $. Tarif plat sur toute la fenêtre 1M — pas de « surcoût long contexte » sur la fiche K3 publique.
- Le vrai levier d’économie, c’est le cache + le routage de modèles, pas la chasse aux fausses clés gratuites. Réutilise les longs system prompts et le contexte repo ; envoie le travail de routine vers des modèles moins chers ; réserve K3 aux jobs durs et longs.
- Le thinking max-effort est activé par défaut sur K3 (pas encore d’interrupteur « mode cheap » dans la doc publique). Un prompt trivial peut quand même brûler des tokens de raisonnement chers — n’utilise pas K3 comme grille-pain.
En une phrase : le produit gratuit pour sentir le modèle ; l’API payante quand tu as besoin d’automation — et traite les 15 $/M d’output + le thinking toujours on comme une fonctionnalité budgétaire, pas un détail.
Ce site est indépendant de Moonshot. Prix et capacité évoluent — confirme sur tarifs K3 et quickstart K3 avant de mettre une équipe en autopilote.

Source : médias de lancement K3 officiels @Kimi_Moonshot, 16 juillet 2026 ; mêmes graphiques que le blog Kimi K3.
La grille tarifaire en français clair
| Ligne | Sens approximatif | USD / 1M tokens |
|---|---|---|
| Input cache-hit | « Tu as déjà payé pour envoyer ce contexte récemment ; on le réutilise. » | 0,30 $ |
| Input cache-miss | Tokens frais que le modèle n’a pas en cache pour ce chemin de requête | 3,00 $ |
| Output | Tokens que le modèle renvoie — y compris les longs traces de raisonnement | 15,00 $ |
| Fenêtre de contexte | Combien de projet tu peux tenir en un appel | 1M tokens (prix plat sur la fiche publique) |
| Model id | Ce que tu mets dans la requête API | kimi-k3 |
Trois lectures que beaucoup ratent :
- 3 $ / 15 $, c’est du « niveau Sonnet », pas du « promo K2 ». Pour un refactor de 20 lignes, un modèle coding moins cher gagne souvent sur le coût.
- Les cache hits à 0,30 $ sont le héros discret. Les agents qui renvoient le même system prompt, le même style guide ou le même snapshot monorepo obtiennent ~90 % de remise sur l’input de la partie répétée — quand le cache fonctionne comme documenté.
- L’output, c’est là que la facture explose. Longues boucles d’outils + long chain-of-thought = beaucoup de tokens à 15 $/M. Un « simple test » qui overthink peut quand même coûter cher pour de vrai.
Liens officiels : platform.kimi.ai · pricing/chat-k3 · guide context caching.
Produit gratuit vs API payante (arrête de les mélanger)
| Chemin | Ce que tu obtiens | Ce que tu paies |
|---|---|---|
| kimi.com / app gratuit + récompenses | UX chat / agent avec quotas | 0 $ jusqu’aux plafonds ; un membership peut débloquer plus |
| Membership / Code membership | Droits produit (≠ comptage API brut) | Prix du plan (voir tarifs membership) |
API kimi-k3 | Clés, outils, automation, base URL compatible OpenAI | Compteur de tokens — 0,30 $ / 3 $ / 15 $ |
OpenRouter moonshotai/kimi-k3 | Le même modèle via un routeur multi-modèles | Même bande 3 $ / 15 $ sur les listings publics ; la capacité peut throttle |
Chercher « kimi k3 free api key », c’est en général l’une de ces trois erreurs :
- Vouloir le chat produit gratuit (bonne porte : guide gratuit)
- Vouloir des clés de prod à 0 $ pour toujours (pas une promesse publique)
- Atterrir sur des dumps de clés arnaque (ne colle jamais une clé d’un gist random en production)
Si les nouveaux abonnements sont en pause côté consommateur, l’API peut rester une porte à part — voir guide pause d’abonnement.

Source : médias de lancement K3 officiels @Kimi_Moonshot, 16 juillet 2026.
Pourquoi la première facture fait plus mal que la grille
K3 est pensé pour le coding long horizon, le knowledge work et le raisonnement profond. Ça se voit :
- Thinking toujours on (max effort au lancement). La doc publique dit qu’on ne peut pas simplement « couper » le chain-of-thought sur K3 comme certains modèles exposent un low/medium effort. Les « salut » low-cost restent une mauvaise habitude.
- 1M de contexte, c’est un outil de puissance, pas un snack gratuit. Bourrer la moitié d’un monorepo à chaque appel sans cache, c’est comment les 3 $ d’input deviennent le plat principal.
- Les boucles agent multiplient l’output. Plan → outil → patch → relecture → re-plan. Chaque étape écrit des tokens à 15 $/M.
Ordre de grandeur mental (illustratif seulement — pas un devis) :
| Job jouet | Inputs qui comptent | Ce qu’il faut surveiller |
|---|---|---|
| Prompt 2k tokens, réponse 500 tokens, pas de cache | Petit | Préfère quand même un modèle cheap si la tâche est triviale |
| Contexte repo 100k tokens, 80 % de cache hit au tour suivant | Cache | L’input bascule vers 0,30 $ sur la partie hit |
| Agent multi-heures, 200k tokens d’output de raisonnement | Output | 15 $ × 0,2 = 3 $ juste pour cette tranche — avant l’input |
Pour la prod, lis toujours les dashboards d’usage, pas l’arithmétique d’un blog.
OpenRouter vs Moonshot en direct
| Moonshot direct | OpenRouter | |
|---|---|---|
| Model id | kimi-k3 | moonshotai/kimi-k3 (des alias peuvent exister) |
| Base URL | https://api.moonshot.ai/v1 | Endpoint compatible OpenAI d’OpenRouter |
| Bande de prix | Officiel 0,30 $ / 3 $ / 15 $ | Listings publics souvent 3 $ / 15 $ avec champs cache |
| Pourquoi le choisir | Moins d’overhead, doc officielle, chemin de prompt caching | Une clé pour beaucoup de modèles ; essais rapides |
| Points de vigilance | Setup compte + facturation | Capacité / 429 en amont quand K3 est chaud |
Aucun des deux n’est une « free API ». Les deux routent vers un flagship au compteur.
Forme minimale d’appel direct (clés en env, jamais dans git) :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{
"role": "user",
"content": "Propose a migration plan for a 200-file TypeScript monorepo. Keep the plan under 800 words.",
}],
)
print(resp.choices[0].message.content)
Note la dernière phrase : plafonne la demande. Sur un modèle qui pense fort par défaut, les prompts flous du type « fais tout » sont la façon dont les factures prennent des jambes.
Maîtrise des coûts qui marche vraiment
1. Route par job, pas par hype
| Job | Préfère | Pourquoi |
|---|---|---|
| Éditions de routine, petites PR, boucles style autocomplete | K2.7 Code (et amis) | SKU moins cher, orienté coding ; voir /kimi-k27 · /kimi-code |
| Classification en masse, brouillons, résumé « good enough » | K2.6 ou autres modèles bas coût | Garde le budget K3 pour les 10 % durs |
| Architecture multi-fichiers, agent long, screenshot→UI, pack de recherche profond | kimi-k3 | C’est pour ça que le premium existe |
Sélecteur de famille : K2.6 vs K2.7 vs K3.
2. Fais travailler le cache pour toi
- Garde des system prompts stables et des schémas d’outils stables
- Réutilise le même gros bundle document/repo d’un tour à l’autre quand la plateforme peut le cacher
- Ne remélange pas du bruit aléatoire dans le préfixe à chaque requête (ça tue le hit rate)
- Lis le guide caching de Moonshot — les détails d’implémentation battent les vibes
3. Réduis l’output exprès
- Demande des plans en puces, pas des romans
- Plafonne les étapes : « trois options, une reco »
- Stoppe les boucles agent quand les tests passent — ne laisse pas « encore une petite amélioration » tourner la nuit sans surveillance
- Logue les tokens output par tâche réussie, pas seulement les « appels / jour »
4. Plafonne la dépense dans la plateforme
- Pose des alertes budget dures sur platform.kimi.ai / OpenRouter
- Clés séparées pour prod vs playground
- Tue les crons oubliés qui pointent encore vers
kimi-k3

Source : matériaux de lancement K3 officiels via @Kimi_Moonshot / blog Kimi K3, 16 juillet 2026.
Mythes qui vident le portefeuille
| Mythe | Réalité |
|---|---|
| « Open weights = API gratuite » | Plans de téléchargement open-weight ≠ inférence hébergée illimitée. Timeline des poids : check de réalité 27 juillet. |
« J’ai trouvé une clé kimi-k3 gratuite en ligne » | Quasi toujours volée, fake ou appât. Crée ta propre clé. |
| « 1M de contexte = je colle tout le monorepo à chaque fois » | Tu peux ; tu paies aussi ce que tu colles (sauf si c’est caché). |
| « K3 est toujours moins cher que Claude/OpenAI » | Compare ton workload. Un agent gourmand en output peut effacer les économies annoncées. |
| « Je mets K3 sur chaque autocomplete » | C’est comme ça qu’on découvre les 15 $/M à la dure. Route le bulk ailleurs. |
Le self-host après l’arrivée des poids, c’est une facture hardware + ops, pas un bon d’API gratuite — voir réalité VRAM / Ollama.
Ce que tu devrais faire cette semaine
Si tu veux juste essayer le modèle : reste sur le chemin produit — options gratuites et comment utiliser K3 cette semaine. Ne force pas une clé API par pure curiosité.
Si tu ship du logiciel :
- Crée une clé sur platform.kimi.ai (ou OpenRouter si tu y vis déjà).
- Branche
kimi-k3uniquement sur le chemin « job dur ». - Active le caching là où la doc le permet ; mesure le hit rate après un jour.
- Pose un plafond de dépense quotidien avant de laisser un agent tourner.
- Garde les tarifs officiels ouverts dans un onglet — les blogs vieillissent ; la grille est le contrat.
Suite
- Hub specs + règles de bascule → /kimi-k3
- Statut / timeline → /kimi-k3-status
- Honnêteté sur le produit gratuit → /blog/33-kimi-k3-free-how-to
- Portes app vs API → /blog/36-how-to-use-kimi-k3
- Calendrier open weights → /blog/31-kimi-k3-open-weights-july-27
- Hub SKU coding → /kimi-code · /kimi-k27
En résumé : l’API Kimi K3, c’est un outil au prix frontière, avec une grosse remise cache et un output cher. Utilise-le là où il justifie la facture — et arrête de prendre les résultats de recherche « free api » pour une page de tarifs.