Цены API Kimi K3: cache hit, OpenRouter и контроль счёта
Хаб Kimi K3: Specs, model id, когда переключаться → /kimi-k3. Бесплатный продукт → как пользоваться K3 бесплатно. Практические двери на этой неделе → как пользоваться Kimi K3.
Вы вбили kimi k3 free api или kimi k3 pricing, потому что лента кричала: модель «открытая». Открыли developer console — а там прайс, который к «free forever» отношения не имеет.
Разрыв нормальный. Бесплатный tier продукта и платный API-ключ — разные двери. Этот гайд только про счёт, который вы получите, вызывая kimi-k3.
Короткий ответ (читай в первую очередь)
- Постоянного free production API на полный
kimi-k3нет. Free chat / rewards живут на продуктовой стороне (kimi.com). Ключи на platform.kimi.ai — pay-as-you-go. - Лист-прайс (USD / 1M токенов, публичные доки конца июля 2026): cache-hit input $0.30 · cache-miss input $3.00 · output $15.00. Плоский по всему окну 1M — на публичной карте K3 нет «надбавки за long context».
- Реальный рычаг экономии — cache + роутинг моделей, а не охота за фейковыми free keys. Переиспользуйте длинные system prompt и repo-контекст; рутину отдавайте дешевле; K3 оставляйте на тяжёлые и длинные задачи.
- Max-effort thinking включён по умолчанию на K3 (в публичных доках пока нет переключателя «cheap mode»). Тупая «привет»-подсказка всё равно может сжечь дорогие reasoning-токены — не ставьте K3 вместо тостера.
Одной фразой: free-продукт — пощупать модель; платный API — когда нужна автоматизация. И $15/M output + всегда-on thinking — это фича бюджета, а не мелочь в подвале.
Сайт независим от Moonshot. Цены и capacity меняются — перед командным autopilot сверьте цены K3 и quickstart K3.

Источник: официальные медиа запуска K3 от @Kimi_Moonshot, 16 июля 2026; те же графики, что в блоге Kimi K3.
Тариф по-человечески
| Строка | Простыми словами | USD / 1M токенов |
|---|---|---|
| Cache-hit input | «Этот контекст вы недавно уже оплатили; мы его переиспользуем.» | $0.30 |
| Cache-miss input | Свежие токены, которых для этого пути запроса ещё нет в cache | $3.00 |
| Output | То, что модель пишет назад — включая длинные reasoning-трассы | $15.00 |
| Context window | Сколько проекта можно удержать в одном вызове | 1M tokens (flat pricing на публичной карте) |
| Model id | Что кладёте в API-запрос | kimi-k3 |
Три «перевода», которые люди обычно пропускают:
- $3 / $15 — это «уровень Sonnet», а не «промо-цены K2». Если задача — рефактор на 20 строк, более дешёвая coding-модель часто выигрывает по деньгам.
- Cache hit за $0.30 — тихий герой. Агенты, которые снова и снова шлют один system prompt, style guide или monorepo snapshot, получают ~90% скидку на input на повторяющейся части — когда caching работает как в доках.
- Output — место, где счёт взрывается. Длинные tool-циклы + длинный chain-of-thought = много токенов по $15/M. «Простой тест», который слишком долго думает, всё равно может стоить реальных денег.
Официальные deep links: platform.kimi.ai · pricing/chat-k3 · гайд по context caching.
Free-продукт vs платный API (хватит их мешать)
| Путь | Что получаете | За что платите |
|---|---|---|
| kimi.com / app free + rewards | Chat / agent UX с квотами | $0 до лимитов; membership может открыть больше |
| Membership / Code membership | Продуктовые entitlements (это не сырой API-metering) | Цена плана (смотрите membership pricing) |
API kimi-k3 | Ключи, tools, автоматизация, OpenAI-compatible base URL | Token meter — $0.30 / $3 / $15 |
OpenRouter moonshotai/kimi-k3 | Та же модель через multi-model router | Тот же коридор $3 / $15 на публичных листингах; capacity может троттлить |
Поиск «kimi k3 free api key» обычно означает одну из трёх ошибок:
- Хотите free chat продукта (правильная дверь: free-гайд)
- Хотите вечные production-ключи за $0 (публичного обещания нет)
- Попали на дампы скам-ключей (никогда не вставляйте ключи из случайных gists в prod)
Если на consumer-стороне новые подписки на паузе, API всё равно может быть отдельной дверью — см. гайд про паузу подписки.

Источник: официальные медиа запуска K3 от @Kimi_Moonshot, 16 июля 2026.
Почему первый инвойс кажется злее, чем прайс
K3 заточен под длинный coding, knowledge work и глубокое рассуждение. На счёте это выглядит так:
- Thinking всегда on (max effort на запуске). Публичные доки: на K3 нельзя просто «выключить» chain-of-thought так, как у части моделей есть low/medium effort. Дешёвые «hi»-промпты — плохая привычка.
- 1M context — power tool, не free-снек. Запихивать полмонорепы в каждый вызов без cache — как раз способ сделать $3 input главной статьёй.
- Agent-циклы множат output. План → tool → патч → перечитать → снова план. Каждый шаг пишет токены по $15/M.
Грубая mental math (только иллюстрация — не котировка):
| Игрушечная задача | Что важно на input | На что смотреть |
|---|---|---|
| Промпт 2k токенов, ответ 500, без cache | Мало | Всё равно берите дешёвую модель, если задача тривиальна |
| Repo-контекст 100k, на следующем ходе 80% cache hit | Cache | Input на hit-части схлопывается к $0.30 |
| Multi-hour agent, 200k output токенов reasoning | Output | $15 × 0.2 = $3 только за этот срез — ещё до input |
Для продакшена всегда читайте usage dashboards, а не арифметику из блога.
OpenRouter vs прямой Moonshot
| Прямой Moonshot | OpenRouter | |
|---|---|---|
| Model id | kimi-k3 | moonshotai/kimi-k3 (могут быть aliases) |
| Base URL | https://api.moonshot.ai/v1 | OpenAI-compatible endpoint OpenRouter |
| Ценовой коридор | Официальные $0.30 / $3 / $15 | Публичные листинги обычно $3 / $15 с полями cache |
| Зачем выбирать | Минимум накладных, официальные доки, путь prompt caching | Один ключ на много моделей; быстрые эксперименты |
| На что смотреть | Аккаунт + billing setup | Upstream capacity / 429, когда K3 горячий |
Ни один путь — не «free API». Оба — роутеры к тарифицируемому flagship.
Минимальная форма прямого вызова (ключи в env, никогда в git):
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{
"role": "user",
"content": "Propose a migration plan for a 200-file TypeScript monorepo. Keep the plan under 800 words.",
}],
)
print(resp.choices[0].message.content)
Заметьте последнюю фразу: ограничьте запрос. На модели, которая по умолчанию думает тяжело, размытое «сделай всё» — как раз то, от чего у счёта вырастают ноги.
Контроль затрат, который реально работает
1. Роутите по задаче, а не по хайпу
| Задача | Берите | Почему |
|---|---|---|
| Рутинные правки, мелкие PR, autocomplete-циклы | K2.7 Code (и друзья) | Дешевле SKU, coding-фокус; см. /kimi-k27 · /kimi-code |
| Массовая классификация, черновики, summary «достаточно хорошо» | K2.6 или другие lower-cost модели | Бюджет K3 берегите на тяжёлые 10% |
| Multi-file архитектура, длинный agent, screenshot→UI, deep research pack | kimi-k3 | За это и платите premium |
Семейный picker: K2.6 vs K2.7 vs K3.
2. Заставьте cache работать на вас
- Держите стабильные system prompts и стабильные tool schemas
- Переиспользуйте один и тот же большой document/repo bundle между ходами, когда платформа может его закэшировать
- Не тасуйте случайный шум в prefix на каждый запрос (это убивает hit rate)
- Читайте гайд Moonshot по caching — детали реализации бьют «вайб»
3. Режьте output намеренно
- Просите bullet-планы, не романы
- Ограничивайте шаги: «три варианта, одна рекомендация»
- Останавливайте agent-циклы, когда тесты зелёные — не давайте «ещё одной правке» бежать всю ночь без присмотра
- Логируйте output-токены на успешную задачу, а не только «вызовов в день»
4. Поставьте потолок в платформе
- Жёсткие budget alerts на platform.kimi.ai / OpenRouter
- Разные ключи для prod vs playground
- Убивайте забытые cron, которые всё ещё смотрят на
kimi-k3

Источник: официальные материалы запуска K3 через @Kimi_Moonshot / блог Kimi K3, 16 июля 2026.
Мифы, которые опустошают кошелёк
| Миф | Реальность |
|---|---|
| «Open weights = free API» | Планы скачать веса ≠ безлимитный hosted inference. Timeline весов: reality check 27 июля. |
«Нашёл free-ключ kimi-k3 в сети» | Почти всегда украденный, фейк или приманка. Создавайте свой. |
| «1M context значит, всегда пастить весь monorepo» | Можно; но вы платите за то, что пастите (если нет cache). |
| «K3 всегда дешевле Claude/OpenAI» | Сравнивайте ваш workload. Output-тяжёлые agents могут съесть headline-экономию. |
| «Просто поставлю K3 на каждый autocomplete» | Так и узнаёте про $15/M на собственной шкуре. Bulk — в другую модель. |
Self-host после выхода весов — это счёт за железо + ops, а не купон на free API; см. VRAM / Ollama reality.
Что сделать на этой неделе
Если хотите только пощупать модель: оставайтесь на продуктовом пути — free-варианты и как пользоваться K3 на этой неделе. Не форсируйте API-ключ из любопытства.
Если выкатываете софт:
- Создайте ключ на platform.kimi.ai (или OpenRouter, если вы уже там).
- Подключите
kimi-k3только на путь «тяжёлой задачи». - Включите caching, где доки это позволяют; через день измерьте hit rate.
- Поставьте daily spend cap, прежде чем оставить agent бежать.
- Держите официальный прайс во вкладке — блоги устаревают; rate card — это контракт.
Куда дальше
- Хаб со specs + правилами переключения → /kimi-k3
- Status / timeline → /kimi-k3-status
- Честно про free-продукт → /blog/33-kimi-k3-free-how-to
- Двери app vs API → /blog/36-how-to-use-kimi-k3
- Календарь open weights → /blog/31-kimi-k3-open-weights-july-27
- Хаб coding SKU → /kimi-code · /kimi-k27
Итог: API Kimi K3 — это frontier-priced инструмент с огромной cache-скидкой и дорогим output. Платите там, где счёт отрабатывает — и перестаньте считать поисковую выдачу «free api» прайс-страницей.