Guides
11 min мин чтения
AI Observer

Цены API Kimi K3: cache hit, OpenRouter и контроль счёта

Хаб Kimi K3: Specs, model id, когда переключаться → /kimi-k3. Бесплатный продукт → как пользоваться K3 бесплатно. Практические двери на этой неделе → как пользоваться Kimi K3.

Вы вбили kimi k3 free api или kimi k3 pricing, потому что лента кричала: модель «открытая». Открыли developer console — а там прайс, который к «free forever» отношения не имеет.

Разрыв нормальный. Бесплатный tier продукта и платный API-ключ — разные двери. Этот гайд только про счёт, который вы получите, вызывая kimi-k3.

Короткий ответ (читай в первую очередь)

  1. Постоянного free production API на полный kimi-k3 нет. Free chat / rewards живут на продуктовой стороне (kimi.com). Ключи на platform.kimi.aipay-as-you-go.
  2. Лист-прайс (USD / 1M токенов, публичные доки конца июля 2026): cache-hit input $0.30 · cache-miss input $3.00 · output $15.00. Плоский по всему окну 1M — на публичной карте K3 нет «надбавки за long context».
  3. Реальный рычаг экономии — cache + роутинг моделей, а не охота за фейковыми free keys. Переиспользуйте длинные system prompt и repo-контекст; рутину отдавайте дешевле; K3 оставляйте на тяжёлые и длинные задачи.
  4. Max-effort thinking включён по умолчанию на K3 (в публичных доках пока нет переключателя «cheap mode»). Тупая «привет»-подсказка всё равно может сжечь дорогие reasoning-токены — не ставьте K3 вместо тостера.

Одной фразой: free-продукт — пощупать модель; платный API — когда нужна автоматизация. И $15/M output + всегда-on thinking — это фича бюджета, а не мелочь в подвале.

Сайт независим от Moonshot. Цены и capacity меняются — перед командным autopilot сверьте цены K3 и quickstart K3.

Официальные coding-бенчмарки Kimi K3 (max effort) против ведущих моделей — зачем существует premium-tier

Источник: официальные медиа запуска K3 от @Kimi_Moonshot, 16 июля 2026; те же графики, что в блоге Kimi K3.

Тариф по-человечески

СтрокаПростыми словамиUSD / 1M токенов
Cache-hit input«Этот контекст вы недавно уже оплатили; мы его переиспользуем.»$0.30
Cache-miss inputСвежие токены, которых для этого пути запроса ещё нет в cache$3.00
OutputТо, что модель пишет назад — включая длинные reasoning-трассы$15.00
Context windowСколько проекта можно удержать в одном вызове1M tokens (flat pricing на публичной карте)
Model idЧто кладёте в API-запросkimi-k3

Три «перевода», которые люди обычно пропускают:

  • $3 / $15 — это «уровень Sonnet», а не «промо-цены K2». Если задача — рефактор на 20 строк, более дешёвая coding-модель часто выигрывает по деньгам.
  • Cache hit за $0.30 — тихий герой. Агенты, которые снова и снова шлют один system prompt, style guide или monorepo snapshot, получают ~90% скидку на input на повторяющейся части — когда caching работает как в доках.
  • Output — место, где счёт взрывается. Длинные tool-циклы + длинный chain-of-thought = много токенов по $15/M. «Простой тест», который слишком долго думает, всё равно может стоить реальных денег.

Официальные deep links: platform.kimi.ai · pricing/chat-k3 · гайд по context caching.

Free-продукт vs платный API (хватит их мешать)

ПутьЧто получаетеЗа что платите
kimi.com / app free + rewardsChat / agent UX с квотами$0 до лимитов; membership может открыть больше
Membership / Code membershipПродуктовые entitlements (это не сырой API-metering)Цена плана (смотрите membership pricing)
API kimi-k3Ключи, tools, автоматизация, OpenAI-compatible base URLToken meter — $0.30 / $3 / $15
OpenRouter moonshotai/kimi-k3Та же модель через multi-model routerТот же коридор $3 / $15 на публичных листингах; capacity может троттлить

Поиск «kimi k3 free api key» обычно означает одну из трёх ошибок:

  1. Хотите free chat продукта (правильная дверь: free-гайд)
  2. Хотите вечные production-ключи за $0 (публичного обещания нет)
  3. Попали на дампы скам-ключей (никогда не вставляйте ключи из случайных gists в prod)

Если на consumer-стороне новые подписки на паузе, API всё равно может быть отдельной дверью — см. гайд про паузу подписки.

Бенчмарки agent и visual-agent Kimi K3 — длинные tool-циклы, где output-токены накапливаются

Источник: официальные медиа запуска K3 от @Kimi_Moonshot, 16 июля 2026.

Почему первый инвойс кажется злее, чем прайс

K3 заточен под длинный coding, knowledge work и глубокое рассуждение. На счёте это выглядит так:

  • Thinking всегда on (max effort на запуске). Публичные доки: на K3 нельзя просто «выключить» chain-of-thought так, как у части моделей есть low/medium effort. Дешёвые «hi»-промпты — плохая привычка.
  • 1M context — power tool, не free-снек. Запихивать полмонорепы в каждый вызов без cache — как раз способ сделать $3 input главной статьёй.
  • Agent-циклы множат output. План → tool → патч → перечитать → снова план. Каждый шаг пишет токены по $15/M.

Грубая mental math (только иллюстрация — не котировка):

Игрушечная задачаЧто важно на inputНа что смотреть
Промпт 2k токенов, ответ 500, без cacheМалоВсё равно берите дешёвую модель, если задача тривиальна
Repo-контекст 100k, на следующем ходе 80% cache hitCacheInput на hit-части схлопывается к $0.30
Multi-hour agent, 200k output токенов reasoningOutput$15 × 0.2 = $3 только за этот срез — ещё до input

Для продакшена всегда читайте usage dashboards, а не арифметику из блога.

OpenRouter vs прямой Moonshot

Прямой MoonshotOpenRouter
Model idkimi-k3moonshotai/kimi-k3 (могут быть aliases)
Base URLhttps://api.moonshot.ai/v1OpenAI-compatible endpoint OpenRouter
Ценовой коридорОфициальные $0.30 / $3 / $15Публичные листинги обычно $3 / $15 с полями cache
Зачем выбиратьМинимум накладных, официальные доки, путь prompt cachingОдин ключ на много моделей; быстрые эксперименты
На что смотретьАккаунт + billing setupUpstream capacity / 429, когда K3 горячий

Ни один путь — не «free API». Оба — роутеры к тарифицируемому flagship.

Минимальная форма прямого вызова (ключи в env, никогда в git):

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{
        "role": "user",
        "content": "Propose a migration plan for a 200-file TypeScript monorepo. Keep the plan under 800 words.",
    }],
)
print(resp.choices[0].message.content)

Заметьте последнюю фразу: ограничьте запрос. На модели, которая по умолчанию думает тяжело, размытое «сделай всё» — как раз то, от чего у счёта вырастают ноги.

Контроль затрат, который реально работает

1. Роутите по задаче, а не по хайпу

ЗадачаБеритеПочему
Рутинные правки, мелкие PR, autocomplete-циклыK2.7 Code (и друзья)Дешевле SKU, coding-фокус; см. /kimi-k27 · /kimi-code
Массовая классификация, черновики, summary «достаточно хорошо»K2.6 или другие lower-cost моделиБюджет K3 берегите на тяжёлые 10%
Multi-file архитектура, длинный agent, screenshot→UI, deep research packkimi-k3За это и платите premium

Семейный picker: K2.6 vs K2.7 vs K3.

2. Заставьте cache работать на вас

  • Держите стабильные system prompts и стабильные tool schemas
  • Переиспользуйте один и тот же большой document/repo bundle между ходами, когда платформа может его закэшировать
  • Не тасуйте случайный шум в prefix на каждый запрос (это убивает hit rate)
  • Читайте гайд Moonshot по caching — детали реализации бьют «вайб»

3. Режьте output намеренно

  • Просите bullet-планы, не романы
  • Ограничивайте шаги: «три варианта, одна рекомендация»
  • Останавливайте agent-циклы, когда тесты зелёные — не давайте «ещё одной правке» бежать всю ночь без присмотра
  • Логируйте output-токены на успешную задачу, а не только «вызовов в день»

4. Поставьте потолок в платформе

  • Жёсткие budget alerts на platform.kimi.ai / OpenRouter
  • Разные ключи для prod vs playground
  • Убивайте забытые cron, которые всё ещё смотрят на kimi-k3

Архитектурная графика Kimi K3 — масштаб и замысел, а не free laptop SKU

Источник: официальные материалы запуска K3 через @Kimi_Moonshot / блог Kimi K3, 16 июля 2026.

Мифы, которые опустошают кошелёк

МифРеальность
«Open weights = free API»Планы скачать веса ≠ безлимитный hosted inference. Timeline весов: reality check 27 июля.
«Нашёл free-ключ kimi-k3 в сети»Почти всегда украденный, фейк или приманка. Создавайте свой.
«1M context значит, всегда пастить весь monorepo»Можно; но вы платите за то, что пастите (если нет cache).
«K3 всегда дешевле Claude/OpenAI»Сравнивайте ваш workload. Output-тяжёлые agents могут съесть headline-экономию.
«Просто поставлю K3 на каждый autocomplete»Так и узнаёте про $15/M на собственной шкуре. Bulk — в другую модель.

Self-host после выхода весов — это счёт за железо + ops, а не купон на free API; см. VRAM / Ollama reality.

Что сделать на этой неделе

Если хотите только пощупать модель: оставайтесь на продуктовом пути — free-варианты и как пользоваться K3 на этой неделе. Не форсируйте API-ключ из любопытства.

Если выкатываете софт:

  1. Создайте ключ на platform.kimi.ai (или OpenRouter, если вы уже там).
  2. Подключите kimi-k3 только на путь «тяжёлой задачи».
  3. Включите caching, где доки это позволяют; через день измерьте hit rate.
  4. Поставьте daily spend cap, прежде чем оставить agent бежать.
  5. Держите официальный прайс во вкладке — блоги устаревают; rate card — это контракт.

Куда дальше

Итог: API Kimi K3 — это frontier-priced инструмент с огромной cache-скидкой и дорогим output. Платите там, где счёт отрабатывает — и перестаньте считать поисковую выдачу «free api» прайс-страницей.

Похожие статьи

Лента полна Kimi K3. Практическая карта на неделю: app или free try, что делать если subscribe на паузе, когда API окупается и что игнорировать до весов 27 июля.
Хотели оплатить Kimi K3 — и упёрлись в стену? Кого затронула пауза, что ещё работает (бесплатный старт, API, действующие планы) и как open weights 27 июля меняют картину.
Ищете Ollama, GGUF или VRAM для Kimi K3? Честная картина локального запуска: чего нет сегодня, что реально значит 2.8T, и чем пользоваться, пока веса не вышли.