Kimi K3 Ollama и VRAM: можно ли запустить локально уже сейчас?
Хаб Kimi K3: Specs, цена, API id → /ru/kimi-k3. Timeline → /ru/kimi-k3-status. Календарь open weights → реальность 27 июля.
Вы вбили kimi k3 ollama, kimi k3 vram или kimi k3 download, потому что лента кричала: модель «открытая». Открыли Hugging Face или библиотеку Ollama — и… нормального install-path нет.
Это не ваша ошибка. Это разрыв между маркетинговым «open» и файлами, которые реально можно загрузить.
Этот гайд отвечает только на локальные вопросы: Можно ли уже крутить Kimi K3 у себя? Сколько VRAM? Когда появятся Ollama/GGUF? Что делать на этой неделе вместо «pull full K3»?
Сайт независим от Moonshot. Факты ниже сверяются с публичными доками на 21 июля 2026 — перед покупкой GPU или доверием случайному репо перепроверьте официальный блог K3 и Moonshot на Hugging Face.
Короткий ответ (читай в первую очередь)
- Надёжного публичного полного dump весов K3 пока нет (на момент написания). Продукт и API уже живые; компания обещала полные веса к 27 июля 2026. Пока нет реального репо Moonshot с файлами, честный
ollama pullполного K3 невозможен. - Масштаб ~2.8 триллиона параметров со sparse MoE (официально: активны 16 из 896 экспертов). Это может помочь эффективности serving относительно плотного 2.8T — но не делает K3 игрушкой для 24 ГБ ноутбука.
- Собственная serving-заметка Moonshot указывает на развёртывание в стиле supernode с 64+ ускорителями. Читайте так: формат дата-центра, а не «одна gaming-карта и мечта».
- Что работает сегодня: kimi.com, Kimi Work, Kimi Code и API model id
kimi-k3на platform.kimi.ai. Для уже скачиваемых open weights оставайтесь на карточках семейства K2.6 / K2.7 Code — не K3.
Одной фразой: на этой неделе — API или приложение; локальный K3 — событие конца июля, которое надо перепроверить, а не команда, которая «уже сегодня».

Источник: community-share официального messaging запуска K3; сверяйте с техблогом Kimi K3, Moonshot AI, 16 июля 2026.
Что люди на самом деле ищут (четыре разные задачи)
Поисковики сваливают это в один ком. Разведите:
| Что вводите | Что, скорее всего, хотите | Доступно сегодня? |
|---|---|---|
| kimi k3 huggingface / download | Официальные файлы весов | Не как готовый публичный checkpoint K3 (перепроверьте ближе к 27 июля) |
| kimi k3 ollama / gguf | Локальный чат одной командой | Ещё нет — нужны веса + community/runtime packaging |
| kimi k3 vram / local requirements | «Влезет ли мой GPU?» | Честной фиксированной таблицы ГБ пока нет — только масштаб + официальный multi-accelerator guidance |
| kimi k3 self host | Запуск в вашем VPC/кластере | После весов + поддержки стека (vLLM / партнёры); планируйте железо уровня кластера |
Если запомните одну строку: intent «скачать» ≠ intent «Ollama» ≠ «бесплатно и безлимитно на моём ПК».
Шире про календарь open weights (не только железо) — наш пост про open weights 27 июля. Здесь глубже про реальность Ollama / VRAM / self-host.
Что Moonshot реально сказал (локально релевантное)
Из официального анонса Kimi K3 (16 июля 2026):
| Факт | Почему это важно локальщикам |
|---|---|
| 2.8T параметров, первая open-заявка класса 3T | Ментальная модель «большой open model» снова прыгнула вверх |
| Контекст 1M токенов, нативное vision | Длинный контекст + мультимодальность бьют по памяти и I/O при self-host |
| MoE: по сути 16 из 896 экспертов + framing Stable LatentMoE | Sparse activation помогает compute, не магия «ноутбук тянет total params» |
| Quantization-aware training: веса MXFP4 / активации MXFP8 (их формулировка) | Говорит о заботе об efficient serving — не о готовой consumer quant-карточке |
| Полные веса к 27 июля 2026 + tech report около этой даты | Событие в календаре, не кнопка «Download» сегодня |
| Выравнивание с inference-партнёрами и open-source maintainers | Ждите lag стека (vLLM и др.) даже после появления файлов |
| Рекомендуют deploy в стиле supernode на 64+ ускорителях | Ближайший официальный vibe check по железу — не гайд «поставь на 4090» |
List price API (USD / 1M токенов), пока ждёте: cache-hit input $0.30, cache-miss input $3.00, output $15.00. Launch thinking — max effort по умолчанию: короткие промпты всё равно могут сжечь серьёзный объём reasoning-токенов.

Источник: официальные медиа запуска K3 / блог Kimi K3, 16 июля 2026.
Реальность VRAM (без выдуманной таблицы ГБ)
Люди хотят аккуратную таблицу: «Q4 = XX ГБ, Q5 = YY ГБ, нужно 2×H100».
Мы такую не выдумаем.
Почему сейчас это было бы нечестно:
- Полные публичные веса K3 ещё не подтверждены на диске у community.
- Официальный quant-recipe под вашу машину — не готовая consumer product page.
- Community-сборки GGUF/AWQ/EXL2 — если появятся — обычно отстают от day-0 dump, и качество плавает.
- Активные эксперты ≠ total parameters на диске. MoE-sparse может резать active compute; это автоматически не значит «хранить только 16 экспертов».
Что можно использовать как reality check:
- 2.8T total — другая вселенная, не «маленький open coder на ноутбуке».
- Рекомендация Moonshot про 64+ ускорителей — собственная serving-форма компании под конкурентный throughput, а не сноска для хобби.
- Если вы уже не крутите multi-node GPU-кластеры (и не платите тем, кто крутит), практические пути — API, продуктовые приложения или будущий managed host, а не «квантизую на выходных и забуду про электричество».
Когда веса выйдут, полезные артефакты будут: repo id, LICENSE, размеры файлов, официальные serving notes, partner endpoints и первые заслуживающие доверия quant README. Пока этого нет, любой пост «точный VRAM K3 на 5090» — фанфик.
Ollama, GGUF и таймлайны «как запустить локально»
Сегодня (21 июля 2026):
- Нет проверенной one-shot записи в библиотеке Ollama для полного Kimi K3, на которую можно уверенно сослаться.
- Паки GGUF требуют базовых весов + pipeline конвертации + кого-то, кто их опубликует. Ничего из этого «готово», пока нет официального dump (и community tooling).
- Более старые open-модели Kimi (например K2.6, K2.7 Code) — те, что уже можно тянуть с Hugging Face и вшивать в локальные стеки. Не путайте их теги с K3.
После выхода весов (следите за календарём, не устраивайте pre-party):
- Подтвердите репо Moonshot (или явно официальное) с реальными файлами — не placeholder, не зеркало со странным именем.
- Прочитайте LICENSE на этом репо (у прошлых open-линий Kimi часто был Modified MIT-style; для K3 ничего не зафиксировано, пока файл не вышел).
- Проверьте заметки поддержки vLLM / SGLang / других — Moonshot уже сказал, что ecosystem alignment важен для архитектуры K3 (включая KDA-related serving work в их блоге).
- Только потом ищите community-порты Ollama / GGUF. Ждите lag от дней до недель для постов «works on my machine» и дольше — для качественных quant.
- Пересчитайте стоимость: self-host кластер + электричество + ops vs API $3/$15 (плюс cache hits). Многие команды оставят API под пиковый intelligence и будут хостить меньшие open-модели для offline bulk.

Источник: официальные медиа запуска K3 / блог Kimi K3, 16 июля 2026.
Чеклист 27 июля (для local / self-host)
Пользуйтесь только когда появится что-то реальное — не как приглашением на пустой календарь.
- Официальное подтверждение, что веса вышли (blog/X/HF), а не просто «скоро»
- Репо на Hugging Face (или другом) под Moonshot со скачиваемыми шардами
- LICENSE прочитан от начала до конца
- README: serving path (vLLM / другое), известные лимиты, multimodal notes
- Размеры файлов / quant-опции от кого-то credible (сначала official или крупные хосты)
- Есть ли у Ollama / llama.cpp / etc. реальный versioned support path
- Ваше дерево решений: API по умолчанию vs managed host vs self-host кластер
- Бюджет на ops-время — не только на GPU
Высокоуровневый статус ведём на /ru/kimi-k3-status. Доверяйте primary sources сильнее скриншотов.
Чем пользоваться на этой неделе вместо K3 local
| Ваша цель | Делайте так |
|---|---|
| Почувствовать качество K3 на жёсткой задаче | App / API kimi-k3 с фиксированным pilot-бюджетом |
| Каждый день шипить код | Kimi Code + держите тёплым путь K2.7 Code |
| Оставаться local сейчас | Self-host уже открытых весов K2.x (K2.6 / K2.7 Code) — не K3 |
| «Бесплатные» продуктовые эксперименты | См. честные free-опции — product quotas ≠ free API ≠ free self-host |
| Какой SKU под какую задачу | K2.6 vs K2.7 vs K3 |
Если новые signup или capacity membership жёсткие (Moonshot публично сглаживал всплески спроса после запуска), API и уже открытые access path важнее отсутствующего локального бинарника.
Фильтры шума (local-редакция)
«Уже есть на Ollama.»
Непроверенные имена в библиотеке и mirror-теги считайте подозрительными, пока они не указывают на реальный checkpoint Moonshot (или явно derived) и рабочий runbook.
«Open weights = бесплатный безлимитный local K3.»
Open weights снимают vendor gate. Они не снимают физику, электричество, multi-GPU ops и license limits.
«MoE значит, моя 24 ГБ карта ок.»
Sparsity помогает active compute. Total storage, routing экспертов, длинный контекст и vision всё равно бьют. Официальный serving guidance — multi-accelerator.
«Чья-то HF-карточка kimi-k3 обязана быть официальной.»
Проверяйте org, файлы, license, ссылку на анонс. Предпочитайте huggingface.co/moonshotai случайным rename.
«Просто подожду и навсегда пропущу API.»
Нормально для research-любопытства. Плохо для product deadlines. Пилотируйте K3 там, где premium reasoning окупается; для bulk держите cheaper/open SKU.
FAQ
Можно ли скачать Kimi K3 уже сегодня?
Планируйте нет для полного официального публичного dump на 21 июля 2026. Официальное обещание: полные веса к 27 июля 2026. Перепроверьте org Moonshot и блог K3.
Можно ли крутить Kimi K3 в Ollama сегодня?
Не в какой-либо заслуживающей доверия полной форме, которую мы можем рекомендовать. Нет весов → нет честного Ollama-path.
Сколько нужно VRAM?
Неизвестно как точная consumer-цифра. Берите официальный масштаб + serving guidance 64+ ускорителей как gut check: если вы уже не крутите cluster GPU, закладывайтесь на API или hosted inference.
K3 — open source или open weight?
Launch language делает упор на open weights для модели класса 3T. Финальный текст license приедет с файлами — читайте тогда. «Open» в заголовке не заменяет LICENSE.
А как насчёт моделей K2 локально?
Более ранние open-линии Kimi (напр. K2.6, K2.7 Code) — практичные self-host опции сегодня. Не вставляйте тег K2 в скрипт и не называйте это K3.
Этот сайт — официальный Moonshot?
Нет. Сверяйте kimi.com/blog/kimi-k3 и platform.kimi.ai, прежде чем тратить деньги или ставить железо в стойку.
Итог
Локальные поисковые запросы не безумны — спрос на HF / download / Ollama / VRAM реален. Чего не хватает — артефакта: публичного релиза весов K3, который можно проверить, плюс стека, который его реально грузит.
Пока этого нет, умный ход скучный:
- Пилотируйте K3 в продукте или API там, где жёсткая задача стоит token bill.
- Self-host уже open-моделей K2.x, если нужно offline-железо.
- Игнорируйте гайды «поставь K3 на ноутбук сегодня вечером», где нет реального репо.
- Перепроверьте около 27 июля — по чеклисту выше, а не одной надеждой.
Дальше: open weights 27 июля · гайд по релизу K3 · free-опции · какую модель выбрать · status hub.