Гайды
11 мин мин чтения
AI Observer

Kimi K3 Ollama и VRAM: можно ли запустить локально уже сейчас?

Хаб Kimi K3: Specs, цена, API id → /ru/kimi-k3. Timeline → /ru/kimi-k3-status. Календарь open weights → реальность 27 июля.

Вы вбили kimi k3 ollama, kimi k3 vram или kimi k3 download, потому что лента кричала: модель «открытая». Открыли Hugging Face или библиотеку Ollama — и… нормального install-path нет.

Это не ваша ошибка. Это разрыв между маркетинговым «open» и файлами, которые реально можно загрузить.

Этот гайд отвечает только на локальные вопросы: Можно ли уже крутить Kimi K3 у себя? Сколько VRAM? Когда появятся Ollama/GGUF? Что делать на этой неделе вместо «pull full K3»?

Сайт независим от Moonshot. Факты ниже сверяются с публичными доками на 21 июля 2026 — перед покупкой GPU или доверием случайному репо перепроверьте официальный блог K3 и Moonshot на Hugging Face.

Короткий ответ (читай в первую очередь)

  1. Надёжного публичного полного dump весов K3 пока нет (на момент написания). Продукт и API уже живые; компания обещала полные веса к 27 июля 2026. Пока нет реального репо Moonshot с файлами, честный ollama pull полного K3 невозможен.
  2. Масштаб ~2.8 триллиона параметров со sparse MoE (официально: активны 16 из 896 экспертов). Это может помочь эффективности serving относительно плотного 2.8T — но не делает K3 игрушкой для 24 ГБ ноутбука.
  3. Собственная serving-заметка Moonshot указывает на развёртывание в стиле supernode с 64+ ускорителями. Читайте так: формат дата-центра, а не «одна gaming-карта и мечта».
  4. Что работает сегодня: kimi.com, Kimi Work, Kimi Code и API model id kimi-k3 на platform.kimi.ai. Для уже скачиваемых open weights оставайтесь на карточках семейства K2.6 / K2.7 Code — не K3.

Одной фразой: на этой неделе — API или приложение; локальный K3 — событие конца июля, которое надо перепроверить, а не команда, которая «уже сегодня».

Карточка запуска open weights Kimi K3: 2.8T параметров, 1M контекст, веса запланированы на 27 июля

Источник: community-share официального messaging запуска K3; сверяйте с техблогом Kimi K3, Moonshot AI, 16 июля 2026.

Что люди на самом деле ищут (четыре разные задачи)

Поисковики сваливают это в один ком. Разведите:

Что вводитеЧто, скорее всего, хотитеДоступно сегодня?
kimi k3 huggingface / downloadОфициальные файлы весовНе как готовый публичный checkpoint K3 (перепроверьте ближе к 27 июля)
kimi k3 ollama / ggufЛокальный чат одной командойЕщё нет — нужны веса + community/runtime packaging
kimi k3 vram / local requirements«Влезет ли мой GPU?»Честной фиксированной таблицы ГБ пока нет — только масштаб + официальный multi-accelerator guidance
kimi k3 self hostЗапуск в вашем VPC/кластереПосле весов + поддержки стека (vLLM / партнёры); планируйте железо уровня кластера

Если запомните одну строку: intent «скачать» ≠ intent «Ollama» ≠ «бесплатно и безлимитно на моём ПК».

Шире про календарь open weights (не только железо) — наш пост про open weights 27 июля. Здесь глубже про реальность Ollama / VRAM / self-host.

Что Moonshot реально сказал (локально релевантное)

Из официального анонса Kimi K3 (16 июля 2026):

ФактПочему это важно локальщикам
2.8T параметров, первая open-заявка класса 3TМентальная модель «большой open model» снова прыгнула вверх
Контекст 1M токенов, нативное visionДлинный контекст + мультимодальность бьют по памяти и I/O при self-host
MoE: по сути 16 из 896 экспертов + framing Stable LatentMoESparse activation помогает compute, не магия «ноутбук тянет total params»
Quantization-aware training: веса MXFP4 / активации MXFP8 (их формулировка)Говорит о заботе об efficient serving — не о готовой consumer quant-карточке
Полные веса к 27 июля 2026 + tech report около этой датыСобытие в календаре, не кнопка «Download» сегодня
Выравнивание с inference-партнёрами и open-source maintainersЖдите lag стека (vLLM и др.) даже после появления файлов
Рекомендуют deploy в стиле supernode на 64+ ускорителяхБлижайший официальный vibe check по железу — не гайд «поставь на 4090»

List price API (USD / 1M токенов), пока ждёте: cache-hit input $0.30, cache-miss input $3.00, output $15.00. Launch thinking — max effort по умолчанию: короткие промпты всё равно могут сжечь серьёзный объём reasoning-токенов.

Официальный coding-бенчмарк Kimi K3 (max effort)

Источник: официальные медиа запуска K3 / блог Kimi K3, 16 июля 2026.

Реальность VRAM (без выдуманной таблицы ГБ)

Люди хотят аккуратную таблицу: «Q4 = XX ГБ, Q5 = YY ГБ, нужно 2×H100».

Мы такую не выдумаем.

Почему сейчас это было бы нечестно:

  • Полные публичные веса K3 ещё не подтверждены на диске у community.
  • Официальный quant-recipe под вашу машину — не готовая consumer product page.
  • Community-сборки GGUF/AWQ/EXL2 — если появятся — обычно отстают от day-0 dump, и качество плавает.
  • Активные эксперты ≠ total parameters на диске. MoE-sparse может резать active compute; это автоматически не значит «хранить только 16 экспертов».

Что можно использовать как reality check:

  1. 2.8T total — другая вселенная, не «маленький open coder на ноутбуке».
  2. Рекомендация Moonshot про 64+ ускорителей — собственная serving-форма компании под конкурентный throughput, а не сноска для хобби.
  3. Если вы уже не крутите multi-node GPU-кластеры (и не платите тем, кто крутит), практические пути — API, продуктовые приложения или будущий managed host, а не «квантизую на выходных и забуду про электричество».

Когда веса выйдут, полезные артефакты будут: repo id, LICENSE, размеры файлов, официальные serving notes, partner endpoints и первые заслуживающие доверия quant README. Пока этого нет, любой пост «точный VRAM K3 на 5090» — фанфик.

Ollama, GGUF и таймлайны «как запустить локально»

Сегодня (21 июля 2026):

  • Нет проверенной one-shot записи в библиотеке Ollama для полного Kimi K3, на которую можно уверенно сослаться.
  • Паки GGUF требуют базовых весов + pipeline конвертации + кого-то, кто их опубликует. Ничего из этого «готово», пока нет официального dump (и community tooling).
  • Более старые open-модели Kimi (например K2.6, K2.7 Code) — те, что уже можно тянуть с Hugging Face и вшивать в локальные стеки. Не путайте их теги с K3.

После выхода весов (следите за календарём, не устраивайте pre-party):

  1. Подтвердите репо Moonshot (или явно официальное) с реальными файлами — не placeholder, не зеркало со странным именем.
  2. Прочитайте LICENSE на этом репо (у прошлых open-линий Kimi часто был Modified MIT-style; для K3 ничего не зафиксировано, пока файл не вышел).
  3. Проверьте заметки поддержки vLLM / SGLang / других — Moonshot уже сказал, что ecosystem alignment важен для архитектуры K3 (включая KDA-related serving work в их блоге).
  4. Только потом ищите community-порты Ollama / GGUF. Ждите lag от дней до недель для постов «works on my machine» и дольше — для качественных quant.
  5. Пересчитайте стоимость: self-host кластер + электричество + ops vs API $3/$15 (плюс cache hits). Многие команды оставят API под пиковый intelligence и будут хостить меньшие open-модели для offline bulk.

Бенчмарк agent / general capability Kimi K3 с официального запуска

Источник: официальные медиа запуска K3 / блог Kimi K3, 16 июля 2026.

Чеклист 27 июля (для local / self-host)

Пользуйтесь только когда появится что-то реальное — не как приглашением на пустой календарь.

  • Официальное подтверждение, что веса вышли (blog/X/HF), а не просто «скоро»
  • Репо на Hugging Face (или другом) под Moonshot со скачиваемыми шардами
  • LICENSE прочитан от начала до конца
  • README: serving path (vLLM / другое), известные лимиты, multimodal notes
  • Размеры файлов / quant-опции от кого-то credible (сначала official или крупные хосты)
  • Есть ли у Ollama / llama.cpp / etc. реальный versioned support path
  • Ваше дерево решений: API по умолчанию vs managed host vs self-host кластер
  • Бюджет на ops-время — не только на GPU

Высокоуровневый статус ведём на /ru/kimi-k3-status. Доверяйте primary sources сильнее скриншотов.

Чем пользоваться на этой неделе вместо K3 local

Ваша цельДелайте так
Почувствовать качество K3 на жёсткой задачеApp / API kimi-k3 с фиксированным pilot-бюджетом
Каждый день шипить кодKimi Code + держите тёплым путь K2.7 Code
Оставаться local сейчасSelf-host уже открытых весов K2.x (K2.6 / K2.7 Code) — не K3
«Бесплатные» продуктовые экспериментыСм. честные free-опции — product quotas ≠ free API ≠ free self-host
Какой SKU под какую задачуK2.6 vs K2.7 vs K3

Если новые signup или capacity membership жёсткие (Moonshot публично сглаживал всплески спроса после запуска), API и уже открытые access path важнее отсутствующего локального бинарника.

Фильтры шума (local-редакция)

«Уже есть на Ollama.»
Непроверенные имена в библиотеке и mirror-теги считайте подозрительными, пока они не указывают на реальный checkpoint Moonshot (или явно derived) и рабочий runbook.

«Open weights = бесплатный безлимитный local K3.»
Open weights снимают vendor gate. Они не снимают физику, электричество, multi-GPU ops и license limits.

«MoE значит, моя 24 ГБ карта ок.»
Sparsity помогает active compute. Total storage, routing экспертов, длинный контекст и vision всё равно бьют. Официальный serving guidance — multi-accelerator.

«Чья-то HF-карточка kimi-k3 обязана быть официальной.»
Проверяйте org, файлы, license, ссылку на анонс. Предпочитайте huggingface.co/moonshotai случайным rename.

«Просто подожду и навсегда пропущу API.»
Нормально для research-любопытства. Плохо для product deadlines. Пилотируйте K3 там, где premium reasoning окупается; для bulk держите cheaper/open SKU.

FAQ

Можно ли скачать Kimi K3 уже сегодня?
Планируйте нет для полного официального публичного dump на 21 июля 2026. Официальное обещание: полные веса к 27 июля 2026. Перепроверьте org Moonshot и блог K3.

Можно ли крутить Kimi K3 в Ollama сегодня?
Не в какой-либо заслуживающей доверия полной форме, которую мы можем рекомендовать. Нет весов → нет честного Ollama-path.

Сколько нужно VRAM?
Неизвестно как точная consumer-цифра. Берите официальный масштаб + serving guidance 64+ ускорителей как gut check: если вы уже не крутите cluster GPU, закладывайтесь на API или hosted inference.

K3 — open source или open weight?
Launch language делает упор на open weights для модели класса 3T. Финальный текст license приедет с файлами — читайте тогда. «Open» в заголовке не заменяет LICENSE.

А как насчёт моделей K2 локально?
Более ранние open-линии Kimi (напр. K2.6, K2.7 Code) — практичные self-host опции сегодня. Не вставляйте тег K2 в скрипт и не называйте это K3.

Этот сайт — официальный Moonshot?
Нет. Сверяйте kimi.com/blog/kimi-k3 и platform.kimi.ai, прежде чем тратить деньги или ставить железо в стойку.

Итог

Локальные поисковые запросы не безумны — спрос на HF / download / Ollama / VRAM реален. Чего не хватает — артефакта: публичного релиза весов K3, который можно проверить, плюс стека, который его реально грузит.

Пока этого нет, умный ход скучный:

  • Пилотируйте K3 в продукте или API там, где жёсткая задача стоит token bill.
  • Self-host уже open-моделей K2.x, если нужно offline-железо.
  • Игнорируйте гайды «поставь K3 на ноутбук сегодня вечером», где нет реального репо.
  • Перепроверьте около 27 июля — по чеклисту выше, а не одной надеждой.

Дальше: open weights 27 июля · гайд по релизу K3 · free-опции · какую модель выбрать · status hub.

Похожие статьи

Хотите Kimi K3 без большого счёта? Что бесплатно уже сегодня: регистрация с наградами, лимиты free-тарифа, за что всё ещё платят, и что реально меняет «open weights 27 июля».
Kimi K3 vs Claude и GPT — это не «снести все API-ключи». Практическое правило: list price, coding-сигналы и когда Sonnet или Sol всё ещё лучше оставить.
В ленте пишут «открытая модель класса 3T», а на Hugging Face пусто. Что Moonshot реально обещала к 27 июля — и чем пользоваться на этой неделе вместо фантазий про локальный GPU.