Guias
11 min min de leitura
AI Observer

Kimi K3 no Ollama e VRAM: dá pra rodar local ainda?

Hub Kimi K3: Specs, preço, id da API → /pt/kimi-k3. Timeline → /pt/kimi-k3-status. Calendário de open weights → reality check de 27 de julho.

Você digitou kimi k3 ollama, kimi k3 vram ou kimi k3 download porque o feed disse que o modelo é “open.” Aí abriu o Hugging Face ou a biblioteca do Ollama e… nenhum caminho limpo de instalação.

Esse buraco não é culpa sua. É a diferença entre “open” de marketing e arquivos que você de fato consegue carregar.

Este guia responde só as perguntas locais: Dá pra rodar Kimi K3 na sua máquina ainda? Quanto de VRAM? Quando Ollama/GGUF aparecem? O que fazer esta semana no lugar?

Este site é independente da Moonshot. Os fatos abaixo acompanham docs públicos em 21 de julho de 2026—confira de novo o blog oficial do K3 e a Moonshot no Hugging Face antes de comprar GPU ou confiar em repo aleatório.

Resposta curta (leia isto primeiro)

  1. Ainda não há dump público confiável dos pesos completos do K3 (nesta data). Produto + API estão no ar; a empresa falou em pesos completos até 27 de julho de 2026. Enquanto não existir um repo Moonshot de verdade com arquivos, você não consegue honestamente dar ollama pull do K3 completo.
  2. A escala é ~2.8T parâmetros com esparsidade estilo MoE (oficial: ativa 16 de 896 experts). Isso ajuda eficiência de serving em relação a um denso de 2.8T—não transforma o K3 em brinquedo de notebook de 24GB.
  3. A própria nota de serving da Moonshot aponta para deploy estilo supernode com 64+ aceleradores. Leia assim: formato datacenter, não “uma placa gamer e um sonho.”
  4. O que funciona hoje: kimi.com, Kimi Work, Kimi Code e o model id da API kimi-k3 em platform.kimi.ai. Para pesos open que já dão pra baixar, fique na família K2.6 / K2.7 Code—não no K3.

Uma frase: use a API ou o app esta semana; trate o K3 local como evento de fim de julho que você revalida, não como comando que roda hoje à noite.

Card de lançamento open-weights do Kimi K3: 2.8T parâmetros, contexto 1M, pesos planejados para 27 de julho

Fonte: compartilhamento comunitário da mensagem oficial de lançamento do K3; confira de novo o blog técnico do Kimi K3, Moonshot AI, 16 de julho de 2026.

O que as pessoas de fato buscam (quatro intenções diferentes)

Os buscadores amassam isso num blob só. Separe:

O que você digitouO que você provavelmente querDisponível hoje?
kimi k3 huggingface / downloadArquivos oficiais de pesosNão como checkpoint público fechado do K3 (reconfira perto de 27 de julho)
kimi k3 ollama / ggufChat local num comandoAinda não—precisa de pesos + empacotamento da comunidade/runtime
kimi k3 vram / requisitos locais“Minha GPU aguenta?”Sem tabela fixa honesta de GB ainda—só escala + orientação multi-acelerador oficial
kimi k3 self hostRodar na sua VPC/clusterDepois dos pesos + suporte da stack (vLLM / parceiros); planeje ferro de classe cluster

Se sobrar só uma linha: intenção de download ≠ intenção de Ollama ≠ “grátis ilimitado no meu PC.”

Para o calendário mais amplo de open weights (não só hardware local), veja o post open weights 27 de julho. Esta página aprofunda a realidade de Ollama / VRAM / self-host.

O que a Moonshot de fato disse (trechos relevantes pro local)

Do anúncio oficial do Kimi K3 (16 de julho de 2026):

FatoPor que quem roda local se importa
2.8T parâmetros, primeira alegação open de classe 3TSeu modelo mental de “modelo open grande” subiu de novo
Contexto de 1M tokens, visão nativaContexto longo + multimodalidade aumentam dor de memória e I/O no self-host
MoE: efetivamente 16 de 896 experts + enquadramento Stable LatentMoEAtivação esparsa ajuda compute, não mágica de “notebook cabe nos params totais”
Quantization-aware training: pesos MXFP4 / ativações MXFP8 (redação deles)Sugere que eles se importam com serving eficiente—não é card de quant consumer publicado
Pesos completos até 27 de julho de 2026 + tech report por volta dissoEvento de calendário, não botão de download hoje
Alinhamento com parceiros de inferência e mantenedores open-sourceEspere lag da stack (vLLM etc.) mesmo depois dos arquivos aparecerem
Recomendam deploy estilo supernode com 64+ aceleradoresO reality check oficial de hardware mais próximo—não guia de instalação em 4090

Preço de lista da API (USD / 1M tokens) enquanto espera: input cache-hit $0.30, input cache-miss $3.00, output $15.00. No lançamento o thinking é esforço max por padrão—prompts curtos ainda podem queimar tokens sérios de raciocínio.

Chart oficial de benchmark de coding do Kimi K3 (esforço max)

Fonte: mídia oficial de lançamento do K3 / blog do Kimi K3, 16 de julho de 2026.

Realidade de VRAM (sem tabela falsa de GB)

O povo quer um chart limpinho: “Q4 = XX GB, Q5 = YY GB, precisa de 2×H100.”

Não vamos inventar um.

Por que seria desonesto agora:

  • Os pesos públicos completos do K3 ainda não estão confirmados em disco para a comunidade.
  • A receita oficial de quant pro seu setup não é uma página de produto consumer fechada.
  • Builds comunitários GGUF/AWQ/EXL2—se aparecerem—costumam atrasar o dump do dia 0, e a qualidade varia.
  • Experts ativados ≠ parâmetros totais no disco. Esparsidade MoE pode cortar compute ativo; não significa automaticamente “só armazena 16 experts.”

O que você pode usar como reality check:

  1. 2.8T total está em outro universo de “coder open pequeno que roda em notebook.”
  2. A recomendação de 64+ aceleradores da Moonshot é o formato de serving da própria empresa para throughput competitivo—não nota de rodapé de hobby.
  3. Se você ainda não opera clusters multi-nó de GPU (ou paga quem opera), seus caminhos práticos são API, apps de produto ou host gerenciado futuro—não “vou quantizar no fim de semana e esquecer a conta de luz.”

Quando os pesos aterrissarem, os artefatos úteis serão: id do repo, LICENSE, tamanhos de arquivo, notas oficiais de serving, endpoints de parceiros e primeiros READMEs de quant confiáveis. Enquanto isso não existir, qualquer post de “VRAM exata do K3 numa 5090” é fanfic.

Ollama, GGUF e o cronograma de “como rodar local”

Hoje (21 de julho de 2026):

  • Nenhuma entrada verificada da biblioteca Ollama pro Kimi K3 completo em que a gente aponte com confiança.
  • Packs GGUF exigem pesos base + pipeline de conversão + alguém publicando. Nada disso está “pronto” até o dump oficial (e tooling da comunidade) existirem.
  • Modelos open mais antigos da Kimi (por exemplo K2.6, K2.7 Code) são os que você já consegue puxar do Hugging Face e plugar em stacks locais—não confunda as tags deles com K3.

Depois que os pesos caírem (olhe o calendário, não comemore antes):

  1. Confirme um repo da Moonshot (ou claramente oficial) com arquivos de verdade—não placeholder, não mirror com nome esquisito.
  2. Leia a LICENSE desse repo (linhas open anteriores da Kimi costumavam usar licença estilo Modified MIT; o K3 não está fechado até o arquivo sair).
  3. Cheque notas de suporte de vLLM / SGLang / outros—a Moonshot já disse que alinhamento de ecossistema importa pra arquitetura do K3 (incluindo trabalho de serving ligado a KDA mencionado no blog deles).
  4. Só então procure ports comunitários de Ollama / GGUF. Espere dias a semanas de lag para blogs “funciona na minha máquina,” e mais tempo para quants de qualidade.
  5. Reavalie custo: cluster self-host + energia + ops vs API $3/$15 (mais hits de cache). Muitos times vão manter API pro pico de inteligência e hospedar modelos open menores pro volume offline.

Chart oficial de benchmark de agentes / capacidade geral do Kimi K3 no lançamento

Fonte: mídia oficial de lançamento do K3 / blog do Kimi K3, 16 de julho de 2026.

Checklist de 27 de julho (pra quem quer local / self-host)

Use isto só quando algo real aparecer—não como convite de festa pra calendário vazio.

  • Confirmação oficial de que os pesos saíram (blog/X/HF), não só “em breve”
  • Hugging Face (ou outro) repo sob Moonshot com shards baixáveis
  • LICENSE lida de ponta a ponta
  • README: caminho de serving (vLLM / outro), limites conhecidos, notas multimodais
  • Tamanhos de arquivo / opções de quant listados por alguém credível (prefira oficial ou hosts grandes primeiro)
  • Se Ollama / llama.cpp / etc. tem caminho real e versionado de suporte
  • Sua árvore de decisão: API por padrão vs host gerenciado vs cluster self-host
  • Orçamento de tempo de ops—não só de GPUs

Vamos acompanhar o status de alto nível em /pt/kimi-k3-status. Confie em fontes primárias mais do que em print.

O que rodar esta semana no lugar

Seu objetivoFaça isto
Sentir qualidade K3 numa tarefa duraApp / API kimi-k3 com orçamento piloto fixo
Entregar código todo diaKimi Code + mantenha o caminho K2.7 Code quente
Ficar local agoraSelf-host pesos já open de K2.x (K2.6 / K2.7 Code)—não K3
Experimentos de produto “grátis”Veja opções grátis honestas—cotas de produto ≠ API grátis ≠ self-host grátis
Qual SKU pra qual jobK2.6 vs K2.7 vs K3

Se cadastros novos ou capacidade de membership estiverem apertados (a Moonshot gerenciou picos de demanda em público depois do lançamento), API e caminhos de acesso existentes ainda importam mais do que um binário local que não existe.

Filtros de ruído (edição local)

“Já está no Ollama.”
Trate nomes de biblioteca não verificados e tags de mirror como suspeitos até apontarem pra um checkpoint Moonshot real (ou claramente derivado) e um guia de execução que funciona.

“Open weights = K3 local grátis e ilimitado.”
Open weights tiram um portão do vendor. Não tiram física, eletricidade, ops multi-GPU nem limites de licença.

“MoE significa que minha placa de 24GB dá.”
Esparsidade ajuda compute ativo. Storage total, roteamento de experts, contexto longo e visão ainda doem. A orientação oficial de serving é multi-acelerador.

“O card no HF chamado kimi-k3 tem que ser oficial.”
Cheque org, arquivos, licença, link do anúncio. Prefira huggingface.co/moonshotai a renomes aleatórios.

“Vou só esperar e pular a API pra sempre.”
Ok pra curiosidade de pesquisa. Ruim pra prazo de produto. Pilote K3 onde raciocínio premium paga; mantenha SKUs mais baratos/open pro volume.

FAQ

Dá pra baixar o Kimi K3 hoje?
Planeje não para um dump público oficial completo em 21 de julho de 2026. Promessa oficial: pesos completos até 27 de julho de 2026. Reconfira a org da Moonshot e o blog do K3.

Dá pra rodar Kimi K3 no Ollama hoje?
Não de forma confiável e completa que a gente recomende. Sem pesos → sem caminho honesto de Ollama.

Quanto de VRAM eu preciso?
Desconhecido como número consumer preciso. Use a escala oficial + orientação de serving com 64+ aceleradores como checagem de sanidade: se você ainda não roda GPUs em cluster, orce API ou inferência hospedada.

K3 é open source ou open weight?
A linguagem de lançamento enfatiza open weights pra um modelo de classe 3T. O texto final da licença sai com os arquivos—leia depois. “Open” na manchete não substitui LICENSE.

E os modelos K2 localmente?
Linhas open anteriores da Kimi (ex.: K2.6, K2.7 Code) são as opções práticas de self-host hoje. Não cole uma tag K2 no script e chame de K3.

Este site é oficial da Moonshot?
Não. Confira de novo kimi.com/blog/kimi-k3 e platform.kimi.ai antes de gastar dinheiro ou rackear hardware.

Resumo final

Quem busca local não está louco—a demanda por HF / download / Ollama / VRAM é real. O que falta é o artefato: uma release pública de pesos do K3 que você consiga verificar, mais uma stack que de fato carregue.

Até isso aterrissar, a jogada inteligente é chata:

  • Pilote o K3 no produto ou na API onde uma tarefa dura vale a conta de tokens.
  • Faça self-host dos modelos open K2.x que você já consegue puxar se precisar de ferro offline.
  • Ignore guias de “instale o K3 no notebook hoje à noite” que nunca mostram um repo real.
  • Reconfira por volta de 27 de julho—com o checklist acima, não só com esperança.

Próximas leituras: open weights 27 de julho · guia de lançamento do K3 · opções grátis · qual modelo · hub de status.

Artigos relacionados

Quer Kimi K3 sem fatura pesada? O que é grátis hoje—recompensas de cadastro, limites do free tier, o que ainda custa, e o que “open weights em 27 de julho” muda de verdade.
Kimi K3 vs Claude e GPT não é “apague suas API keys”. A regra prática de troca—preço de lista, sinais de coding e quando ficar no Sonnet ou no Sol.
O feed grita “modelo open de 3T”, mas o Hugging Face ainda está vazio. O que a Moonshot prometeu para 27/07 — e o que rodar esta semana sem fantasiar GPU de notebook.