Kimi K3 no Ollama e VRAM: dá pra rodar local ainda?
Hub Kimi K3: Specs, preço, id da API → /pt/kimi-k3. Timeline → /pt/kimi-k3-status. Calendário de open weights → reality check de 27 de julho.
Você digitou kimi k3 ollama, kimi k3 vram ou kimi k3 download porque o feed disse que o modelo é “open.” Aí abriu o Hugging Face ou a biblioteca do Ollama e… nenhum caminho limpo de instalação.
Esse buraco não é culpa sua. É a diferença entre “open” de marketing e arquivos que você de fato consegue carregar.
Este guia responde só as perguntas locais: Dá pra rodar Kimi K3 na sua máquina ainda? Quanto de VRAM? Quando Ollama/GGUF aparecem? O que fazer esta semana no lugar?
Este site é independente da Moonshot. Os fatos abaixo acompanham docs públicos em 21 de julho de 2026—confira de novo o blog oficial do K3 e a Moonshot no Hugging Face antes de comprar GPU ou confiar em repo aleatório.
Resposta curta (leia isto primeiro)
- Ainda não há dump público confiável dos pesos completos do K3 (nesta data). Produto + API estão no ar; a empresa falou em pesos completos até 27 de julho de 2026. Enquanto não existir um repo Moonshot de verdade com arquivos, você não consegue honestamente dar
ollama pulldo K3 completo. - A escala é ~2.8T parâmetros com esparsidade estilo MoE (oficial: ativa 16 de 896 experts). Isso ajuda eficiência de serving em relação a um denso de 2.8T—não transforma o K3 em brinquedo de notebook de 24GB.
- A própria nota de serving da Moonshot aponta para deploy estilo supernode com 64+ aceleradores. Leia assim: formato datacenter, não “uma placa gamer e um sonho.”
- O que funciona hoje: kimi.com, Kimi Work, Kimi Code e o model id da API
kimi-k3em platform.kimi.ai. Para pesos open que já dão pra baixar, fique na família K2.6 / K2.7 Code—não no K3.
Uma frase: use a API ou o app esta semana; trate o K3 local como evento de fim de julho que você revalida, não como comando que roda hoje à noite.

Fonte: compartilhamento comunitário da mensagem oficial de lançamento do K3; confira de novo o blog técnico do Kimi K3, Moonshot AI, 16 de julho de 2026.
O que as pessoas de fato buscam (quatro intenções diferentes)
Os buscadores amassam isso num blob só. Separe:
| O que você digitou | O que você provavelmente quer | Disponível hoje? |
|---|---|---|
| kimi k3 huggingface / download | Arquivos oficiais de pesos | Não como checkpoint público fechado do K3 (reconfira perto de 27 de julho) |
| kimi k3 ollama / gguf | Chat local num comando | Ainda não—precisa de pesos + empacotamento da comunidade/runtime |
| kimi k3 vram / requisitos locais | “Minha GPU aguenta?” | Sem tabela fixa honesta de GB ainda—só escala + orientação multi-acelerador oficial |
| kimi k3 self host | Rodar na sua VPC/cluster | Depois dos pesos + suporte da stack (vLLM / parceiros); planeje ferro de classe cluster |
Se sobrar só uma linha: intenção de download ≠ intenção de Ollama ≠ “grátis ilimitado no meu PC.”
Para o calendário mais amplo de open weights (não só hardware local), veja o post open weights 27 de julho. Esta página aprofunda a realidade de Ollama / VRAM / self-host.
O que a Moonshot de fato disse (trechos relevantes pro local)
Do anúncio oficial do Kimi K3 (16 de julho de 2026):
| Fato | Por que quem roda local se importa |
|---|---|
| 2.8T parâmetros, primeira alegação open de classe 3T | Seu modelo mental de “modelo open grande” subiu de novo |
| Contexto de 1M tokens, visão nativa | Contexto longo + multimodalidade aumentam dor de memória e I/O no self-host |
| MoE: efetivamente 16 de 896 experts + enquadramento Stable LatentMoE | Ativação esparsa ajuda compute, não mágica de “notebook cabe nos params totais” |
| Quantization-aware training: pesos MXFP4 / ativações MXFP8 (redação deles) | Sugere que eles se importam com serving eficiente—não é card de quant consumer publicado |
| Pesos completos até 27 de julho de 2026 + tech report por volta disso | Evento de calendário, não botão de download hoje |
| Alinhamento com parceiros de inferência e mantenedores open-source | Espere lag da stack (vLLM etc.) mesmo depois dos arquivos aparecerem |
| Recomendam deploy estilo supernode com 64+ aceleradores | O reality check oficial de hardware mais próximo—não guia de instalação em 4090 |
Preço de lista da API (USD / 1M tokens) enquanto espera: input cache-hit $0.30, input cache-miss $3.00, output $15.00. No lançamento o thinking é esforço max por padrão—prompts curtos ainda podem queimar tokens sérios de raciocínio.

Fonte: mídia oficial de lançamento do K3 / blog do Kimi K3, 16 de julho de 2026.
Realidade de VRAM (sem tabela falsa de GB)
O povo quer um chart limpinho: “Q4 = XX GB, Q5 = YY GB, precisa de 2×H100.”
Não vamos inventar um.
Por que seria desonesto agora:
- Os pesos públicos completos do K3 ainda não estão confirmados em disco para a comunidade.
- A receita oficial de quant pro seu setup não é uma página de produto consumer fechada.
- Builds comunitários GGUF/AWQ/EXL2—se aparecerem—costumam atrasar o dump do dia 0, e a qualidade varia.
- Experts ativados ≠ parâmetros totais no disco. Esparsidade MoE pode cortar compute ativo; não significa automaticamente “só armazena 16 experts.”
O que você pode usar como reality check:
- 2.8T total está em outro universo de “coder open pequeno que roda em notebook.”
- A recomendação de 64+ aceleradores da Moonshot é o formato de serving da própria empresa para throughput competitivo—não nota de rodapé de hobby.
- Se você ainda não opera clusters multi-nó de GPU (ou paga quem opera), seus caminhos práticos são API, apps de produto ou host gerenciado futuro—não “vou quantizar no fim de semana e esquecer a conta de luz.”
Quando os pesos aterrissarem, os artefatos úteis serão: id do repo, LICENSE, tamanhos de arquivo, notas oficiais de serving, endpoints de parceiros e primeiros READMEs de quant confiáveis. Enquanto isso não existir, qualquer post de “VRAM exata do K3 numa 5090” é fanfic.
Ollama, GGUF e o cronograma de “como rodar local”
Hoje (21 de julho de 2026):
- Nenhuma entrada verificada da biblioteca Ollama pro Kimi K3 completo em que a gente aponte com confiança.
- Packs GGUF exigem pesos base + pipeline de conversão + alguém publicando. Nada disso está “pronto” até o dump oficial (e tooling da comunidade) existirem.
- Modelos open mais antigos da Kimi (por exemplo K2.6, K2.7 Code) são os que você já consegue puxar do Hugging Face e plugar em stacks locais—não confunda as tags deles com K3.
Depois que os pesos caírem (olhe o calendário, não comemore antes):
- Confirme um repo da Moonshot (ou claramente oficial) com arquivos de verdade—não placeholder, não mirror com nome esquisito.
- Leia a LICENSE desse repo (linhas open anteriores da Kimi costumavam usar licença estilo Modified MIT; o K3 não está fechado até o arquivo sair).
- Cheque notas de suporte de vLLM / SGLang / outros—a Moonshot já disse que alinhamento de ecossistema importa pra arquitetura do K3 (incluindo trabalho de serving ligado a KDA mencionado no blog deles).
- Só então procure ports comunitários de Ollama / GGUF. Espere dias a semanas de lag para blogs “funciona na minha máquina,” e mais tempo para quants de qualidade.
- Reavalie custo: cluster self-host + energia + ops vs API $3/$15 (mais hits de cache). Muitos times vão manter API pro pico de inteligência e hospedar modelos open menores pro volume offline.

Fonte: mídia oficial de lançamento do K3 / blog do Kimi K3, 16 de julho de 2026.
Checklist de 27 de julho (pra quem quer local / self-host)
Use isto só quando algo real aparecer—não como convite de festa pra calendário vazio.
- Confirmação oficial de que os pesos saíram (blog/X/HF), não só “em breve”
- Hugging Face (ou outro) repo sob Moonshot com shards baixáveis
- LICENSE lida de ponta a ponta
- README: caminho de serving (vLLM / outro), limites conhecidos, notas multimodais
- Tamanhos de arquivo / opções de quant listados por alguém credível (prefira oficial ou hosts grandes primeiro)
- Se Ollama / llama.cpp / etc. tem caminho real e versionado de suporte
- Sua árvore de decisão: API por padrão vs host gerenciado vs cluster self-host
- Orçamento de tempo de ops—não só de GPUs
Vamos acompanhar o status de alto nível em /pt/kimi-k3-status. Confie em fontes primárias mais do que em print.
O que rodar esta semana no lugar
| Seu objetivo | Faça isto |
|---|---|
| Sentir qualidade K3 numa tarefa dura | App / API kimi-k3 com orçamento piloto fixo |
| Entregar código todo dia | Kimi Code + mantenha o caminho K2.7 Code quente |
| Ficar local agora | Self-host pesos já open de K2.x (K2.6 / K2.7 Code)—não K3 |
| Experimentos de produto “grátis” | Veja opções grátis honestas—cotas de produto ≠ API grátis ≠ self-host grátis |
| Qual SKU pra qual job | K2.6 vs K2.7 vs K3 |
Se cadastros novos ou capacidade de membership estiverem apertados (a Moonshot gerenciou picos de demanda em público depois do lançamento), API e caminhos de acesso existentes ainda importam mais do que um binário local que não existe.
Filtros de ruído (edição local)
“Já está no Ollama.”
Trate nomes de biblioteca não verificados e tags de mirror como suspeitos até apontarem pra um checkpoint Moonshot real (ou claramente derivado) e um guia de execução que funciona.
“Open weights = K3 local grátis e ilimitado.”
Open weights tiram um portão do vendor. Não tiram física, eletricidade, ops multi-GPU nem limites de licença.
“MoE significa que minha placa de 24GB dá.”
Esparsidade ajuda compute ativo. Storage total, roteamento de experts, contexto longo e visão ainda doem. A orientação oficial de serving é multi-acelerador.
“O card no HF chamado kimi-k3 tem que ser oficial.”
Cheque org, arquivos, licença, link do anúncio. Prefira huggingface.co/moonshotai a renomes aleatórios.
“Vou só esperar e pular a API pra sempre.”
Ok pra curiosidade de pesquisa. Ruim pra prazo de produto. Pilote K3 onde raciocínio premium paga; mantenha SKUs mais baratos/open pro volume.
FAQ
Dá pra baixar o Kimi K3 hoje?
Planeje não para um dump público oficial completo em 21 de julho de 2026. Promessa oficial: pesos completos até 27 de julho de 2026. Reconfira a org da Moonshot e o blog do K3.
Dá pra rodar Kimi K3 no Ollama hoje?
Não de forma confiável e completa que a gente recomende. Sem pesos → sem caminho honesto de Ollama.
Quanto de VRAM eu preciso?
Desconhecido como número consumer preciso. Use a escala oficial + orientação de serving com 64+ aceleradores como checagem de sanidade: se você ainda não roda GPUs em cluster, orce API ou inferência hospedada.
K3 é open source ou open weight?
A linguagem de lançamento enfatiza open weights pra um modelo de classe 3T. O texto final da licença sai com os arquivos—leia depois. “Open” na manchete não substitui LICENSE.
E os modelos K2 localmente?
Linhas open anteriores da Kimi (ex.: K2.6, K2.7 Code) são as opções práticas de self-host hoje. Não cole uma tag K2 no script e chame de K3.
Este site é oficial da Moonshot?
Não. Confira de novo kimi.com/blog/kimi-k3 e platform.kimi.ai antes de gastar dinheiro ou rackear hardware.
Resumo final
Quem busca local não está louco—a demanda por HF / download / Ollama / VRAM é real. O que falta é o artefato: uma release pública de pesos do K3 que você consiga verificar, mais uma stack que de fato carregue.
Até isso aterrissar, a jogada inteligente é chata:
- Pilote o K3 no produto ou na API onde uma tarefa dura vale a conta de tokens.
- Faça self-host dos modelos open K2.x que você já consegue puxar se precisar de ferro offline.
- Ignore guias de “instale o K3 no notebook hoje à noite” que nunca mostram um repo real.
- Reconfira por volta de 27 de julho—com o checklist acima, não só com esperança.
Próximas leituras: open weights 27 de julho · guia de lançamento do K3 · opções grátis · qual modelo · hub de status.