Kimi K3 Ollama·VRAM: 지금 로컬에서 돌릴 수 있나?
Kimi K3 허브: 사양·가격·API id → /ko/kimi-k3. 타임라인 → /ko/kimi-k3-status. 오픈 웨이트 일정 → 7월 27일 현실 점검.
kimi k3 ollama, kimi k3 vram, **kimi k3 download**를 검색창에 넣은 이유가 있을 겁니다. 피드가 「오픈」이라고 해서 Hugging Face나 Ollama 라이브러리를 열었는데… 깔끔한 설치 경로가 없습니다.
그건 당신 잘못이 아닙니다. **마케팅용 「오픈」**과 실제로 로드할 수 있는 파일 사이의 간극입니다.
이 가이드는 로컬 질문만 답합니다. 지금 내 머신에서 Kimi K3를 돌릴 수 있나? VRAM은 얼마? Ollama/GGUF는 언제? 이번 주에는 뭘 써야 하나?
이 사이트는 Moonshot과 무관한 독립 사이트입니다. 아래 사실은 2026년 7월 21일 기준 공개 문서를 따릅니다—GPU를 사거나 랜덤 레포를 믿기 전에 공식 K3 블로그와 Hugging Face의 Moonshot을 다시 확인하세요.
한 줄 요약 (먼저 읽기)
- 아직 신뢰할 수 있는 공개 풀 웨이트 덤프는 없습니다 (작성 시점 기준). 제품·API는 살아 있고, 회사는 2026년 7월 27일까지 전체 웨이트를 말했습니다. 실제 파일이 있는 Moonshot 레포가 나오기 전까지는 풀 K3를 정직하게
ollama pull할 수 없습니다. - 규모는 약 2.8T 파라미터, MoE 스타일 희소성(공식: 896개 중 16개 전문가 활성). 밀집 2.8T 대비 서빙 효율에는 도움이 될 수 있지만, K3를 24GB 노트북 장난감으로 만들지는 않습니다.
- Moonshot 자체 서빙 노트는 가속기 64+대 규모의 슈퍼노드형 배포를 가리킵니다. 해석하면: 데이터센터 형태이지, 「게이밍 카드 한 장과 꿈」이 아닙니다.
- 오늘 되는 것: kimi.com, Kimi Work, Kimi Code, 그리고 platform.kimi.ai의 API 모델 id
kimi-k3. 이미 받을 수 있는 오픈 웨이트는 K2.6 / K2.7 Code 계열 카드—K3가 아닙니다.
한 문장: 이번 주는 API나 앱을 쓰고, 로컬 K3는 7월 말 이벤트로 재검증할 대상이지, 오늘 밤 되는 명령이 아닙니다.

출처: 공식 K3 론칭 메시지의 커뮤니티 공유; Kimi K3 테크 블로그, Moonshot AI, 2026년 7월 16일과 교차 확인.
사람들이 실제로 검색하는 것 (서로 다른 네 가지 일)
검색엔진은 이걸 한 덩어리로 뭉갭니다. 나누면:
| 검색어 | 실제로 원하는 것 | 오늘 가능? |
|---|---|---|
| kimi k3 huggingface / download | 공식 웨이트 파일 | 완성된 공개 K3 체크포인트로는 아직 아님 (7월 27일 전후 재확인) |
| kimi k3 ollama / gguf | 한 줄 명령 로컬 채팅 | 아직 아님—웨이트 + 커뮤니티/런타임 패키징 필요 |
| kimi k3 vram / local requirements | 「내 GPU에 들어가나?」 | 정직한 고정 GB 표는 아직 없음—규모 + 공식 멀티 가속기 가이드만 |
| kimi k3 self host | 내 VPC/클러스터에서 돌리기 | 웨이트 + 스택 지원(vLLM / 파트너) 이후; 클러스터급 장비로 계획 |
한 행만 기억한다면: 다운로드 의도 ≠ Ollama 의도 ≠ 「내 PC에서 무료 무제한」.
오픈 웨이트 일정 전반(로컬 하드웨어만이 아님)은 오픈 웨이트 7월 27일 글을 보세요. 이 페이지는 Ollama / VRAM / 셀프호스트 현실을 더 깊게 다룹니다.
Moonshot이 실제로 말한 것 (로컬 관련 부분)
공식 Kimi K3 발표 (2026년 7월 16일)에서:
| 사실 | 로컬 사용자가 신경 쓰는 이유 |
|---|---|
| 2.8T 파라미터, 오픈 3T급 최초 주장 | 「큰 오픈 모델」의 멘탈 모델이 다시 점프함 |
| 1M 토큰 컨텍스트, 네이티브 비전 | 긴 컨텍스트 + 멀티모달이 셀프호스트 시 메모리·I/O 부담을 키움 |
| MoE: 실질 896개 중 16개 전문가 + Stable LatentMoE 프레임 | 희소 활성은 연산에 도움—「총 파라미터가 노트북에 들어간다」는 마법이 아님 |
| 양자화 인지 학습: MXFP4 웨이트 / MXFP8 활성화 (그들 표현) | 효율 서빙을 신경 쓴다는 신호—소비자용 양자화 카드 공개가 아님 |
| 전체 웨이트 2026년 7월 27일까지 + 그 무렵 기술 리포트 | 캘린더 이벤트이지, 오늘 다운로드 버튼이 아님 |
| 추론 파트너·오픈소스 유지자와 정렬 | 파일이 나와도 스택 지연(vLLM 등)을 예상 |
| 가속기 64+ 슈퍼노드형 배포 권장 | 가장 가까운 공식 하드웨어 감—4090 설치 가이드가 아님 |
기다리는 동안 API 리스트 가격(USD / 1M 토큰): 캐시 히트 입력 $0.30, 캐시 미스 입력 $3.00, 출력 $15.00. 출시 시점 thinking은 기본 max effort—짧은 프롬프트도 추론 토큰을 꽤 태울 수 있습니다.

출처: 공식 K3 론칭 미디어 / Kimi K3 블로그, 2026년 7월 16일.
VRAM 현실 (가짜 GB 표 없이)
사람들은 깔끔한 차트를 원합니다. 「Q4 = XX GB, Q5 = YY GB, 2×H100 필요.」
우리는 그걸 지어내지 않습니다.
지금 그게 부정직한 이유:
- 커뮤니티용 공개 K3 풀 웨이트가 디스크에 아직 확인되지 않았습니다.
- 당신 머신용 공식 양자화 레시피가 완성된 소비자 제품 페이지가 아닙니다.
- 커뮤니티 GGUF/AWQ/EXL2 빌드—나온다면—보통 day-0 덤프보다 늦고, 품질도 제각각입니다.
- 활성 전문가 수 ≠ 디스크에 있는 총 파라미터. MoE 희소성은 활성 연산을 줄일 수 있지만, 「16개 전문가만 저장하면 된다」는 뜻이 자동으로 성립하지 않습니다.
쓸 수 있는 현실 체크:
- 총 2.8T는 「노트북에서 도는 작은 오픈 코더」와 다른 우주에 있습니다.
- Moonshot의 가속기 64+ 권장은 경쟁력 있는 처리량용 회사 자체 서빙 형태이지, 취미 각주가 아닙니다.
- 이미 멀티노드 GPU 클러스터를 운영하지 않는다면(또는 그걸 하는 사람에게 비용을 내지 않는다면), 현실 경로는 API, 제품 앱, 또는 미래 매니지드 호스트이지, 「주말에 양자화하고 전기세는 잊자」가 아닙니다.
웨이트가 내려오면 유용한 아티팩트는 이겁니다: 레포 id, LICENSE, 파일 크기, 공식 서빙 노트, 파트너 엔드포인트, 첫 번째 믿을 만한 양자화 README. 그게 있기 전까지 「5090에서 K3 정확한 VRAM」 글은 팬픽션입니다.
Ollama, GGUF, 「로컬 실행」 타임라인
오늘 (2026년 7월 21일):
- 풀 Kimi K3용으로 자신 있게 가리킬 검증된 원샷 Ollama 라이브러리 항목은 없습니다.
- GGUF 팩은 베이스 웨이트 + 변환 파이프라인 + 누군가의 공개가 필요합니다. 공식 덤프(와 커뮤니티 툴링)가 있기 전까지 「끝」이 아닙니다.
- 이전 Kimi 오픈 모델(예: K2.6, K2.7 Code)이 Hugging Face에서 받아 로컬 스택에 꽂을 수 있는 것들입니다—그 태그를 K3와 혼동하지 마세요.
웨이트 공개 후 (캘린더를 보고, 미리 축하하지 말 것):
- 실제 파일이 있는 Moonshot 소유(또는 분명히 공식) 레포를 확인—플레이스홀더, 이상한 이름 미러 말고.
- 그 레포의 LICENSE를 읽으세요 (이전 Kimi 오픈 라인은 Modified MIT 계열을 자주 썼습니다; K3는 파일이 나올 때까지 확정이 아닙니다).
- vLLM / SGLang / 기타 지원 노트를 확인—Moonshot은 이미 생태계 정렬이 K3 아키텍처에 중요하다고 했습니다(블로그의 KDA 관련 서빙 작업 포함).
- 그다음에야 Ollama / GGUF 커뮤니티 포트를 보세요. 「내 머신에서 된다」 블로그는 며칠~몇 주 지연, 품질 좋은 양자화는 더 길 수 있습니다.
- 비용을 다시 계산: 셀프호스트 클러스터 + 전력 + 운영 vs API $3/$15(캐시 히트 포함). 많은 팀은 피크 지능은 API, 오프라인 대량은 더 작은 오픈 모델로 둘 겁니다.

출처: 공식 K3 론칭 미디어 / Kimi K3 블로그, 2026년 7월 16일.
7월 27일 체크리스트 (로컬 / 셀프호스트용)
무언가 진짜가 나왔을 때만 쓰세요—빈 캘린더 파티 초대장이 아닙니다.
- 웨이트 공개 공식 확인 (블로그/X/HF), 「곧」만이 아님
- Moonshot 아래 Hugging Face(또는 기타) 다운로드 가능한 샤드 레포
- LICENSE 끝까지 읽음
- README: 서빙 경로(vLLM / 기타), 알려진 한계, 멀티모달 노트
- 파일 크기 / 양자화 옵션을 믿을 만한 누군가가 나열 (우선 공식 또는 대형 호스트)
- Ollama / llama.cpp / 등에 실제 버전 있는 지원 경로가 있는지
- 결정 트리: API 기본 vs 매니지드 호스트 vs 셀프호스트 클러스터
- 운영 시간 예산—GPU만이 아님
상위 상태는 /ko/kimi-k3-status에서 추적합니다. 스크린샷보다 1차 소스를 믿으세요.
이번 주에 대신 돌릴 것
| 목표 | 이렇게 |
|---|---|
| 어려운 작업에서 K3 품질 체감 | 앱 / kimi-k3 API, 파일럿 예산 고정 |
| 매일 코드 배포 | Kimi Code + K2.7 Code 경로 유지 |
| 지금 로컬 유지 | 이미 오픈된 K2.x 웨이트 셀프호스트 (K2.6 / K2.7 Code)—K3 아님 |
| 「무료」 제품 실험 | 솔직한 무료 옵션—제품 쿼터 ≠ 무료 API ≠ 무료 셀프호스트 |
| 어떤 SKU를 어떤 일에 | K2.6 vs K2.7 vs K3 |
신규 가입·멤버십 용량이 빡빡해도(Moonshot은 출시 후 수요 급증을 공개적으로 관리해 왔습니다), 없는 로컬 바이너리보다 API와 기존 접근 경로가 더 중요합니다.
노이즈 필터 (로컬 에디션)
「이미 Ollama에 있다.」
검증 안 된 라이브러리 이름·미러 태그는, 실제 Moonshot(또는 명확히 파생된) 체크포인트와 동작하는 런북을 가리키기 전까지 의심하세요.
「오픈 웨이트 = 무료 무제한 로컬 K3.」
오픈 웨이트는 벤더 게이트를 없앱니다. 물리, 전기, 멀티 GPU 운영, 라이선스 제한을 없애지는 않습니다.
「MoE니까 24GB 카드면 된다.」
희소성은 활성 연산에 도움입니다. 총 저장, 전문가 라우팅, 긴 컨텍스트, 비전은 여전히 아픕니다. 공식 서빙 가이드는 멀티 가속기입니다.
「이름이 kimi-k3인 HF 카드면 공식이겠지.」
org, 파일, 라이선스, 발표 링크를 확인하세요. 랜덤 개명보다 huggingface.co/moonshotai를 우선하세요.
「기다리면 되고 API는 영원히 스킵.」
연구 호기심에는 괜찮습니다. 제품 데드라인에는 나쁩니다. 프리미엄 추론이 값어치 있는 곳에서 K3를 파일럿하고, 대량은 더 싸거나 오픈한 SKU를 유지하세요.
FAQ
오늘 Kimi K3를 다운로드할 수 있나?
2026년 7월 21일 기준 완성된 공식 공개 덤프는 없다고 보시면 됩니다. 공식 약속: 2026년 7월 27일까지 전체 웨이트. Moonshot org와 K3 블로그를 다시 확인하세요.
오늘 Ollama에서 Kimi K3를 돌릴 수 있나?
신뢰할 수 있는 완성 형태로 추천할 수 있는 건 없습니다. 웨이트 없음 → 정직한 Ollama 경로 없음.
VRAM은 얼마나 필요하나?
정밀한 소비자용 숫자로는 모름. 공식 규모 + 가속기 64+ 서빙 가이드를 감으로 쓰세요: 이미 클러스터 GPU를 돌리지 않는다면 API 또는 호스팅 추론 예산을 잡으세요.
K3는 오픈소스인가 오픈 웨이트인가?
론칭 언어는 3T급 모델의 오픈 웨이트를 강조합니다. 최종 라이선스 텍스트는 파일과 함께 옵니다—그때 읽으세요. 헤드라인의 「오픈」은 LICENSE 대체재가 아닙니다.
K2 모델은 로컬에서?
이전 오픈 Kimi 라인(예: K2.6, K2.7 Code)이 오늘 실질 셀프호스트 옵션입니다. 스크립트에 K2 태그를 붙여 K3라고 부르지 마세요.
이 사이트는 공식 Moonshot인가?
아닙니다. 돈 쓰거나 랙 올리기 전에 kimi.com/blog/kimi-k3와 platform.kimi.ai를 교차 확인하세요.
정리
로컬을 찾는 사람이 이상한 게 아닙니다—HF / download / Ollama / VRAM 수요는 진짜입니다. 없는 것은 아티팩트: 검증 가능한 공개 K3 웨이트 릴리스, 그리고 그걸 실제로 로드하는 스택입니다.
그게 오기 전까지 똑똑한 선택은 밋밋합니다:
- 어려운 작업이 토큰 값을 하는 곳에서 제품·API로 K3 파일럿.
- 오프라인 장비가 필요하면 이미 받을 수 있는 오픈 K2.x를 셀프호스트.
- 실제 레포를 보여 주지 않는 「오늘 밤 노트북에 K3 설치」 가이드는 무시.
- 7월 27일 전후 재확인—희망만이 아니라 위 체크리스트로.
다음 읽기: 오픈 웨이트 7월 27일 · K3 출시 가이드 · 무료 옵션 · 어떤 모델 · 상태 허브.