Guides
12 min 분 읽기
AI Observer

Kimi K3 Day 0 셀프호스트: vLLM 경로 vs Ollama 노트북 환상

Kimi K3 허브: 사양·가격·API id → /kimi-k3. 타임라인 → /kimi-k3-status. Ollama/VRAM 현실 → /blog/34-kimi-k3-vram-ollama-local-requirements. 오픈 웨이트 일정 → /blog/31-kimi-k3-open-weights-july-27.

피드에는 Kimi K3 오픈 웨이트가 7월 27일에 풀린다고 뜹니다. 누군가는 Mac Mini 스크린샷을 올리고, 누군가는 정체 불명의 GGUF 「원클릭 Ollama」를 붙여 넣. 그런데 당신이 답해야 하는 일은 더 단순합니다. 우리 팀이 이걸 셀프호스트할 수 있나, 아니면 그냥 과대광고인가?

짧은 버전: 셀프호스트는 클러스터 / vLLM 문제로 다루세요. 노트북 채팅 앱 문제가 아닙니다. 제품과 API는 이미 살아 있습니다. 공개 풀 웨이트는 아직 Hugging Face에서 다시 확인해야 하는 캘린더 이벤트이지, 오늘 밤 ollama pull이 된다는 보장이 아닙니다.

이 사이트는 Moonshot과 무관한 독립 사이트입니다. 아래 사양·날짜는 2026년 7월 27일 기준 공개 문서와 파트너 블로그를 따릅니다. 장비를 사거나 랜덤 레포를 믿기 전에 Kimi K3 블로그, 플랫폼 문서, vLLM의 K3 프리뷰를 다시 확인하세요.

한 줄 답 (먼저 읽기)

  1. 일은 두 가지다.
    • 「오늘 K3 품질이 필요」kimi.com, Kimi Code, 또는 platform.kimi.ai의 API id kimi-k3.
    • 「웨이트를 VPC에」 → 실제 파일이 있는 Moonshot 소유 HF 레포 + day-0 서빙 스택(vLLM이 Moonshot·파트너가 준비 중인 공개 경로)을 기다리세요.
  2. 작성 시점 기준 HF moonshotai/Kimi-K3는 여전히 Upcoming release 페이지입니다 (카운트다운 / notify)—safetensors가 깔린 완성 다운로드가 아닙니다. 「이미 오픈」이라는 SNS 글은 대개 약속만 읽고 Files 탭은 안 본 것입니다.
  3. 게이밍 GPU 한 장 + Ollama는 풀 2.8T급 K3에 잘못된 멘탈 모델입니다. 공식 서빙 언어는 슈퍼노드 / 멀티 가속기 배포를 가리키지, 24GB 장난감을 가리키지 않습니다.
  4. vLLM의 7월 22일 프리뷰가 공개된 「업계가 이걸 어떻게 서빙할지」 노트 중 최고입니다: day-0 모델 경로, KDA 인식 prefix 캐싱, Docker 레시피, NVIDIA + 초기 AMD 작업—소비자용 한 줄 명령이 아닙니다.
  5. 이미 받을 수 있는 오픈 Kimi 라인(예: Hugging Face의 K2.6 / K2.7 Code)은 K3 파일이 아직 대기 중일 때 오늘 오프라인 웨이트가 필요할 때 셀프호스트할 대상입니다.

한 문장: 이번 주 지능은 API나 제품으로; 셀프호스트는 Files 탭이 진짜일 때 vLLM + 실제 웨이트로—두 문을 섞지 마세요.

Kimi K3 launch card: 2.8T parameters, 1M context, open weights planned around July 27

출처: 공식 K3 론칭 메시징 / Kimi K3 테크 블로그, Moonshot AI, 2026년 7월 16일.

이 가이드는 누구를 위한가 (그리고 누구를 위한 게 아닌가)

당신은…이렇게 읽으세요이 환상은 버리세요
GPU 플릿을 준비하는 인프라 / 플랫폼 엔지니어Day-0 체크리스트 + 스택 포인터노트북에서 즉시 Ollama
「오픈 = Mac에서 영원히 공짜」를 들은 창업자비용 + 운영 현실 점검소비자 카드 한 장으로 풀 K3 오프라인
코딩 도움만 필요한 개발자제품 / API 우선완벽한 로컬 스택을 며칠 기다림
감사 / 파인튜닝용 웨이트가 필요한 연구 랩HF + LICENSE + 모델 카드 검증이름만 바꾼 커뮤니티 미러 신뢰

「kimi k3 ollama」 만 검색했다면 VRAM & Ollama 글도 함께 보세요—그 페이지가 로컬 하드웨어 정직 점검입니다. 이 페이지는 셀프호스트 / 서빙 경로입니다.

「오픈 웨이트 day 0」이 실제로 의미하는 것

Moonshot의 공개 스토리 (K3 발표 참고):

  • 제품 + API 먼저 (약 2026년 7월 16일부터 라이브): 채팅, Work, Code, kimi-k3 API.
  • 전체 모델 웨이트는 2026년 7월 27일까지파일을 내놓겠다는 약속이지, 「이미 모든 미러에 있다」는 마법 주장이 아닙니다.
  • 서빙을 바꾸는 아키텍처: Kimi Delta Attention (KDA), Attention Residuals, 희소 MoE(공식 프레이밍: 토큰당 전문가 896개 중 16개 활성), 총 파라미터 ~2.8T, 컨텍스트 1M, 네이티브 비전.
  • 명시적으로 KDA 관련 prefix-cache 작업을 vLLM 커뮤니티에 기여했고, 모델과 함께 릴리스한다고 함—KDA는 고전 full-attention KV 캐시처럼 동작하지 않기 때문입니다.

그래서 셀프호스터에게 「day 0」은 사실 두 번의 드롭입니다.

  1. 웨이트 + LICENSE + 모델 카드 (보통 Hugging Face moonshotai/… 아래).
  2. K3를 이해하는 서빙 코드 (vLLM 프리뷰가 모델 경로, 파서, 커널, Docker, 레시피를 가리킴).

둘 중 하나만 있으면 반은 열린 문입니다.

경로 A — 제품 & API (대부분 오늘 열어야 할 문)

프론티어 K3 품질을 맛보려면 셀프호스트가 필요 없습니다:

잘 맞는 용도주의점
kimi.com / 앱모델 감 잡기, 지식 업무쿼터, 멤버십 용량 (구독 일시 중지 메모 참고)
Kimi CodeIDE / 터미널 코딩 에이전트일에 맞는 모델 고르기 (어떤 모델)
API kimi-k3자동화, 툴, OpenAI 호환 클라이언트종량제: 공개 카드 기준 캐시 히트 $0.30 / 미스 $3 / 출력 $15 per 1M 토큰—API 가격 가이드

목표가 「이번 스프린트에 기능을 낸다」라면 API + 제품이 이깁니다. 셀프호스트는 데이터 레지던시, 에어갭, 커스텀 파인튜닝, 혹은 초고볼륨 단위경제용이지 FOMO용이 아닙니다.

Kimi K3 coding benchmark chart (max effort)—why teams care about serving quality, not only download size

출처: 공식 K3 론칭 미디어 / Kimi K3 블로그, 2026년 7월 16일.

경로 B — vLLM으로 셀프호스트 (진지한 day-0 경로)

vLLM이 공개적으로 약속한 것 (2026년 7월 22일)

vLLM 팀 프리뷰는 풀 오픈소스 day 전에 우리가 가진 가장 명확한 「에코시스템 준비도」 글입니다. 쉬운 말로, 그들은 준비 중이라고 말합니다:

  • 웨이트 릴리스용 Day-0 오픈소스 서빙: 모델 구현, Docker 이미지, 배포 레시피, 프로덕션 검증
  • KDA 인식 prefix 캐싱 (고전 paged KV 트릭만으로는 recurrent KDA 상태에 부족)
  • KDA prefill·decode, Attention Residuals, MoE(MXFP4 경로, 그들 릴리스 프레이밍), 멀티모달 쪽의 커널 / 성능 작업
  • 최종 튜닝 중인 NVIDIA 레시피 + 초기 AMD 경로

이건 인프라 언어입니다. 「Windows Ollama에 붙여 넣고 채팅」이 아닙니다.

Day-0 서빙을 생각하는 법 (고정 CLI가 아닌 체크리스트)

웨이트가 나타나면, 건전한 셀프호스트 런북은 대략 이렇습니다—항상 공식 모델 카드와 vLLM 문서를 이 블로그를 포함한 어떤 글보다 우선하세요:

  1. 레포 검증
    • 오그는 moonshotai(또는 공식 블로그에서 Moonshot이 링크한 출처)여야 합니다.
    • 실제 Files(샤드)가 있어야 하고, 「Upcoming release」 마케팅만 있으면 안 됩니다.
    • LICENSE를 끝까지 읽으세요 (이전 Kimi 오픈 라인은 종종 Modified MIT 스타일 라이선스를 썼습니다; K3는 파일이 나올 때까지 가정하지 마세요).
  2. K3 / KDA 지원을 주장하는 서빙 빌드에 핀
    • vLLM 포스트와 day-0용으로 태그한 버전을 따르세요—nightly/main 브랜치는 움직입니다.
    • 이전 K2 계열 레시피와 비슷하게 툴콜 / 추론 파서와 Kimi 전용 멀티모달 플래그를 예상하세요.
  3. MoE 거인처럼 병렬을 계획
    • 2.8T급 희소 MoE는 expert parallelism + 대역폭 문제입니다. tensor-parallel-size 1 실험 하나가 아닙니다.
    • 공식 제품 문서는 경쟁력 있는 처리량을 위해 슈퍼노드형 멀티 가속기 서빙을 가리켜 왔습니다—데이터센터 형태로 읽으세요.
  4. 1M 컨텍스트에 겸손해지세요
    • 클라우드 API의 「1M 정액」과 「day one에 --max-model-len 1048576 넣고 날아다닌다」는 같은 말이 아닙니다.
    • 더 짧은 max length로 시작하고 prefill/decode를 재 본 뒤 늘리세요.
  5. 「디스크 위의 웨이트」와 「프로덕션 SLO」를 분리
    • Day-0는 종종 부팅된다는 뜻입니다. 프로덕션은 모니터링, PD disaggregation, 캐시 히트율, 장애 도메인—vLLM 포스트가 그 어려운 부분을 명시적으로 다룹니다.

우리는 축복받은 척 가짜 플래그의 vllm serve … 한 줄을 붙여 넣지 않습니다. 틀린 플래그는 몇 시간 만에 썩습니다. 파일이 떨어지는 날의 진실 소스는 모델 카드 + vLLM 릴리스 노트입니다.

하드웨어 현실 (가짜 GB 표 없이)

사람들이 원하는 것: 「K3 Q4 = 4090에서 XX GB.」

우리는 그 표를 지어내지 않습니다.

붙잡을 수 있는 것:

  • 총 규모(~2.8T)희소 활성(16/896 프레이밍) 은 「노트북에 총 파라미터가 들어간다」와 같지 않습니다. 여전히 거대한 웨이트 발자국을 저장하고, 토큰마다 일부만 활성할 뿐입니다.
  • 커뮤니티의 다운로드 크기 추측은 양자화 스토리(MXFP4 vs 더 높은 정밀도)에 따라 보통 수백 GB ~ ~1+ TB 대에 떨어집니다—어떤 숫자든 모델 카드에 파일 크기가 적히기 전까지는 비공식으로 다루세요.
  • Moonshot 자체의 64+ 가속기 / 슈퍼노드형 언어는 서빙 형태이지, 취미 각주가 아닙니다.
  • 이미 멀티노드 GPU 클러스터를 돌리거나 매니지드 추론을 사지 않는다면, 대부분의 팀에서 API나 매니지드 호스트가 영웅적인 주말 빌드를 이깁니다.

Ollama/GGUF 타임라인과 「로컬에서 아직 되나」는 VRAM 가이드에 두세요.

Kimi K3 agent / capability charts—long-horizon work is why serving architecture (KDA cache, MoE routing) matters

출처: 공식 K3 론칭 미디어 / Kimi K3 블로그, 2026년 7월 16일.

경로 C — Ollama / 「Mac Mini」 신화 (예의 있게 죽이기)

ollama, gguf, local, self host 검색 수요는 진짜입니다. 실수는 이걸 하나의 환상으로 쌓는 것입니다:

신화현실
「오픈 웨이트 = 내 PC에서 무료 무제한」오픈 웨이트는 라이선스 아래 다운로드·실행할 수 있다는 뜻—전기·운영·VRAM이 공짜라는 뜻이 아님
「HF에 있으면 오늘 밤 Ollama에 있다」Ollama/llama.cpp 포트는 보통 공식 덤프보다 늦고, 품질 좋은 양자화는 더 늦음
「2.8T MoE는 30B Q4처럼 들어가야 한다」희소 연산 ≠ 작은 디스크 / RAM
「K3라는 이름의 GGUF면 다 괜찮다」공식 오그 + 해시를 선호; 가짜·abliterated 팩은 웨이트 드롭 날의 실제 노이즈원
「셀프호스트가 항상 API보다 싸다」GPU, 전력, 유휴 시간, 온콜, 실패한 실험$3 / $15 API와 견준 뒤에야

기다리는 동안 건강한 로컬 경로: 오프라인 코딩 에이전트용으로 이미 HF에 있는 K2.6 / K2.7 Code를 셀프호스트하고, 어려운 일은 API로 K3. 하이브리드 스택이 순수성 경쟁을 이깁니다.

당일 체크리스트 (캘린더 칸이 찍힐 때)

실제로 무언가가 나타났을 때 쓰세요—리포스트가 「드롭한다」고 할 때가 아닙니다.

웨이트

  • 공식 블로그/X 또는 HF 페이지가 Upcoming에서 다운로드 가능한 Files로 이동
  • 레포가 moonshotai 아래 (또는 kimi.com/blog/kimi-k3에서 명확히 링크)
  • LICENSE + 모델 카드 + 나열된 샤드 크기
  • 랜덤 서드파티 「Kimi-K3-abliterated」만을 유일한 복사본으로 의존하지 않음

서빙

  • vLLM(또는 Moonshot이 명명한 다른 엔진)의 K3를 문서화한 버전 / 이미지
  • 툴콜 / 추론 파서가 카드와 일치
  • 대형 MoE를 돌려 본 사람이 검토한 병렬 계획
  • 스모크 테스트: 헬스 엔드포인트, 짧은 프롬프트, 툴콜 한 번, 롱컨텍스트 prefill 한 번

비즈니스

  • 결정 트리: API 기본 vs 셀프호스트 파일럿 vs 매니지드 호스트
  • 보안: 웨이트 접근 통제, 환각 / 툴 안전 평가—「오픈 = 그날 밤 프로드 배포」가 아님

이번 주에 할 일 (결정 트리)

점심 전에 K3 품질이 필요하면
→ 제품 또는 API. 웨이트에 막히지 마세요.

셀프호스트 파일럿을 짓고 있으면
vLLM의 K3 프리뷰를 읽고; 클러스터 용량을 예약하고; 위 체크리스트를 초안 잡고; K3 파일이 떨어질 때 파이프라인이 지루해지도록 K2.6 / K2.7 Code 웨이트로 연습하세요.

게이밍 노트북만 있다면
클라우드 제품/API에서 K3를 즐기세요. 로컬에는 더 작은 오픈 모델을. 「24GB에 풀 K3」 썸네일은 무시하세요.

컴플라이언스 팀이 오픈 웨이트를 필요로 하면
HF moonshotai/Kimi-K3와 공식 블로그를 북마크하고; LICENSE + 파일이 진짜일 때까지 프로덕션 설계 금지.

주의점 (노이즈 필터)

  1. 약속 날짜 ≠ Files 탭. 7월 27일은 Moonshot의 공개 타깃입니다—아티팩트를 검증하세요.
  2. SNS의 환각 / 독립 벤치마크 스레드는 들쭉날쭉합니다—서드파티 %를 런북에 「공식」으로 붙여 넣지 마세요.
  3. 아키텍처 키워드(KDA, AttnRes, MXFP4)는 진짜 엔지니어링입니다; day one에 소비자 런타임이 존재한다는 증거가 아닙니다.
  4. 이 사이트는 Moonshot 지원이 아닙니다. 의심되면 공식 문서가 이깁니다.

다음 어디

한 줄 결론: Kimi K3 셀프호스트는 진지한 서빙 프로젝트(vLLM + 멀티 가속기 현실)이지, Ollama 파티 트릭이 아닙니다. Upcoming 페이지가 아직 Upcoming인 동안은 클라우드 문을 쓰고—Files 탭이 진짜가 되면 어떤 다운로드든 믿기 전에 오그·라이선스·스택을 검증하세요.

관련 기사

K3는 무료 채팅 경로가 아니다. $0.30 / $3 / $15 요금표를 쉽게 풀어—캐시가 아낄 때, max thinking이 돈을 태울 때, 더 싼 Kimi 모델이 이길 때.
피드는 전부 Kimi K3 이야기. 이번 주 실전 지도—앱/무료 체험, 구독이 막혔을 때, API가 언제 값어치 있는지, 7월 27일 웨이트 전까지 무시해도 되는 것.
Kimi K3 결제하려다 막혔나요? 영향 받는 사람, 지금 되는 것(무료 체험·API·기존 플랜), 7월 27일 오픈 웨이트가 계획을 어떻게 바꾸는지.