1P by GN⁺ | ★ favorite | 댓글 2개
  • Kimi K3는 2.8조 개 매개변수와 104만 8,576토큰 컨텍스트를 갖춘 오픈 가중치 네이티브 멀티모달 에이전트 모델로, 장시간 코딩·지식 작업·추론을 지원함
  • Kimi Delta Attention(KDA), Attention Residuals, Stable LatentMoE를 결합해 896개 전문가 중 토큰마다 16개를 활성화하며, Kimi K2보다 전체 스케일링 효율이 약 2.5배 높음
  • 공개 평가에서 GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2, OmniDocBench 91.1을 기록했지만, 모델별 하네스·추론 설정·하드웨어 차이를 함께 고려해야 함
  • MXFP4 가중치·MXFP8 활성값으로 양자화 인식 학습됐으며 Transformers, vLLM, SGLang, Docker와 OpenAI·Anthropic 호환 API로 실행할 수 있음
  • 다중 턴과 도구 호출에서는 API가 반환한 reasoning_contenttool_calls를 포함한 전체 assistant 메시지를 그대로 다시 전달해야 하며, 코드와 가중치는 Kimi K3 License로 공개됨

모델 구조와 규모

  • Kimi K3는 장시간 코딩, 지식 작업, 추론을 위해 설계된 오픈 가중치 네이티브 멀티모달 에이전트 모델임
  • 총 매개변수는 2.8T, 활성 매개변수는 104B이며 93개 레이어로 구성됨
    • Dense 레이어 1개, KDA 레이어 69개, Gated MLA 레이어 24개를 사용함
    • Attention hidden dimension은 7,168, attention head는 96개임
  • Stable LatentMoE는 896개 전문가 중 토큰마다 16개를 선택하고 공유 전문가 2개를 사용함
    • Latent MoE dimension은 3,584, 전문가별 MoE hidden dimension은 3,072임
    • Kimi K2와 비교하면 전체 스케일링 효율이 약 2.5배 향상됨
  • 어휘 크기는 160K, 컨텍스트 길이는 1,048,576토큰이며 활성화 함수는 SiTU-GLU임
  • 비전 인코더로 401M 매개변수의 MoonViT-V2를 사용함
  • 주요 기능에는 텍스트·이미지·비디오 이해가 포함되지만, 모델 요약표의 modality 항목에는 Text와 Image만 기재돼 있음

장시간 코딩과 지식 작업

  • 최소한의 사람 감독으로 긴 엔지니어링 세션을 유지하면서 대규모 저장소를 탐색하고 터미널 도구를 조율함
    • GPU 커널 최적화와 컴파일러 개발을 지원함
    • 비전을 활용하는 게임 개발, CAD, 칩 설계도 대상에 포함됨
  • 에이전트형 지식 작업에서는 심층 조사와 함께 대화형 시각화, 위젯, 대시보드를 생성함
    • 모션 디자인과 비디오 편집도 지원 범위에 들어감
  • 코딩 에이전트 프레임워크로 Kimi Code CLI를 권장하며, 터미널에서 /model 명령으로 Kimi K3를 선택할 수 있음

평가 결과

  • 모든 Kimi K3 결과는 reasoning_effort="max", temperature 1.0으로 측정됨
    • GPQA Diamond, HLE-Full, 도구 없는 비전 평가 같은 단일 단계 작업에는 top-p 0.95를 사용함
    • 에이전트 작업에는 top-p 1.0을 적용함
  • 추론·지식 평가에서 GPQA Diamond 93.5, CritPt 23.4, AA-LCR 74.7을 기록함
    • HLE-Full은 도구 없이 43.5, 도구 사용 시 56.0임
  • 코딩 평가에서는 ProgramBench 77.8, Terminal-Bench 2.1 88.3, FrontierSWE 81.2를 기록함
    • DeepSWE는 Kimi Code 하네스에서 67.5, mini-SWE-agent 하네스에서 67.3임
    • SWE-Marathon 42.0, PostTrainBench 36.6, MLS-Bench-Lite 48.3, SciCode 58.7, Kimi Code Bench 2.0 72.9를 기록함
  • 에이전트 평가에서는 BrowseComp 91.2, DeepSearchQA F1 95.0, ResearchRubrics 76.2를 기록함
    • MCPMark-Verified 94.5, AutomationBench 30.8, SpreadsheetBench 2 34.8, OSWorld-Verified 84.8임
    • Harvey Lab-AA 94.6, CorpFin v2 71.6, Finance Agent v2 54.4, Legal Research Bench 44.2로 측정됨
  • 비전 평가에서는 OmniDocBench 91.1, Video-MME 90.0, MMVU 82.1을 기록함
    • MMMU-Pro는 도구 없이 81.6, 도구 사용 시 83.4임
    • MathVision은 94.3에서 Python 사용 시 97.8로 높아짐
    • ZeroBench pass@5는 23.0에서 도구 사용 시 41.0으로 상승함

평가 조건과 비교 제약

  • 비교 모델에는 Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5, GLM-5.2가 포함되지만 평가 하네스가 모델마다 다를 수 있음
    • Kimi K3는 주로 Kimi Code 또는 Claude Code를 사용함
    • GPT 계열은 주로 Codex, 다른 Claude·GLM 모델은 Claude Code나 Terminus 2 등을 사용함
  • SWE-Marathon은 최종 v1.1 이전인 2026년 7월 9일 기준 작업을 H20에 맞게 보정한 브랜치에서 평가함
    • Docker 이미지, GPU 성능 기준, 참조 오라클은 H20용으로 재보정했지만 정확성과 부정행위 방지 검증기는 바꾸지 않음
    • Claude Fable 5는 작업의 35%에서 fallback이 발생해 측정 성능에 부정적인 영향을 받았을 수 있음
  • PostTrainBench는 공식 환경의 H100 대신 H20 GPU에서 최대 추론 노력으로 실행한 3회 결과의 평균임
  • Kimi Code Bench 2.0에는 사이버보안·안전 작업이 포함됨
    • Claude Fable 5는 80개 작업 중 fallback 13건과 거부 1건이 발생함
    • GPT-5.6 Sol은 10건, GPT-5.5는 3건을 거부함
  • BrowseComp 91.2는 300K토큰에서 작동하는 컨텍스트 압축 전략을 사용한 결과임
    • 별도 컨텍스트 관리 없이 전체 1M토큰 창을 사용하면 90.4를 기록함
  • 멀티모달 평가는 ZeroBench를 제외하고 3회 평균을 사용함
    • ZeroBench는 공식 설정에 따라 5회 실행함
    • PerceptionBench는 원자적 시각 인지 능력을 측정하는 자체 벤치마크임

네이티브 양자화

  • SFT 단계부터 양자화 인식 학습을 적용함
  • 가중치는 MXFP4, 활성값은 MXFP8을 사용해 광범위한 하드웨어 호환성을 목표로 함

배포와 실행 방법

  • kimi-k3를 선택해 Kimi API에 접근할 수 있으며 OpenAI·Anthropic 호환 API를 제공함
  • Hugging Face Transformers에서는 pipeline("image-text-to-text", ...) 또는 AutoModel.from_pretrained(...)로 불러올 수 있음
    • 커스텀 모델 코드를 사용하려면 trust_remote_code=True가 필요함
  • 로컬 서빙은 vLLMSGLang을 지원함
    • 두 엔진 모두 OpenAI 호환 /v1/chat/completions 엔드포인트에서 텍스트와 이미지 요청을 처리할 수 있음
  • Docker Model Runner에서는 docker model run hf.co/moonshotai/Kimi-K3로 실행함
  • HuggingChat, Google Colab, Kaggle에서도 모델을 사용할 수 있음

추론 상태를 보존하는 API 사용법

  • Kimi K3는 사고 모드가 항상 활성화reasoning_content를 반환함
  • 최상위 요청 필드 reasoning_effort"low", "high", "max"를 지원하며 기본값은 "max"
  • 다중 턴 대화와 도구 호출은 보존된 사고 이력 방식에 맞춰야 함
    • API가 반환한 assistant 메시지를 messages에 그대로 다시 전달해야 함
    • content뿐 아니라 reasoning_contenttool_calls도 포함해야 함
  • 비전 입력, 구조화 출력, partial mode, 도구 선택, 동적 도구 로딩, 컨텍스트 캐싱은 Kimi K3 QuickstartThinking Effort에서 확인할 수 있음

라이선스

  • 코드 저장소와 모델 가중치는 모두 Kimi K3 License로 공개됨

댓글과 토론

국내에서 제공하는 업체가 나오면 좋겠네요.

Hacker News 의견들
  • 3조 매개변수 모델의 서드파티 중간 가격이 정해지면 실제 서빙 비용과 연구소의 API 토큰 보조 여부를 가늠할 수 있을 것임
    MXFP4 네이티브라 약 1.5TB VRAM이 필요해 8×B200의 한계에 걸치며, 문맥 길이와 처리량 최적화까지 고려하면 현실적으로 16장이 필요해 보임
    사이버 보안 AISI 벤치마크에서는 GLM 5.2보다 높지만 최첨단 비공개 모델과는 큰 격차가 있어 미세조정이 필요할 수 있음. Cursor가 Kimi 2.6/2.7 미세조정판인 Composer 계열 및 Grok 4.5와 직접 비교하도록 다시 학습할지도 궁금함
    전체 확률분포를 학습하는 제대로 된 지식 증류로 소형 모델을 만들 가능성도 기대됨. 특히 서빙 비용이 낮은 DSV4-Kimi가 유망할 듯함

    • GPU 없이 RAM만 1.5~3TB인 듀얼·쿼드 소켓 Xeon 서버에서 얻을 수 있는 저속 추론 성능이 궁금함. 4~6시간짜리 장기 작업이라면 초당 5~6토큰도 용도에 따라 쓸 만할 수 있음
      중고 4U 서버와 64GB ECC DIMM 32개로 3TB RAM을 구성하면 3만 달러 미만이라 실제 GPU 장비와 가격 차이가 큼. 아직 완전 정밀도 가중치나 Unsloth의 Q8/Q8-XL 양자화판이 없지만, 넉넉한 문맥까지 쓰려면 1,536GB를 넘어 2TB, 가능하면 2.5~3TB가 필요해 보임
      Q4와 Q6는 지식과 정밀도를 잃으면서도 느리고 신뢰하기 어려운 최악의 절충안이 될 가능성이 높아, 저예산 장비에서 똑똑하지만 느린 모델을 돌린다면 Q8은 필요하다고 봄
    • 현재 미세조정은 보통 bnb 4비트 기반 모델 위에 LoRA를 적용하지만, 이제 기반 형식을 GGUF로 바꿀 때라고 봄. GGUF는 새 모델 아키텍처와 더 공격적인 양자화를 활발히 지원함
      https://github.com/woct0rdho/transformers5-qwen3.5-recipe에서 개념 증명을 만들었으며, CPU 오프로딩 없이 Qwen3.5-35B-A3B는 16GiB VRAM, DeepSeek-V4-Flash 284B-A13B는 90GiB VRAM으로 미세조정할 수 있음. Strix Halo 같은 통합 메모리 시스템에서도 잘 작동함
      그래도 Kimi-K3급 모델은 여러 GPU와 노드가 필요해 단일 GPU 학습보다 해결할 일이 훨씬 많음
    • Anthropic과 OpenAI에는 중국 연구소들이 갖지 못한 최적화 혁신이 있으므로, 이 가격은 비용의 상한선은 보여줘도 하한선은 보여주지 못함
    • MXFP4 네이티브 모델이라 하드웨어 측면도 흥미로움. 8×AMD MI355X 노드에 여유 있게 들어가므로 토큰 가격을 더 낮출 가능성이 있음
    • 학습 비용을 모르면 이런 모델을 서빙하는 한계비용만 추론할 수 있을 뿐, 연구소가 API 토큰을 보조하는지는 알 수 없음. 비공개 모델의 실제 크기도 모르며 Fable이 10조인지 1조 매개변수인지조차 알 수 없음
  • 이번 공개에서 가격보다 훨씬 흥미로운 부분은 맞춤화임. 스타트업도 가중치를 내려받아 수정하고 미세조정할 수 있으며, 진짜 이점은 비용보다 자사 데이터에서의 성능과 지식재산권 주권에 있음. Kimi 팀의 큰 성과임

  • 개인이 LLM을 돌리기 위한 하드웨어는 용도에 맞지 않게 구성돼 있다고 느낌. 통합 메모리에서 초당 5~10토큰으로 버티거나, 수백 GB VRAM과 1kW 이상을 소비하는 데이터센터 카드로 가야 함
    TDP 180~250W에 VRAM 128GB나 256GB를 갖춘 준전문가용 GPU가 없으며, 이런 카드 두 장과 보편적인 NVLink급 연결만 있어도 꽤 유용할 것임. Kimi K3의 로컬 실행은 엄청난 홈랩과 비용이 필요하겠지만, GLM 5.2를 단일 세션에서 초당 약 100토큰, 여러 하위 에이전트 사용 시 약 60토큰으로 돌릴 수 있다면 좋겠음

    • 원하는 Q8 대형 모델은 최대 RAM 128GB인 3,995달러 시스템에 들어가지 않으며 실용적인 문맥 공간도 확보할 수 없음. Qwen 3.5 122B Q8, DeepSeek V4 Flash Q8, Laguna S 2.1 Q8은 전체 문맥을 포함해 RAM 170~190GB가 필요해 GPU 없는 256GB 듀얼 소켓 워크스테이션이나 서버에는 들어감
      최신 llama-server--no-mmap으로 실행한 측정치는 DeepSeek-V4-Flash Q4_K_XL 178,175MiB, Q8_K_XL 184,636MiB, Laguna-S-2.1 Q8_K_X 172,860MiB, Qwen3.5-122B-A10B Q8_K_XL 170,038MiB로 예상됨
    • 단일 사용자의 LLM 추론은 일반 소비자용 하드웨어에 특히 맞지 않음. 부하는 간헐적이지만 가중치는 항상 메모리에 있어야 하므로, 가중치를 상주시킨 다중 사용자 서버가 사용자별 KV 캐시만 추가하는 편이 훨씬 효율적이고 비싼 GPU 코어도 대부분의 시간 동안 놀지 않게 됨
      데스크톱 작업도 간헐적이지만 필요한 연산 성능이 충분히 저렴해져 유휴 상태에는 과도할 정도의 장비를 책상 위에 둘 수 있게 된 것과 대비됨
    • 암호화폐 붐 이후 GPU 제조사들은 가격 차별을 위해 VRAM으로 시장을 분할하기 시작함. Nvidia는 소비자용 카드의 메모리를 작게 제한해 클라우드 사업자가 이를 쓸어가는 일을 막고, 본질적으로 같은 하드웨어를 PC와 데이터센터 시장에 크게 다른 가격으로 판매해 양쪽 이익을 모두 취할 수 있었음
    • 모델이 계속 커지면서 PC 혁명의 반대 방향으로 가고 있다고 느낌. 최전선 연구소들은 비공개 모델만 내놓고 gpt-oss 정도를 예외로 둔 채 공개 모델 실행을 어렵게 만들면서도 민주화를 말해 특히 부당해 보임
    • 이런 LLM을 집에서 실행하는 일은 설계상의 돌파구가 없는 한 실용적이기 어려움. 합리적인 실행 방식은 공유 하드웨어에서 큰 배치로 처리하는 것뿐임
      몇천 달러짜리 GPU를 살 수 있다면 부유한 기술광으로서 구매하겠지만, 스포츠카 같은 극도로 비효율적인 사치임을 인정해야 함. 진짜 불행은 신뢰할 수 있는 방식으로 공유 하드웨어를 운영할 컴퓨팅 기술이나 정치·사회적 제도가 없다는 데 있음
  • 라이선스상 라이선스 보유자나 계열사가 서비스형 모델 사업을 운영하고 연속 12개월 합산 매출이 2천만 달러를 넘으면, 소프트웨어나 파생물을 상업적으로 사용하기 전에 Moonshot AI와 별도 계약을 체결해야 함

    • 초기 Llama 모델에서 Meta가 적용한 방식과 비슷해 보임. 또한 월간 활성 사용자 1억 명 또는 월매출 2천만 달러를 넘는 상용 제품·서비스에서 소프트웨어나 파생물을 사용하면 사용자 인터페이스에 Kimi K3를 눈에 띄게 표시해야 한다는 조항도 영리한 마케팅임
  • https://app.fireworks.ai/models/fireworks/kimi-k3에서 이용 가능하며, 가격은 미캐시 입력 100만 토큰당 3달러, 캐시 입력 0.30달러, 출력 15달러임

    • Fireworks의 Kimi 우선순위 요금제도 OpenRouter에서 100만 토큰당 3.75달러로 제공됨: https://openrouter.ai/moonshotai/kimi-k3#providers
      현재 Moonshot보다 지연 시간이 크게 낮지만 사용량도 훨씬 적어 유지될지는 지켜봐야 함. 그래도 당일 배포는 인상적임
    • Claude Opus 5는 미캐시 입력 5달러, 캐시 입력 0.50달러, 출력 25달러이며, 캐시 쓰기에는 5분 기준 25%, 1시간 기준 100%의 추가 비용도 붙음
    • Fireworks가 출시한 지 몇 시간 만에 우리 플랫폼 사용자에게 제공할 수 있었음. 다만 주문형 Flux 모델을 중단해 이제 이미지 생성은 어디서 해야 할지 아쉬움
    • Together.ai에서도 같은 판매 가격으로 이용 가능하며, Fireworks와 Together를 가장 먼저 확인했음
  • 경쟁으로 인해 GLM 5.2 가격은 6월 16일 출시 후 약 1.5개월 만에 45%가량 내려갔고 아직도 새 공급자들이 가격 경쟁 중임: https://openrouter.ai/z-ai/glm-5.2#providers
    경제학적으로 가격이 총비용보다 낮아서는 안 되는 게 아니라 한계비용보다 낮아서는 안 되며, GPU 가동률이 낮은 데이터센터라면 이는 대략 전기료에 해당함. 소규모 데이터센터의 과잉 설비와 경쟁 때문에 곧 전기료와 GPU 감가상각비를 합친 수준보다 낮게 토큰을 파는 곳도 나올 수 있다고 추측함

    • 토큰을 싸게 판 뒤 사용자의 토큰 데이터를 다른 곳에 다시 판매하는 구조일 수도 있음
    • 45% 하락 수치는 의심스러움. OpenRouter의 저가 공급자는 공식 Z.ai의 FP8과 달리 FP4를 사용함. Novita 같은 저렴한 FP8 공급자도 있지만 UI상 임시 할인처럼 보이고 정상가는 공식 Z.ai와 거의 같음
    • SemiAnalysis는 약 2조 매개변수 모델의 비용을 100만 토큰당 1달러 미만으로 추정함. 처리량과 양자화에 따라 달라지지만, 대규모 공급자의 원가가 충분히 낮다면 GLM 5.2의 현재 최저가인 2.42달러도 큰 이익을 남길 수 있음
  • Hugging Face에서 “Tell me about yourself”라고 물었더니 Kimi K3가 자신을 Anthropic이 만든 Claude라고 답해 흥미로웠음

    • 같은 질문에 “Moonshot AI가 개발한 Kimi”라고 정상적으로 답했음
    • 이런 답변은 별 의미가 없음. Opus에 중국어로 같은 질문을 하면 자신을 DeepSeek이라고 답하기도 하며, 학습 데이터가 섞이고 모델이 환각하기 때문임
    • 놀랄 일은 아님. 지식 증류는 흔하고 모든 연구소가 의도적이든 아니든 사용함. ChatGPT 이후의 학습 말뭉치에는 언제나 AI 생성 콘텐츠가 포함되기 때문임
  • 최전선 모델은 보존용으로 다운로드해 두길 권함. 1.5TB라도 저렴한 디스크에 넣어 두고 토렌트를 시딩하면 더 유용함
    과거 암호화 알고리즘을 통제하려 했듯 모델도 규제로 봉쇄될 수 있으며, 공개 소프트웨어는 널리 배포돼야 살아남음. 시간이 지나면 기법과 하드웨어 제조에 대한 막대한 투자 덕분에 현실적인 실행이 가능해질 텐데, 그때 배포가 불법이 되어 규제 포획 비용을 내야 한다면 안타까울 것임

    • 토렌트 파일은 https://terminalbytes.com/kimi-k3-torrent/Kimi-K3.torrent에 있음
      마그넷 주소는 magnet:?xt=urn:btih:1e63a865fbf9b58decc8b71091db54d673c5da6f&dn=Kimi-K3&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A6969%2Fannounce&tr=udp%3A%2F%2Fopen.stealth.si%3A80%2Fannounce&tr=udp%3A%2F%2Fexplodie.org%3A6969%2Fannounce&tr=udp%3A%2F%2Ftracker.torrent.eu.org%3A451%2Fannounce&tr=udp%3A%2F%2Fexodus.desync.com%3A6969%2Fannounce
    • 당국은 결국 이런 모델을 실행할 하드웨어 구매부터 제한할 것임
    • 이제 저렴한 디스크도 없으며 막연한 규제 우려 때문에 수백 달러를 쓰고 싶지는 않음
  • 라이선스를 검토하고 실제 하드웨어에서 시험해 본 결과, 공급자가 Moonshot 가격보다 60~70% 저렴하게 제공하기는 어려워 보임. 약간 낮출 수는 있어도 처리 속도를 크게 희생하지 않는 한 GLM 수준의 할인은 힘들 듯함
    Kimi의 마진은 GPU를 비싼 임대 가격으로 조달한다고 가정해도 약 40~50%로 추정되며, 자체 장비라면 더 높을 수 있음. 하지만 일부가 추정하는 Anthropic의 90% 이상 마진에는 못 미치고 Anthropic API 마진 80%조차 의심스러움
    전기료만 원가라면 80~90%도 가능하겠지만 현재 제공되는 초당 토큰 수를 보면 쉽지 않음. B200에서만 시험했고 B300은 구하지 못했으며, 이미 양자화 모델이고 100만 토큰 문맥도 사용하지 않아 즉각적인 메모리 최적화 여지도 작아 보임. R100 접근 권한이 있는 누군가가 비용을 검증해 주면 좋겠음
    대형 공급자는 Kimi와 계약해야 하므로 Kimi가 최상위 공개 모델인 동안 큰 폭의 할인은 기대하기 어려움

  • 원문 링크가 404를 반환하는데 차단됐거나 자체 검열된 것인지 궁금함

    • 몇 분 전까지 가중치 공개 카운트다운 페이지가 있었고 종료까지 19분 남았는데 갑자기 404가 발생했음
    • 전환 과정의 기술적 문제일 가능성이 큼. 거의 아무도 실행할 수 없더라도 수많은 사용자가 수 TB짜리 모델을 내려받으면 Hugging Face에 어떤 일이 생길지도 흥미로움
      정부 통제로 갑자기 사라질 가능성에 대비해 보관하려는 수요가 있을 듯함. 중국도 최근 모델 수출 통제를 논의하기 시작했으며, 뒤처진 모델이 아니라 최첨단 모델을 내놓기 시작한 지금은 상황이 달라짐
    • 음모론처럼 들릴 수 있지만 미국이나 중국이 영향력을 과시하기 좋은 기회이며, 미국일 가능성이 더 높아 보임