- Kimi K3는 2.8조 개 매개변수와 104만 8,576토큰 컨텍스트를 갖춘 오픈 가중치 네이티브 멀티모달 에이전트 모델로, 장시간 코딩·지식 작업·추론을 지원함
- Kimi Delta Attention(KDA), Attention Residuals, Stable LatentMoE를 결합해 896개 전문가 중 토큰마다 16개를 활성화하며, Kimi K2보다 전체 스케일링 효율이 약 2.5배 높음
- 공개 평가에서 GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2, OmniDocBench 91.1을 기록했지만, 모델별 하네스·추론 설정·하드웨어 차이를 함께 고려해야 함
- MXFP4 가중치·MXFP8 활성값으로 양자화 인식 학습됐으며 Transformers, vLLM, SGLang, Docker와 OpenAI·Anthropic 호환 API로 실행할 수 있음
- 다중 턴과 도구 호출에서는 API가 반환한
reasoning_content와tool_calls를 포함한 전체 assistant 메시지를 그대로 다시 전달해야 하며, 코드와 가중치는 Kimi K3 License로 공개됨
모델 구조와 규모
- Kimi K3는 장시간 코딩, 지식 작업, 추론을 위해 설계된 오픈 가중치 네이티브 멀티모달 에이전트 모델임
- 총 매개변수는 2.8T, 활성 매개변수는 104B이며 93개 레이어로 구성됨
- Dense 레이어 1개, KDA 레이어 69개, Gated MLA 레이어 24개를 사용함
- Attention hidden dimension은 7,168, attention head는 96개임
- Stable LatentMoE는 896개 전문가 중 토큰마다 16개를 선택하고 공유 전문가 2개를 사용함
- Latent MoE dimension은 3,584, 전문가별 MoE hidden dimension은 3,072임
- Kimi K2와 비교하면 전체 스케일링 효율이 약 2.5배 향상됨
- 어휘 크기는 160K, 컨텍스트 길이는 1,048,576토큰이며 활성화 함수는 SiTU-GLU임
- 비전 인코더로 401M 매개변수의 MoonViT-V2를 사용함
- 주요 기능에는 텍스트·이미지·비디오 이해가 포함되지만, 모델 요약표의 modality 항목에는 Text와 Image만 기재돼 있음
장시간 코딩과 지식 작업
- 최소한의 사람 감독으로 긴 엔지니어링 세션을 유지하면서 대규모 저장소를 탐색하고 터미널 도구를 조율함
- GPU 커널 최적화와 컴파일러 개발을 지원함
- 비전을 활용하는 게임 개발, CAD, 칩 설계도 대상에 포함됨
- 에이전트형 지식 작업에서는 심층 조사와 함께 대화형 시각화, 위젯, 대시보드를 생성함
- 모션 디자인과 비디오 편집도 지원 범위에 들어감
- 코딩 에이전트 프레임워크로 Kimi Code CLI를 권장하며, 터미널에서
/model명령으로 Kimi K3를 선택할 수 있음
평가 결과
- 모든 Kimi K3 결과는
reasoning_effort="max", temperature 1.0으로 측정됨- GPQA Diamond, HLE-Full, 도구 없는 비전 평가 같은 단일 단계 작업에는 top-p 0.95를 사용함
- 에이전트 작업에는 top-p 1.0을 적용함
- 추론·지식 평가에서 GPQA Diamond 93.5, CritPt 23.4, AA-LCR 74.7을 기록함
- HLE-Full은 도구 없이 43.5, 도구 사용 시 56.0임
- 코딩 평가에서는 ProgramBench 77.8, Terminal-Bench 2.1 88.3, FrontierSWE 81.2를 기록함
- DeepSWE는 Kimi Code 하네스에서 67.5, mini-SWE-agent 하네스에서 67.3임
- SWE-Marathon 42.0, PostTrainBench 36.6, MLS-Bench-Lite 48.3, SciCode 58.7, Kimi Code Bench 2.0 72.9를 기록함
- 에이전트 평가에서는 BrowseComp 91.2, DeepSearchQA F1 95.0, ResearchRubrics 76.2를 기록함
- MCPMark-Verified 94.5, AutomationBench 30.8, SpreadsheetBench 2 34.8, OSWorld-Verified 84.8임
- Harvey Lab-AA 94.6, CorpFin v2 71.6, Finance Agent v2 54.4, Legal Research Bench 44.2로 측정됨
- 비전 평가에서는 OmniDocBench 91.1, Video-MME 90.0, MMVU 82.1을 기록함
- MMMU-Pro는 도구 없이 81.6, 도구 사용 시 83.4임
- MathVision은 94.3에서 Python 사용 시 97.8로 높아짐
- ZeroBench pass@5는 23.0에서 도구 사용 시 41.0으로 상승함
평가 조건과 비교 제약
- 비교 모델에는 Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5, GLM-5.2가 포함되지만 평가 하네스가 모델마다 다를 수 있음
- Kimi K3는 주로 Kimi Code 또는 Claude Code를 사용함
- GPT 계열은 주로 Codex, 다른 Claude·GLM 모델은 Claude Code나 Terminus 2 등을 사용함
- SWE-Marathon은 최종 v1.1 이전인 2026년 7월 9일 기준 작업을 H20에 맞게 보정한 브랜치에서 평가함
- Docker 이미지, GPU 성능 기준, 참조 오라클은 H20용으로 재보정했지만 정확성과 부정행위 방지 검증기는 바꾸지 않음
- Claude Fable 5는 작업의 35%에서 fallback이 발생해 측정 성능에 부정적인 영향을 받았을 수 있음
- PostTrainBench는 공식 환경의 H100 대신 H20 GPU에서 최대 추론 노력으로 실행한 3회 결과의 평균임
- Kimi Code Bench 2.0에는 사이버보안·안전 작업이 포함됨
- Claude Fable 5는 80개 작업 중 fallback 13건과 거부 1건이 발생함
- GPT-5.6 Sol은 10건, GPT-5.5는 3건을 거부함
- BrowseComp 91.2는 300K토큰에서 작동하는 컨텍스트 압축 전략을 사용한 결과임
- 별도 컨텍스트 관리 없이 전체 1M토큰 창을 사용하면 90.4를 기록함
- 멀티모달 평가는 ZeroBench를 제외하고 3회 평균을 사용함
- ZeroBench는 공식 설정에 따라 5회 실행함
- PerceptionBench는 원자적 시각 인지 능력을 측정하는 자체 벤치마크임
네이티브 양자화
- SFT 단계부터 양자화 인식 학습을 적용함
- 가중치는 MXFP4, 활성값은 MXFP8을 사용해 광범위한 하드웨어 호환성을 목표로 함
배포와 실행 방법
kimi-k3를 선택해 Kimi API에 접근할 수 있으며 OpenAI·Anthropic 호환 API를 제공함- Hugging Face Transformers에서는
pipeline("image-text-to-text", ...)또는AutoModel.from_pretrained(...)로 불러올 수 있음- 커스텀 모델 코드를 사용하려면
trust_remote_code=True가 필요함
- 커스텀 모델 코드를 사용하려면
- 로컬 서빙은 vLLM과 SGLang을 지원함
- 두 엔진 모두 OpenAI 호환
/v1/chat/completions엔드포인트에서 텍스트와 이미지 요청을 처리할 수 있음
- 두 엔진 모두 OpenAI 호환
- Docker Model Runner에서는
docker model run hf.co/moonshotai/Kimi-K3로 실행함 - HuggingChat, Google Colab, Kaggle에서도 모델을 사용할 수 있음
추론 상태를 보존하는 API 사용법
- Kimi K3는 사고 모드가 항상 활성화돼
reasoning_content를 반환함 - 최상위 요청 필드
reasoning_effort는"low","high","max"를 지원하며 기본값은"max"임 - 다중 턴 대화와 도구 호출은 보존된 사고 이력 방식에 맞춰야 함
- API가 반환한 assistant 메시지를
messages에 그대로 다시 전달해야 함 content뿐 아니라reasoning_content와tool_calls도 포함해야 함
- API가 반환한 assistant 메시지를
- 비전 입력, 구조화 출력, partial mode, 도구 선택, 동적 도구 로딩, 컨텍스트 캐싱은 Kimi K3 Quickstart와 Thinking Effort에서 확인할 수 있음
라이선스
- 코드 저장소와 모델 가중치는 모두 Kimi K3 License로 공개됨