- Xiaomi의 MiMo-7B는 추론 작업을 위해 처음부터 학습한 7B 언어 모델 시리즈로, 베이스·SFT·RL 모델 체크포인트를 오픈소스로 공개함
- 2025년 5월 30일 업데이트에서 SFT 데이터셋을 약 50만 건에서 600만 건으로 늘리고 RL 학습 윈도 크기를 32K에서 48K로 확장해 MiMo-7B-RL-0530의 AIME 2024 성능이 80.1에 도달함
- 사전학습은 약 25조 토큰과 3단계 데이터 혼합 전략을 사용하며, 추론 패턴 밀도를 높이기 위한 데이터 필터링·합성 추론 데이터·Multiple-Token Prediction을 포함함
- 후학습은 수학·코드 문제 13만 건, 규칙 기반 검증기, 규칙 기반 정확도 보상, 코드 문제용 테스트 난이도 기반 보상과 쉬운 문제 재샘플링 전략을 사용함
- 배포는 SGLang, Xiaomi의 vLLM 포크, HuggingFace 예제를 제공하며, 다른 추론 엔진에서의 MiMo 검증은 아직 완료되지 않았고 기여를 받음
MiMo-7B 시리즈의 목표와 공개 범위
- MiMo-7B는 언어 모델의 추론 잠재력을 사전학습부터 후학습까지 끌어내는 것을 목표로 한 모델 시리즈임
- 공개된 체크포인트는 다음 4종임
- MiMo-7B-Base: 추론 잠재력을 가진 베이스 모델
- MiMo-7B-RL-Zero: 베이스 모델에서 RL로 학습한 모델
- MiMo-7B-SFT: 베이스 모델에서 SFT로 학습한 모델
- MiMo-7B-RL: SFT 모델에서 RL로 학습한 모델
- 모델은 HuggingFace와 ModelScope에서 제공됨
- 기술 보고서는 arXiv에 공개됨
2025년 5월 30일 업데이트
- MiMo-7B-RL-0530은 SFT 데이터셋을 약 50만 건에서 600만 건으로 확장하고, RL 학습 윈도 크기를 32K에서 48K로 계속 확장한 결과를 반영함
- AIME 2024에서 MiMo-7B-RL-0530은 80.1을 기록해 DeepSeek R1의 79.8을 넘어섬
- 주요 벤치마크 변화는 다음과 같음
- MATH500 Pass@1: 95.8 → 97.2
- AIME 2024 Pass@1: 68.2 → 80.1
- AIME 2025 Pass@1: 55.4 → 70.2
- LiveCodeBench v5 Pass@1: 57.8 → 60.9
- LiveCodeBench v6 Pass@1: 49.3 → 52.2
- GPQA-Diamond Pass@1: 54.4 → 60.6
- Alignbench1.1, GPT-4.1 평가: 6.9 → 7.4
사전학습: 추론용 베이스 모델
- MiMo-7B-Base는 추론 작업을 위해 처음부터 학습된 베이스 모델임
- 사전학습은 약 25조 토큰을 사용함
- 데이터 처리에서는 텍스트 추출 도구를 개선하고, 다차원 데이터 필터링을 적용해 사전학습 데이터의 추론 패턴 밀도를 높임
- 다양한 대규모 합성 추론 데이터를 생성하기 위해 여러 전략을 사용함
- 사전학습에는 3단계 데이터 혼합 전략이 적용됨
- Multiple-Token Prediction을 추가 학습 목표로 넣어 모델 성능과 추론 속도를 개선함
후학습과 RL 학습 방식
- 후학습에는 규칙 기반 검증기로 확인 가능한 수학·코드 문제 13만 건을 RL 학습 데이터로 사용함
- 각 문제는 품질 확보를 위해 정제와 난이도 평가를 거침
- 보상은 잠재적 보상 해킹을 피하기 위해 규칙 기반 정확도 보상만 사용함
- 어려운 코드 문제의 희소 보상 문제를 완화하기 위해 테스트 난이도 기반 코드 보상을 도입함
- 난이도가 다른 테스트 케이스에 세분화된 점수를 부여함
- 정책은 더 조밀한 보상 신호로 최적화될 수 있음
- 쉬운 문제에는 데이터 재샘플링 전략을 적용해 롤아웃 샘플링 효율을 높이고, 특히 RL 학습 후반부의 정책 업데이트를 안정화함
RL 인프라와 모델 구조
- Seamless Rollout Engine은 RL 학습과 검증을 가속하기 위해 개발됨
- 설계는 연속 롤아웃, 비동기 보상 계산, 조기 종료를 결합해 GPU 유휴 시간을 줄임
- 성능 개선 수치는 다음과 같음
- 학습 속도 2.29배 향상
- 검증 속도 1.96배 향상
- MiMo-7B의 MTP 레이어는 사전학습과 SFT 중 튜닝되고, RL 중에는 고정됨
- MTP 레이어 1개를 투기적 디코딩에 사용할 때 수락률은 약 90% 임
- vLLM에서 MTP를 지원하고, RL 시스템의 추론 엔진 견고성을 강화함
평가 결과
- MiMo-7B-RL은 수학과 코드 추론 작업에서 OpenAI o1-mini와 맞먹는 성능을 보인다고 제시됨
- 주요 모델 비교에서 MiMo-7B-RL의 수학·코드 결과는 다음과 같음
- MATH-500 Pass@1: 95.8
- AIME 2024 Pass@1: 68.2
- AIME 2025 Pass@1: 55.4
- LiveCodeBench v5 Pass@1: 57.8
- LiveCodeBench v6 Pass@1: 49.3
- MiMo-7B 시리즈 내부 비교에서는 RL 적용 후 성능이 크게 상승함
- MATH500: Base 37.4 → RL-Zero 93.6 → SFT 93.0 → RL 95.8
- AIME 2024: Base 32.9 → RL-Zero 56.4 → SFT 58.7 → RL 68.2
- LiveCodeBench v5: Base 32.9 → RL-Zero 49.1 → SFT 52.3 → RL 57.8
- 평가 설정은
temperature=0.6임 - 반복 평가 조건은 다음과 같음
- AIME24와 AIME25는 32회 반복 평균
- LiveCodeBench v5, LiveCodeBench v6, GPQA-Diamond, IF-Eval은 8회 반복 평균
- MATH500과 SuperGPQA는 단일 실행
배포와 추론 사용
- SGLang은 MiMo 모델 지원과 MTP 지원을 통해 MiMo를 메인스트림에서 지원함
- 관련 PR: MiMo model support, MTP
- 사용 문서는 SGLang documents에서 제공됨
- vLLM 추론은 Xiaomi의 vLLM 포크 사용을 권장함
- 권장 포크: XiaomiMiMo/vllm
- 해당 포크는 vLLM 0.7.3 기반으로 개발됨
- MTP 파라미터를 로드하지 않는 방식으로 vLLM 로더를 등록할 수도 있음
- HuggingFace 추론 예제는
AutoModelForCausalLM.from_pretrained와AutoTokenizer.from_pretrained를 사용함 - 권장 프롬프트 설정은 빈 system prompt임
- 다른 추론 엔진에서의 MiMo 검증은 아직 완료되지 않았고, HuggingFace 저장소의 모델 정의를 기반으로 한 기여를 받음