- Olmo 3는 모델의 최종 결과뿐 아니라 전체 개발 과정(model flow) 을 공개해, 데이터·코드·체크포인트까지 완전한 추적 가능성을 제공
- 7B와 32B 파라미터 규모의 Base, Think, Instruct, RL Zero 네 가지 모델로 구성되어, 추론·대화·강화학습 등 다양한 연구 목적에 맞게 활용 가능
- Dolma 3와 Dolci 데이터셋을 기반으로, 웹·코드·수학·과학 등 약 9.3조 토큰 규모의 투명한 학습 데이터 공개
- OlmoTrace 도구를 통해 모델의 출력이 어떤 학습 데이터에서 비롯되었는지 실시간으로 추적 가능, 투명성과 신뢰성 강화
- 완전한 오픈소스 공개로 누구나 모델의 특정 단계에서 개입·수정·재학습이 가능하며, 검증 가능한 AI 연구 생태계 구축
Olmo 3 개요
- Olmo 3는 Allen Institute for AI(Ai2) 가 공개한 차세대 오픈소스 언어 모델 패밀리로, 모델의 전체 개발 흐름(model flow) 을 공개하는 것이 핵심
- 모델 플로우는 데이터 수집, 전처리, 학습, 미세조정, 강화학습 등 모든 단계를 포함
- 이를 통해 연구자와 개발자가 모델의 내부 작동 원리를 분석하고 수정 가능
- Olmo 3는 7B와 32B 파라미터 버전으로 제공되며, 노트북부터 연구 클러스터까지 다양한 환경에서 실행 가능
주요 모델 구성
-
Olmo 3-Base (7B, 32B)
- 완전 공개된 베이스 모델로, 코드·수학·독해 등 다양한 영역에서 최상급 성능
- Qwen 2.5, Gemma 3 등 동급 모델과 경쟁하며, 65K 토큰의 확장 컨텍스트 지원
-
Olmo 3-Think (7B, 32B)
- 다단계 추론 문제를 학습한 추론 특화 모델, RL 연구 및 장기적 사고 실험에 적합
- 32B 모델은 MATH, OMEGA, BigBenchHard 등에서 동급 최고 수준 성능
-
Olmo 3-Instruct (7B)
- 대화·명령 수행·도구 사용에 최적화된 모델로, Qwen 2.5·Gemma 3·Llama 3.1을 동급 혹은 상회
-
Olmo 3-RL Zero (7B)
- 강화학습 알고리듬 평가용 완전 공개 경로 제공, 수학·코드·지시 따르기 등 4가지 도메인 체크포인트 포함
성능 및 벤치마크
- Olmo 3-Base 32B는 Marin 32B, Apertus 70B 등 완전 공개 모델을 능가
- GSM8k(수학) 80.5점, HumanEval(코드) 66.5점 등 주요 벤치마크에서 우수한 결과
- Olmo 3-Think 32B는 Qwen 3 32B와 비슷하거나 근접한 성능을 보이며, HumanEvalPlus·IFEval 등에서 최고 점수 기록
- Olmo 3-Instruct 7B는 안전성(Safety) 항목에서 87.3점으로 비교 모델 중 최고
아키텍처와 학습 과정
- 디코더 전용 트랜스포머 구조 사용, 3단계 사전학습(기초→중간→장문)과 3단계 후학습(SFT→DPO→RLVR)으로 구성
- 각 단계별 체크포인트 공개, 연구자가 원하는 시점에서 모델을 포크하거나 실험 가능
-
Dolma 3(약 9.3조 토큰)과 Dolci 데이터셋을 통해 학습 전 과정의 데이터 투명성 확보
- Dolma 3 Mix(6조 토큰), Dolmino(100B 토큰), Longmino(50B 토큰) 등 세부 구성
- Dolci는 SFT·DPO·RLVR 각 단계별로 별도 데이터 믹스 제공
효율적 학습 인프라
- 최대 1,024개의 H100 GPU로 학습, 7B 모델 기준 7.7K 토큰/초 처리 속도
- in-flight weight updates, continuous batching, 스레딩 개선 등으로 RL 학습 효율 4배 향상
- Olmo 3의 32B 모델은 성능과 접근성의 균형점으로 설정되어, 연구자들이 직접 미세조정 가능
투명성과 도구 생태계
- OlmoTrace를 통해 모델 출력과 학습 데이터 간의 연결을 시각적으로 추적 가능
- 모든 데이터셋과 툴체인은 오픈소스로 공개
- Olmo-core(분산 학습 프레임워크), Open Instruct(후학습 파이프라인), datamap-rs(데이터 정제), duplodocus(중복 제거), OLMES(평가 툴킷) 등 포함
- 연구자는 모델의 중간 추론 단계와 실패 지점을 분석해 모델 행동의 원인 파악 가능
활용 및 의의
- Olmo 3는 연구·교육·응용 개발 등에서 신뢰 가능한 AI 시스템 구축을 지원
- 모델의 모든 단계가 공개되어 있어, 재현성·검증 가능성·협업 연구 촉진
- Ai2는 “진정한 오픈소스 AI는 단순한 접근이 아니라 신뢰와 책임, 공동 발전을 의미한다”고 명시
- Olmo 3는 완전한 투명성을 통해 누구나 AI의 내부를 이해하고 개선할 수 있는 새로운 개방형 연구 패러다임 제시