- OpenAI가 최초로 대규모 오픈 웨이트 언어 모델(gpt-oss) 을 공개함
- gpt-oss-120b와 gpt-oss-20b 두 가지 모델이 제공되며, 강력한 성능과 다양한 디바이스 지원을 강조
- Apache 2.0 라이선스로 상업적 이용 및 맞춤화, 자유로운 배포가 가능함
- 안전성을 위한 훈련 및 외부 전문가 리뷰, 포괄적 안전 테스트 절차를 도입
- Hugging Face, GitHub 등에서 모델을 직접 다운로드 및 사용 가능하며, 파인튜닝·배포·맞춤화 관련 리소스와 Playground도 제공
OpenAI의 오픈 모델
- OpenAI는 모든 사용 사례에 맞춤 설정이 가능하고, 어디서나 실행할 수 있는 대규모 오픈 웨이트 추론 모델(gpt-oss)을 공개함
- Hugging Face 및 GitHub에서 모델 파일을 직접 다운로드할 수 있으며, 웹 기반 Playground를 통해 데모도 체험 가능함
- Apache 2.0 라이선스로 배포되어, 카피레프트나 특허 침해 우려 없이 자유롭게 상업적 활용, 맞춤화, 배포 가능함
- gpt-oss-120b: 데이터센터, 고성능 데스크탑 및 노트북용 대형 모델
- gpt-oss-20b: 대부분의 데스크탑 및 노트북에서 구동 가능한 중형 모델
주요 특징
-
에이전트 작업 최적화
- 도구 사용 및 지침 준수가 강점이며, 웹 검색·Python 코드 실행 등 에이전트 관련 활용에 적합함
-
맞춤화 및 파인튜닝
- reasoning_effort(추론 난이도) 등 하이퍼파라미터 조절 가능
- 전체 파라미터 파인튜닝을 통한 고급 맞춤화 지원
-
생각의 흐름(Chain-of-Thought) 노출
- 모델의 추론 과정 전개(생각의 흐름) 를 모두 볼 수 있어, 디버깅과 신뢰도 평가가 쉬움
-
Playground 제공
- 개발자와 연구자 누구나 브라우저에서 모델 성능을 체험할 수 있는 Playground 지원
모델 성능
- gpt-oss-120b와 gpt-oss-20b는 OpenAI의 상업 모델(OpenAI o3, o4-mini)과 여러 주요 벤치마크에서 성능이 직접 비교됨
- 각 모델의 추론·지식, 경쟁 수학 등 다양한 영역에서의 성적이 구체적으로 공개됨
- 일부 항목에서는 OpenAI 상업 모델과 근접하거나 특정 테스트에서는 뛰어난 결과를 보임
주요 벤치마크 성능 상세
-
추론 및 지식
- MMLU(Massive Multitask Language Understanding)
- gpt-oss-120b: 90
- gpt-oss-20b: 85.3
- OpenAI o3: 93.4
- OpenAI o4-mini: 93
- → 대형 상업 모델에는 다소 못 미치지만, 오픈 모델 기준으로 매우 우수한 종합 추론 성능을 보임
- GPQA Diamond
- gpt-oss-120b: 80.9
- gpt-oss-20b: 74.2
- OpenAI o3: 77
- OpenAI o4-mini: 81.4
- → 오픈 모델임에도 상업 모델과 거의 비슷한 고급 지식 기반 질의 응답 성능을 달성함
- Humanity’s Last Exam
- gpt-oss-120b: 19
- gpt-oss-20b: 17.3
- OpenAI o3: 24.9
- OpenAI o4-mini: 17.7
- → 고난이도 평가에서는 상업 모델에 비해 낮은 편이지만, 20b와 o4-mini는 거의 유사한 결과임
- MMLU(Massive Multitask Language Understanding)
-
경쟁 수학(AIME)
- AIME 2024
- gpt-oss-120b: 96.6
- gpt-oss-20b: 96
- OpenAI o3: 91.6
- OpenAI o4-mini: 93.4
- → 2024년 버전 기준으로는 오히려 상업 모델보다 높은 점수를 기록함
- AIME 2025
- gpt-oss-120b: 97.9
- gpt-oss-20b: 98.7
- OpenAI o3: 88.9
- OpenAI o4-mini: 92.7
- → 수학 분야에서는 OpenAI의 상업 모델을 능가하는 수치도 보임
- AIME 2024
-
종합 해석
- gpt-oss 시리즈는 특히 수학, 논리, 지식 분야에서 강력한 성능을 입증함
- 상업 모델과의 격차가 크지 않으며, 실제 서비스나 엔지니어링 응용에도 활용 가능성이 높음
- 대형 오픈 모델로서 연구·개발, 에이전트, 맞춤화 환경에서 충분히 경쟁력 있는 선택지임
안전성 및 테스트
- 모든 모델에 대해 엄격한 안전 훈련과 평가가 적용됨
- OpenAI의 준비성 프레임워크에 따라, 악의적 파인튜닝에 대한 내성도 별도로 테스트함
- 외부 안전 전문가와 협력하여, 오픈 모델의 안전 표준을 마련함
- Hugging Face와 GitHub에서 모델 다운로드 및 사용 가능