- OpenAI가 gpt-oss-20b/120b 모델을 오픈 가중치로 공개함에 따라 2019년 GPT-2 이후 처음으로 OpenAI의 대형 공개 가중치 LLM이 등장함
- gpt-oss 모델은 GPT-2와 비교해 Dropout, Absolute Position Embedding, GELU 등을 효율적인 현대 기법인 RoPE, SwiGLU, RMSNorm 등으로 대체하며 발전함
- Mixture-of-Experts(모듈형 전문가 구조), Sliding Window Attention, MXFP4 양자화 등의 적용으로 성능 효율뿐 아니라 단일 GPU 실행 환경을 크게 개선함
- Qwen3와의 비교에서 아키텍처 깊이/넓이, 전문가 수, 주의 편향, 오픈소스 라이선스 등 다양한 차별점이 존재함을 확인함
- gpt-oss-20b는 최신 하드웨어에 맞춘 경량화와 reasoning effort 조정 기능으로 실제 활용성과 연구 확장성 모두 확보함
개요 및 주요 혁신
- OpenAI는 gpt-oss-20b/120b를 2019년 GPT-2 이후 처음으로 오픈 가중치로 공개함
- 일반 사용자 GPU(최대 16GB RAM)에서 20B, H100 80GB에서 120B를 실행 가능하게 함
- MXFP4 최적화로 단일 GPU 실행, 소비자 접근성 확대
GPT-2 → gpt-oss 주요 아키텍처 변화
Dropout 제거
- GPT-2에는 Dropout이 포함됐으나 대량 데이터 단일 epoch 학습 환경에선 오히려 성능 저하가 확인됨
- 최근 연구 결과에서도 Dropout 미적용이 LLM의 다운스트림 작업에서 더 뛰어난 성능을 보임
RoPE(회전 위치 임베딩) 채택
- 기존 절대 위치 임베딩 대신 RoPE(Rotary Position Embedding) 가 주류로 자리 잡음
- RoPE는 쿼리/키 벡터의 각도를 위치에 따라 회전시켜 더 유연하고 일반화된 위치 정보를 제공함
SwiGLU 활성화 함수와 GLU 도입
- GEGLU/SwiGLU 등 GLU 방식 도입으로 기존 2-layer FFN보다 적은 파라미터로 더 우수한 표현 능력을 발휘함
- Swish는 연산적으로도 GELU 대비 효율적
Mixture-of-Experts(MoE) 적용
- 단일 FFN 대신 다중 전문가(Expert) 네트워크를 활용해 매 토큰 생성 시 일부 전문가만 활성화
- 모델 파라미터 수를 급격히 늘리면서도 추론 효율성(희소성) 유지, 학습 용량 증대
Grouped Query Attention(GQA) 도입
- 기존 Multi-Head Attention 대비 키/값 공유로 메모리 및 연산량 절감 효과
- 성능 손실 없이 효율성 개선, 대규모 LLM에서 표준적 적용 추세
Sliding Window Attention 활용
- 일부 레이어마다 전체 문맥 대신 최근 128토큰 한정 Sliding Window로 국소 주의 계산, 메모리 사용량 최소화
- 성능 저하 없이 빠른 추론, 대규모 컨텍스트 지원용
RMSNorm 채택
- LayerNorm 대신 RMSNorm 적용으로 연산 효율 증대
- LayerNorm의 평균/분산 계산 대신 RMS(평균제곱근)를 적용, GPU 연산 부담 감소
gpt-oss와 Qwen3 비교
규모/구조 차이
- Qwen3은 더 깊은(48개 Transformer 블록) 구조이나, gpt-oss는 더 넓은(emb dimension, head 수 증가) 구조
- 깊은 모델이 더 유연하지만 학습 어려움, 넓은 모델이 추론 병렬화에 유리(Gemma 2 논문, 9B 모델 기준 넓은 쪽이 소폭 우세)
MoE 구조 차이
- gpt-oss-20b: 32명 대형 전문가, 4명만 활성화
- Qwen3: 다수 소형 전문가, 8명 활성화
- 최신 흐름은 더 많은 소형 전문가 구성이 효과적이라는 방향이나 gpt-oss는 대형-소수 구조 고수 (20B, 120B에서는 전문가 및 블록 수만 조정)
Attention Bias와 Sinks
- gpt-oss는 attention에 bias 유닛 활용 (GPT-2 시절 이후 보기 드문 방식)
- 하지만 key-proj에는 효과 미미함이 최근 연구에서 밝혀짐
- 주의 sink는 시퀀스 시작위치에 항상 attend되는 특수 토큰 개념이나, gpt-oss에서는 입력 토큰에 변형 없이 Learned bias logit 형태로 각 head에 추가 적용
라이선스 및 공개 범위
- Apache 2.0 오픈소스 라이선스로 상업적 활용/파생 모델 구축 자유
- 단, 진정한 의미의 오픈소스(학습 코드, 데이터 세트 공개)는 아님(‘open weight’ 모델임)
기타 세부 사항 및 실제 운용
훈련/최적화
- gpt-oss는 2.1M H100-hours 컴퓨팅 리소스로 훈련
- 영어 중심, STEM과 코딩, 일반 지식 텍스트에 집중
- 사전학습+지도 미세학습(Instruction), RL 기반 reasoning 단계 등 최신 기법 적용
Reasoning Effort 조절
- System prompt를 통해 reasoning effort(저/중/고)를 설정해 답변 길이·정확도를 자동 조정
- 단순 작업은 저효율로 빠르게, 복잡한 reasoning이 필요하면 높게 설정 가능
MXFP4 양자화로 단일 GPU 지원
- MXFP4 포맷 활용으로 20B도 16GB VRAM(최신 GPU 필수)에서 구동 가능
- 120B는 H100 기준 80GB 메모리면 단일 GPU에서 실현 가능, 분산 처리 없고 구동 간편
벤치마크 및 실 사용성
- gpt-oss는 학습 초점이 reasoning에 치중, 일부 범용 지식 질문에는 환각(hallucination) 경향
- 사용성 면에서는 현존 오픈 모델 중 상위, tool integration과 조합 시 실용성 강화 예정
- 실제 사용에서 정확도와 reasoning의 균형, 추후 타 오픈모델과의 비교 필요
GPT-5와의 비교
- gpt-oss-120b는 OpenAI 상용 모델(GPT-5)과 벤치마크 기준 근접 성능을 보임
- 현실 환경에서의 우위는 더 지켜봐야 하나, 오픈 가중치로 제공되는 최신 LLM 중 강력한 대안임
- 벤치마크만으로 실전 경쟁력 완전히 설명하기엔 한계, 향후 외부 비교 및 연구에 큰 기회 제공
요약
- gpt-oss 시리즈의 등장은 대형 오픈 가중치 LLM 분야의 새로운 기준 제시, 최신 LLM들이 도입한 혁신적 아키텍처들이 실제로 어떻게 구현·적용됐는지 상세히 비교, 분석됨
- Quen3, GPT-5 등 다른 최신 모델과의 차별점과 추세를 파악할 수 있어, 실제 적용/연구에 유용한 최신 동향 파악 가능