- OpenAI가 첫 오픈소스 대규모 언어 모델
gpt-oss-120b와gpt-oss-20b를 공개했으며, 일부 벤치마크에서는 뛰어나지만 실제 응용에서는 한계가 있음 - 이 모델들은 범용 지식은 갖추었으나 대중문화 등 특정 영역 지식이 부족하다는 평가를 받음
- Microsoft의 Phi 시리즈처럼 합성 데이터 중심 학습을 통해 벤치마크 성능은 높지만 실제 활용도는 떨어지는 경향이 있음
- 합성 데이터 학습은 안전성을 높여 오픈소스 공개 시 발생할 수 있는 오용 위험을 줄이는 장점이 있음
- OpenAI는 중국산 오픈소스 모델 대비 벤치마크 우위를 확보하면서도 안전성을 유지하기 위해 Phi 스타일 접근을 선택한 것으로 보임
OpenAI의 첫 오픈소스 LLM 공개
- OpenAI가
gpt-oss-120b와gpt-oss-20b라는 첫 오픈소스 대규모 언어 모델을 발표했으며, 웹에서 직접 대화 가능 - 일부 벤치마크에서는 우수한 성능을 보이지만, SimpleQA 같은 특정 테스트에서는 성능이 떨어짐
- 과학 분야 등 일반 지식은 풍부하지만 대중문화 지식은 부족하다는 평가가 있음
- 실제 활용성은 6개월 정도 후에 명확해질 것으로 예상되며, 벤치마크 대비 실전 성능이 낮을 가능성이 큼
Phi 모델과 합성 데이터 학습
- 2024년 Microsoft의 Sebastien Bubeck이 주도한 Phi 시리즈는 전적으로 합성 데이터로 학습된 모델
- 합성 데이터는 다른 언어 모델이 생성하거나 사람이 선별한 교재 기반 텍스트로, 품질과 통제가 용이하지만 생성 비용이 큼
- 이 방식은 벤치마크 성능을 높이지만, 실제 환경에서는 기대 이하의 결과를 보이는 경향이 있음
- 합성 데이터는 벤치마크 문제 유형에 맞춰 쉽게 생성할 수 있어 시험 대비형 학습이 가능하지만, 범용성은 떨어짐
Sebastien Bubeck의 OpenAI 합류와 gpt-oss
- 2024년 말 Bubeck이 Microsoft를 떠나 OpenAI에 합류
gpt-oss모델의 사전학습 데이터 세부 내용은 공개되지 않았으나, 강하게 필터링되거나 합성된 데이터를 사용했을 가능성이 큼- 이러한 접근은 Phi-5 및 Phi-5-mini와 유사한 특성을 가질 수 있음
합성 데이터의 안전성 이점
- 오픈소스 모델은 공개 후 무제한으로 파인튜닝이 가능해 안전성 문제가 발생할 수 있음
- 특히 소형 언어 모델의 주요 비공식 활용처 중 하나가 성인 역할극이어서, 안전성 관리가 중요
- 합성 데이터나 교재 기반 데이터로 학습하면 위험 콘텐츠를 포함하지 않아 안전성을 높일 수 있음
- OpenAI는 중국산 오픈소스 모델보다 벤치마크에서 우위를 점하면서도 안전성을 유지하는 전략을 선택한 것으로 보임
결론: 사실상 Phi-5 계열
gpt-oss모델은 합성 데이터 기반의 안전 중심 설계로, 실전 성능보다 벤치마크 점수와 안전성을 우선한 것으로 추정- 결과적으로 이 모델들은 사실상 Phi-5와 Phi-5-mini에 해당하는 성격을 가짐