- ChatGPT 출시 1주년 시점에 오픈소스 LLM이 어떤 과제에서 ChatGPT와 동등하거나 더 나은 성능을 냈는지 비교한 서베이임
- ChatGPT는 인간 피드백 기반 강화학습을 통해 유용하고 안전한 답변과 지시 수행을 보여줬고, 출시 두 달 만에 1억 사용자에 도달함
- 비공개 LLM은 아키텍처와 학습 데이터가 공개되지 않아 재현성, 위험 평가, 장애, API 비용, 데이터 소유권과 프라이버시 부담이 남아 있음
- Llama-2, Falcon 같은 오픈소스 모델은 GPT-4 등 비공개 모델보다 뒤처진다는 인식이 있지만, 일부 벤치마크에서는 GPT-3.5-turbo를 앞선 사례도 있음
- 모델과 벤치마크가 빠르게 바뀌는 환경에서는 단일 승자를 고르기보다, 일반 능력·에이전트·추론·장문 맥락·응용·신뢰성을 나눠 봐야 함
ChatGPT 이후 달라진 LLM 환경
- ChatGPT는 2022년 말 출시 이후 AI 연구와 상업 영역 전반에 큰 변화를 가져옴
- 대형 언어 모델에 지도 미세조정과 인간 피드백 기반 강화학습을 적용해, 다양한 질문에 답하고 지시를 따르는 챗봇 경험을 대중화함
- 이전에는 요약이나 질의응답 같은 자연어 과제를 사전학습 후 과제별로 미세조정한 모델이 주로 처리했지만, ChatGPT는 이런 과제를 폭넓게 수행함
- 출시 두 달 만에 1억 사용자에 도달해 TikTok이나 YouTube 같은 인기 앱보다 빠른 성장세를 보임
- 기업들은 노동 비용 절감, 워크플로 자동화, 새로운 고객 경험 가능성 때문에 ChatGPT에 큰 투자를 이어감
비공개 LLM이 만드는 제약
- ChatGPT는 오픈소스가 아니며, 접근 권한도 민간 기업이 통제함
- InstructGPT, 즉 GPT-3.5에서 도입된 절차를 따른다는 설명은 있지만 정확한 아키텍처, 사전학습 데이터, 미세조정 데이터는 공개되지 않음
- 이런 비공개성은 모델을 평가하고 운영하는 과정에서 여러 부담을 만듦
- 내부 학습 절차를 알 수 없어 독성·비윤리적·허위 콘텐츠 생성 같은 사회적 위험을 추정하기 어려움
- ChatGPT 성능이 시간에 따라 변한다는 보고가 있어 재현 가능한 결과를 얻기 까다로움
- 2023년 11월 두 차례 큰 장애가 발생했고, ChatGPT 웹사이트와 API 접근이 완전히 차단된 사례가 있음
- 기업 도입 시 API 호출 비용, 서비스 장애, 데이터 소유권, 프라이버시가 실질적인 부담이 될 수 있음
- Sam Altman CEO 해임, 직원 반발, 복귀로 이어진 이사회 갈등 같은 예측하기 어려운 사건도 기업 사용자에게 고려 요소가 됨
오픈소스 LLM은 어디까지 따라왔나
- 오픈소스 LLM은 비공개 LLM의 제약을 완화하거나 우회할 수 있는 대안으로 주목받음
- 연구 커뮤니티는 높은 성능의 LLM을 오픈소스로 유지하려는 노력을 이어가고 있음
- 2023년 말 기준으로 Llama-2나 Falcon 같은 오픈소스 LLM은 OpenAI의 GPT-3.5, GPT-4, Anthropic의 Claude, Google의 Bard 같은 비공개 모델보다 뒤처진다는 인식이 널리 퍼져 있음
- GPT-4는 일반적으로 가장 앞선 모델로 간주됨
- 다만 격차는 계속 줄어들고 있으며, 일부 표준 벤치마크에서는 최고 성능 오픈소스 LLM이 GPT-3.5-turbo보다 좋은 결과를 보임
- 비교 자체도 쉽지 않음
- 비공개 LLM은 더 최신 데이터로 재학습되며 계속 업데이트됨
- 오픈소스 LLM도 이를 따라잡기 위해 새로 출시됨
- LLM 비교에 쓰이는 평가 데이터셋과 벤치마크가 많아 최고의 모델 하나를 고르기 어려움
비교한 평가 영역과 대표 모델
- 서베이는 오픈소스 LLM과 ChatGPT를 비교한 여러 평가를 모아, 현재 성능 격차를 영역별로 볼 수 있게 정리함
-
일반 능력
- AlpacaEval, MT-bench, ELO rating, Open LLM leaderboard 등이 포함됨
- 관련 오픈소스 모델로 Llama-2, WizardLM, Zephyr, Deepseek, Yi, Mixtral 등이 다뤄짐
-
에이전트 능력
- 도구 사용, 자기 디버깅, 자연어 피드백 따르기, 환경 탐색으로 나뉨
- API-Bank, ToolBench, APIBench, ToolAlpaca, InterCode-Bash, InterCode-SQL, MINT, ALFWorld, WebArena 등이 평가에 포함됨
- Gorilla, ToolLLaMA, Lemur-chat, AgentLlama, OpenChat-3.5 등이 관련 모델임
-
논리 추론
- 수학과 코딩 영역을 포함함
- GSM8K, MATH, TheoremQA, HumanEval, MBPP, APPs 등이 평가 과제로 쓰임
- WizardMath와 WizardCoder가 대표 모델로 언급됨
-
장문 맥락 모델링
- SCROLLS, Zero-SCROLLS, LongBench, L-Eval, BAMBOO, M4LE 등이 포함됨
- Llama-2-long이 관련 모델로 다뤄짐
-
응용 특화 영역
- 질의 중심 요약, 개방형 질의응답, 의료, 구조화 데이터 생성, 비평 생성 등을 포함함
- QMSum, SQuALITY, CovidET, NEWTS, NQ, TriviaQA, NewsQA, SQuAD, Quoref, NarrativeQA, DROP, MIMIC-CXR 등이 과제로 쓰임
- InstructRetro, MentaLLaMA, Radiology-Llama-2, Struct-Bench, Shepherd 등이 관련 모델임
-
신뢰성
- 환각과 안전성을 다룸
- TruthfulQA, FactualityPrompt, FActScore, KoLA-KC, HaluEval, FACTOR, SafetyBench, XSTEST 등이 포함됨
- Platypus와 Chain-of-Verification 등이 환각 관련 접근으로 언급됨
연구자와 기업이 얻을 수 있는 판단 기준
- 이 서베이는 연구 커뮤니티와 비즈니스 부문이 오픈소스 LLM의 현재 수준과 향후 가능성을 판단하는 데 필요한 자료를 제공함
- 연구자는 오픈소스 LLM의 진행 상황과 변화 추세를 종합하고, 향후 연구 방향을 찾는 데 활용할 수 있음
- 기업 의사결정자는 오픈소스 LLM 도입의 적용 가능성과 이점을 평가하는 데 필요한 통찰과 지침을 얻을 수 있음
- 논문은 배경 개념을 소개한 뒤 여러 영역에서 ChatGPT를 이긴 오픈소스 LLM을 검토하고, 개발 추세·훈련 모범 사례·잠재적 이슈를 논의한 뒤 요약으로 마무리함