- 대규모 언어 모델 훈련에서 데이터 출처의 폭이 중요해지면서, The Pile은 22개 고품질 데이터셋을 묶은 825GiB 규모의 공개 훈련 세트로 공개됨
- 핵심 설계는 책, 코드, 웹페이지, 채팅 로그, 학술 논문 등 여러 출처를 결합해 교차 도메인 일반화를 높이는 데 있음
- The Pile로 훈련한 모델은 기존 언어 모델링 벤치마크에서 중간 수준의 개선을 보였고, Pile BPB에서는 유의미한 개선을 보임
- Pile BPB는 여러 도메인의 텍스트를 함께 다루기 때문에 단일 말뭉치 성능보다 폭넓은 텍스트 모델링 능력을 확인하는 데 쓰임
- 리더보드는 테스트셋 중복 가능성을
*로 표시하며, Zero-shot은 The Pile의 모든 구성요소가 훈련 데이터에 포함되지는 않았음을 뜻함
The Pile의 구성과 배포
- The Pile은 825GiB 규모의 다양한 오픈소스 언어 모델링 데이터셋임
- 22개의 더 작고 고품질인 데이터셋을 하나로 결합해 구성됨
- 다운로드 파일은 the Eye에서 호스팅됨
- The Pile을 사용하거나 The Pile로 평가하는 모델이 있으면 EleutherAI에 알릴 수 있음
- The Pile 또는 구성요소를 사용할 경우 다음 논문을 인용해야 함
-
The Pile: An 800GB Dataset of Diverse Text for Language Modeling
- arXiv preprint arXiv:2101.00027, 2020
-
훈련 세트와 벤치마크로서의 역할
- 특히 대규모 모델에서는 데이터 출처의 다양성이 일반적인 교차 도메인 지식과 다운스트림 일반화 능력을 개선함
- 평가 결과, The Pile로 훈련한 모델은 전통적 언어 모델링 벤치마크에서 중간 수준의 개선을 보였고 Pile BPB에서는 유의미한 개선을 기록함
- Pile BPB(bits per byte)는 여러 도메인의 텍스트 이해가 필요한 벤치마크임
- 대상 도메인에는 책, GitHub 저장소, 웹페이지, 채팅 로그가 포함됨
- 의학, 물리, 수학, 컴퓨터과학, 철학 논문도 포함됨
- 이 벤치마크는 도메인별 세계 지식과 추론 능력을 함께 요구해, 대규모 언어 모델의 교차 도메인 텍스트 모델링 능력을 평가하는 데 활용됨
- 리더보드 예시는 2021년 1월 1일 기준 항목을 포함함
- GPT-3 (Zero-Shot)*, OpenAI: Test BPB 0.7177
- GPT-2 (Zero-Shot)*, OpenAI: Test BPB 1.2253
*는 잠재적 테스트셋 중복 가능성을 나타냄- Zero-shot은 The Pile의 모든 구성요소가 훈련 데이터에 포함되지는 않았음을 뜻함