- LLM 추론 평가는 벤치마크 포화와 데이터 오염 때문에 흔들리고 있으며, 이 연구는 모델 가중치 대신 출력에 영향을 준 사전 훈련 문서를 추적함
- Cohere Command R 7B와 35B, 사전 훈련 토큰 25억 개와 문서 500만 개를 대상으로 40개 사실 질의와 40개 추론 질의의 영향 문서를 순위화함
- 사실 질의는 질문마다 영향 문서가 달랐지만, 같은 수학 과제의 추론 질의들은 여러 질문에서 비슷한 영향 패턴을 보여 절차적 지식의 존재를 시사함
- 사실 질의의 답은 상위 0.01% 영향 문서에서 자주 발견된 반면, 추론 질의의 정답이나 중간 단계 답은 대체로 상위 영향 문서에 나타나지 않았음
- 추론은 이전에 본 답을 꺼내는 방식보다, 비슷한 절차를 담은 문서들에서 일반화 가능한 풀이 과정을 합성하는 방식에 가까움
벤치마크 오염을 넘어 사전 훈련 문서를 추적
- LLM은 여러 추론 벤치마크에서 빠르게 높은 성능을 보이지만, 데이터 오염 때문에 점수를 일반화 능력으로 곧바로 해석하기 어려움
- 일반적인 머신러닝에서는 훈련 데이터와 테스트 데이터를 분리해 일반화를 측정함
- 현재 최첨단 모델은 수조 개 토큰 규모의 데이터를 사용하므로 벤치마크가 사전 훈련 데이터에 섞일 가능성을 피하기 어려움
- 재표현된 벤치마크 데이터도 N-그램 기반 탐지를 피하면서 성능에 영향을 줄 수 있음
- 핵심 질문은 LLM이 사전 훈련 데이터에서 어떻게 추론을 배우는가임
- 이전에 본 답이나 추론 흔적을 검색해 재조합하는지
- 질문과 더 추상적으로 관련된 여러 문서에서 절차를 배워 일반화하는지 비교함
- 분석은 모델 내부 가중치를 직접 해석하지 않고, 특정 출력에 영향을 준 사전 훈련 문서를 거슬러 올라감
- 강건 통계 기법을 대규모 Transformer에 맞춘 영향 함수 방식으로 사용함
- 각 사전 훈련 문서가 특정 프롬프트-완성 쌍의 가능도에 얼마나 영향을 주는지 계산함
실험 설정
- 실험 대상은 Cohere의 Command R 7B와 35B 두 모델임
- 분석한 사전 훈련 데이터는 25억 토큰이며, 이를 500만 개 문서로 다룸
- 질의는 총 80개로 구성됨
- 40개 사실 질의: 파라메트릭 지식에서 답을 검색해야 하는 질문
- 40개 추론 질의: 단순한 수학 추론 질문
- 추론 질의는 세 가지 수학 과제를 포함함
- 2단계 산술
- 기울기 계산
- 선형 방정식 풀이
- 각 질의마다 사전 훈련 문서 500만 개를 모델 출력 가능도에 미친 영향 기준으로 순위화함
추론에서는 같은 절차를 담은 문서가 반복해서 영향
- 같은 수학 과제에 속한 서로 다른 추론 질의들은 문서 영향 패턴이 비슷하게 나타남
- 한 문서가 한 추론 질의의 추론 흔적에 미치는 영향은 같은 과제의 다른 질의에 대한 영향도 강하게 예측함
- 이 패턴은 4개 사례 중 3개에서 확인됨
- 문서는 특정 숫자나 답 하나에만 대응하지 않고, 같은 절차를 다른 숫자에 적용하는 여러 질문에 비슷하게 기여함
- 반대로 사실 질의는 각 질문마다 주로 서로 다른 데이터 집합에 의존하며, 추론 질의 같은 공통 영향 패턴이 나타나지 않음
- 기울기 계산 과제에서는 상관이 특히 강하게 나타남
- 이 과제의 다수 질의에서 상위 0.002% 사전 훈련 데이터 안에 코드나 수학 형태의 풀이 절차가 여러 번 발견됨
사실 검색과 추론은 영향 문서의 성격이 다름
- 사실 질의에서는 답 자체가 영향력이 높은 문서에 자주 등장함
- 상위 500개 문서, 즉 상위 0.01% 영향 문서에서 7B 모델 질의의 55%, 35B 모델 질의의 30%가 답을 포함함
- 추론 질의에서는 정답이 영향력이 높은 문서에 거의 나타나지 않음
- 25억 토큰 전체에서 정답을 찾을 수 있는 경우에도 상위 영향 문서에는 보통 나타나지 않음
- 중간 추론 단계의 답도 영향력이 높은 문서에 대체로 포함되지 않음
- 추론 질의는 모델이 생성한 질의 정보량 단위당 개별 문서 영향이 사실 질의보다 대체로 낮음
- 추론 흔적을 만들 때 문서 하나하나에 덜 의존함
- 영향 문서 집합의 전체 영향 크기도 추론 질의에서 덜 변동적임
- 25억 사전 훈련 토큰의 무작위 부분집합 안에 매우 영향력 높은 문서가 포함되는지는 사실 질의에서 더 우연에 좌우됨
- 두 패턴을 함께 보면, 추론은 개별 문서 의존도가 낮고 더 일반적인 문서 집합에서 일반화하는 쪽에 가까움
코드와 고품질 절차 데이터의 역할
- 수학 추론 질의의 긍정적·부정적 영향 순위 상위 부분에서 코드 데이터가 훈련 분포 대비 강하게 과대표집됨
- 코드가 분석 대상 모든 수학 과제에서 중요한 역할을 한다는 증거가 확인됨
- 모델의 추론은 사전 훈련 중 형성된 파라메트릭 지식에서 답을 검색하는 방식과 다름
- 일반적인 절차 설명
- 유사한 절차가 적용된 사례
- 코드나 수식으로 풀이 과정을 보여주는 문서
- 모든 가능한 사례를 사전 훈련 데이터에 넣기보다, 다양한 추론 과제에서 절차를 보여주는 고품질 데이터에 집중하는 편이 더 효과적일 수 있음
- 연구 범위는 같은 수학 과제 안에서 절차를 학습하는 경우로 제한됨
- 코드처럼 여러 과제에 걸쳐 절차 학습을 가능하게 하는 사전 훈련 데이터 유형이 있는지는 추가 질문으로 남아 있음