- GSM8K 점수 상승만으로는 LLM의 실제 수학 추론 능력을 판단하기 어려워, GSM-Symbolic은 같은 문제 구조의 여러 변형으로 더 통제된 평가를 가능하게 함
- 이 벤치마크는 GSM8K 문제를 기호 템플릿으로 바꿔 이름·숫자·조건절 수를 조절하며, 100개 템플릿에서 템플릿당 50개 샘플을 만들어 벤치마크당 5,000개 예제를 구성함
- 25개 최신 공개·비공개 모델은 같은 문제 구조에서도 숫자만 바뀌면 성능이 낮아지고 분산이 커졌으며, GSM8K 원본 점수는 25개 중 21개 모델에서 GSM-Symbolic 분포의 오른쪽에 위치함
- 조건절이 늘수록 정확도는 낮아지고 분산은 커졌으며, Gemma2-9B-it은 GSM-M1 84.4%에서 GSM-P2 41.8%로, GPT-4o는 94.4%에서 88.0%로 하락함
- 무관하지만 관련 있어 보이는 절을 추가한 GSM-NoOp에서는 모든 모델 성능이 크게 떨어졌고, Phi-3-mini는 GSM8K 대비 65.7%p 낮아져 필요한 정보와 불필요한 정보를 안정적으로 구분하지 못함
GSM8K만으로 보기 어려운 수학 추론 능력
- GSM8K는 8,000개 이상의 초등 수학 문제와 풀이를 포함하며, 7,473개 훈련 예제와 1,319개 테스트 예제로 구성됨
- 사칙연산 중심의 비교적 단순한 수학 문제라 Chain-of-Thought(CoT) 프롬프팅 평가에 널리 쓰임
- 단일 고정 테스트셋 구조에서는 한 번의 정확도만 얻을 수 있어, 질문 변형이나 난이도 변화에 따른 모델 행동을 통제해 보기 어려움
- 널리 쓰이는 벤치마크일수록 테스트 예제가 모델 훈련 데이터에 우연히 포함되는 데이터 오염 가능성도 커짐
- GSM-Symbolic은 GSM8K 문제를 기호 템플릿으로 바꿔 다양한 변형을 만들고, LLM의 수학 추론 성능을 단일 점수가 아닌 성능 분포로 평가함
- GSM-Symbolic 템플릿과 생성 데이터는 apple/ml-gsm-symbolic에 공개됨
템플릿 생성과 평가 방식
- GSM-Symbolic은 GSM8K 테스트셋의 특정 예제를 파싱 가능한 템플릿으로 바꾸는 방식으로 만들어짐
- 변수, 변수 범위, 정답이 맞도록 보장하는 조건을 지정함
- 초등 수학 문제 특성상 정답이 정수가 되도록 나누어떨어짐 같은 조건을 자주 사용함
- 사람 이름, 음식, 통화 같은 일반 고유명사를 활용해 템플릿 생성을 단순화함
- 템플릿 생성 뒤에는 여러 자동 검사를 거침
- 원래 변수 값이 템플릿에 남아 있지 않은지 확인함
- 원래 값이 모든 조건을 만족하는지 점검함
- 생성된 최종 답이 원래 문제의 답과 일치하는지 확인함
- 템플릿당 무작위 10개 샘플을 수동 검토함
- 모든 모델 평가 뒤 각 문제를 최소 2개 모델이 맞히지 못하면 다시 수동 검토함
- 숫자 범위는 원래 GSM8K 테스트셋과 가깝게 맞춤
- 목적은 산술 능력 자체가 아니라 논리적 추론 능력 평가에 있음
- 부록 분석은 확장된 숫자 범위가 모델의 산술 정확도가 유지되는 경계 안에 있음을 확인함
- 평가에는 2B부터 27B까지의 공개 모델 20개 이상과 GPT-4o-mini, GPT-4o, o1-mini, o1-preview 같은 비공개 최신 모델이 포함됨
- 전체적으로 약 500회 평가를 수행했으며, 본문 실험은 100개 템플릿과 템플릿당 50개 샘플로 구성된 5,000개 예제 벤치마크를 사용함
- 별도 언급이 없으면 GSM8K와 다른 수학 벤치마크에서 흔히 쓰이는 8-shot CoT와 greedy decoding 설정을 따름
- 예비 실험에서는 shot 수가 성능과 결론을 크게 바꾸지 않음
같은 문제 구조에서도 흔들리는 성능
- GSM-Symbolic의 50개 데이터셋에서 모든 최신 모델은 무시하기 어려운 정확도 분산을 보임
- Gemma2-9B는 최악 성능과 최고 성능 차이가 12%를 넘음
- Phi-3.5-mini는 그 차이가 약 15%임
- 각 질문 인스턴스의 차이는 이름과 숫자뿐이며, 문제를 풀기 위한 전체 추론 단계는 같음
- GSM8K 원본 문제 100개에서의 성능은 많은 모델에서 GSM-Symbolic 성능 분포 중심보다 1 표준편차 이상 오른쪽에 있음
- 이 현상은 25개 모델 중 21개에서 나타남
- 가능한 설명 중 하나는 GSM8K 테스트 예제가 모델 훈련 데이터에 우연히 들어가 성능이 낙관적으로 측정되는 데이터 오염임
- GSM8K에서 GSM-Symbolic으로 바꾸면 모든 모델 성능이 하락함
- Mistral-7b-it-v0.1은 -9.2%p
- Gemma2-2b와 Gemma2-2b-it은 각각 -7.4%p
- Gemma2-9b, Gemma2-9b-it, Mistral-7b-it-v0.3은 각각 -6.2%p
- GPT-4o-mini는 -2.4%p, o1-preview는 -2.2%p
- o1-mini는 -0.6%p, GPT-4o는 -0.3%p
- Llama3-8b와 GPT-4o처럼 GSM8K 성능이 GSM-Symbolic 분포 중심에 가까운 모델은 성능 하락이 작음
이름보다 숫자 변경에 더 민감함
- 이름만 바꾼 경우에도 성능 변동은 있지만, 숫자를 바꿀 때보다 분산이 작음
- 원래 GSM8K 정확도는 이름만 바꾼 분포의 중심에 더 가까움
- 숫자를 바꾸거나 이름과 숫자를 함께 바꾸면 분포 평균이 왼쪽으로 이동하고 분산이 커짐
- Gemma2-9b-it의 8-shot CoT 정확도는 GSM8K 87.0%, 이름 변경 88.6±2.0%, 숫자 변경 83.1±2.2%, 둘 다 변경 79.1±3.0%임
- Phi-3.5-mini-instruct는 GSM8K 88.0%, 이름 변경 89.1±1.8%, 숫자 변경 84.9±2.4%, 둘 다 변경 82.1±3.4%임
- Mathstral-7b-v0.1은 GSM8K 80.0%, 이름 변경 81.0±1.3%, 숫자 변경 77.3±2.0%, 둘 다 변경 74.0±3.5%임
- 이런 결과는 LLM의 추론 과정이 형식적 추론보다 훈련 데이터에서 본 유사한 질문과 풀이 단계를 맞추는 패턴 매칭에 가까울 수 있음을 시사함
조건절 증가와 GSM-NoOp에서 드러난 취약성
- 난이도 실험은 GSM-Symbolic에서 절을 하나 제거한 GSM-M1, 절을 하나 추가한 GSM-P1, 절을 둘 추가한 GSM-P2를 사용함
- 절 하나를 추가하거나 제거하는 것이 필요한 추론 단계 수를 정확히 하나 늘리거나 줄인다는 뜻은 아님
- 실험의 초점은 정확한 숫자 자체보다 성능 분포가 어떻게 변하는지에 있음
- 절 수가 늘수록 모든 모델에서 평균 성능은 내려가고 분산은 커짐
- Gemma2-9b-it: GSM-M1 84.4±2.4%, GSM-Symb 79.1±3.0%, GSM-P1 68.1±4.8%, GSM-P2 41.8±6.0%
- Phi-3.5-mini-instruct: 87.6±2.0%, 82.1±3.4%, 64.8±5.4%, 44.8±6.3%
- GPT-4o-mini: 92.5±1.6%, 91.7±2.0%, 81.1±3.1%, 72.4±4.6%
- GPT-4o: 94.4±1.6%, 94.9±1.9%, 93.9±2.6%, 88.0±3.4%
- o1-mini: 94.9±1.5%, 94.5±1.6%, 94.3±2.6%, 89.1±3.6%
- GSM-NoOp은 문제 풀이에 필요하지 않지만 관련 있어 보이는 절을 GSM-Symbolic 템플릿에 추가한 데이터셋임
- 예시에서는 “일요일에 딴 키위 중 5개가 평균보다 조금 작았다”는 정보가 총 키위 수 계산에는 영향을 주지 않음
- o1-mini와 Llama3-8B는 이 5개를 일요일 수확량에서 빼는 연산으로 바꿔 오답을 냄
- 모델들은 문장을 의미에 따라 무시하기보다 연산으로 변환하는 경향을 보임
- “discount” 같은 표현을 문맥과 무관하게 곱셈으로 해석하는 사례도 관찰됨
- GSM-NoOp에서는 모든 테스트 모델의 성능이 크게 하락함
- Phi-3-mini-128k-instruct는 GSM8K 대비 -65.7%p
- Phi-3-small-128k-instruct는 -64.0%p
- Gemma2-9b와 Gemma2-9b-it은 각각 -63.0%p
- Phi-3.5-mini-instruct는 -62.5%p
- GPT-4o-mini는 -40.0%p, GPT-4o는 -32.0%p
- o1-mini는 -29.1%p, o1-preview는 -17.5%p
- 같은 질문의 GSM-Symbolic 변형 8개를 shot으로 제공하는 NoOp-Symb 설정에서도 성능은 표준편차 범위 안에 머묾
- Phi-3-medium-128k-instruct는 GSM 87.3%, GSM-Symb 82.5%, GSM-NoOp 29.4%, NoOp-Symb 30.2%, NoOp-NoOp 22.6%임
- Llama3-8b-instruct는 GSM 76.0%, GSM-Symb 74.6%, GSM-NoOp 18.6%, NoOp-Symb 19.6%, NoOp-NoOp 19.2%임
- 다른 GSM-NoOp 문제 8개를 shot으로 제공하는 NoOp-NoOp 설정에서도 성능 회복은 제한적임
- Llama3-8B는 원래 NoOp와 성능이 같음
- Phi-3는 성능이 약간 낮아짐
- 일부 낮은 GSM8K·GSM-Symbolic 성능 모델은 NoOp-Symb에서 더 높은 성능을 보임
- Gemma2b는 GSM 12.1%, GSM-Symb 8.2%, GSM-NoOp 4.7%, NoOp-Symb 48.3%, NoOp-NoOp 3.1%임
- Mistral-7b-v0.1은 GSM 44.5%, GSM-Symb 41.1%, GSM-NoOp 16.2%, NoOp-Symb 62.5%, NoOp-NoOp 14.5%임
- 전체 결과는 LLM의 수학 추론이 같은 문제의 변형, 약간의 난이도 증가, 무관한 정보 추가에 취약하며, 확률적 패턴 매칭에 가까울 수 있음을 보여줌