- 짧은 AIW 문제만으로도 GPT-4, Claude 3 Opus 같은 최신 LLM의 일반화와 기본 추론이 크게 흔들릴 수 있음
- 문제는 “Alice has N brothers and M sisters. How many sisters does Alice’s brother have?” 형태이며, 정답은 Alice와 Alice의 자매를 합친 M+1임
- N, M ≤ 7의 자연스러운 변형은 구조와 난이도를 바꾸지 않지만, GPT-4 예시에서는 변형 3 정답률이 0에 가깝고 변형 4는 1에 가까운 성능 변동이 나타남
- 사고 과정 유도(chain-of-thought), 재검토, 자기검증, 다중 턴 상호작용은 실패를 안정적으로 고치지 못했고, 오답에는 그럴듯한 설명과 과신이 자주 따라붙음
- AIW Light 통제 문제 결과를 보면 언어 파싱, 가족 관계 이해, 성별 속성 바인딩, 기본 산술만으로는 실패를 설명하기 어려워, 기존 표준 벤치마크의 일반화 결함 탐지력을 다시 봐야 함
AIW 문제로 드러난 단순 추론 실패
- LLM은 MMLU, HellaSwag, ARC, MATH, GSM8k 같은 표준 벤치마크에서 높은 점수를 받으며 일반화와 추론 능력이 강하다고 평가되어 왔음
- 이 평가는 복잡한 벤치마크 대신 사람이 쉽게 풀 수 있는 짧은 상식 문제에서도 같은 능력이 유지되는지 확인하는 방식으로 검증됨
- AIW 문제 템플릿은 다음과 같음
- “Alice has N brothers and she also has M sisters. How many sisters does Alice’s brother have?”
- 모든 형제자매가 같은 부모를 공유한다고 가정함
- Alice의 남자 형제가 가진 자매 수는 Alice 본인과 Alice의 자매를 합친 M+1임
- 문제 변형은 N, M ≤ 7의 자연수를 바꿔 만들며, 구조와 난이도는 유지됨
- Variation 1: Alice has 3 brothers and 6 sisters → 정답 7
- Variation 2: Alice has 2 sisters and 4 brothers → 정답 3
- Variation 3: Alice has 4 sisters and 1 brother → 정답 5
- Variation 4: Alice has 4 brothers and 1 sister → 정답 2
변형에 따라 크게 흔들리는 정답률
- 테스트한 최신 LLM은 AIW 문제와 구조 보존 변형에서 낮은 평균 정답률과 큰 변동을 보임
- GPT-4(gpt-4-0613)는 각 변형마다 60회 시행했을 때 문제 숫자에 따라 결과가 크게 달라짐
- Variation 3에서는 정답률이 0에 가까움
- Variation 4에서는 정답률이 1에 가까움
- STANDARD, THINKING, RESTRICTED 프롬프트 유형 전반에서 같은 현상이 나타남
- 문제 해결과 무관한 숫자 변화만으로 성능이 흔들리기 때문에, 이는 견고성 부족과 일반화 결함으로 해석됨
- 최근 추론 모델인 DeepSeek-R1, o1-mini도 AIW 문제 버전에서 강한 성능 변동을 보여 같은 취약성이 나타남
- GPT-4/4o, Claude 3 Opus/Claude 3.5 Sonnet, Qwen 2.5 72B, Llama 3.1 405B 같은 대형 모델은 정답률이 0보다 높고, 정답 출력에서는 올바른 추론이 보이는 경우가 많음
- 다만 올바른 추론의 빈도는 자연스러운 구조 보존 변형에 따라 크게 달라짐
- 핵심은 추론이 완전히 없다는 것이 아니라, 추론이 취약하고 쉽게 교란된다는 점임
통제 문제로 배제한 단순 원인
- 실패 원인이 자연어 파싱, 숫자 처리, 가족 관계 이해, 속성 바인딩, 기본 산술 같은 낮은 수준 문제인지 확인하기 위해 AIW Light 통제 문제가 구성됨
- AIW Light Arithmetic Siblings는 “Alice has N brothers and M sisters. How many siblings does Alice have?” 형태임
- 정답은 N+M
- 가족 관계를 파악하고 주어진 형제·자매 수를 더하면 됨
- 원래 AIW와 달리 Alice를 자매 집합에 포함하는 집합 연산이나 성별 속성 바인딩은 필요하지 않음
- AIW Light Family는 “How many brothers does Alice’s sister have?”를 묻는 형태임
- 정답은 N
- 기본 가족 관계와 “Alice’s sister”라는 엔티티 이해만 필요함
- 산술이나 집합 연산은 필요하지 않음
- AIW Light Arithmetic Total Girls는 “How many girls are there in total?”을 묻는 형태임
- 정답은 원래 AIW와 같은 M+1
- Alice가 여성이라는 속성, 자매의 성별, 전체 여자 수 합산이 필요함
- 원래 AIW와 달리 Alice를 남자 형제의 자매 집합에 배정하는 집합 처리는 필요하지 않음
- 통제 문제 결과는 원래 AIW 실패가 단순한 토큰화·자연어 파싱·기본 가족 구조·속성 바인딩·초등 산술 문제만으로 설명되기 어렵다는 쪽을 가리킴
프롬프트와 평가 절차
- 실험은 프롬프트 엔지니어링 영향을 확인하기 위해 세 가지 주요 프롬프트 유형을 사용함
- STANDARD: 최종 답을 자연수 형식으로 출력하도록 지시
- THINKING: 신중히 생각하도록 유도해 chain-of-thought 스타일을 장려
- RESTRICTED: 최종 답 자연수 외에는 아무것도 출력하지 않도록 제한
- THINKING v2는 THINKING에 “step by step” 문구를 추가한 작은 변형이며, 통제 실험에서 THINKING과 동등한 성능 양상을 보임
- 각 입력은
<문제 변형> <프롬프트 유형>형태이며, 모델 응답에서 최종 답을 쉽게 파싱하기 위해### Answer:형식을 요구함- 모델들은 이 형식 지시를 따를 수 있었음
- 형식 지시가 없는 통제 실험도 수행되어 관찰된 행동이 해당 형식에 의존하지 않음이 확인됨
- 각 모델·문제 변형·프롬프트 유형 조합마다 최소 30회 시행을 수집함
- 정답 여부를 Bernoulli 시행으로 해석함
- 정답률 추정치는 성공 비율 X/n으로 계산함
- 확률 p의 평균과 분산을 추정하고 Beta 분포 파라미터를 사용해 성능 분포를 시각화함
- 모델 선택은 강한 일반화와 추론 능력을 주장하고 표준 벤치마크·리더보드에서 높은 순위를 보이는 SOTA LLM을 대상으로 함
- 가능한 경우 같은 모델 계열 안에서 작은 규모부터 큰 규모까지 포함함
- API 접근 또는 vLLM 기반 로컬 배포를 사용함
- 실험에는 liteLLM과 TogetherAI가 사용됨
- 원시 응답 데이터, 정답률 추정치, 실험 루틴은 재현성과 커뮤니티 검증을 위해 공개됨
오답 과신과 벤치마크 재평가
- 정답률이 낮은 AIW 변형에서는 출력 자연수 분포의 피크가 오답에 몰리는 경우가 있어, 단순 다수결만으로는 해결하기 어려움
- 오답은 종종 그럴듯한 설명을 동반함
- 모델은 잘못된 최종 답을 뒷받침하는 설득력 있는 문장을 생성함
- 정답이라고 확신하는 어조가 함께 나타남
- 사용자가 정답을 쉽게 검증할 수 없는 상황에서는 이런 응답이 사용자를 잘못된 답으로 이끌 수 있음
- 다중 턴 상호작용과 자기검증 실험에서도 모델은 실수를 제대로 감지하거나 오답을 수정하는 데 실패함
- 사고 과정 유도, 재검토 요청, 다단계 재평가 같은 표준 개입은 AIW 문제의 정답률 변동과 실패를 안정적으로 고치지 못함
- 표준 벤치마크에서 높은 점수를 받는 모델이 단순 AIW 변형에서 정답률 0에 가까운 성능을 보이는 경우가 있어, 현재 평가 절차는 일반화와 추론 결함을 제대로 탐지하지 못함
- 현재 SOTA LLM의 능력은 재평가가 필요하며, 이런 결함을 포착할 수 있는 새로운 표준 벤치마크가 필요함