- 사용자가 요구사항을 한 번에 완전히 쓰지 못하는 상황에서, 15개 LLM의 멀티 턴·불완전 명령 성능은 단일 턴·완전 명령보다 크게 낮아져 6개 생성 과제 평균이 90%에서 65%로 떨어짐
- 실험은 기존 단일 턴 벤치마크 명령을 여러 조각으로 나누는 샤딩(sharding) 방식으로 구성해, 대화가 진행될수록 조건과 맥락이 조금씩 드러나게 함
- 성능 저하는 단순한 능력 부족보다 불안정성 증가의 영향이 컸고, 200,000개 이상 대화에서 모델은 초반 가정과 이른 최종 답변 시도에 과도하게 의존함
- 테스트 대상은 Llama3.1-8B-Instruct부터 Gemini 2.5 Pro까지 포함됐으며, Code, Database, Actions, Math, Data-to-Text, Summary 등 프로그래밍과 자연어 생성 과제를 함께 사용함
- 실제 인간-AI 대화를 단순화한 시뮬레이션이지만 모든 대화가 과제 해결에 충분한 정보로 끝나도록 설계됐기 때문에, 관측된 하락폭은 실제 불완전 멀티 턴 대화보다 작을 수 있음
단일 턴 평가와 실제 대화 사용의 간극
- LLM은 ChatGPT, Gemini, Claude처럼 대화형 인터페이스로 사용되며, 사용자는 처음부터 요구사항을 완전히 특정하지 못해도 여러 턴을 거치며 요구를 정의·탐색·수정할 수 있음
- 기존 LLM 평가는 주로 단일 턴·완전 명령 환경에 집중했지만, LLM 대화 로그에서는 사용자 지시의 불완전성이 흔하게 나타남
- 기존 멀티 턴 평가 다수는 대화를 독립적으로 평가 가능한 하위 과제들의 배열처럼 다루는 episodic 방식에 가까움
- 턴 사이 맥락 이해를 일부 요구하지만, 불완전한 사용자 지시에서 정보를 능동적으로 결합하는 상황과는 다름
- 이런 과제는 멀티 턴 대화에서 LLM 성능을 실제보다 높게 보이게 할 수 있음
샤딩으로 만든 불완전 멀티 턴 대화
- 실험은 고품질 단일 턴 벤치마크의 완전한 명령을 sharded instruction으로 변환함
- 첫 번째 shard는 과제의 높은 수준 의도를 제시함
- 이후 shard는 원래 명령의 추가 조건이나 맥락을 하나씩 제공함
- 모든 shard를 합치면 원래 완전 명령과 같은 정보를 담음
- 예시로 GSM8K의 눈덩이 문제는 단일 지문에서 “시간당 20개 생성”, “15분마다 2개 녹음”, “총 60개 필요” 같은 조건을 모두 제공하지만, sharded 버전은 이를 여러 턴에 걸쳐 나눠 공개함
- 샤딩 과정은 반자동으로 수행됐으며, GPT-4o가 후보를 만들고 검증한 뒤 연구자가 검토·수정함
대화 시뮬레이션 구조
- 멀티 턴 시뮬레이션에는 세 주체가 있음
- 평가 대상 assistant: 성능을 측정할 LLM
- user simulator: 전체 sharded instruction을 알고 있으며 각 턴에서 다음 shard를 공개하는 LLM
- system: assistant 응답을 분류하고 답변 시도를 평가하는 구성요소
- 첫 턴에서 user simulator는 첫 shard만 공개하고, assistant는 자유 텍스트로 응답함
- assistant 응답은 7가지 전략 중 하나로 분류됨
- clarification
- refusal
- hedging
- interrogation
- discussion
- missing
- answer attempt
- answer attempt로 분류되면 answer extractor가 코드 조각, 숫자, SQL 등 평가에 필요한 답변 범위를 추출하고, 과제별 evaluator가 점수를 매김
- 대화는 두 조건 중 하나에서 종료됨
- assistant의 답변 시도가 정답으로 평가됨
- 새 턴 시작 시 더 공개할 shard가 없음
- user simulator, strategy classifier, answer extractor는 prompt 기반 GPT-4o-mini로 구현됨
- 수백 개 대화를 수동 주석한 결과, user simulator·classifier·extractor 오류는 검사한 대화의 5% 미만에서 발생했고 assistant 모델에 불리하게 작용한 오류는 2% 미만이었음
비교한 다섯 가지 시뮬레이션 유형
- FULL은 원래 완전 명령을 첫 턴에 제공하는 단일 턴 시뮬레이션이며, 기본 성능 기준선으로 사용됨
- SHARDED는 shard를 여러 턴에 걸쳐 공개하는 멀티 턴·불완전 대화이며, 핵심 평가 환경임
- CONCAT은 shard들을 한 턴의 bullet-point 명령으로 합쳐 제공함
- FULL처럼 불완전성이 제거됨
- SHARDED처럼 샤딩 과정에서 생긴 재표현은 유지됨
- FULL과 CONCAT에서는 성공하지만 SHARDED에서 실패하면, 정보 손실보다 멀티 턴·불완전성 자체가 원인일 수 있음
- RECAP은 SHARDED 대화 뒤 마지막에 모든 shard를 한 번에 다시 제시해 LLM에 최종 답변 기회를 줌
- SNOWBALL은 각 턴에서 새 shard와 지금까지 공개된 모든 shard를 함께 다시 말해, 턴마다 누적 요약을 제공함
사용한 과제와 벤치마크
- 실험은 프로그래밍과 자연어 생성 사용 사례를 모두 포함하는 6개 생성 과제로 구성됨
- 각 과제마다 90~120개 sharded instruction을 준비했고, 전체는 600개 instruction임
- 과제 구성:
- Code: HumanEval, LiveCodeBench 기반 Python 함수 작성
- Database: Spider 기반 text-to-SQL 생성
- Actions: Berkeley Function Calling Leaderboard 기반 API 함수 호출 생성
- Math: GSM8K 기반 초등 수학 문장제 풀이
- Data-to-Text: ToTTo 기반 표 데이터 설명 문장 생성
- Summary: Summary of a Haystack 기반 문서 묶음 요약과 인용 생성
- 평가 지표는 원래 벤치마크의 지표를 재사용함
- Code와 Database는 실행 기반 정확도
- Actions와 Math는 참조 답변과의 의미적 동등성 또는 수치 정답
- Data-to-Text는 BLEU
- Summary는 정보 포괄성과 출처 귀속 정확도를 측정하는 LLM-as-a-judge “Joint Score”
- 이진 정확도도 0~100 범위로 매핑해 모든 과제 점수를 같은 스케일에서 집계함
성능, 능력, 불안정성 측정
- LLM 출력은 확률적이므로 같은 instruction과 시뮬레이션 유형에 대해 N=10회 반복 실행함
- 각 실행은 0~100 범위의 점수로 평가됨
- 세 지표를 사용함
- 평균 성능 P: 반복 실행 점수의 평균
- aptitude A90: 점수의 90번째 백분위로, 상위 10% 실행에서의 best-case 성능 추정
- unreliability U90-10: 90번째 백분위와 10번째 백분위의 차이로, best-case와 worst-case 사이 격차를 측정
- 단일 턴에서는 aptitude가 높은 모델이 더 신뢰성도 높은 경향을 보였지만, 멀티 턴에서는 aptitude와 관계없이 모든 LLM에서 높은 unreliability가 나타남
대규모 실험 결과
- 메인 실험은 600개 instruction, 3개 시뮬레이션 유형(FULL, CONCAT, SHARDED), 15개 LLM을 대상으로 진행됨
- 각 조합을 10회 반복해 200,000개 이상의 대화를 시뮬레이션함
- 모든 시뮬레이션은 기본 temperature T=1로 수행됐으며, temperature가 aptitude와 reliability에 미치는 영향은 별도 보조 실험에서 다룸
- 전체적으로 멀티 턴·불완전 대화의 평균 성능은 65% 였고, 전체 명령을 처음부터 받은 단일 턴 성능 90% 보다 25포인트 낮음
- 작은 open-weight 모델부터 최신 모델까지 멀티 턴 성능 하락이 공통적으로 나타남
- 테스트 대상에는 Llama3.1-8B-Instruct 같은 작은 open-weight 모델과 Gemini 2.5 Pro 같은 최신 모델이 포함됨
- Figure 1에는 Claude 3.7 Sonnet, Deepseek-R1, o3, GPT-4.1, Gemini 2.5 Pro가 예시로 표시됨
- 6개 생성 과제 평균 성능 하락은 39% 이며, Figure 1은 멀티 턴 설정에서 약 -35% 성능 저하를 표시함
왜 길을 잃는가
- 성능 저하는 두 요소로 나뉨
- aptitude 감소: best-case 성능 자체가 일부 낮아짐
- unreliability 증가: 실행 간 품질 격차가 크게 커짐
- Figure 1 기준 멀티 턴에서는 aptitude가 -15% 낮아지고 unreliability가 +112% 높아짐
- 모델은 불완전한 초반 정보만 보고 잘못된 가정을 만들고, 대화 초기에 최종 답변을 시도하는 경향을 보임
- 이후 새 정보가 제공돼도 이전의 잘못된 답변 시도에 과도하게 의존해 방향 수정에 실패함
- 멀티 턴 불완전 대화에서 한 번 잘못된 방향으로 들어가면 회복하지 못하는 현상이 lost in conversation으로 정의됨
한계와 실무적 함의
- 완전 자동 시뮬레이션은 실제 인간-AI 대화를 그대로 대표하지 않음
- 실험 환경은 단순화·이상화되어 있음
- 대화는 과제를 풀기에 충분한 정보로 끝나도록 보장됨
- 실제 환경에서 발생할 수 있는 대화 이탈 같은 예기치 않은 행동은 제한됨
- 이런 설계 때문에 관측된 성능 저하는 실제 불완전 멀티 턴 인간-AI 대화에서 발생하는 저하보다 과소평가일 수 있음
- LLM 기반 대화 제품을 만드는 조직과 최종 사용자는 멀티 턴 신뢰성을 단일 턴 능력과 함께 평가해야 함
- 불완전한 요구사항을 처음부터 완전하게 쓰기 어려운 초보 사용자에게는 멀티 턴 성능 저하가 AI 시스템 사용 확산을 낮추는 원인일 가능성이 있음