- 대규모 언어 모델(LLM)이 다른 사람들이 알고 모르는 것을 이해하는 방식인 마음 이론(Theory of Mind)의 정도에 대해 많은 논쟁이 있음
- 이 노트북에서는 9개의 LLM 챗봇에 셰릴의 생일 문제(등장인물들이 각기 다른 시점에서 서로 다른 지식 상태를 가지는 유명한 논리 퍼즐)를 푸는 것을 요청함으로써 이 문제의 한 부분을 탐구함
LLM 성능 요약
- LLM들은 모두 문제에 익숙했기 때문에 프롬프트에서 문제를 설명할 필요가 없었고, 이름만 언급하면 됨
- 대부분은 문제의 정답인 7월 16일을 정확하게 기억해냄
- 그러나 어느 것도 솔루션을 찾는 프로그램을 작성할 수 없었음
- 모든 LLM이 시간이 지남에 따라 등장인물들의 서로 다른 지식 상태를 구별하지 못했음
- 적어도 이 문제와 관련해서는 LLM들에게 마음 이론이 없었음 (이는 LLM이 훈련된 파이썬 프로그램 중 마음 이론을 다루는 프로그램이 거의 없기 때문일 수 있음)
LLM별 응답 요약
실제 인간
- 원래 문제를 정확하게 해결하고 새로운 날짜 세트와 문제의 다른 변형도 처리할 수 있는 프로그램을 작성할 수 있음
- BeliefState라는 개념을 도입했고, 이는 사람이 생일일 가능성이 있다고 믿는 가능한 날짜 집합
- 등장인물의 발언을 특정 날짜를 입력으로 받아 발언과 일치하면 true를 반환하는 함수로 모델링함
ChatGPT 4o
- 문제에 대한 훌륭한 요약으로 시작함
- 일반화된 솔루션을 작성하려 했지만, 시간에 따른 등장인물들의 서로 다른 신념 상태를 추적하지 못했음
Microsoft Copilot
- ChatGPT와 유사한 실수를 저질렀음
Gemini Advanced
- 함수를 여러 개로 정의했다는 점에서 좋았지만, 시간에 따른 상태 변화를 제대로 처리하지 못했음
Meta Llama 405B
- 솔루션을 찾지 못했음
Claude 3.5 Sonnet
- 서로 다른 날짜로 예제를 명시적으로 시도했다는 점에서 좋았지만, 두 번째 예제에 대해 우연히 솔루션이 없다고 정확하게 보고했을 뿐임
Perplexity
- albert_knows와 bernard_knows라는 별도의 변수가 있어 유망해 보였지만 제대로 처리하지 못했음
- 가능한 날짜를 매개변수로 받아들이지만 입력을 무시하고 원래 날짜를 기반으로 month_days를 정의함
HuggingFace Chat
- 클래스 정의를 제안한 유일한 모델이었지만 여전히 비슷한 실수를 저질렀음
- 가능한 날짜 목록을 생성자에서 받아들이지만 원래 문제의 특정 월과 일을 하드코딩함
You.com
- 다른 모델들과 유사한 실수를 했지만, 결과적으로는 날짜를 선택하지 않는 대신 잘못된 날짜를 선택했음
GN+의 의견
- 이 문제는 LLM의 이론적 마음 능력을 평가하는 흥미로운 방법
- 모든 LLM이 정답을 기억했지만 어느 것도 시간에 따른 등장인물들의 지식 상태 변화를 추적하는 프로그램은 만들지 못했음
- 이는 LLM이 훈련된 코드 샘플에 이런 유형의 추론이 포함되지 않았기 때문일 수 있음
- 이런 유형의 추론 문제에 대한 LLM의 성능을 개선하려면, 명시적으로 이런 시나리오를 다루는 프로그램으로 훈련시키는 것이 도움될 수 있음
- LLM의 이론적 마음 능력에 대한 우리의 이해를 넓히기 위해서는 이와 유사한 더 많은 문제를 테스트해 볼 필요가 있음