"언어 모델보다 더 똑똑한가요?"
많은 벤치마크가 언어 모델이 인간의 작업을 얼마나 잘 수행하는지 평가하려고 합니다.
하지만 당신은 다음 단어를 예측하는 전형적인 언어 모델 작업에서 얼마나 잘할 수 있을까요?
15개의 문제를 풀어보세요
"언어 모델보다 더 똑똑한가요?"
많은 벤치마크가 언어 모델이 인간의 작업을 얼마나 잘 수행하는지 평가하려고 합니다.
하지만 당신은 다음 단어를 예측하는 전형적인 언어 모델 작업에서 얼마나 잘할 수 있을까요?
15개의 문제를 풀어보세요
"스마트"라는 제목에서 기대한 것과는 다르지만, 흥미로운 아이디어임
Hacker News 댓글에서 다음 단어를 맞추는 게임/퀴즈를 만듦
언어 모델이 선택할 가능성이 가장 낮은 단어를 선택하는 것이 이기는 전략임
결과를 보면, 주어진 정보로 다음 단어를 정확히 예측하는 것은 불가능함
이 게임은 HN 댓글을 너무 많이 읽는지 확인하는 좋은 테스트임
매번 무작위 퀴즈를 받기 때문에 결과를 비교할 수 없음
HN에서 보낸 시간 덕분에 AI보다 약간 더 나은 예측을 할 수 있었음
100문제 퀴즈에 도전하는 사람들에게: 전통적인 통계 기준으로는 3분의 1 이상 맞춰야 추측보다 나은 것으로 간주됨
샘플이 HN에서 나왔다면, 텍스트가 이미 데이터셋의 일부일 가능성이 있음
일부는 더 큰 맥락에서 발췌한 것으로, LLM이 예측에 유리한 위치에 있음