얼마전에 Hacker News를 뜨겁게 달궜던 주제가 있습니다.
고전 ML로 AI Slop Text를 판별하는 게 생각보다 효과가 좋다는 블로그 글이었어요.
https://news.ycombinator.com/item?id=48936880
https://blog.lyc8503.net/en/post/llm-classifier/
이미 많이 논의되었던 접근이기도 했지만 아직도 유효하고 효율이 있다는 점도 매력적이어서 한국어로도 만들어 봤습니다.
- 문장 단위로 나눠 char/word n-gram TF-IDF + 선형 SVM 앙상블로 채점하고, 의심 문장 비율로 문서 전체를 판정합니다.
- 추론이 전부 JavaScript라 서버, API, GPU 없이 정적 페이지만으로 돌아갑니다. 모델은 1.4MB 정도이고, 붙여넣은 글은 어디로도 전송되지 않습니다.
물론 한계도 뚜렷합니다. SVM같은 고전 ML을 활용했다보니 몇몇 뚜렷한 AI 스러운 글은 확실히 탐지하는 편이지만 애매하거나 학술적인 글에서는 모호한 결과를 내기도 합니다.
이 결과에 AI라고 나온다고 해서 무조건 AI는 아닐 수도 있지만 한번 AI가 만든 글은 확인해보는 용도로 쓰면 좋을 것 같습니다.