OpenAI GPTBot의 웹사이트 크롤링 문제
-
저자는 자신의 웹사이트 web.sp.am에 OpenAI의 GPTBot이 방문해 과도하게 페이지를 크롤링하는 문제가 있음
- 하루에 약 300만 페이지를 요청했고, 그 중 180만건은 robots.txt 요청이었음
- 저자의 사이트는 Content Farm 형태로 68억 5900만개의 웹사이트가 각각 1개의 페이지를 가지고 있는 구조임
- 모든 페이지가 거의 동일해 보이고 같은 IP, 같은 와일드카드 SSL 인증서를 사용하고 있어 크롤러가 상황을 파악하기 어렵지 않은 상황임
-
1~2달 전에는 아마존의 크롤러도 비슷한 문제를 일으켜, 연락을 취해 크롤링을 중단시킬 수 있었음
-
저자는 OpenAI에도 연락할 수 있는 사람이 있는지 문의하고 있음
-
저자는 GPT-5 학습에 자신의 웹사이트 데이터가 사용되고 있는 것 같다고 농담을 하고 있음
GN⁺의 의견
- 크롤러가 robots.txt를 제대로 해석하지 못하고 과도한 요청을 보내는 것은 악의적이진 않더라도 상대방 입장에서는 서비스에 피해가 갈 수 있는 심각한 문제임. OpenAI도 빠른 시일 내에 크롤러 로직을 보완해야 할 것으로 보임
- 특히 Content Farm처럼 수많은 도메인을 운영하는 곳에서는 각각의 사이트를 개별적으로 크롤링하지 않도록 IP 기반 필터링 등의 방안을 고려해야 함
- 크롤링 봇의 동작을 모니터링하고 이상 징후를 탐지해 빠르게 대응할 수 있는 프로세스와 시스템이 필요해 보임
- 크롤링 대상 사이트 관리자와 긴밀히 커뮤니케이션 하면서 피해를 최소화할 수 있도록 해야 함. 무조건 데이터 수집에만 집중할 것이 아니라 상생의 관점이 중요함