- Perplexity가 크롤링 금지 지침을 우회하기 위해 신원을 숨긴 웹 크롤러를 사용함
- robots.txt 파일 무시 및 IP, User Agent 지속적 변경같은 행위가 포착됨
- 신규 도메인 실험에서 금지 설정에도 불구하고 Perplexity가 사이트 콘텐츠에 접근함이 확인됨
- Cloudflare는 이러한 행위를 방지하기 위해 Perplexity를 공식 인증 봇에서 제외하고 관리 규칙을 수정함
- OpenAI와 같은 선의의 봇 운영자와 대조적으로, Perplexity의 은폐형 행동이 문제로 지적됨
Perplexity의 은밀한 크롤러 사용 행위 개요
- Perplexity는 AI 기반 답변 엔진으로, 공식적으로 신고된 유저 에이전트로 처음 웹사이트를 크롤링함
- 그러나 네트워크 차단에 직면할 경우, 신원을 감추기 위해 User Agent를 변경하고, 다양한 ASN(자율 시스템 번호) 을 통해 접근을 시도함
- 이 과정에서 robots.txt 파일을 무시하거나 아예 요청하지 않고 접근하는 시도들이 다수 발견됨
웹사이트와 크롤러 간 신뢰 원칙 및 문제 행태
- 지난 수십 년간의 인터넷은 신뢰를 바탕으로 발전했고, 크롤러 역시 투명성과 목적성, 그리고 명확한 행동 기준을 갖추는 것이 원칙임
- 크롤러는 웹사이트 소유자의 지침과 우선순의를 존중해야 하며, Perplexity의 이번 관찰된 행동은 이러한 원칙에 위배되는 사항임
- 이로 인해 Cloudflare는 Perplexity를 공식 인증 봇 목록에서 제외하고, 스텔스 크롤러 탐지 및 차단을 위한 추가적인 관리 규칙을 적용함
실험 및 탐지 사례
- Cloudflare는 신규 도메인을 만들어 Perplexity의 크롤링 행태를 실험함
- robots.txt로 모든 자동 접근을 금지하고, WAF 규칙을 추가 설정했음
- Perplexity의 공식 User Agent 및 IP를 막았음에도, 여전히 신분을 숨긴 채 사이트 콘텐츠를 수집한 사실이 확인됨
- Perplexity는 공식 및 스텔스 User Agent 모두에서 콘텐츠 접근을 시도하며, 후자는 실제 브라우저(Chrome)로 가장함
| 구분 | User Agent 예시 | 일일 요청량 |
|---|---|---|
| 공식 | Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Perplexity-User/1.0; +https://perplexity.ai/perplexity-user) | 2,000만~2,500만 |
| 은밀 | Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/124.0.0.0 Safari/537.36 | 300만~600만 |
- 공식 IP 범위에 포함되지 않은 여러 IP와 ASN을 사용하고, IP를 지속적으로 교체하며 차단 정책을 우회하려 함
- 이로 인해 수만 개의 도메인과 수백만 건의 요청에서 이러한 활동이 식별되었으며, Cloudflare는 머신러닝과 네트워크 신호를 활용해 해당 크롤러를 지문화함
스텔스 크롤러 우회 사례 및 한계
- 스텔스 크롤러 차단 시 Perplexity는 타 웹사이트 등 외부 자료를 활용해 답변을 제공하려 함
- 그러나 이 경우 콘텐츠 상세도가 현저히 떨어지는 현상도 확인됨
선의의 봇 운영자 기준과 OpenAI의 모범 사례
- 잘 운영되는 봇은 투명성, 신원 명확화, 활동 목적 공개, 개별 활동 별 독립된 봇 사용, 웹마스터 규칙(robots.txt 등) 준수 등의 원칙을 지녀야 함
- OpenAI는 공식 IP와 User Agent, 크롤러 활동 목적을 투명하게 제공하고, robots.txt를 엄격히 준수함
- 실제 실험에서도 ChatGPT 크롤러는 disallow 설정 또는 네트워크 차단을 발견하면 추가 크롤링 시도를 중단함
- Web Bot Auth 등 표준화된 인증 방식도 적극적으로 도입함
보호 방법 및 대응
- Perplexity의 신고되지 않은 User Agent에서 발생된 모든 크롤링은 Cloudflare 봇 관리 시스템에서 탐지되어 차단됨
- Cloudflare의 기존 봇 차단 규칙 또는 챌린지 규칙 활성 고객은 이미 보호 대상임
- 스텔스 크롤러 차단용 관리자 규칙이 전체 고객(무료 고객 포함)에게 제공됨
- Content Independence Day 발표 후 250만 개가 넘는 웹사이트가 AI 크롤링 금지 정책을 적용함
- 봇 운영자의 계속 진화하는 우회 시도에 맞춰 Cloudflare도 대응 체계와 기술을 지속적으로 발전 중임
정책적 노력 및 향후 전망
- Cloudflare는 전 세계 기술 및 정책 전문가, IETF 등과 함께 robots.txt 확장 표준화 논의에 적극 참여 중임
- 신뢰받는 크롤러 규칙을 정립하고, 급변하는 AI 및 크롤러 환경에서 투명성과 준법성을 강조하는 방향으로 나아감