- 모든 요금제 고객이 자동화 트래픽을 Search·Agent·Training으로 나눠 허용하거나 차단할 수 있어, 기존의 일괄적인 AI 봇 차단보다 세밀한 정책 설정이 가능해짐
- AI 사용 여부가 아니라 사이트에서 수행하는 행동과 콘텐츠 용도를 분류 기준으로 삼으며, 다목적 크롤러에는 관련 규칙을 모두 적용하고 목적별 크롤러 분리를 권장함
- 2026년 9월 15일부터 신규 도메인의 광고 표시 페이지에서는 Training과 Agent가 기본 차단되고 Search는 허용되며, Googlebot·Applebot·BingBot 같은 다목적 크롤러에는 가장 제한적인 규칙이 적용됨
- Enterprise Bot Management용 BotBase에서 알려진 봇과 에이전트의 분류·탐지 ID를 검색할 수 있고,
immediate·reference·full 콘텐츠 사용 수준과 robots.txt의 use 신호도 도입함
- Verified는 더 이상 자동 허용을 뜻하지 않으며, RFC 7239의
Forwarded 헤더를 활용한 전이적 신뢰로 운영자와 콘텐츠 사용 방식을 중개 계층 너머까지 전달하려 함
AI 트래픽을 용도별로 제어해야 하는 이유
- 과거 웹 크롤링은 사이트 콘텐츠를 수집하는 대신 검색 유입을 돌려주는 관계였지만, AI 학습은 콘텐츠를 가져가면서 사이트 소유자에게 가치를 돌려주지 않는 문제가 있었음
- Cloudflare는 1년 전 원클릭 Block AI Bots 옵션과 Pay-Per-Crawl marketplace를 출시함
- 콘텐츠 소유자는 원본을 보호하고 보상받기를 원하지만, 모든 자동화를 일괄 차단하는 방식만으로는 이런 요구를 충족하기 어려움
- 소규모 사이트는 검색 노출을 얻기 위해 AI 학습까지 허용하거나, 학습을 막는 대신 발견 가능성을 잃는 선택에 놓일 수 있음
- 검색과 학습에 같은 봇을 사용하는 기존 검색 사업자에 유리한 구조임
- 경쟁 격차를 좁히려는 신규 사업자에는 탐지를 피하려는 유인이 생김
- Google 검색처럼 결과 페이지에서 직접 답을 제공하는 서비스가 등장하면서, 봇이 AI인지보다 무엇을 하고 저장하며 재배포하는지가 더 중요한 기준이 됨
Search·Agent·Training 분류
- 모든 고객이 관리할 수 있는 AI 중심 사용 사례를 세 가지로 구분함
- Search: 콘텐츠를 미리 수집하거나 색인해 이후 질문에 응답하며, 사이트 소유자는 추천 트래픽이나 그에 상응하는 보상을 기대할 수 있음
- Agent: 사람을 대신해 실시간 작업을 수행하며, ChatGPT-User 같은 채팅 수집 봇과 Gemini·Claude가 Chrome을 조작하는 브라우저 에이전트가 포함됨
- Training: 콘텐츠를 가져가 모델을 학습하거나 미세 조정하며, 데이터가 AI 기반 구조에 영구적으로 흡수돼 성능 개선에 사용됨
- 하나의 크롤러가 여러 목적을 가질 수 있으므로 해당하는 모든 분류를 함께 추적함
- 검색 색인 구축, 에이전트 작업, 모델 학습을 모두 수행하는 사업자에는 목적별 크롤러를 세 개로 분리해 방문 목적과 접근 권한을 명확히 밝히도록 권장함
- 광고 검증, 피드 수집, 에이전트 거래 같은 자동화 행동도 별도로 분류하지만, Search·Agent·Training에는 모든 사이트 소유자가 직접 관리할 수 있는 기능을 제공함
모든 요금제에 제공되는 제어와 새 기본값
- 기존 Block AI Bots 프리셋은 주로 모델 학습용 단일 목적 봇을 차단했지만, 새 설정은 Search·Agent·Training별 제어를 Free 요금제까지 제공함
- 2026년 9월 15일부터 Cloudflare에 새로 등록되는 도메인의 광고 표시 페이지에 다음 기본값을 적용함
- Training과 Agent는 기본 차단함
- Search는 기본 허용함
- 광고는 사람이 페이지에 방문해 확인하도록 설계된 수익화 신호이므로, 사람의 주의를 가로막을 수 있는 Training과 Agent를 차단함
- Search는 방문자를 사이트로 유도하는 행동에 가장 가깝기 때문에 기본 허용함
- Search와 Training을 함께 수행하는 다목적 크롤러에는 가장 제한적인 규칙이 우선함
- Training 차단을 선택한 고객에게는 Googlebot·Applebot·BingBot도 차단됨
- 새 AI 트래픽 관리 옵션과 기존 Block AI Bots 서비스 모두에 적용됨
- 기존 고객은 9월 15일 전까지 Security settings에서 변경 거부를 표시해 Search도 수행하는 Training 크롤러에 기존 설정을 유지할 수 있음
BotBase가 제공하는 봇 가시성과 행동 분류
- Enterprise Bot Management에 추가된 BotBase는 Verified 봇과 에이전트를 포함한 알려진 자동화 트래픽의 검색 가능한 데이터베이스임
- Cloudflare 대시보드에서 전체 Verified 봇·에이전트 목록과 새 분류를 확인할 수 있음
- 초기에는 가시성에 집중하고, 2026년 후반에는 사이트의 알려진 자동화 콘텐츠를 직접 제어하는 관리 센터로 확장할 계획임
- BotBase는 봇이 사이트에서 수행할 수 있는 행동에 따라 하나 이상의 범주를 부여함
- Search: 검색 결과 노출을 위한 크롤링
- Agent: 사람의 지시에 따라 페이지를 방문하는 에이전트
- Training: 모델 학습 또는 미세 조정용 크롤링
- Transact: 사용자를 대신한 결제 작업
- Data Collection: 가격 수집, 경쟁 정보 수집, 제3자 분석
- Security Testing: 취약점 스캔과 침투 테스트
- SEO: SEO 크롤링, 사이트 감사, 접근성 검사
- Ads Verification: 광고 배치 검증과 광고 사기 탐지
- Social / Link Preview: 소셜 플랫폼과 메시징 앱의 링크 미리보기
- Feed Fetching: RSS 리더, 팟캐스트 수집기, 뉴스 피드 봇
- Monitoring & Operations: 가동 시간 모니터링, 웹훅, 상태 확인
콘텐츠 사용 수준과 robots.txt 신호
- 봇이 수집한 콘텐츠를 저장하고 재사용하는 방식을 콘텐츠 사용(content use) 수준으로 관리하는 기능을 개발 중임
immediate: 상호작용만 하고 저장하거나 재사용하지 않음
reference: 색인하고 일부를 인용하며 원문으로 연결하는 기본값
full: 요약하고 재현할 수 있음
- 봇 분류와 콘텐츠 사용 수준을 결합해 “Search·SEO·Ads Verification은 허용하되
reference까지만 허용” 같은 정책을 만들 수 있음
- 개별 봇마다 규칙을 작성하지 않고 행동 그룹 단위로 접근 여부를 결정할 수 있음
- Content Signals를 확장하는
use 신호를 robots.txt에서 시험함
use=immediate
use=reference
use=full
- robots.txt의 콘텐츠 사용 값은 직접 차단을 집행하지 않고 사이트 소유자의 선호를 전달함
- 기존 관리형 robots.txt에서
search=yes,ai-train=no를 사용하던 고객에게는 use=reference가 추가됨
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
- BotBase는 각 봇의 콘텐츠 사용 방식도 추적하며, 신호를 악용한 봇은 Verified 지위를 잃어 더 이상 허용되지 않음
- 콘텐츠를 전부 재현하는 봇은 현재 Verified 지위를 받을 수 없음
Verified의 달라진 의미
- 과거에는 모든 Verified 봇을 기본 허용했으며, 이 기준이 Bot Fight Mode와 Enterprise Bot Management 규칙 템플릿에 반영됐음
- 이제 비검증 봇은 계속 기본 차단되지만, Verified 봇도 자동으로 허용되지는 않음
- Verified는 관련 범주에서 허용 가능한 봇이라는 뜻이며, 실제 접근 여부는 Search 같은 해당 범주가 허용됐는지에 따라 결정됨
- 봇 운영자가 Verified 지위를 얻으려면 두 조건을 충족해야 함
- 자신의 정체를 정직하게 표시해야 함
- 그 정직성을 바탕으로 얻은 접근 권한을 악용하지 않아야 함
- Cloudflare 분류에 운영자가 정확히 반영됐는지 관리할 수 있는 봇 운영자용 도구도 개발 중임
중개 플랫폼을 통과하는 전이적 신뢰
- 자동화나 에이전트는 이를 만든 회사가 직접 운영하지 않을 수 있으며, 하나의 개발 플랫폼이 기업부터 개인 개발자까지 수천 운영자의 요청을 대신 실행할 수 있음
- 사이트 소유자→봇 소유 회사→최종 사용자로 이어지는 관계를 전이적 신뢰(transitive trust) 로 정의함
- RFC 7239의
Forwarded 헤더를 이용해 프록시 과정에서 사라지는 운영자 정보를 요청에 포함하는 방식을 제안함
Forwarded: for="openai"
Forwarded: for="openai";use="reference"
- 사이트가 특정 운영자를 허용하면 신뢰받는 여러 중개 계층을 거쳐 들어오는 요청에도 같은 정책을 유지할 수 있으며, 자세한 형식은 웹 봇 인증 문서에서 확인 가능함
- Cloudflare 뒤에 있는 웹 도메인이 20%를 넘기 때문에 신뢰 상태 상실은 운영자에게 실질적인 억제 수단이 될 수 있음
- 봇과 인간 트래픽이 섞이면 신원을 밝힐 여력이 있는 사용자에게만 전이적 신뢰가 적용될 수 있음
적용 상태와 운영 원칙
- 새 AI 트래픽 옵션은 현재 모든 기존 고객에게 제공되며 zone Settings에서 설정할 수 있음
- 새 기본값과 분류 체계는 사이트 소유자가 누가 콘텐츠를 어떻게 사용하는지 결정하고, 자동화 운영자가 목적을 투명하게 밝힐수록 더 많은 접근을 얻는 구조를 지향함
- 웹과 자동화 트래픽의 변화에 맞춰 세부 정책은 계속 조정하되, 콘텐츠 제작자의 선택과 신뢰를 중심에 두는 원칙은 유지함