# Cloudflare, 고객별 AI 트래픽 제어 옵션 공개

> Clean Markdown view of GeekNews topic #31857. Use the original source for factual precision when an external source URL is present.

## Metadata

- GeekNews HTML: [https://news.hada.io/topic?id=31857](https://news.hada.io/topic?id=31857)
- GeekNews Markdown: [https://news.hada.io/topic/31857.md](https://news.hada.io/topic/31857.md)
- Type: GN+
- Author: [xguru](https://news.hada.io/@xguru)
- Published: 2026-07-27T10:12:32+09:00
- Updated: 2026-07-27T10:12:32+09:00
- Original source: [blog.cloudflare.com](https://blog.cloudflare.com/content-independence-day-ai-options/)
- Points: 1
- Comments: 1

## Topic Body

- 모든 요금제 고객이 자동화 트래픽을 **Search·Agent·Training**으로 나눠 허용하거나 차단할 수 있어, 기존의 일괄적인 AI 봇 차단보다 세밀한 정책 설정이 가능해짐
- AI 사용 여부가 아니라 사이트에서 수행하는 **행동과 콘텐츠 용도**를 분류 기준으로 삼으며, 다목적 크롤러에는 관련 규칙을 모두 적용하고 목적별 크롤러 분리를 권장함
- **2026년 9월 15일**부터 신규 도메인의 광고 표시 페이지에서는 Training과 Agent가 기본 차단되고 Search는 허용되며, Googlebot·Applebot·BingBot 같은 다목적 크롤러에는 가장 제한적인 규칙이 적용됨
- Enterprise Bot Management용 **BotBase**에서 알려진 봇과 에이전트의 분류·탐지 ID를 검색할 수 있고, `immediate`·`reference`·`full` 콘텐츠 사용 수준과 robots.txt의 `use` 신호도 도입함
- Verified는 더 이상 자동 허용을 뜻하지 않으며, RFC 7239의 `Forwarded` 헤더를 활용한 **전이적 신뢰**로 운영자와 콘텐츠 사용 방식을 중개 계층 너머까지 전달하려 함

---

### AI 트래픽을 용도별로 제어해야 하는 이유
- 과거 웹 크롤링은 사이트 콘텐츠를 수집하는 대신 **검색 유입**을 돌려주는 관계였지만, AI 학습은 콘텐츠를 가져가면서 사이트 소유자에게 가치를 돌려주지 않는 문제가 있었음
- Cloudflare는 1년 전 원클릭 **Block AI Bots** 옵션과 [Pay-Per-Crawl marketplace](https://blog.cloudflare.com/introducing-pay-per-crawl/)를 출시함
- 콘텐츠 소유자는 원본을 보호하고 보상받기를 원하지만, 모든 자동화를 일괄 차단하는 방식만으로는 이런 요구를 충족하기 어려움
- 소규모 사이트는 검색 노출을 얻기 위해 AI 학습까지 허용하거나, 학습을 막는 대신 발견 가능성을 잃는 선택에 놓일 수 있음
  - 검색과 학습에 같은 봇을 사용하는 기존 검색 사업자에 유리한 구조임
  - 경쟁 격차를 좁히려는 신규 사업자에는 탐지를 피하려는 유인이 생김
- Google 검색처럼 결과 페이지에서 직접 답을 제공하는 서비스가 등장하면서, 봇이 AI인지보다 **무엇을 하고 저장하며 재배포하는지**가 더 중요한 기준이 됨

### Search·Agent·Training 분류
- 모든 고객이 관리할 수 있는 AI 중심 사용 사례를 세 가지로 구분함
  - **Search**: 콘텐츠를 미리 수집하거나 색인해 이후 질문에 응답하며, 사이트 소유자는 추천 트래픽이나 그에 상응하는 보상을 기대할 수 있음
  - **Agent**: 사람을 대신해 실시간 작업을 수행하며, ChatGPT-User 같은 채팅 수집 봇과 Gemini·Claude가 Chrome을 조작하는 브라우저 에이전트가 포함됨
  - **Training**: 콘텐츠를 가져가 모델을 학습하거나 미세 조정하며, 데이터가 AI 기반 구조에 영구적으로 흡수돼 성능 개선에 사용됨
- 하나의 크롤러가 여러 목적을 가질 수 있으므로 **해당하는 모든 분류**를 함께 추적함
- 검색 색인 구축, 에이전트 작업, 모델 학습을 모두 수행하는 사업자에는 목적별 크롤러를 세 개로 분리해 방문 목적과 접근 권한을 명확히 밝히도록 권장함
- 광고 검증, 피드 수집, 에이전트 거래 같은 자동화 행동도 별도로 분류하지만, Search·Agent·Training에는 모든 사이트 소유자가 직접 관리할 수 있는 기능을 제공함

### 모든 요금제에 제공되는 제어와 새 기본값
- 기존 Block AI Bots 프리셋은 주로 모델 학습용 단일 목적 봇을 차단했지만, 새 설정은 **Search·Agent·Training별 제어**를 Free 요금제까지 제공함
- **2026년 9월 15일**부터 Cloudflare에 새로 등록되는 도메인의 광고 표시 페이지에 다음 기본값을 적용함
  - Training과 Agent는 기본 차단함
  - Search는 기본 허용함
- 광고는 사람이 페이지에 방문해 확인하도록 설계된 수익화 신호이므로, 사람의 주의를 가로막을 수 있는 Training과 Agent를 차단함
- Search는 방문자를 사이트로 유도하는 행동에 가장 가깝기 때문에 기본 허용함
- Search와 Training을 함께 수행하는 다목적 크롤러에는 **가장 제한적인 규칙**이 우선함
  - Training 차단을 선택한 고객에게는 Googlebot·Applebot·BingBot도 차단됨
  - 새 [AI 트래픽 관리 옵션](https://developers.cloudflare.com/bots/additional-configurations/block-ai-bots/)과 기존 Block AI Bots 서비스 모두에 적용됨
- 기존 고객은 9월 15일 전까지 [Security settings](https://dash.cloudflare.com/?to=/:account/:zone/security/settings)에서 변경 거부를 표시해 Search도 수행하는 Training 크롤러에 기존 설정을 유지할 수 있음

### BotBase가 제공하는 봇 가시성과 행동 분류
- Enterprise Bot Management에 추가된 [**BotBase**](https://developers.cloudflare.com/bots/botbase/)는 Verified 봇과 에이전트를 포함한 알려진 자동화 트래픽의 검색 가능한 데이터베이스임
- Cloudflare 대시보드에서 전체 Verified 봇·에이전트 목록과 새 분류를 확인할 수 있음
  - 특정 봇의 트래픽을 필터링할 수 있음
  - 탐지 ID를 복사해 Security 규칙에 활용 가능함
  - 전용 화면은 [Bot Management configuration card](https://dash.cloudflare.com/?to=/:account/:zone/security/settings/bot-traffic/bot-base)에서 접근할 수 있음
- 초기에는 **가시성**에 집중하고, 2026년 후반에는 사이트의 알려진 자동화 콘텐츠를 직접 제어하는 관리 센터로 확장할 계획임
- BotBase는 봇이 사이트에서 수행할 수 있는 행동에 따라 하나 이상의 범주를 부여함
  - **Search**: 검색 결과 노출을 위한 크롤링
  - **Agent**: 사람의 지시에 따라 페이지를 방문하는 에이전트
  - **Training**: 모델 학습 또는 미세 조정용 크롤링
  - **Transact**: 사용자를 대신한 결제 작업
  - **Data Collection**: 가격 수집, 경쟁 정보 수집, 제3자 분석
  - **Security Testing**: 취약점 스캔과 침투 테스트
  - **SEO**: SEO 크롤링, 사이트 감사, 접근성 검사
  - **Ads Verification**: 광고 배치 검증과 광고 사기 탐지
  - **Social / Link Preview**: 소셜 플랫폼과 메시징 앱의 링크 미리보기
  - **Feed Fetching**: RSS 리더, 팟캐스트 수집기, 뉴스 피드 봇
  - **Monitoring & Operations**: 가동 시간 모니터링, 웹훅, 상태 확인

### 콘텐츠 사용 수준과 robots.txt 신호
- 봇이 수집한 콘텐츠를 저장하고 재사용하는 방식을 **콘텐츠 사용(content use)** 수준으로 관리하는 기능을 개발 중임
  - `immediate`: 상호작용만 하고 저장하거나 재사용하지 않음
  - `reference`: 색인하고 일부를 인용하며 원문으로 연결하는 기본값
  - `full`: 요약하고 재현할 수 있음
- 봇 분류와 콘텐츠 사용 수준을 결합해 “Search·SEO·Ads Verification은 허용하되 `reference`까지만 허용” 같은 정책을 만들 수 있음
- 개별 봇마다 규칙을 작성하지 않고 **행동 그룹 단위**로 접근 여부를 결정할 수 있음
- [Content Signals](https://contentsignals.org/)를 확장하는 `use` 신호를 robots.txt에서 시험함
  - `use=immediate`
  - `use=reference`
  - `use=full`
- robots.txt의 콘텐츠 사용 값은 직접 차단을 집행하지 않고 사이트 소유자의 **선호**를 전달함
- 기존 관리형 robots.txt에서 `search=yes,ai-train=no`를 사용하던 고객에게는 `use=reference`가 추가됨

```text
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
```

- BotBase는 각 봇의 콘텐츠 사용 방식도 추적하며, 신호를 악용한 봇은 Verified 지위를 잃어 더 이상 허용되지 않음
- 콘텐츠를 전부 재현하는 봇은 현재 **Verified 지위**를 받을 수 없음

### Verified의 달라진 의미
- 과거에는 모든 Verified 봇을 기본 허용했으며, 이 기준이 Bot Fight Mode와 Enterprise Bot Management 규칙 템플릿에 반영됐음
- 이제 비검증 봇은 계속 기본 차단되지만, Verified 봇도 자동으로 허용되지는 않음
- **Verified**는 관련 범주에서 허용 가능한 봇이라는 뜻이며, 실제 접근 여부는 Search 같은 해당 범주가 허용됐는지에 따라 결정됨
- 봇 운영자가 Verified 지위를 얻으려면 두 조건을 충족해야 함
  - 자신의 정체를 정직하게 표시해야 함
  - 그 정직성을 바탕으로 얻은 접근 권한을 악용하지 않아야 함
- Cloudflare 분류에 운영자가 정확히 반영됐는지 관리할 수 있는 **봇 운영자용 도구**도 개발 중임

### 중개 플랫폼을 통과하는 전이적 신뢰
- 자동화나 에이전트는 이를 만든 회사가 직접 운영하지 않을 수 있으며, 하나의 개발 플랫폼이 기업부터 개인 개발자까지 수천 운영자의 요청을 대신 실행할 수 있음
- 사이트 소유자→봇 소유 회사→최종 사용자로 이어지는 관계를 **전이적 신뢰(transitive trust)** 로 정의함
- [RFC 7239](https://www.rfc-editor.org/info/rfc7239)의 `Forwarded` 헤더를 이용해 프록시 과정에서 사라지는 운영자 정보를 요청에 포함하는 방식을 제안함

```text
Forwarded: for="openai"
```

- 콘텐츠 사용 수준도 함께 전달할 수 있음

```text
Forwarded: for="openai";use="reference"
```

- 사이트가 특정 운영자를 허용하면 신뢰받는 여러 중개 계층을 거쳐 들어오는 요청에도 같은 정책을 유지할 수 있으며, 자세한 형식은 [웹 봇 인증 문서](https://developers.cloudflare.com/bots/reference/bot-verification/web-bot-auth/)에서 확인 가능함
- Cloudflare 뒤에 있는 웹 도메인이 20%를 넘기 때문에 신뢰 상태 상실은 운영자에게 실질적인 억제 수단이 될 수 있음
- 봇과 인간 트래픽이 섞이면 신원을 밝힐 여력이 있는 사용자에게만 전이적 신뢰가 적용될 수 있음
  - 소규모 트래픽 출처에는 개인정보 보호가 필요함
  - 개인정보 보호 약속을 지키려는 회사에는 [비공개 속도 제한(private rate limiting)](https://blog.cloudflare.com/private-rate-limiting/) 같은 대안적 구성 요소가 필요함

### 적용 상태와 운영 원칙
- 새 AI 트래픽 옵션은 현재 모든 기존 고객에게 제공되며 [zone Settings](https://dash.cloudflare.com/?to=/:account/:zone/security/settings)에서 설정할 수 있음
- 새 기본값과 분류 체계는 사이트 소유자가 **누가 콘텐츠를 어떻게 사용하는지** 결정하고, 자동화 운영자가 목적을 투명하게 밝힐수록 더 많은 접근을 얻는 구조를 지향함
- 웹과 자동화 트래픽의 변화에 맞춰 세부 정책은 계속 조정하되, 콘텐츠 제작자의 선택과 신뢰를 중심에 두는 원칙은 유지함

## Comments



### Comment 62444

- Author: neo
- Created: 2026-07-27T10:12:33+09:00
- Points: 1

###### [Hacker News 의견들](https://news.ycombinator.com/item?id=49052564) 
- **Googlebot**은 검색 색인과 Gemini 학습에 같은 크롤러 인프라를 쓰기 때문에, 9월 15일부터 Cloudflare의 ‘학습 차단’ 정책에 걸리게 됨  
  가장 제한적인 규칙이 우선 적용되므로 학습을 차단한 고객 사이트에서는 Googlebot, Applebot, BingBot 같은 다목적 크롤러도 차단됨
  - Google이 사이트 소유자에게 **AI 학습에 동의하거나 검색에서 빠지도록 강요**하는 방식은 약탈적이고 불공정하며 불법으로 보임  
    검색 독점 기업의 이런 행위를 막는 것이 반독점법의 역할인 만큼 EU 규제 당국이라도 나서길 바라며, 접근 로그의 모든 Googlebot 크롤링 기록이 손해배상의 근거가 될 수 있음
  - Googlebot이 고객 시스템에 무작위로 요청을 퍼부어 장애 직전까지 몰고 간 뒤에야 AI 학습에도 쓰인다는 사실을 알게 됨  
    Google에 콘텐츠를 이런 식으로 사용하지 말라고 **올바르게 거부하는 방법**조차 검색으로 찾기 어려워 답답했음
  - 콘텐츠 도용을 거부하는 기업에 보내는 **협박**처럼 느껴짐
  - 사용자는 어떤 형태로든 검색을 이용하며, 대규모 언어 모델이든 전통적인 검색 엔진이든 누군가는 페이지를 색인해야 함

- 신규 도메인에서는 광고가 표시되는 페이지의 **학습 및 에이전트 크롤링**을 기본 차단하면서 검색은 허용한다는 Cloudflare의 태도는 군비 경쟁의 양쪽에 모두 발을 걸친 듯해 피곤함  
  한편으로 에이전트와 AI 제품을 만드는 기술을 제공하면서 다른 한편으로 이런 정책을 추진하는 회사를 선뜻 이용하기 어려움  
  웹 도메인 20% 이상을 기반으로 ‘신뢰 지위’를 부여하거나 박탈할 수 있다는 권력을 긍정적으로 내세우는 모습도 놀라움
  - 양쪽에 발을 걸쳤다고 보기는 어려움. Cloudflare의 스크래핑 제품도 시스템을 마비시키지 않고 **절제된 방식으로 동작**하게 하려는 것으로 알고 있음
  - 무제한 크롤링을 허용하지도, 전부 차단하지도 않고 생산자와 소비자가 **허가와 보상**을 바탕으로 거래할 도구를 제공하는 중간 경로를 만들려는 것으로 보임

- Cloudflare 기능 대신 Anubis 같은 **작업 증명(PoW)** 도입을 고려해주길 바람  
  Cloudflare로 보호되는 사이트에서 CAPTCHA조차 없이 완전히 차단되는 일이 늘고 있으며, 개별 사이트는 중요하지 않더라도 이런 선택이 인터넷의 근간을 침식하는 과정은 암울함
  - Anubis 같은 작업 증명은 효과가 없음. 봇은 점점 헤드리스 브라우저를 사용해 CAPTCHA와 작업 증명을 풀고 거의 모든 차단을 우회하므로, 원치 않는 트래픽이 사이트와 서비스를 두드리는 일을 막기 어려워지고 있음
  - Anubis는 구형 하드웨어와 저가형 스마트폰에서 사이트 접속에 **몇 분씩 걸릴 수 있으므로** 사용하지 않길 바람
  - Googlebot 사용자 에이전트 문자열로 탐색하는 게 아니라면 완전 차단이 아니라 많아야 **Turnstile 과제**가 나와야 하며, 이는 Anubis 과제와 크게 다르지 않음  
    완전히 차단됐다면 Cloudflare 자체보다 모든 VPN이나 특정 국가 외의 사용자를 막도록 설정한 사이트 측 결정일 가능성이 큼
  - 작업 증명으로 연산을 완전히 낭비할 바에는 차라리 **Monero를 채굴**하는 편이 낫지 않겠음
  - 궁금한 사람을 위한 GitHub 링크: [https://github.com/techaroHQ/anubis](<https://github.com/techaroHQ/anubis>)

- 누가 사이트에 접근할 수 있는지를 점점 더 지배적인 기업 하나에 자발적으로 맡기는 것은 불안함  
  ‘봇’과 ‘AI’를 반사적으로 차단하면 정작 **사용자를 대신해 일하는 AI 에이전트**까지 접근하지 못하므로 정책의 전제도 잘못됐음

- Cloudflare와 웹이 궁극적으로 원하는 결과가 무엇인지 모르겠음. Anthropic, DeepMind, OpenAI, Google이 크롤링 비용을 지불할 것 같지 않으며, Reddit 같은 주요 담론 공급처와 비공개 계약을 맺을 가능성이 더 큼  
  새로운 정보를 문맥으로 가져오는 기능은 계속되겠지만, 그것은 무차별 스크래핑과는 다름
  - 누구도 다음 결과를 알지 못함. 검색 엔진의 콘텐츠 수집을 둘러싼 기존 균형도 이미 불편했지만, **AI 봇은 가져가기만 하고 돌려주는 것이 없다**는 말은 과장이 아니라 현재 상황임  
    Google이 질문에 직접 답하고 원본 사이트로 보내는 사용자가 거의 없어지는 방향에 성공하면, 웹에 콘텐츠를 공개할 경제적 가치가 광범위하게 사라짐. 그대로라면 Google은 기술적·법적으로 차단돼 콘텐츠를 얻지 못하고 모두가 손해 보게 됨  
    모두가 무상으로 일해 Google과 AI 엔진만 가치를 가져가는 세계나 콘텐츠 생산이 완전히 중단되는 세계는 지속 가능하지 않지만, 결국 거의 모든 콘텐츠가 유료화될 가능성은 남음  
    다만 **소액 결제**는 지금까지 철저히 실패했으며, 마찰을 충분히 낮출 방법이 없다면 가치 있는 콘텐츠 대부분이 잠기고 발견과 접근 비용이 커져 콘텐츠 산업 전체가 급격히 축소될 수 있음. 큰 단위 결제만 남는다면 상업 웹은 훨씬 작아지고 품질은 높아질지 몰라도 대가가 상당할 것임
  - 인터넷 전체의 트래픽 흐름에 영향을 주는 결정을 Cloudflare가 일방적으로 내리는 데 복잡한 감정이 듦  
    선도하는 것과 별개로 이런 결정에는 모든 이해관계자를 고려할 수 있도록 **IETF가 직접 참여**해야 하며, 그렇지 않으면 인터넷이 파편화될 수 있음
  - Cloudflare는 페이지 접근마다 1페니를 걷는 **인터넷의 보편적 세금 징수자**가 되려는 듯함  
    기존 대기업은 이를 감당하면서 신규 진입자에게 거대한 재정 장벽을 세울 수 있으므로 오히려 반길 가능성이 큼
  - 선택지는 돈을 내거나 죽는 것뿐이며 Cloudflare는 기꺼이 통행세를 거둘 것임. Apple도 Google에서 매년 200억 달러를 받는 식으로 이미 이런 세금을 걷고 있음  
    Cloudflare 고객 역시 무료 또는 저렴한 서비스를 통해 몫을 받는 한, 회사가 주요 AI 기업을 어떻게 다루는지 개의치 않을 가능성이 큼

- **Google, OpenAI, Grok, Claude, Perplexity만 허용**하고 나머지 봇을 차단하는 설정이 가능한지 궁금함  
  현재 실제 방문자를 보내주는 곳은 Google뿐이지만 다른 주요 AI 서비스도 앞으로는 보낼 수 있음  
  ‘익명 봇 차단’도 대안이 될 수 있음. AI 봇이 늘어난 뒤 실제 사람을 흉내 내는 가정용 IP의 막대한 요청으로 큰 피해를 보고 있으며, 이 트래픽은 수익 없이 비용만 발생시킴  
  Amazon CloudFront에는 이를 도와주는 기능이 있는지도 궁금함
  - Google은 이제 사이트에 **방문자를 보내지 않기 위해** 적극적으로 움직이고 있음

- Cloudflare는 웹사이트가 AI와 어떻게 관계를 맺을지 선택하고, AI 트래픽을 **수익화할 방법**까지 제공하는 몇 안 되는 플랫폼이라 고맙게 생각함

- **크롤링당 과금 프로그램**에 관한 새로운 소식이 있는지 궁금함

- AI 학습을 차단해보니 **Google 검색 봇까지 막혀 트래픽이 절반**으로 줄었으므로 권하고 싶지 않음

- 실제로 이런 기능을 쓰는 사람이 있는지 궁금함. 스크래퍼가 돈을 낼지도 의문이고, 내더라도 **수지에 맞을 만큼 지불할지** 회의적임
