3P by GN⁺ | ★ favorite | 댓글 2개
  • CloudflareA.I. 데이터 스크래퍼를 기본적으로 차단하는 새로운 설정을 도입함
  • 웹사이트 소유자는 권한을 부여하지 않는 한 자동으로 AI 봇의 크롤링이 차단됨
  • AI 모델 훈련에 필요한 고품질 데이터의 수집과 관련해 인터넷 콘텐츠 보호 역할을 강화함
  • 콘텐츠 제작자와 미디어는 무단 데이터 사용에 대한 우려를 계속 표명함
  • AI 기업과 콘텐츠 소유자 간의 법적 분쟁이 점점 더 빈번해지는 추세임

Cloudflare AI 데이터 스크래퍼 기본 차단 기능 도입

  • Cloudflare는 온라인 트래픽 관리와 보안 서비스를 제공하는 기술 기업
  • 최근 AI 기업들이 웹사이트 데이터를 무단으로 수집하는 현상이 증가함에 따라, Cloudflare는 고객이 자동으로 AI 데이터 스크래퍼의 접근을 차단할 수 있는 권한 기반 새 설정을 도입함

새로운 기본 정책과 그 변화

  • 새롭게 도입된 이 기능을 통해, 웹사이트는 기본적으로 AI 봇의 자동 크롤링(스크래핑) 을 차단할 수 있음
  • 데이터 크롤링이 필요하다면, 웹사이트 소유자가 별도로 접근 권한을 수동 부여해야 함
  • 기존에는 Cloudflare가 해커나 악성 행위자로 간주하지 않은 봇이 자유롭게 웹사이트 정보를 수집할 수 있었음

Cloudflare의 정책 변화 이유

  • Cloudflare CEO인 Matthew Prince는 이번 조치가 "인터넷상의 원본 콘텐츠 보호와 웹 퍼블리셔 권익을 강화하기 위함"이라고 강조함
  • AI 기업이 무단으로 인터넷 데이터를 활용하게 되면 콘텐츠 제작자가 새로운 콘텐츠를 생산할 유인이 감소하는 문제가 발생함
  • Cloudflare 네트워크는 전 세계 인터넷 트래픽의 약 20% 를 처리함
  • 최근 웹상에서 AI 크롤러 활동이 급증하고 있어 이에 대응하는 정책 추진임

AI 데이터와 업계 갈등 심화

  • OpenAI, Anthropic, Google 등 AI 모델 개발을 위한 대규모 데이터 수집 경쟁이 치열함
  • 고품질의 웹 데이터는 AI 모델의 정교함과 결과물 품질에 핵심적인 역할을 하고 있음
  • 그 결과, 웹사이트 운영자, 언론사, 저작권자들은 무단 데이터 수집 및 미보상에 대해 항의함

법적 분쟁 확대 사례

  • 2025년 6월 Reddit가 Anthropic을 상대로, 2023년 The New York Times가 OpenAI 및 Microsoft를 상대로 AI 훈련 데이터 무단 활용과 저작권 침해라는 이유로 각각 소송을 제기함
  • OpenAI와 Microsoft는 이러한 저작권 침해 주장에 대해 부인하고 있음

결론

  • Cloudflare의 새로운 AI 데이터 수집 기본 차단 정책은 AI 산업과 콘텐츠 소유자 간 데이터 접근 및 활용의 윤리∙법적 기준에 중대한 영향을 미침
  • 이번 정책 변화는 AI 생태계 내에서 콘텐츠 권리 보호와 사전 동의의 표준을 정립하는 데 중요한 계기가 되고 있음.

댓글과 토론

Hacker News 의견들
  • 지금까지 온라인에서 한 거의 모든 활동이 OpenAI, Anthropic 등을 더 부자로 만들기 위한 무료 학습 데이터가 됐고, 정작 가치를 만든 인간은 배제됐다는 걸 깨닫는 사람이 많지 않음
    지금 시점에서는 너무 늦었을 수도 있고 이 해법도 특별히 혁신적이진 않지만, AI 기생성을 막는 방향으로는 100% 맞다고 봄

    • Cloudflare와 비슷한 중개자들이 인터넷을 자유롭지 않게 만들고 있음
      이미 “브라우저 확인 중” 때문에 차단되거나 1998년식 로딩 시간을 겪고 있고, 결국 승인된 브라우저에서 승인된 행동을 하는 사람만 제대로 접근하게 될 것 같음
      Cloudflare는 문제를 해결하는 게 아니라 중간에 끼어들어 이익을 뽑아내며 모든 걸 더 나쁘게 만든다고 봄
    • 온라인에 글을 쓰는 건 공유하고 싶은 생각이 있기 때문임
      “이걸 해봤고 방법은 이렇다”, “정책을 이렇게 바꿔야 한다”, “X 하는 법 아는 사람?” 같은 글이 사람이 읽는 것처럼 모델 학습에 들어가도 괜찮다고 봄
    • 공개 인터넷 데이터로 자유롭게 학습하는 건 100% 괜찮다고 봄
      절대 괜찮지 않은 건 작은 웹사이트 운영이 어려워질 정도로 과도한 속도로 크롤링하는 것임
      정말 공유지의 비극에 가깝다
    • 이 댓글과 내 댓글도 포함됨
      HN 자체도 늘 스크랩되고 있고, 가장 불편한 건 문체 분석을 통한 익명 해제
      이미 가능하지만 대규모로 하기 어려웠던 일이 권위주의자에게 궁극의 도구가 될 수 있음
      말투가 곧 식별자가 되면 숨은 신원은 사라지고, 나쁜 정부나 대기업이 국경 밖 개인까지 협박할 힘을 갖게 됨
      우리는 빠르게 디스토피아로 가고 있으며, 인터넷 전체의 파괴나 전례 없는 자기검열로 이어질 수 있음
      이미 플랫폼 검열 때문에 algospeak가 생겼지만, 이건 훨씬 더 침습적이고 개인적인 검열이 됨
      어제 YouTube는 25~60세 연령대인 나에게 “End veteran suicide”라고 적힌 셔츠 때문에 비행기에서 쫓겨난 사람 영상에 콘텐츠 경고를 띄웠고, Apple은 “suicidal”은 스와이프 입력하게 해도 “suicide”는 막음
      정신건강 위기는 사람들이 문제를 논의하지 못하게 해서 줄어드는 게 아니라 더 악화됨
    • 오히려 이익을 얻는 쪽은 프롬프트를 정하는 사용자이고, AI 제공자는 정액 요금을 받으며, 저자는 다른 사람과 같은 AI 도구를 쓰는 것 외엔 아무것도 못 받는다고 봄
      사용자가 문제를 AI에 가져오므로 큰 몫을 가져가는 건 자연스럽다
      AI는 특정 사람이나 회사가 가진 과제에 적용되기 전까지 쓸모가 없고, 기회는 사용자가 만든다
      사용자가 사회 전반에 분산돼 있으니 이익도 가장자리로 퍼지며, 이 점에서 LLM은 Linux와 비슷함
      각 사용자에게 각자의 방식으로 봉사하지만, 오픈소스 코드 기여자가 직접 보상받지는 않음
  • 이 기능을 켜 보니 robots.txt가 자동으로 조정됐고, 그 밖에 뭘 하는지는 잘 모르겠음
    Amazonbot, Applebot-Extended, Bytespider, CCBot, ClaudeBot, Google-Extended, GPTBot, meta-externalagent 등을 Disallow: /로 막는 Cloudflare 관리 블록이 추가됨

    • User-agent: CCBot Disallow: /가 들어가는데, Common Crawl이 AI 전용인지 의문임
      CCBot은 이미 예전부터 많은 robots.txt에 있었고, Common Crawl이 아카이브 내용의 사용 방식을 어떻게 알거나 통제할 수 있는지도 애매함
      공정 이용에 기대고 있다면 어떨지도 문제임
      사이트 운영자가 자료에 지식재산권이 없다면, 그 자료를 LLM 생성용으로 라이선스하고 수수료를 받기 위해 권리자의 허락이 필요한지 궁금함
      사이트 약관이 운영자에게 사용자 저작물을 유료로 LLM 생성용 재라이선스할 권리를 주는 게 흔한지도 모르겠고, 그 돈이 권리자에게 배분되는지도 의문임
    • 논리와 응답이 맞지 않는 점이 흥미로움
      Cloudflare는 원본 콘텐츠 보호를 위해 바꾼다고 하면서도, 금지 예외에 인공지능 검색 증강 생성을 넣어둠
      이건 언어 모델 학습에 세금을 매기려는 것처럼 보이는데, RAG는 오히려 온라인 콘텐츠 제작자에게 즉각적인 영향을 더 크게 주고 클릭을 대체하니 왜 예외인지 모르겠음
    • Google은 색인용으로도, AI용으로도 긁어가는데 언젠가 “내 AI 학습을 돕기 싫으면 내 검색에서도 빠져라”라고 할 수도 있어 보임
      어려운 거래지만 어느 정도 자기일관성은 있음
    • robots.txt 갱신만으로는 소수만 막을 수 있고, Cloudflare는 이미 데이터를 모아 악성 에이전트 프로파일링을 해 온 듯함
      Cloudflare 글이 조금 더 설명함: https://blog.cloudflare.com/declaring-your-aindependence-blo...
      결국 고양이와 쥐 게임이 됨
    • 내 취미 사이트들은 UA에 대소문자 무시로 “bot”이 들어가고 robots.txt, humans.txt, favicon.ico 등이 아닌 걸 요청하면 상태 444로 연결을 닫아버림
      검색엔진도 떨어뜨리지만 대부분의 CIDR 블록은 블랙홀 라우팅해 둠
      여기서 이렇게까지 하는 사람은 아마 나뿐일 듯함
  • 제목은 조금 오해의 소지가 있음
    Cloudflare를 쓰는 사이트가 이제 모든 AI 봇을 빠르게 막는 옵트인 옵션을 갖게 된 것이지, Cloudflare 사용 사이트에 기본으로 켜지는 건 아님
    다만 Cloudflare 경영진의 단독 판단으로 그런 걸 할 수 있다는 발상 자체가 Cloudflare의 힘을 보여줌

    • 그 근거가 있는지 궁금함
      https://blog.cloudflare.com/content-independence-day-no-ai-c...에는 “기본값을 바꾼다”고 되어 있음
    • 이제 AI 봇과 웹사이트는 적대적 관계가 됐고, Cloudflare는 거기에 반응하는 것뿐임
      DDoS 보호도 같은 방식 아닌가 싶음
    • Cloudflare가 할 수 있는 건 인터넷을 느리게 만드는 것뿐이라고 봄
      지금까지 만난 Cloudflare 챌린지는 반나절 안에 다 우회할 수 있었음
      이건 결국 마켓플레이스를 만들고 LLM 검색 최적화에 들어가려는 첫 단계일 뿐이며, 사이트 보호에는 관심 없고 스크래퍼와 퍼블리셔 사이에서 몫을 떼려는 준비로 보임
      퍼블리셔와 직접 거래하면 되는데 왜 Cloudflare를 거쳐야 하는지 모르겠음
      Cloudflare가 할 줄 아는 건 중간자 공격뿐이라고 봄
    • 이런 기능은 옵트인이어야 한다고 봄
      방향에는 동의하지만, 내 웹사이트에 자동으로 켜졌다면 꽤 화났을 것 같음
  • Cloudflare를 통해 제공되는 내 데이터가 2년 전 월 20GB 미만에서 지금은 월 100GB로 늘었고, 전부 꽤 정적인 취미 사이트들임
    같은 기간 실제 사람 트래픽은 절반 정도 줄었으니, Cloudflare 입장에서도 리소스 사용을 줄이는 비용 절감 동기가 꽤 있을 것 같음

    • 이 규모의 대역폭은 비싸니 충분히 말이 됨
  • “AI 회사가 허락이나 대가 없이 여러 웹사이트 데이터를 자유롭게 쓰면 사람들이 새 디지털 콘텐츠를 만들 의욕을 잃는다”는 흐름은 피할 방법이 잘 안 보임
    AI는 성장할수록 다른 형태의 디지털 상호작용을 근본적으로 위축시킴
    성장 메커니즘 자체가 다른 디지털 콘텐츠를 죽이고, 결국 아이러니하게도 주 먹이인 을 죽일 것임

    • 모두가 AI로 하고 싶어 하는 것, 즉 인간과의 오락·상호작용과 경제적 상호작용이 실제로 일어나야 AI가 굶지 않음
    • 여기에 광고 차단기 사용률도 30% 쯤 된다고 하니, 이 논리는 중복되거나 더 미묘해짐
    • 암처럼?
  • HN에서 봇 트래픽이 웹사이트를 느리게 만든다는 얘기를 많이 들었는데, 웹사이트 운영자로서 솔직히 의아함
    이미 Cloudflare를 쓴다면 기본 캐시 설정만으로도 대부분 봇 트래픽은 캐시에 맞고 서버를 괴롭히지 않아야 함
    설령 그렇게 안 해도 요즘은 대역폭과 CPU가 싸서 큰 차이가 없어야 할 텐데, 왜 다들 그렇게 화가 났는지 모르겠음

    • AI 트래픽 때문에 장애를 겪었고 지금은 Cloudflare 도구를 쓰고 있음
      사이트 대부분은 여러 계층에서 캐시되지만, 인증 없는 공개 영역 중 기능상 캐시할 수 없는 엔드포인트가 있음
      그 지점을 두드리면 앱이 내려간 적이 있음
      또 생성 비용이 큰 페이지는 여러 계층 사이로 새어나갈 수 있음
      공개 페이지가 수백만 개라 무거운 페이지에서 동시에 캐시 미스가 나면 재생성 요청이 쌓이고 오류가 나며, 오류가 나면 캐시도 채워지지 않음
      그러면 AI 트래픽이 계속 같은 엔드포인트를 때리고, 계속 캐시되지 않고, 계속 오류가 나면서 나선형 장애로 번짐
    • 그건 꽤 큰 가정임
      내가 다루는 가장 큰 사이트는 페이지가 수십만 개이고 각 페이지가 약 10개 언어로 있어서 이미 수백만 페이지 규모임
      평소에는 잘 동작하고 어제도 하루 평균 거의 1000 RPS를 처리했음
      그런데 AI 크롤러 하나가 넓은 IP 범위에 걸쳐 100, 200 RPS 이상을 추가하면 사이트가 내려간 적이 있음
      요청 수 자체보다 한 “사용자”에게 지나치게 큰 비중이라는 점이 문제고, robots.txt에서 제외되고 다른 속도 제한으로 보호되던 비싼 엔드포인트를 때리기도 함
      그 방어는 DDoS를 예상하고 만든 게 아니었음
    • 이미 Cloudflare 사용을 전제로 하는 것부터 문제임
      이제 단순한 웹사이트를 유지하려면 Cloudflare가 필수인가?
    • 내가 들은 사례들은 대체로 스크래퍼 봇이 “날짜 범위의 모든 글 가져오기” 같은 API를 찾아낸 뒤, 시작일과 종료일 조합을 전부 두드리는 식이었음
    • 복잡한 얘기가 아님
      큰 사이트에서 일했는데, 사이트를 실시간 생성할 만큼의 연산 자원이나 입출력, 특히 DB IOPS가 없었음
      대규모 크롤링은 차가운 페이지와 객체를 생성하게 만들고 CPU와 IOPS를 쓰며, 그것들을 캐시로 끌어와 캐시 적중률을 크게 악화시켰음
      이 정도면 사이트가 쉽게 내려갈 수 있음
      규모가 커지면 캐시는 비싸고, 멍청한 크롤러의 대규모·빈번한 크롤링을 허용하려면 캐시에 크게 투자하거나 모든 사용자에게 사이트를 느리게 만들어야 함
      사이트는 사용자에게 제공하려고 만든 것이지, 회사들에 학습 데이터를 제공하려고 만든 게 아님
      Google은 다른 99.9%보다 훨씬 유능해서 사이트를 내려뜨리지 않도록 조심했고, 검색을 통해 트래픽을 제공했거나 예전에는 그랬음
      그래서 그건 거래였지 일방적 수탈은 아니었음
      Cloudflare와 거래하고 싶지 않은 이유도 있음
      초과하면 월 1만 달러부터 시작하는 엔터프라이즈 계정이 필요하다면 그 기준 X를 알아야 하는데, Cloudflare는 할당량을 공개하지 않음
      고객이 그 한도를 넘게 둔 뒤, 돈을 내지 않으면 거의 즉시 퇴출하겠다고 강하게 요구하는 사업 관행처럼 보임
  • Cloudflare 문구를 보면 robots.txt를 지키고 크롤 속도를 존중하며 행동을 숨기지 않는 검증된 AI 봇을 감지·차단할 수 있다고 함
    Perplexity 같은 회사가 이미 트래픽을 숨긴다는 걸 알고 있는데, 정중하고 투명한 봇을 벌주면 오히려 은폐를 유도하는 것 아닌가 싶었음
    다만 다른 댓글에 올라온 링크를 보면 은폐는 잘 통하지 않는다고 함: https://blog.cloudflare.com/declaring-your-aindependence-blo...
    Cloudflare는 초당 평균 5,700만 건 이상의 요청을 보는 네트워크 신호와 지문을 이용해 회피형 AI 봇도 “봇일 가능성 높음”으로 판정한다고 함

    • 정중하고 투명한 봇을 벌주면 은폐를 유도하는 건 맞지만, 그 다리는 이미 20년 전에 건넜음
      없던 군비 경쟁을 새로 만드는 게 아님
      봇은 이미 20년 넘게 그런 식으로 해 왔고, 사람들도 그만큼 오래 싸워 왔음
      새 문제도 아니고 새 해법도 아니며, 이 경쟁이 곧 끝날 전망도 없음
    • 바로 다음 줄에 규칙을 따르지 않는 AI 봇의 추가 시그니처도 포함됐다고 되어 있음
      Super Bot Fight Mode의 Block AI Bots 규칙은 봇 트래픽 대부분을 걸러냄
      내 사이트는 사용자보다 봇 트래픽이 10배 많았음
      이 기능은 robots.txt나 사용자 에이전트에만 의존하지 않으며, 켠 뒤 내 도구가 사이트에서 동작하게 하려고 별도 우회 페이지 규칙을 써야 했음
    • Cloudflare는 마음에 들지 않는 사람에게 웹을 지옥으로 만드는 법을 이미 알고 있음
      robots.txt 항목은 “악성”으로 표시되지 않고 사이트가 허용할 기회를 얻는 AI 봇 목록처럼 읽힘
      나머지는 Cloudflare식 특별 처리를 받게 될 듯함
    • Cloudflare 입장에서는 인터넷의 큰 덩어리를 긁는 봇을 숨기는 게 그리 쉽지 않음
      몰래 쓰는 방식도 지문을 찍을 수 있고, 대기업들은 Cloudflare와 일해야 하니 나쁜 행동에 대해 대화를 나눌 채널도 있을 것이라고 봄
      변호사가 얼마나 자주 끼는지는 모르겠지만, 끼는 경우가 있을 것 같음
  • 주요 AI 회사들이 실제로 robots.txt를 지키는지 모르겠음
    공개적으로 알려진 크롤러 일부는 지킬 수 있겠지만, 책·이미지·사용자 데이터를 불법 복제해 학습한 것처럼 몰래 크롤링하는 비공개 캠페인도 분명 있을 것 같음

    • 나도 같은 생각임
      robots.txt를 존중하는 건 관례일 뿐이고, 따를 기술적 요구사항은 없음
      자동으로 발생하는 법적 요구사항도 없을 듯함
      사이트가 약관에 “robots.txt 정책을 따라야 한다”고 넣을 수는 있겠지만, 크롤러가 포기할 만큼 강제력이 있을지는 모르겠음
    • 명확하지는 않지만, 이 트래픽의 상당수는 사람이 AI에 질문하고 AI가 답을 찾기 위해 웹을 조사하는 것일 가능성이 커 보임
      AI 도구가 연구용 웹브라우저처럼 쓰일 때도 robots.txt를 따라야 하는지, 아니면 그건 검색 색인에만 의도된 것인지 애매함
    • 작은 크롤러들이 차단을 피하려고 주요 회사처럼 흉내 내기 때문에 판별하기 어려움
    • 요즘 Cloudflare가 문지기 역할을 하는 건 싫지만, AI 회사들이 굽히게 만들 정도의 영향력은 실제로 갖고 있음
  • 현재 봇 목록은 꽤 짧음: https://developers.cloudflare.com/bots/concepts/bot/#ai-bots

    • 문서에는 AI 봇을 차단할 수 있고, LLM 학습 같은 AI 관련 콘텐츠 사용을 막기 위한 선택이라고 되어 있는데, 목록에 CCBot이 들어감
      Common Crawl은 AI 봇이 아님: https://commoncrawl.org
    • Cloudflare는 웹 트래픽을 많이 보니, 지금 보이는 가장 큰 봇들이 이 목록일 것 같음
      새 경쟁자가 나오면 발견하는 대로 추가할 수 있을 듯함
      전부 막는 건 사실상 불가능하겠지만, Cloudflare는 대부분보다 넓은 웹 커버리지로 더 많이 탐지할 수 있음
    • 이 차단이 유지된다면 대부분 사이트에서 트래픽을 절반 이상 줄이기엔 충분함
  • 아카이브 링크: https://archive.ph/ARnyu

    • 그 링크는 어떻게 만든 건지 궁금함