- 영화 7만8,000여 편의 데이터를 제공하던 The Numbers가 2026년 3월 5일 갑자기 중단됐고, 30년 된 시스템을 겨냥한 대규모 자동 트래픽과 보안 탐색 탓에 기존 사이트를 폐기하고 최소 기능만 복구함
- 전체 트래픽에서 사람의 비중은 약 10% 에 불과했으며, 2025년 12월부터 프롬프트 기반 수집과 에이전트형 AI 트래픽이 급증해 운영진 업무 시간의 약 90%가 기존 사이트 유지에 투입됨
- 로그에서는 정상적인 수집뿐 아니라 데이터 조기 접근이나 조작을 노린 것으로 보이는 백도어 탐색도 발견됐지만, 실제 장애 원인과 공격 주체는 확인되지 않음
- The Numbers 데이터가 Polymarket의 영화 흥행 예측 시장을 판정하는 기준으로 쓰이면서 공개 전 데이터가 거래상 우위를 제공할 수 있고, AI 도구는 오래된 사이트의 취약점을 저렴하게 탐색할 수 있게 함
- AI 크롤러는 독자를 돌려주지 않으면서 막대한 비용과 장애를 유발해 개방형 웹의 교환 관계를 무너뜨리며, 오래된 코드와 소규모 운영진에 의존하는 독립 아카이브·뉴스·포럼·참조 사이트가 특히 취약함
영화 산업의 데이터 기반이 사라진 일주일
- The Numbers는 박스오피스 매출, 제작비, 홈비디오, 스트리밍 데이터를 직접 조사해 제공하며 연간 방문자가 800만 명 이상인 영화 데이터 사이트임
- 언론인, 학계, 영화 제작자, 예측 시장과 Guinness World Records가 권위 있는 자료로 사용함
- 2026년 초 데이터베이스에는 영화 78,396편, 극장 개봉 기록 178,375건, 인물 236,176명이 들어 있었음
- 사이트는 2026년 3월 5일 중단된 뒤 일주일 넘게 돌아오지 않았고, 3월 13일 새 인프라에서 축소판으로 복구됨
- 과거 차트, 영화별 페이지, Report Builder 등이 사라지고 최신 박스오피스 수치 중심의 최소 기능만 남음
- 구체적인 안내 없이 재구축 메시지만 표시되자 이용자들이 분노했고, 유료 상품 전환을 위한 의도적 기능 축소라는 의혹까지 나옴
1997년에 시작된 30년 된 시스템
- 수학자이자 전 IBM 소프트웨어 개발자인 Bruce Nash는 1997년 10월 17일 영화 300편을 추적하는 Geocities 사이트를 시작함
- Access 데이터베이스에서 HTML을 생성해 Geocities에 올리고, Hollywood Stock Exchange 게시판에서 영화 주식 거래에 활용할 박스오피스 분석을 알린 것이 출발점이었음
- 당시 20주년 회고문은 현재 Internet Archive의 보관본으로만 남아 있음
- 수십 년간 확장된 기존 사이트는 약 16만 개의 소스 파일로 약 200만 페이지를 제공하고 있었음
AI 크롤러가 만든 두 차례의 트래픽 파동
- 초기 25년 동안에는 사람, 비교적 규칙을 잘 지키는 검색 엔진, 개인 프로젝트용 수집기가 주된 방문자였고 과도한 수집자는 찾아 차단할 수 있었음
- 첫 번째 변화는 2024년 무렵 AI 학습용 크롤러가 검색 엔진 수집에 합류하면서 시작됨
- AI 크롤러는 검색 엔진보다 규칙을 덜 지키는 경향이 있어 사이트를 안정적으로 유지하기 위한 관리 작업이 늘어남
- 2024년에는 전체 웹에서 자동 트래픽이 사람 트래픽을 넘어섰고, 이후 Cloudflare 집계에서는 봇이 웹페이지 요청의 57.5% 에 도달함
- 두 번째 파동은 2025년 12월 무렵 시작됐으며, 프롬프트에 응답해 사이트를 수집하는 AI 에이전트와 사용자가 직접 만든 에이전트가 트래픽을 더욱 키움
- The Numbers 방문량 중 사람이 직접 탐색하는 비중은 약 10%였고, 나머지는 AI 봇과 자동화 트래픽이었음
- 12월부터 3월 초까지 운영진은 업무 시간의 약 90% 를 기존 사이트 유지에 쓰고 남는 시간에 새 시스템을 개발함
크롤러에 라이선스 경로를 알린 대응
- 운영진은 LLM이 읽을 수 있는 안내를 사이트에 넣어 데이터를 직접 수집하는 대신 라이선스 구매 방법을 답하도록 유도함
- 이후 데이터 라이선스 문의가 약 10배로 늘어남
- 트래픽 완화책은 효과가 있었지만, 30년 된 코드와 16만 개의 파일을 방어하면서 서비스를 계속 운영해야 하는 구조적 부담은 해소하지 못함
서버 중단과 보안 탐색 흔적
- 서버는 3월 5일 새벽 무너졌고, 운영진은 처음에 AI 트래픽 부하만을 원인으로 의심함
- 로그에서는 정상 URL을 이용한 접근과 함께 백도어를 찾는 시도가 발견됨
- 누군가 사이트 공개 전 데이터에 접근하거나 사용자에게 제공되는 데이터를 조작하려 했을 가능성이 있음
- 수개월간 자동화된 수집과 탐색이 있었지만, 최종 장애를 무엇이 일으켰고 누가 실행했는지는 확인되지 않음
- 사이버보안 전문가의 조언에 따라 기존 서버는 다시 켜지 않음
- 백업을 복구하면 이미 오랫동안 취약점을 탐색한 공격자에게 16만 개의 레거시 파일을 다시 노출하게 됨
- 기존 서버는 재가동 후 수분 안에 다시 중단될 수 있다고 판단해 새 인프라에 최소 기능 버전을 구축함
예측 시장이 영화 데이터에 부여한 금전적 가치
- Polymarket은 영화 개봉 주말 성적 시장을 운영하며 The Numbers의
Daily Box Office Performance를 시장 판정 기준으로 지정함 - 개별 주말 시장은 보통 수만~수십만 달러 규모이고, 동시에 열려 있는 영화 흥행 시장 전체에는 수백만 달러가 걸리기도 함
- 공개 전에 The Numbers의 데이터를 볼 수 있다면 매주 다른 거래자보다 먼저 결과를 파악해 선행 거래할 수 있음
- 예측 시장은 거의 모든 데이터를 금전적 가치로 바꿀 수 있고, 저렴한 AI 도구는 사이트 침입의 기술 장벽을 낮추며 대규모 에이전트 봇은 기존 웹 인프라의 취약성을 확대함
AI가 낮춘 사이버 공격의 진입 장벽
- Anthropic은 2025년 11월 AI가 조율한 최초의 문서화된 사이버 첩보 캠페인을 공개함
- 국가 지원 조직이 약 30개 기관을 공격했으며 AI가 작업의 80~90% 를 수행함
- 사람은 캠페인마다 4~6개의 의사결정 지점에만 개입함
- 정교한 사이버 공격의 장벽은 크게 낮아졌고 계속 낮아질 것으로 보임
- Anthropic의 이전 위협 보고서에 따르면 기술력이 부족한 범죄자도 과거 수년의 훈련이 필요했던 랜섬웨어 개발 같은 복잡한 작업을 AI로 수행함
- 자율형 AI 침투 테스트 도구 XBOW는 약 1,060건의 취약점을 제출하며 HackerOne 미국 순위 1위에 오름
- 알려진 취약점이 존재할 가능성이 큰 30년 된 사이트는 AI 도구가 저렴하게 탐색하기에 적합한 공격 표면이며, 과거 소규모 사이트를 보호하던 전문성 장벽이 크게 약해짐
전면 재구축에 나선 The Numbers
- 공개 사이트는 중단됐지만 The Numbers의 핵심 수익원은 영향을 받지 않아 사업 자체는 유지됨
- 무료 사이트는 최근 몇 년간 광고 의존도가 높지 않았음
- 대량 데이터를 판매하는 OpusData, 영화 제작자와 투자자용 비교 분석 보고서, Business Report가 주요 사업임
- 영화 78,396편, 개봉 기록 178,375건, 인물 236,176명을 제공할 웹사이트를 처음부터 다시 구축해야 하므로 기능을 한꺼번에 복원하지 못하고 있음
- 운영진은 2026년의 공개 웹사이트가 상대해야 할 이용자를 여섯 부류로 구분함
- 사람
- 검색 엔진
- LLM 학습 작업
- 프롬프트 기반 AI 트래픽
- 에이전트형 AI
- 예측 시장 거래자
- 과거에는 콘텐츠·광고·SEO 세 요소에 집중했다면 이제 모든 설계 결정에서 약 8~10개 요소를 고려해야 함
- 새 사이트는 여섯 이용자 유형을 모두 지원하면서 OpusData 서비스와 Business Report 구독자 기능을 추가하고, 일반 이용자에게 기존 데이터를 개선된 형태로 돌려주는 것을 목표로 함
크롤링 비용과 돌아오지 않는 방문자
- Cloudflare의 플랫폼별 집계에서 사이트가 추천 방문자 한 명을 얻기 위해 허용하는 크롤링 규모는 크게 달랐음
- Google은 방문자 한 명당 약 5페이지를 수집함
- OpenAI는 1,000페이지 이상을 수집함
- Anthropic은 38,000페이지 이상을 수집함
- 검색 엔진이 콘텐츠를 읽는 대신 독자를 보내주던 개방형 웹의 교환 관계가 AI 크롤러에서는 작동하지 않음
- 대량 수집은 소규모 사이트의 대역폭 비용을 높이고 서비스 전체를 중단시킬 수 있음
다른 사이트가 겪은 대규모 수집 피해
- Read the Docs에서는 한 크롤러가 한 달 동안 압축 HTML 73TB를 내려받아 대역폭 비용이 5,000달러 이상 발생함
- iFixit은 Anthropic 크롤러에서 하루 100만 건의 요청을 기록함
- 직원 7명의 3D 스캔 판매업체 Triplegangers는 영업시간 중 OpenAI 봇 때문에 중단됐고, CEO는 이를 사실상 DDoS 공격이라고 평가함
- SourceHut 운영자는 매주 업무 시간의 20~100% 를 AI 크롤러 대응에 쓰며 주당 수십 차례의 짧은 장애를 겪음
- Linux 뉴스 사이트 LWN은 수백만 개 IP에서 들어오는 크롤러 트래픽을 분산 서비스 거부 공격으로 판단함
- GNOME 오픈소스 프로젝트가 측정한 트래픽의 약 97% 는 봇이었음
- 한 대학 도서관은 목록 서비스를 유지하기 위해 48시간 동안 IP 주소 1만6,000개를 차단함
Wikipedia가 겪은 비용과 독자 감소
- Wikimedia Foundation은 2025년 4월 봇이 Wikipedia 페이지 조회의 약 35% 를 차지하지만, 처리 비용이 가장 높은 트래픽에서는 최소 65%를 차지한다고 집계함
- 크롤러가 사람이 거의 읽지 않는 페이지까지 대량으로 가져가기 때문에 비용 비중이 더 높음
- 6개월 뒤 Wikipedia의 사람 페이지 조회는 전년 대비 약 8% 감소함
- 이용자들이 Wikipedia를 직접 방문하지 않고 AI 요약에서 지식을 얻는 일이 늘어남
- AI 시스템은 콘텐츠를 대규모로 가져가는 동시에 원래 사이트가 받을 독자도 줄임
기존 인터넷의 전제가 무너진 상황
- AI 도구는 강력하면서도 파괴적이며, 실제 환경에서 대중에 의해 실시간으로 시험되고 있음
- 기존 개방형 웹은 다음 전제 위에 구축됐지만 모두 현재 상황과 맞지 않음
- 방문자의 대부분은 사람임
- 트래픽은 독자 수와 대체로 비례함
- 사이트 제공 비용은 운영자가 얻는 가치와 연결됨
- AI의 유용성을 부정하는 문제와 별개로, 현재의 웹은 누구나 접근할 수 있는 AI 모델의 힘과 규모에 대비되지 않았음
크롤링 과금과 기본 차단 실험
- Cloudflare는 사이트가 AI 크롤러에 페이지당 비용을 부과하는 pay-per-crawl을 출시함
- 이후 콘텐츠가 AI 답변에 실제로 사용될 때 게시자에게 비용을 지급하는 pay-per-use 모델을 발표함
- 9월 15일부터 Cloudflare 고객의 광고 기반 페이지는 비용을 내지 않는
mixed-use크롤러를 기본 차단할 예정임 - 이러한 정책의 성패는 AI 기업이 기술적으로 우회하지 않고 과금 체계에 참여하는지에 달려 있음
독립 웹사이트 전체에 대한 경고
- The Numbers는 과도한 기계 트래픽과 침입 가능성 사이에서 사이트 전체를 잃었지만, 공개 웹사이트가 사업의 전부는 아니어서 생존할 수 있었음
- 독일 섬유업체 ZEGO는 37년간 운영됐으나 3월 사이버 공격으로 생산이 6주간 중단된 뒤 파산을 신청함
- 독립 아카이브, 취미 데이터베이스, 지역 뉴스, 포럼, 참조 사이트는 오래된 코드와 소규모 팀 또는 개인 운영자에게 의존하면서 축적된 공동 지식을 보존하고 있음
- The Numbers는 더 나은 구조로 복구 중이며, 기존 인터넷을 위해 만들어진 소규모 사이트를 계속 사용하고 지원하는 일이 생존에 직접 연결됨