- 뉴욕타임스는 OpenAI 계열사들과 Microsoft가 자사 콘텐츠를 무단으로 학습·출력에 활용했다며, GPT 인스턴스와 학습 데이터셋 삭제까지 요구하는 저작권 소송을 제기함
- 핵심 쟁점은 모델 학습 자체뿐 아니라 GPT 기반 도구가 Times 유료 기사 내용을 거의 그대로 재현해 유료 장벽을 우회할 수 있는지임
- Times는 Common Crawl에 자사 사이트의 고유 레코드 1,600만 건이 포함됐고, GPT-3.5 이전 공개 학습 데이터에서 세 번째로 많이 참조된 출처였다고 주장함
- Ars Technica의 시험에서는 ChatGPT의 해당 우회가 막힌 것으로 보였지만, Copilot은 특정 Times 기사 첫 문단 요청에 기사 앞부분 상당량을 재현함
- 소송은 저작권 침해와 DMCA, 상표권, 부정경쟁 청구를 포함하며 영구 금지명령과 손해배상, 반환, 부당이득 환수를 요구함
소송 대상과 핵심 요구
- 뉴욕타임스는 OpenAI 관련 여러 회사와 Microsoft를 상대로 저작권 침해 소송을 제기함
- Microsoft는 OpenAI의 파트너로서 Copilot 서비스를 OpenAI 기술로 구동하고, GPT 대형 언어 모델 학습을 위한 인프라 제공에 관여했다는 이유로 소송 대상에 포함됨
- 요구 사항에는 Times 자료로 학습된 모든 GPT 인스턴스 삭제와 학습에 사용된 데이터셋 파기가 포함됨
- 앞으로 유사한 행위를 막기 위한 영구 금지명령도 함께 요구함
- 금전적 구제에는 법정손해배상, 보상손해배상, 반환, 부당이득 환수, 법이나 형평법상 가능한 기타 구제가 포함됨
Times가 보는 피해 구조
- Times는 많은 기자와 취재 인력을 유지하며 다양한 분야 보도와 탐사보도를 수행하고, 그 결과 여러 사안에서 권위 있는 출처로 여겨진다고 주장함
- 이런 보도 비용을 회수하기 위해 Times는 강력한 유료 장벽으로 기사 접근을 제한함
- 인쇄판 저작권 고지, 서비스 약관의 복제·사용 제한, 선택적 라이선스 정책을 통해 저작물 이용을 통제함
- OpenAI 도구가 Times 콘텐츠를 허가 없이 제공하면 독자 관계가 훼손되고, 구독·라이선스·광고·제휴 수익을 빼앗긴다는 것이 소송의 핵심 피해 논리임
학습 데이터 사용 관련 쟁점
- Times는 GPT 여러 버전의 학습 과정에서 자사 콘텐츠가 무단 사용됐다고 주장함
- GPT-3.5 이전에는 학습 데이터셋 정보가 공개됐고, 그중 하나인 Common Crawl에 Times 사이트에서 발행된 고유 레코드 1,600만 건이 포함됐다고 봄
- 해당 기준에서 Times는 Wikipedia와 미국 특허 데이터베이스에 이어 세 번째로 많이 참조된 출처였음
- OpenAI는 최근 GPT 버전의 학습 데이터 세부 정보를 더 이상 많이 공개하지 않지만, 소송은 Times 기사 전문이 여전히 학습 과정에 포함됐다는 정황을 제시함
- 사건이 진행되면 학습 데이터 접근 정보가 증거개시 절차의 주요 쟁점이 될 수 있음
출력 단계에서 드러난 재현 문제
- 소송은 저작권 자료가 학습에 쓰였다는 데서 멈추지 않고, 학습된 자료가 사용 중 다시 출력될 수 있다는 점을 강조함
- Times는 OpenAI 기반 생성 AI 도구가 Times 콘텐츠를 문장 그대로 낭독하거나, 매우 가깝게 요약하거나, 표현 스타일을 모방할 수 있다고 주장함
- 소송 자료에는 GPT-4가 Times 기사 큰 부분을 거의 그대로 재현한 사례들이 포함됨
- 예시 프롬프트는 ChatGPT에 Times 기사 제목을 주고 첫 문단을 요청한 뒤, 계속 다음 문단을 요청하는 방식임
- Ars Technica가 같은 프롬프트 일부를 시험했을 때 ChatGPT는 Times 웹사이트나 다른 신뢰할 수 있는 출처 확인을 권했지만, 이전 문맥이 있으면 저작권 자료가 나올 가능성은 배제하지 못한다고 봄
- Copilot은 Bing Chat에서 이름이 바뀐 서비스이며, Ars Technica는 특정 Times 기사 첫 문단을 요청하자 기사 앞부분 약 3분의 1을 재현하는 것을 확인함
공정 이용 반박과 평판 피해
- OpenAI와 Microsoft 측은 생성 AI 모델 학습을 위한 무허가 저작권 콘텐츠 사용이 새로운 변형적 목적을 제공하므로 공정 이용이라고 공개적으로 주장해 왔음
- Times는 비용을 지불하지 않고 Times 콘텐츠를 이용해 Times를 대체하고 독자를 빼앗는 제품을 만드는 데는 변형성이 없다고 반박함
- AI의 환각도 Times 평판 가치를 훼손할 수 있는 요소로 제시됨
- 예시로 GPT 모델이 2020년 1월 10일 Times가 오렌지 주스와 비호지킨 림프종의 관련성을 다룬 기사를 게재했다고 꾸며냈지만, Times는 그런 기사를 낸 적이 없다고 주장함
- 심장 건강에 좋은 음식 관련 Times 기사에 대해 Copilot이 원문에 없는 예시 목록을 제시했고, 요청된 목록의 80%는 원 기사에 언급되지 않은 음식이었다고 소송은 주장함
- Wirecutter 추천 사례에서는 직원들이 리뷰하지 않은 제품이 Wirecutter 추천으로 귀속됐다고 주장함
Wirecutter와 제휴 수익 문제
- Wirecutter는 The New York Times가 소유한 매체임
- 소송은 Copilot이 Wirecutter 기사 큰 부분도 출력할 수 있다고 주장함
- 해당 기사 발췌에는 제휴 링크가 제거돼 있어, Wirecutter의 주요 수익원이 차단된다는 문제가 제기됨
법적 청구 항목
- 소송은 OpenAI 관련 회사들에 소프트웨어 개발 책임을 묻고, Microsoft에는 OpenAI 기반 서비스 제공 및 학습 인프라 구축 책임을 함께 물음
- 청구 항목에는 직접 저작권 침해, 기여 침해, 대위 침해가 포함됨
- 추가로 DMCA 위반, 상표권 위반, 그리고 부정경쟁에 의한 유용도 제기됨