1P by GN⁺ | ★ favorite | 댓글 1개
  • X/Twitter의 새 서비스 이용약관은 사용자 게시물을 AI 훈련에 쓸 수 있게 하며, 외부 스크래퍼를 막아온 X가 자체 데이터 활용 범위를 넓힌다는 점이 쟁점임
  • Elon Musk는 과거 Microsoft의 Twitter 데이터 사용을 문제 삼았지만, 이제 X는 사용자 콘텐츠를 AI 모델 훈련에 활용할 수 있는 방향으로 움직임
  • X에 직접 게시하라는 기자 대상 권유와 xAI의 X·Tesla 협력 구조가 맞물리며, X 데이터가 xAI의 지속적 데이터 공급원이 될 수 있다는 우려가 커짐
  • 업데이트된 약관의 AI 기반 정의는 콘텐츠 접근 제한이나 차단으로 이어질 수 있어, 특정 트윗·해시태그 노출과 콘텐츠 확산에 영향을 줄 수 있음
  • 플랫폼 경험은 모두에게 같은 공개 공간보다 AI가 정의한 사용자 정체성에 따라 달라지는 개인화된 영역에 가까워질 수 있음

X/Twitter 약관 변경이 겨냥하는 데이터 활용

  • 새 약관은 사용자의 게시물을 AI 훈련에 사용할 수 있게 함
  • 이 변화는 여러 회사가 AI 학습 데이터와 약관을 둘러싸고 논란을 겪는 흐름과 맞닿아 있음
    • Brave는 저작권 데이터의 AI 훈련 판매 이슈와 함께 거론됨
    • Zoom은 사용자 콘텐츠를 AI 훈련에 쓰는 약관 변경 사례로 언급됨
    • AWS는 기본값이 AI 서비스 관련 데이터 사용 opt-in인 구조로 비교됨
  • X는 외부 스크래퍼로부터 플랫폼을 고립시키려는 조치를 취해왔고, xAI 출범 이후 X의 데이터를 AI 훈련에 활용할 수 있다는 점이 핵심 쟁점이 됨

Elon Musk, xAI, 사용자 콘텐츠의 관계

  • Elon Musk는 과거 Microsoft가 Twitter 데이터를 불법적으로 사용했다고 말했고, Microsoft를 법정에 세우겠다는 입장을 보인 적이 있음
  • 이제 X 자체가 사용자 콘텐츠를 AI 훈련에 쓰는 방향으로 약관을 바꾸면서, 사용자가 별도 허가나 보상 없이 Musk의 AI 사업에 기여하게 된다는 비판을 받음
  • Musk는 기자들에게 더 큰 자유와 수익을 원하면 X에 직접 게시하라고 말한 바 있음
    • 이 발언은 독점적이고 흥미로운 정보를 X에 모으고, 그 데이터를 모델 훈련에 활용하려는 흐름으로 해석될 수 있음
  • xAI 홈페이지는 xAI가 X Corp와 별도 회사지만 X(Twitter), Tesla 등과 긴밀히 협력한다고 밝힘
  • AI에서 데이터 품질과 고유성이 병목이 될 수 있다는 전제 아래, X 데이터는 xAI를 위한 지속적 데이터 공급원으로 작동할 수 있음

사용자 경험에 생길 수 있는 변화

  • 업데이트된 약관의 AI 기반 정의에 따라 사용자의 콘텐츠 접근이 제한되거나 차단될 수 있음
    • 특정 트윗이나 해시태그가 보이지 않을 수 있음
    • 자신의 콘텐츠가 더 넓은 독자에게 도달하기 어려워질 수 있음
  • Twitter에서는 과거에도 shadow banning 논란이 있었지만, 자동화와 AI 개입은 더 정교하고 광범위한 방식으로 작동할 수 있음
  • 이런 방식은 Twitter에만 머물지 않고 인터넷 전반으로 확장될 가능성이 있음
    • Google 검색 결과
    • Facebook 피드의 뉴스 노출
    • 사용자가 볼 수 있는 경로와 선택지
  • 인터넷의 경로 자체가 줄어드는 것이 아니라, AI가 정의한 사용자 정체성에 따라 일부 경로가 숨겨지거나 드러나는 방식으로 개인별 경험이 좁아질 수 있음
  • Twitter는 모두에게 같은 보편적 경험보다 AI 알고리듬이 정의하는 개인화된 공간에 가까워질 수 있음

댓글과 토론

Hacker News 의견들
  • Musk는 Twitter를 AI 학습용 데이터의 보고처럼 보는 데 집착해 왔고, AI 회사들이 학습 목적으로 Twitter 데이터를 쓴다고 자주 불평해 왔음
    OpenAI 같은 회사들은 Twitter를 특별히 노린다기보다 웹을 크롤링하다 보니 Twitter도 포함된다고 생각했는데, Twitter 데이터가 정말 그렇게 가치 있는지 궁금함
    다른 공개 데이터셋보다 특히 유용하게 만드는 특성이 무엇인지 잘 모르겠음

    • Twitter 데이터는 (1) 정확한 시간표시가 있고, (2) 최근 사건을 다루는 새 데이터가 계속 흘러들어옴
      영어권에서는 Reddit 말고는 비슷한 소스가 거의 없음
      GPT류 구조에는 둘 다 직접 관련이 없어 보이지만, 미래의 모델 구조가 이를 활용할 가능성은 있음
      정보이론 관점에서 보면 트윗의 시간표시와 상대적 순서에도 0이 아닌 정보량이 들어 있음
    • Twitter는 일반적인 학습 데이터 발굴 장소로는 별로라고 봄
      대부분의 데이터가 잘 구조화되거나 태깅되어 있지 않고, 신호 대 잡음비가 낮으며, 텍스트는 대체로 짧고 맥락 의존성이 큼
      Twitter는 짧은 동영상 플랫폼으로도 대체로 실패했고, 관심사/주제 기반 피드를 알고리즘으로 만든 흔적은 있지만 품질이 좋았던 적은 별로 없음
      장점은 신선도와 규모지만, 강한 웹 크롤링 인프라가 있으면 Twitter 없이도 달성 가능해 보임
      현재 세대의 대규모 언어 모델은 적어도 지금은 분 단위 신선도를 제대로 활용하지 못함
    • Twitter 데이터는 트윗 같은 콘텐츠를 생성하는 데는 매우 가치가 있음: 짧고 독립적인 문장, 이미지, 동영상 같은 것들
      다만 오늘날 Twitter에는 에세이, 뉴스 기사, 책, 과학 논문 같은 긴 형식 콘텐츠와 비슷한 데이터가 많지 않음
      그래서 Twitter/X가 트윗 길이 제한을 늘려 그런 데이터를 모으려 한 것일 수도 있음
    • Twitter가 Elon이 생각하는 만큼 사용자 데이터의 보고라면, 왜 Twitter의 광고 타기팅은 Facebook이나 Instagram보다 훨씬 나쁜지 의문임
    • Twitter는 트윗의 최대 데이터베이스를 갖고 있음
      트윗을 쓰는 AI를 원한다면 그보다 나은 것은 없음
      Twitter는 커뮤니티 매니저가 필요 없게 하는 서비스를 제공할 수도 있음. 보도자료나 제품 웹사이트를 넣으면 잘 다듬어진 광고 트윗 흐름을 만들어 주거나, 심지어 여론 조작용 글도 만들 수 있음
  • 이 변화는 Twitter에만 국한되지 않고, 인터넷의 새 표준이 될 수 있는 모습을 보여줌
    Google/Gmail/YouTube, Amazon, Microsoft, TikTok, 그리고 사용자 생성 콘텐츠를 다루는 모든 인터넷 플랫폼도 곧 똑같이 할 것임
    이미 하고 있지 않다면 말임

    • GMail은 이미 분류, 데이터 마이닝 등 여러 AI 목적에 사용자 데이터를 써 왔음
      처리된 GMail 데이터가, 민감정보 제거 같은 절차를 거쳐, LLM이나 다른 AI 프로젝트 학습에 쓰이지 않는다면 오히려 꽤 놀랄 것 같음
    • 그들은 수년 전부터 해 왔음
      서버에 올리는 모든 것은 학습 소스가 됨
      2010년대 중후반 FB Messenger에서는 추천과 자동응답 모델이 사용자 간에 오간 암호화되지 않은 메시지 전체 말뭉치로 학습됐음
    • 직접 호스팅을 그만두고 화이트라벨 이메일 서비스를 고를 때 Proton Mail을 선택한 큰 이유 중 하나가 그거였음
      서버 쪽에서 긁어갈 게 없음
    • Google이 이걸 한다는 건 정말 엄청난 아이러니임
  • 약관에 이제 집단소송 포기 조항도 들어갔음

    • 대체 그런 조항이 어떻게 합법인지 모르겠음
      AI 학습 조항보다 솔직히 이쪽이 더 불편함
      사람들의 주의를 광고주에게 파는 것보다는 AI 학습이 덜 문제라고 봄
  • 아, 이제 알겠음
    몇 초 동안은 윈도 시스템 X가 데이터를 AI에 어떻게 쓰는지 궁금했음

    • 다른 대기업들도 혼란을 더 키우려고 주력 서비스 이름을 짧게 줄이면 좋겠음
  • Twitter 사용자들이 트윗하는 것들로 학습한 AI보다 세상에 더 나쁜 건 상상하기 어려움

    • 온갖 사상가 흉내 봇들의 뜨거운 견해를 차단 목록에 추가할 날이 기대됨
  • Elon의 다른 회사인 xAI가 이 데이터를 필요로 하기 때문에 이렇게 한 것임

  • 거의 모든 약관은 데이터를 사용해 제품을 개선할 수 있도록 허용함
    “허술한 휴리스틱 몇 개를 거대한 AI 모델로 대체하는 것”은 내게는 제품 개선으로 보임
    따라서 이미 사용자 데이터로 AI 모델을 학습할 수 있었던 셈임

    • 이런 약관은 공개 포럼에서도 누군가가 소유권이나 개인정보 침해를 주장할 수 있는 공개 사용 시나리오를 막기 위해 필요했을 가능성이 큼
  • 챗봇을 학습시키려고 그러는 건가? Elon은 봇을 없애겠다고 했던 것 같은데

    • 사람들을 heaven ban하는 데 쓰면 됨: https://cosmosmagazine.com/technology/internet/heaven-bannin...
      CEO가 Elon에게 써서 그를 얌전하게 둘 수도 있음
    • 자율주행차, 스스로 착륙하는 로켓, 어설프게 걷는 소름 끼치는 휴머노이드 로봇을 만든 그 사람 말이지? 맞아, 자동화된 걸 정말 싫어하겠네
    • 남의 봇을 없애겠다는 뜻이었겠지
  • 조직적이든 개인적이든 소비자 행동이 여기서 다음 일을 바꿀 가능성은 0%임
    결국 지식재산권법과 그 주변 영역에 달려 있음
    여기서 의도적인 행동을 기대할 이유는 별로 없음

    • 소비자는 소비를 멈출 수 있음
      예전 Twitter든, 지금 우리가 뭐라고 부르든 말임
    • 정말 그럴까?
      소비자 행동이 데이터셋을 오염시키는 것이라면 어떨까?
  • 우리는 모두 AI 기계에 소비될 것임
    “모든 능력은 데이터 분석에서 만들어지고, 그들이 분석하는 데이터는 바로 당신이다. 직접적인 의도든 아니든, 모든 발전은 당신에 대해 알 수 있는 모든 사실과 추론을 집어삼키는 쪽으로 침범하고 있다. 그 힘을 발현시키기 위해 당신의 영혼은 기계에 제물로 바쳐져야 한다.”
    https://www.mindprison.cc/p/ai-end-of-privacy-end-of-sanity