2P by GN⁺ | ★ favorite | 댓글 1개

요약

  • 대형 언어 모델(LLM)의 영향
    대형 언어 모델(LLM)은 인간이 생성한 데이터와 지식 자원의 대체 가능성을 가지고 있음. 그러나 이러한 대체는 미래 모델 개발에 필요한 훈련 데이터의 감소로 이어질 수 있는 문제를 제기함. 이 연구에서는 ChatGPT의 출시와 함께 Stack Overflow의 활동이 감소했음을 문서화함.

  • ChatGPT의 영향
    ChatGPT 출시 후 6개월 이내에 Stack Overflow의 활동이 러시아 및 중국의 유사 플랫폼과 수학 포럼에 비해 25% 감소함. 이는 ChatGPT가 Stack Overflow에 미치는 진정한 영향의 하한으로 해석됨. 가장 널리 사용되는 프로그래밍 언어와 관련된 게시물에서 감소가 더 큼.

  • LLM의 대체 효과
    LLM은 중복되거나 낮은 품질의 콘텐츠뿐만 아니라 고품질 콘텐츠도 대체하고 있음. ChatGPT 사용자는 Stack Overflow에 게시할 가능성이 낮고 플랫폼을 정기적으로 방문하지 않음. 이는 LLM의 빠른 채택이 훈련에 필요한 공공 데이터의 생산을 감소시켜 중요한 결과를 초래할 수 있음을 시사함.

  • 프로그래밍 언어별 영향
    Python과 Javascript와 같은 널리 사용되는 언어에서 ChatGPT의 영향이 더 큼. CUDA와 같은 특정 언어에서는 ChatGPT 출시 후 게시물이 증가함. 이는 AI와 관련된 소프트웨어에 대한 관심이 증가하고 있음을 보여줌.

GN⁺의 정리

  • 이 연구는 ChatGPT와 같은 대형 언어 모델이 온라인 Q&A 플랫폼에 미치는 영향을 분석함으로써, AI의 빠른 채택이 공공 데이터의 생산에 미치는 부정적 영향을 강조함.
  • ChatGPT의 사용이 증가함에 따라 Stack Overflow와 같은 플랫폼의 활동이 감소하고, 이는 미래 AI 모델의 훈련 데이터 품질에 영향을 미칠 수 있음.
  • 이러한 변화는 디지털 경제와 정보 접근 방식에 중요한 영향을 미칠 수 있으며, 이는 AI 생태계의 지속 가능성에 대한 우려를 제기함.
  • 유사한 기능을 가진 다른 프로젝트로는 GitHub의 프로그래밍 언어 관련 리포지토리들이 있음.

댓글과 토론

Hacker News 의견들
  • 결국 문제는 LLM이 무엇을 근거로 삼을 것인가임. 새 정보를 만들어내는 게 아니라 기존 정보를 되뱉고 조합하는 방식이라, 공개 샘플이나 Stack Overflow/Reddit 답변이 충분하지 않은 코드에서는 성능이 크게 떨어짐

    • 참고로 GPT o1이 문서가 불투명하고 공개 예제가 적은 오픈소스 라이브러리인 epub.js의 꽤 복잡한 사용 사례를 해결하는 데 도움을 줬음
      몇 번 주고받아야 동작하는 해법에 도달했지만 결국 해냈고, AI가 인터넷의 obscure한 자료를 잘 찾아 소화한 건지, 아니면 난해한 문서를 나보다 더 잘 이해한 건지 궁금해짐. 후자라면 공개 샘플의 필요성은 줄어들 수도 있음
    • LLM이 모르는 탓에 사람들이 무작정 새 프로그래밍 언어와 프레임워크를 만들어내는 일이 줄어드는 흥미로운 부작용이 생길 수도 있음
      이미 LLM이 잘 다루는 기술 쪽으로 기울고 있는데, 약간 더 나은 언어나 프레임워크의 이점보다 LLM에게 문제의 90%를 풀게 할 수 있다는 장점이 더 큼. Python을 언어로는 꽤 싫어하지만, LLM이 다른 많은 언어보다 Python에서 훨씬 잘한다는 건 부정하기 어려움
    • “새 정보를 만들지 않는다”는 말과 달리, 온라인 Q&A 플랫폼의 지식 공유 대부분은 창의적 활동이 아님. 시스템 개발자 본인을 제외하면 모두가 겪는 같은 문제를 끝없이 묻는 것에 가깝고, 상당 부분은 검색 플랫폼을 대체하는 일임
    • LLM이 근거로 삼을 수 있는 건 공식 문서
      숫자는 지어내지만 방어할 수 있음: Stack Overflow 정보의 90%는 어딘가의 매뉴얼에서 되풀이된 것임. 문제는 관련 문서 안에서 원하는 정보를 찾기 어렵고, 찾아도 읽기 어려운 경우가 많다는 점인데, LLM은 문서를 읽고 이해하는 데 매우 뛰어남
    • LLM은 예전 방식과 새 방식을 대충 오가고, LLM 스파게티 코드가 커질수록 기존 로직을 깨지 않고 정밀하게 기능을 추가하지 못하게 됨
      프롬프트 한두 개로 앱 전체를 즉시 만드는 기술 데모들은 허술함. 뭘 하는지 모르면 기능을 계속 추가하는 동안 API 호출 방식, 상태 관리 방식, CSS 라이브러리를 계속 바꿔버릴 것임. 예를 들어 네이티브 fetch 함수가 3개 있는 파일에 갑자기 이유 없이 axios를 설치해 쓰자고 함
      {/* rest of your functions here*} 같은 부분은 삭제해버리기도 함
      한동안 지나면 반복문이나 switch 같은 지루한 작업에만 안전하게 쓸 수 있어서, 개발자 일자리는 당분간은 안전해 보임
  • 논문은 LLM이 공개 지식 공유를 줄이고 있으며, 그 효과가 단순히 중복·저품질·초보자 수준 콘텐츠를 대체하는 것만은 아니라고 말하지만, 주장은 약하고 효과도 제목만큼 선정적이지 않음
    첫째, LLM이 저품질 게시물을 대체한다는 제안된 검정에 대해 Figure 3만 보여주고 회귀 결과는 제시하지 않음. 반면 사용자가 10번 게시했으면 경험자라는 식의 임의적인 사용자 경험 구분에 대한 검정은 보고함. 왜 게시물 품질별 검정은 생략하고 임의의 “경험” 버킷 결과는 보여주는지 의문임
    둘째, Figure 3 자체는 좋은 질문과 중립 질문의 추세 변화를 보여줌. 좋은 질문은 하락 추세였다가 평평해졌고, 중립 질문은 상승 추세에서 평평해졌음. 나쁜 질문은 계속 감소하며 눈에 띄는 추세 변화가 없음. 이는 오히려 LLM이 저품질 콘텐츠를 대체하고 있다는 반대 결론을 시사함
    결론이 더 강한 표현을 필요로 했고, 연구는 꼼꼼하지만 놀랍지 않은 결과를 잘 보상하지 않음. 그래서 선정적인 제목과 일부 생략된 듯한 결과가 나온 느낌임

    • 이 글이 정확히 다루는 내용은 아니지만, 예전에 HN에서 누군가 비슷한 현상을 잘 표현했음. 인터넷이 발칸화되고 있음. 새 개념은 아니지만, 온라인 커뮤니티에 초점을 맞추면 특히 잘 맞음
      사람들이 예전처럼 공개 포럼에 정보를 자유롭게 공유하지 않고, Discord 같은 서비스로 물러나 해자를 파고 도개교를 올리고 있음. 비난하기도 어려움. 많은 포럼과 소셜 미디어는 점점 적대적인 설계와 수익화를 도입하고, AI/LLM은 곳곳을 크롤링해 모든 것을 빨아들인 뒤 유료 벽 뒤에 두며 원 출처가 검색에서 발견될 가능성을 망침. 참여를 유도하는 알고리즘은 독설과 논쟁을 키움. 요즘 HN은 드문 예외임
      결국 특정 관심사나 지식을 가진 사람들이 사적인 커뮤니티에 모여 서로끼리만 이야기하고, 새로 들어오려는 사람들에게는 더 어려운 환경이 됨
    • LLM이 코더를 충분히 잘 도와서 사람들이 Stack Overflow에서 시간을 덜 보내고, 대신 더 많은 오픈소스 코드를 밀어 올린다면 그 편이 모두에게 더 가치 있을 수도 있음
  • 사람들이 Stack Overflow에 무료 기여를 줄이는 건 당연함. Stack Overflow가 OpenAI API 계약과 수많은 “AI” 과장 블로그 글로 기여자들을 팔아넘기고 있음

    • 그게 주된 이유는 아닌 것 같음. 사람들은 자신이 플랫폼에 만든 것을 누군가 팔아도 크게 신경 쓰지 않음. Facebook 같은 대형 소셜 미디어가 수년간 그래 왔지만 여전히 사용됨. Stack Overflow에는 답을 얻으러 오는 것이고, 나중에 누군가 그 답으로 LLM을 학습시킨다고 왜 신경 쓰겠음
    • 이건 답변 감소보다는 질문 감소에 더 가까워 보임
    • 분석 기간이 2023년 5월까지라서 OpenAI 계약보다 1년 전임. 그 계약은 논문의 결과와 무관함
    • 이미 2014년쯤부터 이어진 장기 추세 위에 더해진 것임. 질문의 품질과 성격, 즉 사이트 가이드라인을 따르지 않고 사이트가 어떻게 작동해야 하는지 이해하려는 노력도 부족한 질문들에 대한 불만이 계속 커져 왔음
  • 개인적으로 오픈소스 프로젝트 관련 질문 상당수는 GitHub와 Discord로 옮겨갔고, LLM 외에도 플랫폼 이동이 있음
    더 일반적인 프로그래밍 문제는 Gemini로 시작하는 편임. 내 문제의 용어로 바로 답해줘서 여러 페이지를 돌아다니며 조립하지 않아도 되거나, 틀리더라도 검색을 시작할 더 좋은 단서를 주는 경우가 많음. 제목은 비슷하지만 내용의 중요한 차이가 있는 Stack Overflow 글을 여러 번 클릭하는 시간을 아껴줌

    • 2022년: Discord는 검색 엔진에 색인되지 않아서 별로임
      2024년: Discord는 AI 찌꺼기 생성기에 색인되지 않아서 좋음
    • 오픈소스 프로젝트 질문이 GitHub와 Discord로 옮겨간 건 완전히 같은 경험임. 게다가 관리자와 직접 이야기할 수 있어서 좋았음
  • 여러 기술 subreddit을 구독하는데, 지난 2년 동안 같은 질문이 여러 subreddit에 뿌려지는 걸 많이 봄. 계정이 새로 만들어졌거나 모든 답글이 자동 생성처럼 보이는 일반적인 한 줄 응답임
    AI 학습용 봇 계정이라고 보고, 긴 기술 설명을 쓰기 전에는 실제 사람이 묻는지 먼저 확인한 뒤에야 답함

    • 어쨌든 학습에는 도움을 주고 있음
      결국 WWW를 통한 “선물 문화”, “지식은 자유로워야 한다”, F/OSS 등의 성공은 Stallman식 해커 윤리 전체를 나쁘게 보이게 만들 것 같음
      우리는 모두 IBM^H^H^HOpenAI를 위해 일하지만, 이제 우리를 뒷받침할 GPL 같은 것은 없음
  • 데자뷔가 느껴진다면, 이 내용은 이미 2023년 7월에 비판자들이 “Are Large Language Models a Threat to Digital Public Goods? Evidence from Activity on Stack Overflow”로 크게 부각했던 것임: https://arxiv.org/abs/2307.07367
    HN에서도 다뤄졌음: https://news.ycombinator.com/item?id=36763718

  • 결국 대규모 언어 모델은 오픈소스의 종말이 될 것임. 받아들이면 됨
    대규모 언어 모델은 지식재산을 집계하고 보간하는 데 쓰임. 이 과정에는 저작자나 계보에 대한 인정도, 출처 표시나 인용도 없음. 사실상 모델 학습에 쓰인 지식재산은 익명의 공유 재산이 됨
    오픈소스 작업의 동기가 되곤 하는 사회적 보상, 예컨대 크레딧과 존중이 약화됨. 그렇게 끝날 것임

    • 왜 LLM으로 더 많은 오픈소스를 작성하지 않겠음?
      기여 비용이 극적으로 낮아짐. 예를 들어 100달러면 GPT-3.5 토큰 2억 개이고, 2만 줄짜리 프로젝트의 각 줄을 개발하는 데 1만 토큰씩 쓰는 셈이 됨
      한 번의 기부와 오후 한나절 워크플로 프레임워크 관리로 가능한 중간 규모 프로젝트임
    • 이 관점은 이해가 안 됨
      LLM이 오픈소스의 종말이라면, 그 이유는 말한 그대로 지식재산을 집계하고 보간하며, 저작자·계보·출처 표시 없이 학습된 지식재산을 익명의 공유 재산으로 만들기 때문일 것임
      그런데 이게 사실이고 계속 허용된다면, 저작권에 의존하는 모든 지식재산이 똑같이 위협받음. 오픈소스에만 고유한 문제가 아님. 비오픈소스 저작물은 “소스”나 그에 해당하는 것을 비밀로 유지하면 보호된다는 뜻이라면, 아무에게도 보여주지 못하는 블록버스터 영화나 아무도 읽지 못하게 해야 하는 소설로 어떻게 돈을 벌 수 있을지 모르겠음
      크레딧과 존중만이 오픈소스 작업의 동기는 아니고, 가장 흔한 동기인지도 의심스러움. 그런 보상은 오픈소스를 소셜 네트워크화하거나 게임화하려는 행위자들이 그리고 싶어 하는 이미지에 더 가까움
      그런 것들이 왜 사라져야 하는지도 불분명함. 카메라가 발명됐다고 초상화가의 예술적 즐거움이 사라지지는 않았음. 순수한 금전적 동기는 타격을 받을 수 있지만, 그건 오픈소스에 특별히 고유한 동기와는 거리가 멂
    • 그렇지는 않고, 이미 충분히 니치한 오픈소스를 더 니치하게 만들 뿐임
  • LLM 학습에 가치가 생긴 인간 생성 텍스트 말뭉치를 폐쇄 정원으로 유지하려는 건 지는 싸움임. 이미 말은 마구간을 벗어났을 가능성이 큼
    다만 이건 일시적인 문제라고 봄. LLM은 과도기적 기술임. 언젠가는 Reddit 전체와 지금까지 쓰인 모든 것을 통째로 학습할 필요가 없어질 것임. 이런 통계 모델에는 명백한 한계가 있고, 인간은 그렇게 배우지 않음. 평생 책을 수백 권, 어쩌면 수천 권 읽었을 수는 있지만 백만 권은 읽지 않았고, 그럴 필요도 없음
    흥미로운 점은 이 이슈가 명백히 절도임에도, 데이터를 “소유한” 사이트나 회사로부터의 절도로 다뤄지고, 그것을 만든 사용자로부터의 절도로 다뤄지지 않는다는 것임. 사용자 생성 콘텐츠 사이트들은 결국 실패할 운명임. 동기가 사용자와 어긋나고, 끝없는 이윤 추구가 필연적으로 사용자를 떠나게 만들기 때문임
    또 다른 문제는 지식재산을 어느 정도 소비해야 절도가 되느냐임. LLM이 지금까지 만들어진 모든 영화를 봤다면 아마 절도일 것임. 하지만 몇 편부터 너무 많은 걸까? Apocalypse Now는 Heart of Darkness에서 느슨하게 기반을 두었거나 영감을 받았지만, 인간이 Heart of Darkness를 읽었다고 “절도”라고 하지는 못함
    말하듯이 모든 예술은 파생적임

    • 동의하지만, 인간 지능의 작동 방식을 너무 특권화하는 것일 수도 있음. LLM은 초인적인 속도로 콘텐츠를 뱉어내는 박식가
      시와 문학을 만들고, 코드와 물리학 답변, 자동차 수리 답변도 비슷하게 생성할 수 있음. 요즘 그런 능력을 가진 인간은 매우 드묾
      그래서 LLM이 과도기적이라는 데는 동의하지만, 기저핵에서 신피질로 이어지는 뇌의 과도기성과 비슷한 의미임. 미래의 범용 AI 두뇌에는 LLM이 다른 요소들과 함께 들어갈 가능성이 크지만, 반드시 인간의 뇌처럼 작동하도록 진화할지는 분명하지 않음
    • 온라인 포럼은 틈새 상황과 경계 사례의 해법을 찾을 수 있는 유일한 곳일 때가 있음. 혼자 알아내기 매우 어려웠을 요령들임
      LLM은 도구나 라이브러리의 공식 문서를 학습할 수는 있지만, 기술 업계에서 너무 흔한 이상한 문제를 직접 실험해 해법을 찾아낼 수는 없음. 사람들이 그런 해법을 서로 공유하지 않게 되면 큰 문제가 될 수 있음
    • “인간은 그렇게 배우지 않는다”는 점을 요즘 많이 생각함
      예를 들어 강화학습과 생성적 적대 신경망을 사용해, 문서 묶음을 기반으로 IT 작업을 수행하게 하고, 작업의 직접 성공뿐 아니라 문맥이 전혀 없는 자기 복사본도 그 작업을 잘할 수 있게 해주는 새롭고 더 잘 정제된 문서를 만들어내는 능력까지 적합도로 측정하는 AI를 훈련할 수 있을까 궁금함
    • “Finite and Infinite Games” 같은 책을 생각해보면, 다른 분야에서 읽은 것만으로도 그 책의 지식과 핵심 논지를 어느 정도 “재구성”할 수 있다고 봄
      서로 다른 영적 구루들이 같은 내용을 다른 말로 표현하는 것을 듣는 일은, 만화경에서 같은 색 유리 조각들이 재배열되어 새 패턴을 만드는 것을 보는 것과 비슷함
    • 절반만 맞음. 추론과 실제 이해가 LLM의 강점은 아닐 수 있지만, 읽은 모든 것에서 좋은 정보를 만들어낼 수 있다는 점은 흥미로움. 나는 그중 극히 일부만 읽었으니까. 멍청할 수는 있어도 기억력은 좋음
      그래서 미래 AI도 지금 ChatGPT처럼 평균적인 사람들이 거의 무엇이든 조언을 구하는 용도로 쓰인다면, 결국 모든 것을 읽어야 한다고 봄
  • 사람들은 방문하지 않는 곳에는 글을 올리지 않음
    잘 알려진 자료, 특히 인기 언어에 대해 Stack Overflow를 방문하지 않는 이유는 perplexity.ai, ChatGPT, Claude 등이 Stack Overflow 페이지를 읽는 것보다 질문에 더 잘 답할 뿐 아니라, 맞든 틀리든 답을 더 빠르게 복사해 붙여 넣을 수 있게 해주기 때문임
    질문하러 Stack Overflow에 있지 않으면, 거기서 답변도 하지 않게 됨. 관측 결과를 설명하는 데 다른 이유는 필요 없음
    물론 이는 Stack Overflow와 다른 Q&A 포럼이 경쟁하려면 답변 사용성, 즉 답을 작업 흐름에 통합하는 편의성을 최우선으로 끌어올려야 한다는 뜻임

    • AI와 경쟁하는 것은 Stack Overflow 커뮤니티와 내가 쓰는 다른 Q&A 포럼인 Codidact의 명시적 비목표임
      AI가 “질문에 더 잘 답하는” 것은 아님. 질문을 해석하고 답변 모양의 단어들과 맞춰보는 중간 단계를 잘라낼 뿐임. 자주 환각을 일으키고, 무엇을 하려는지에 대한 타당성 검사는 사실상 하지 않음
      Q&A 포럼보다 속도와 편의성에서 우위인 주된 이유는, 질문과 답변이 나중에 다른 사람에게 도움이 될 수 있는지 전혀 신경 쓰지 않기 때문임. 검색 엔진으로 발견 가능하고, 다른 사람이 같은 질문이라고 이해할 수 있으며, 단일 이슈에 집중되어야 한다는 요구를 고려하지 않음
      애초에 그렇게 설계되지 않았고, 그럴 이익도 없음. 다음 사람이 물으면 같은 답변 내용을 다른 저품질 방식으로 다시 생성하면 됨. 인간 전문가와 달리 AI는 그 작업에 지치지 않음