- Community Notes는 트윗에 맥락 정보를 덧붙여 허위정보를 바로잡는 팩트체크 도구로, 2021년 1월 Birdwatch라는 파일럿으로 처음 도입된 뒤 단계적으로 확장
- 전문가 집단이 아닌 누구나 작성·투표할 수 있고, 어떤 노트를 노출할지는 전적으로 오픈소스 알고리듬이 결정하는 구조
- 핵심은 단순 평균이 아니라 다양한 관점의 사용자들로부터 동시에 긍정 평가를 받는 노트를 우선하는 방식으로, 진영을 넘어 합의된 노트가 높은 점수를 받음
- 좌우 정치 축은 하드코딩되지 않고 사용자·노트 분석에서 창발적으로 발견되며, 데이터와 코드를 내려받아 결과를 직접 검증 가능
- 모든 허위 트윗을 교정하는 것이 목표가 아니라, 다수 관점의 존재를 상기시키는 교육적 도구로서 가치를 지니며 "신뢰할 수 있는 중립성(credible neutrality)" 이상에 근접
배경: Twitter X의 격변 속에서 성장한 기능
- 지난 2년간 Elon Musk의 440억 달러 인수 이후 Twitter는 인력, 콘텐츠 모더레이션, 비즈니스 모델 전반에 걸친 대대적 변화를 겪음
- 이러한 논쟁적 변화 한가운데서 한 신규 기능이 빠르게 중요해졌고, 정치 성향을 막론하고 호평받음
- 인수 시점과 가장 급격한 확장 단계가 겹침
- 대규모 청중에 도달하는 트윗, 특히 정치적으로 민감한 주제에서 자주 등장
- 노트가 붙을 때 유익하고 가치 있다는 평가가 다양한 정치 성향 사람들 사이에서 공유됨
- "크립토 프로젝트"가 아님에도 주류 세계에서 "크립토 가치(crypto values)" 에 가장 근접한 사례로 평가
- 중앙에서 선정한 전문가가 아니라 누구나 작성·투표
- 노출 여부는 오픈소스 알고리듬이 전적으로 결정
Community Notes 알고리듬 작동 방식
-
일정 기준(6개월 이상 활동, 최근 규칙 위반 없음, 전화번호 인증)을 충족하는 Twitter 계정이면 참여 신청 가능
- 현재는 무작위로 천천히 승인 중이며, 최종적으로 기준 충족자 전원 허용 계획
- 처음엔 기존 노트 평가만 가능하고, 좋은 평가를 충분히 쌓으면 직접 노트 작성 가능
-
작성된 노트는 다른 참여자 리뷰를 바탕으로 점수를 받음
- 리뷰는
HELPFUL,SOMEWHAT_HELPFUL,NOT_HELPFUL의 3점 척도 투표에 추가 태그가 더해진 형태 - 점수가 0.40 초과면 노트 노출, 그렇지 않으면 비노출
- 리뷰는
-
점수 계산의 독창성
- 단순 합계·평균이 아니라 서로 다른 관점의 사람들로부터 긍정 평가를 받은 노트를 명시적으로 우선
- 평소 평가가 엇갈리던 사람들이 특정 노트에 동의하면 그 노트는 특별히 높은 점수
- 사용자×노트 행렬 M을 만들어, 각 셀 Mi,j는 i번째 사용자가 j번째 노트를 어떻게 평가했는지를 표현
- 대부분의 사용자는 대부분의 노트를 평가하지 않아 행렬 대부분이 0이지만 문제없음
- 사용자에게 "친화도(friendliness)"·"극성(polarity)", 노트에게 "유익성(helpfulness)"·"극성(polarity)" 을 부여하는 4열 모델로 행렬을 예측
- 단순 합계·평균이 아니라 서로 다른 관점의 사람들로부터 긍정 평가를 받은 노트를 명시적으로 우선
-
변수의 의미
- μ는 사용자들이 전반적으로 얼마나 높은 평점을 주는지 반영하는 "전반적 대중 분위기" 파라미터
- iu는 특정 사용자가 높은 평점을 줄 경향(친화도)
- in은 특정 노트가 높게 평가될 경향(유익성)이며, 궁극적으로 관심 대상인 변수
- fu/fn은 정치 양극화의 지배적 축에서의 위치(극성)로, 음수는 대략 좌향·양수는 우향
- 단, 좌우 개념은 하드코딩이 아니라 분석에서 창발적으로 발견
-
핵심 아이디어
- 표준 gradient descent로 행렬 예측을 최적화하며, 노트에 부여된 유익성이 최종 점수
- 극성 항은 일부에게만 호감을 사는 속성을 흡수하고, 유익성 항은 모두에게 호감을 사는 속성만 측정
- 따라서 유익성 선택은 진영을 넘는 승인을 식별하고, 한 진영만 환호하는 노트를 배제
-
핵심 위에 덧붙은 추가 메커니즘
- 무작위 극단 "유사 투표"를 더해 여러 번 실행, 그 범위의 하한 신뢰구간을 0.32 임계값과 대조
- 비슷한 극성의 사용자 다수가 동일 태그("논쟁적·편향적 표현", "출처가 노트를 뒷받침하지 않음" 등)로
Not Helpful을 주면 게시 임계값이 0.4에서 0.5로 상승(실무상 매우 큼) - 노트가 승인된 뒤 해제되려면 그 유익성이 승인 임계값보다 0.01점 더 낮게 떨어져야 함
- 다수 모델로 훨씬 더 여러 번 실행해, 원래 점수가 0.3~0.4 사이인 노트가 승격되기도 함
- 결과적으로 22개 파일에 걸친 6,282줄의 복잡한 Python 코드이며, 모두 공개되어 직접 실행·검증 가능
실제 작동 양상
-
단순 평균과 구별되는 가장 중요한 개념은 극성(polarity) 값으로, 곱해지는 두 항(fu, fn)이기에 factor의 f를 사용
- 극성은 사용자와 노트 모두에 부여되며, 사용자 ID와 실제 계정의 연결은 의도적으로 비공개·노트는 공개
- 영어 데이터셋에서 극성은 좌우 정치 스펙트럼에 매우 근접하게 대응
-
극성 -0.8 부근 노트 예시
- Lauren Boebert 등 콜로라도 보수 의원들이 반트랜스 수사를 증폭했다는 내용(-0.800)
- Trump가 2020년 대선 전 미국인의 선거 결과 신뢰를 명시적으로 훼손했다는 내용(-0.825)
- 2020년 대선이 자유롭고 공정하게 치러졌다는 내용(-0.818)
- 위 세 항목은 임의 선별이 아니라 로컬 실행 시 극성(
coreNoteFactor1) -0.8 미만의 첫 세 행
-
극성 +0.8 부근 노트 예시
- 다수가 포르투갈어 브라질 정치 또는 Tesla 비판 반박이라 일부 선별
- 2021년 기준 "흑인" 아동의 64%가 한부모 가정에 산다는 내용(+0.809)
- 아동 인신매매가 실재하는 큰 문제이며 Operation Underground Railroad가 대응한다는 내용(+0.840)
- 금지된 LGBTQ+ 아동 도서가 외설이며 헌법상 표현의 자유로 보호되지 않는다는 내용(+0.806)
- 좌우 분열은 하드코딩이 아니라 창발적으로 발견되었으므로, 다른 문화권에 적용 시 그 사회의 주된 정치 분열도 자동 탐지·연결 가능
-
유익성 최상위 노트
- 실제 Twitter에 노출되어 직접 캡처 가능
- 두 번째 예시는 당파적 주제를 더 직접 다루지만, 명확하고 고품질·유익하기에 높게 평가됨
- 알고리듬이 작동하며, 코드 실행으로 출력을 검증하는 능력도 작동하는 것으로 보임
알고리듬에 대한 평가
-
분석에서 가장 인상적인 점은 복잡성으로, 학술 논문 버전(5항 벡터·행렬 방정식의 gradient descent)과 임의 계수가 많은 실제 버전이 존재
- 학술 버전조차 내부에 복잡성을 숨김: fu∗fn의 2차 항과 제곱 오차 비용함수로 인해 4차 방정식
- 4차 방정식은 다수 해를 가질 수 있어, gradient descent가 매번 다른 답에 도달 가능
- 입력의 작은 변화가 국소 최솟값 사이를 뒤집어 출력을 크게 바꿀 수 있음
-
경제학자의 알고리듬 vs 엔지니어의 알고리듬
- quadratic funding 같은 작업과의 차이는 경제학자의 알고리듬과 엔지니어의 알고리듬의 구분처럼 느껴짐
- 경제학자의 알고리듬: 단순하고 분석이 쉬우며 최적성을 보이는 수학적 성질과 악용 피해 한계를 증명, 예상 밖 상황에서 완전히 무너지지 않음
- 엔지니어의 알고리듬: 반복적 시행착오의 산물로 실용적이며 일을 해냄
- 크립토의 "이론충 미학(theorycel aesthetic)"은 실제로 신뢰가 필요 없는 프로토콜과, 멀쩡해 보이지만 내부적으로 중앙화 주체를 신뢰해야 하거나 사기인 구조를 구분하는 데 필요
- 딥러닝은 작동할 때 작동하지만 적대적 머신러닝 공격에 취약하므로, Community Notes를 더 경제학자 알고리듬에 가깝게 만들 수 있는지가 하나의 질문
- quadratic funding 같은 작업과의 차이는 경제학자의 알고리듬과 엔지니어의 알고리듬의 구분처럼 느껴짐
-
pairwise-bounded quadratic funding 사례
- 일반 quadratic funding에서 두 참가자만 담합해도 가짜 프로젝트로 풀 전체를 빼낼 수 있는 구멍을 막기 위한 설계
- 참가자 쌍마다 제한 예산 M을 배정해, A·B가 함께 지지한 프로젝트 보조금은 (A,B) 쌍 예산에서 차감
- k명이 담합해도 탈취 최대치는 k∗(k−1)∗M으로 제한
- 다만 Community Notes에선 사용자별 투표가 매우 적어 두 사용자가 공통 투표가 거의 없으므로 그대로 적용 불가
- 머신러닝 모델의 목표가 바로 희소한 데이터로 행렬을 채우는 것이며, 소수 악성 투표에 결과가 불안정해지지 않게 하려면 추가 노력 필요
-
Community Notes는 실제로 양극화를 줄이는가
- 나이브 투표도 어느 정도는 양극화 완화(찬성 200·반대 100인 글이 찬성 200만인 글보다 낮음)
- 추상적으로는 판단이 어려워, 단순화 구현으로 100라운드 직접 실행
- 그룹1(좋음): 0.300, 그룹2(좋지만 더 양극적): 0.217, 그룹3(중립): 0.094, 그룹4(나쁨): -0.152
- "좋음"은 같은 진영 +2·반대 진영 +0, "좋지만 더 양극적"은 +4·-2로 평균은 같지만 극성이 다름
- 실제로 "좋음" 노트가 "좋지만 더 양극적" 노트보다 평균 유익성이 높게 나옴
- 경제학자 알고리듬에 가까울수록 양극화 페널티 원리에 대한 설명이 더 명확해지는 이점
고위험 상황에서의 유용성
-
약 한 달 전 Ian Bremmer가 중국 정부 관리 트윗에 붙은 비판적 노트가 삭제되었다고 문제 제기
- Ethereum 커뮤니티의 소규모 실험과 달리 수백만 명에 영향을 주는 정치·지정학 사안이라 모두가 최대치의 악의를 가정
- Elon이 중국에 사업 이해관계가 많아 중앙화된 조작 의혹이 제기될 여지 존재
-
오픈소스로 직접 검증
- 원본 트윗 ID
1676157337109946369로 다운로드 데이터에서 해당 노트 행을 찾아 노트 ID1676391378815709184확보 scored_notes.tsv·note_status_history.tsv에서 검색한 결과, 현재 상태는NEEDS_MORE_RATINGS, 이전에는CURRENTLY_RATED_HELPFUL- 알고리듬이 먼저 노트를 노출했다가 평점이 떨어지자 제거한 것으로, 중앙화 개입은 보이지 않음
ratings-00000.tsv를 시간순 정렬해 첫 50표를 보면HELPFUL40표·NOT_HELPFUL9표- 초기 청중이 후기 청중보다 호의적이어서 평점이 처음 높았다가 하락
- 상태 변화 경위는 단순 임계값 통과가 아니라, 다수
NOT_HELPFUL이 이상치(outlier) 조건을 촉발해 필요 유익성 점수를 높인 결과- 신뢰할 수 있는 중립 알고리듬이 진정 신뢰받으려면 단순함을 유지해야 하며, 상태 변화에 단순·명료한 설명이 필요
- 원본 트윗 ID
-
brigading 취약성
- 노트를 싫어하는 사람이 참여도 높은 커뮤니티나 가짜 계정 다수를 동원해
NOT_HELPFUL을 몰아주는 brigading 가능성- 노트를 "유익"에서 "양극적"으로 떨어뜨리는 데 그리 많은 표가 필요하지 않을 수 있음
- 개선안으로 누구나 아무 노트에 투표하지 못하게 하고, "For you" 피드로 노트를 무작위 배정해 배정된 노트만 평가하도록 하는 방식 제시
- 노트를 싫어하는 사람이 참여도 높은 커뮤니티나 가짜 계정 다수를 동원해
-
Community Notes가 충분히 "용감하지" 않은가
- 주된 비판은 충분히 하지 않는다는 것으로, 두 건의 최근 기사가 이 점을 지적
- 노트가 공개되려면 정치 스펙트럼 전반의 이념적 합의가 필요하고, 점점 당파적인 환경에서 "진실에 대한 초당적 합의"는 거의 불가능
- 그럼에도 불공정한 노트 하나보다 허위 트윗 열 개를 놓치는 편이 낫다는 입장
- "우리는 진실을 알고 한쪽이 더 자주 거짓말한다"는 용감한 팩트체크는 결국 팩트체크 자체에 대한 광범위한 불신을 낳음
- 모두가 어느 정도 존중하는 초진영 기관을 세우는 데 가치가 있으며, William Blackstone의 격언처럼 작위보다 부작위의 죄를 더 많이 범하는 시스템이어야 존중 유지 가능
- 모든, 혹은 대부분의 허위 트윗에 교정 노트가 붙는 것이 목표가 아님
- 허위 트윗의 1% 미만만 노트를 받아도 교육적 도구로서 매우 가치 있는 서비스
- 목표는 다수 관점의 존재를 상기시키고, 설득력 있어 보이는 글이 틀릴 수 있으며 직접 검색으로 확인 가능함을 일깨우는 것
- 공공 인식론의 모든 문제를 푸는 만병통치약이 아니며, prediction markets나 전문 인력을 둔 조직 등 다른 메커니즘이 빈틈을 채울 여지
- 주된 비판은 충분히 하지 않는다는 것으로, 두 건의 최근 기사가 이 점을 지적
결론
- Community Notes는 흥미로운 소셜미디어 실험이자, 양극화를 식별하고 분열을 잇는 것을 우선하는 새로운 메커니즘 디자인 장르의 한 사례
- 같은 범주의 다른 사례로 Gitcoin Grants에 쓰이는 pairwise quadratic funding, 그리고 클러스터링으로 폭넓게 호응받는 발언을 찾는 토론 도구 Polis
- 이 분야의 학술 연구가 더 많이 나오기를 기대
- Community Notes의 알고리듬 투명성은 완전한 탈중앙 소셜미디어는 아니어서, 알고리듬에 동의하지 않아도 다른 알고리듬으로 같은 콘텐츠를 볼 방법은 없음
- 다만 향후 수년 내 초대규모 애플리케이션이 도달할 수 있는 가장 근접한 형태이며, 중앙화 조작 방지와 조작하지 않는 플랫폼이 정당한 평가를 받게 하는 두 측면에서 이미 큰 가치 제공