- 단순한 검색어 6개만으로도 Google, Bing 같은 대형 검색엔진의 상위 결과에 SEO 스팸, 사기성 광고, 부정확한 답변이 자주 섞인다는 점이 드러남
- 비교 대상은 Google, Bing, Marginalia, Kagi, Mwmbl, ChatGPT 3.5였고, 광고 차단기를 끈 상태에서 Vancouver, BC 기준 지역화 결과까지 포함해 살펴봄
- Marginalia는 완전한 답을 자주 주지는 못했지만 사기성 결과가 상대적으로 적었고, ChatGPT는 일부 검색에서 좋았으나 답변 거부와 환각도 보임
- Google과 Bing은 YouTube 다운로드, 광고 차단기, 겨울 눈 예보처럼 일반 사용자가 많이 찾는 검색에서 사기성 사이트와 광고성 결과를 상위에 노출함
- 좋은 결과를 얻으려면 사이트 제한, 키워드 조합, 후속 검색 같은 숙련자 요령이 필요해졌고, 이는 “그냥 검색하면 됨”이라는 과거 검색 경험과 멀어짐
비교 방식과 평가 기준
- 비교 대상은 Google, Bing, Marginalia, Kagi, Mwmbl, ChatGPT 3.5임
- 검색어는 세 종류에서 골랐음
- 비전문 사용자가 새 컴퓨터를 설정하며 쓸 법한 검색어
- 고등학생도 이해할 수 있지만 답을 찾기 어려운 기술·과학 질문
- 글을 쓰는 중 실제로 필요했던 지역 정보 검색
- 사용한 쿼리는 다음 6개임
download youtube videosad blockerdownload firefoxWhy do wider tires have better grip?Why do they keep making cpu transistors smaller?vancouver snow forecast winter 2023
- 평가는
Terrible,Very Bad,Bad,Ok,Good,Great로 나눴고, 사기성 결과를 큰 감점 요소로 봄 - 검색은 대부분 2023년 11월에, 일부는 12월 중순에 실행함
- 검색엔진 쿼리는 쿠키를 지운 새 시크릿 창에서 실행했고, Kagi는 로그아웃 검색을 허용하지 않아 새 계정을 사용함
- 위치는 Vancouver, BC였으며 일부 검색엔진에서 지역화 랭킹이 적용된 것으로 보임
전체 결과
- Marginalia는 때때로 괜찮지만 완벽하지 않은 답을 주고, 답하지 못하는 질문에는 결과가 없거나 명백히 관련 없는 결과를 내는 쪽에 가까웠음
- 사기성 결과 비율은 다른 검색엔진보다 낮았지만, 이 실험에서도 일부 사기성 결과는 있었음
- Mwmbl은 사용자가 검색 결과 순위를 직접 편집할 수 있음
- 한 쿼리는 편집 후
Great로 볼 수 있는 결과가 됐지만, 벤치마크에 맞춰 직접 최적화한 결과라 점수에는 반영하지 않음
- 한 쿼리는 편집 후
- Google은 최신 결과와 최근 YouTube 동영상을 강하게 선호하는 경향을 보임
ad blocker검색에서는 내용이 빈약한 YouTube 영상이 노출됐고, 해당 영상은 첫 결과가 “Google 공식”인 것처럼 잘못 말함
- ChatGPT는 한 사례에서 전통 검색엔진보다 훨씬 나았고, 다른 사례에서는 괜찮거나 답변을 회피했으며, 여러 쿼리에서 환각을 냄
- Google과 Bing은 일부 쿼리에서 ChatGPT보다 더 많은 환각성·조작성 결과를 반환한 것으로 평가됨
- 눈 예보 검색에서는 광고 수익용 가짜 예보 사이트와 불필요한 제설 서비스 가입을 유도하는 지역 업체 결과가 나옴
쿼리별 결과
-
download youtube videos- 이상적인 결과는
yt-dlp또는yt-dlp의 얇은 무료 GUI 래퍼였고,youtube-dl처럼 덜 자주 업데이트되는 프로젝트도 허용 가능한 결과로 봄 - Google은 좋은 결과가 없었고, 상위 일반 결과 대부분이 badware 설치 유도, 사기성 광고, 유료 대체품, 광고성 리스트 글, YouTube 블로그스팸성 영상이었음
- Bing도 좋은 결과가 없었으며, badware로 보이는 확장 설치 유도, 가짜 다운로드 버튼, 유료 다운로더 광고가 다수였음
- Marginalia는 첫 결과가
youtube-dl관련 오래된 답변이었고,yt-dlp설치·사용법 블로그 글도 포함해 가장 나은 결과로 평가됨 - Kagi는 Norton SafeWeb을 내세운 다운로드 사이트, scam pop-up, 오래된
youtube-dlarchive.org 링크 등으로 채워짐 - Mwmbl은 일부 유료 소프트웨어,
youtube-dl설치 글, GUI 래퍼 관련 영상, 사기성 또는 저품질 사이트가 섞였음 - ChatGPT는 YouTube Premium 없이 다운로드하지 말라고 답했고, 구체적인 서드파티 앱·웹사이트 추천은 거부함
- 이상적인 결과는
-
ad blocker- 이상적인 결과는 uBlock Origin이었고, 최소한 기본적으로 광고를 차단하는 비사기성 광고 차단기를 기대함
- Google에는 uBlock Origin 링크가 없었고, Acceptable Ads 프로그램에 참여해 일부 광고를 기본 허용하는 광고 차단기와 사기성으로 보이는 광고가 섞임
- Bing은 상단 광고가 Avast Secure Browser, TOTAL Adblock, 가짜 리뷰 사이트 등으로 이어졌고, 광고 표시가 매우 미묘해 일반 검색 결과로 오인될 수 있음
- Marginalia는 3·4번째 결과가 uBlock Origin을 추천하고 8번째 결과가 uBlock Origin 자체였으며, 직접적인 사기성 결과가 적어 좋은 편이었음
- Mwmbl은 Ghostery, 유료 광고 차단기, 광고로 가득한 사이트, Hacker News 댓글 속 uBlock Origin 추천 등이 섞임
- Kagi는 Adblock Plus와 AdBlock 계열 결과가 상단을 차지했고, TOTAL Adblock 설치를 유도하는 팝업이 있는 기사도 포함함
- ChatGPT는
How do I install the best ad blocker?에 대해 첫 추천으로 uBlock Origin을 제안해 이 쿼리에서는 가장 좋은 결과로 평가됨
-
download firefox- 이상적인 결과는 Firefox 다운로드 링크이며, 가짜·사기성 링크가 없어야 함
- Bing, Mwmbl, Kagi는 Firefox 다운로드 관련 링크를 제공해
Great로 평가됨 - ChatGPT는 기술적으로 부정확한 설치 안내를 줬지만, 올바른 사이트로 가라고 안내해 사용자가 Firefox를 다운로드할 가능성이 높다고 봄
- Marginalia는 Firefox 다운로드 직접 링크는 없고 Firefox 관련 간접 링크만 있어
Ok로 평가됨 - Google은 상위 링크 대부분이 정상 다운로드 링크였지만, 7번째와 10번째 결과에 badware 설치나 신용카드 정보 요구로 이어지는 사기성 링크가 있어
Bad로 평가됨
-
Why do wider tires have better grip?- 올바른 답은 넓은 타이어가 건조 노면 제동과 랩타임에 주는 영향, 젖은 노면에서의 제동·수막현상, 휠 폭과 타이어 폭을 따로 바꿨을 때의 차이, 타이어 압력 변화까지 설명해야 한다고 봄
- Google, Bing, Kagi는 표면적, 접지면, 동적 하중 같은 불완전하거나 틀린 설명과 광고성 페이지를 다수 반환함
- ChatGPT는 문법은 좋지만 인터넷 댓글식의 그럴듯한 환각 답변을 제공함
- Marginalia는 원래 질문에는 결과가 없고, 물음표를 제거하면 틀린 결과 하나만 반환함
- Mwmbl은 관련 없는 NYT 기사나 자전거 타이어 관련 글을 반환함
- 어떤 검색엔진도 올바른 설명을 제공하지 못했고, Marginalia는 틀린 결과와 사기성 링크가 적어 상대적으로 낫다고 평가됨
-
Why do they keep making cpu transistors smaller?- 기대한 답은 트랜지스터가 작아질 때 왜 빨라지고 전력·커패시턴스와 어떤 관계가 있는지 직관적으로 설명하는 자료였음
- Google은 지식 카드와 Stack Exchange, Quora 결과를 반환했지만 대부분은 “작을수록 빠르다” 같은 부분 답변이거나 다른 질문에 대한 답이었음
- Bing은 상단 지식 카드 일부에 후속 검색으로 이어질 수 있는 부분 답변이 있어
Ok로 평가됨 - Kagi는 Reddit, Stack Exchange, Quora, Metafilter 결과를 반환했고, 10번째 링크에서 Dennard Scaling 등으로 이어질 수 있지만 직접 답은 약했음
- Marginalia는 결과가 없었고, Mwmbl은 “Why do artists keep making holiday albums?”라는 관련 없는 Vox 기사 하나만 반환함
- ChatGPT는 성능 증가 같은 비답변을 주고, 추가 설명을 요구하면 회로 전파·상호연결에 대한 오해 소지가 있는 답을 냄
-
vancouver snow forecast winter 2023- 좋은 결과는 Environment Canada의 2023년 겨울 다개월 눈 예보처럼 Vancouver의 눈이 평년보다 상당히 적고 기온은 높을 것이라는 예보였음
- Google은 지역 제설 업체의 가짜성 예보를 지식 카드로 보여줬고, 해당 페이지는 많은 눈과 추위를 예측해 제설 서비스 구매를 유도함
- Bing의 상위 관련 결과로 보이는 페이지는 일별 “겨울 폭풍” 확률을 조작한 듯한 SEO 가짜 예보 사이트였음
- Kagi는 Bing의 가짜 예보 사이트를 상위 4개 결과로 보여줬고, 관련 없는 뉴스와 SEO 스팸도 포함함
- Marginalia는 결과가 없었고, Mwmbl은 2022년 정전 기사, Philadelphia 눈 예보, Ohio river 동결, Oregon 지역 뉴스 등 관련 없는 결과를 반환함
- ChatGPT는 직접 답하지 않고 날씨 웹사이트나 앱을 보라고 했으며, 한 번은 실수로
User\n가 붙은 프롬프트에서 Environment Canada를 제안함
광고, SEO, 환각이 섞이는 방식
- 검색엔진 결과에는 의도적으로 조작된 결과와 일반적인 SEO 광고 농장 페이지가 함께 섞여 있었음
- 눈 예보 검색에서는 광고 수익용 가짜 예보 사이트와 제설 서비스 구매를 유도하는 가짜 예보가 나옴
- 광고 차단기 검색에서는 객관적 리뷰처럼 보이지만 특정 광고 차단기 설치로 유도하는 가짜 리뷰 사이트가 있었음
- YouTube 다운로드 검색에서는 무료 오픈소스 도구 대신 유료 소프트웨어, badware 의심 확장, 가짜 다운로드 버튼이 반복적으로 나타남
- 전통 검색 생태계는 사용자에게 최선인 결과보다 소프트웨어 공급망에 가장 이익이 되는 결과를 앞에 놓도록 강하게 유도된다고 봄
- 클릭과 참여 같은 랭킹 신호는 사용자가 좋은 결과를 알아볼 만큼 숙련됐을 때만 좋은 결과를 강화할 수 있음
광고 기반 검색의 인센티브 문제
- Sergey Brin과 Larry Page의 원래 PageRank 논문은 광고 기반 검색이 좋은 검색 결과 제공과 인센티브 불일치를 가진다고 봄
- 논문은 광고 수익이 검색엔진을 광고주 쪽으로 편향시키고 소비자 필요에서 멀어지게 할 수 있다고 설명함
- 현재 Google과 Bing은 광고를 실제 검색 결과처럼 보이게 만드는 방향으로 바뀌었고, 사용자는 광고와 자연 검색 결과를 구분하지 못하는 경우가 많다고 봄
- 순위 평가는 페이지에 보이는 순서를 기준으로 삼음
- 자연 검색 결과 위에 광고 4개가 있으면 광고가 1~4위, 자연 결과가 5위로 계산됨
cellular phone검색 예시에서 Google의 상단 결과는 Google Store Pixel 7, Amazon의 Android phone, Wikipedia, 상업적 결과와 SEO 스팸으로 채워졌음- PageRank 논문에서 좋은 상위 결과로 언급된 “The Effect of Cellular Phone Use Upon Driver Attention”은 상업적 결과 더미 아래에 묻혀 보이지 않았음
소형 검색엔진과 메타검색 가능성
- Marginalia가 1인 개발 검색엔진임에도 일부 쿼리에서 상대적으로 좋은 결과를 낸 점은 흥미로운 사례임
- Google을 대체하는 주류 검색엔진을 만드는 일은 여전히 어려움
- 실시간으로 변하는 Twitter, 뉴스 등 색인
- 기본 수준 이상의 NLP
- 사용자가 검색엔진에 기대하는 기능 증가
- 반대로 소수 사용자를 위한 유용한 검색엔진은 더 쉬워졌다고 봄
- Google 결과가 많은 쿼리에서 예전보다 나빠졌기 때문임
- Google은 덜 인기 있는 페이지나 정확히 기억한 문자열 검색에서도 원하는 페이지를 반환하지 못하는 경우가 많아졌다고 함
- 과거에는 거의 없던 일이 2015년에는 드물게, 현재는 상당한 비율로 발생한다고 함
- 여러 소형 검색엔진 조합이 많은 사용자에게 Google보다 나은 결과를 줄 수 있는지는 이미 수년간 “그렇다”에 가깝다고 봄
- Mwmbl의 사용자 큐레이션 방식은 추가 조정 없이는 어렵다고 봄
RSS검색의 상위에 blogspam을 추가한 사용자 편집 사례가 있었고, 쉽게 찾을 수 있는 신고 방법이 없었음
- 1996년식 Metacrawler처럼 여러 검색엔진, ChatGPT, Bard 등을 집계하는 방식은 법적·라이선스 비용 문제를 제외하면 기술적으로 꽤 좋을 가능성이 있음
부록: 다른 검색엔진
- DuckDuckGo는 과거 Bing과 매우 비슷했으며, 이번에도 Bing 광고를 제거하면 예전만큼은 아니지만 비슷해 별도 표에 넣을 가치가 크지 않다고 봄
- 숙련자가 쿼리를 잘 쓰면 Google처럼 괜찮지만, 이 비교의 순진한 쿼리에서는 좋지 않음
- wiby.me는 Marginalia처럼 비교적 모호한 결과를 찾기 위한 검색엔진임
- 4개 쿼리에서 흥미롭고 매우 다른 결과를 냈지만 관련성 있는 결과는 반환하지 못함
- searchmysite.net은 일부 쿼리에서 어느 정도 관련된 결과를 냈지만 Marginalia만큼 관련성은 높지 않았음
- Google, Bing, Kagi보다 사기와 광고성 페이지가 훨씬 적었음
- indieweb-search.jamesg.blog는 모든 쿼리에서 서버 오류로 처리되지 않음
- Teclis는 검색창은 남아 있지만 bot abuse 때문에 닫혔고, 프런트 페이지에는 트래픽의 99.9%가 봇이었다는 안내가 있음
- Teclis 결과는 Kagi의
Non-commercial Web렌즈와 API를 통해 사용할 수 있다고 안내됨
- Teclis 결과는 Kagi의
부록: 좋은 답을 찾기 위한 우회 과정
- 넓은 타이어 접지 질문에서는 일반 검색엔진이 좋은 답을 주지 못했고, 검색 과정은 YouTube 검색, 댓글, 자동차 관련 서적, 유사 서적 탐색, 특정 모델명 검색으로 이어짐
- Carroll Smith의
Tune To Win은 넓은 접지면이 열 축적을 줄이고 더 좁은 온도 범위에서 동작하는 더 부드러운 고무 설계를 가능하게 한다고 언급하지만, 관찰되는 현상을 충분히 설명하지 못한다고 봄 - Kummer의
The Unified Theory of Tire and Rubber Friction, Hays and Browne의The Physics of Tire Traction, Milliken and Milliken의Race Car Vehicle Dynamics도 충분한 설명에는 닿지 못함 - Guiggiani의
The Science of Vehicle Dynamics는 관련 요인을 어떻게 생각하고 모델링할지에 더 가까웠음 - 마지막 장의
brush model을 단서로brush model tire width를 검색해 Pacejka의Tire and Vehicle Dynamics로 이어졌고, 이 책이 넓은 타이어 접지와 필요한 타이어·차량 동역학 모델링을 설명하기 시작한다고 봄 - 좋은 검색 결과를 얻으려면 검색어, 사이트, 후속 검색을 조합하는 숙련자 요령이 필요하며, 모든 사용자가 이런 요령을 갖고 있지는 않음
Google 지식 카드 사례
- Google 지식 카드 결과는 쉽게 찾을 수 있는 답이나 우스운 질문에서도 부정확한 경우가 많았다고 함
oc2 gemini length는 보트 길이 대신 기사에 나온 아기 길이20″를 반환함busy beaver number는 전화번호(604) 375-2754를 반환함Feedly revenue는 사설 기업 매출·이익 추정치를 조작하는 듯한 사이트를 기반으로$5.2M/yr를 반환함boston up118s dimensions는 피아노 크기를5826298 x 5826899 x 582697 in로 반환함Intel number of engineers는 엔지니어 수 대신 전화번호를 반환함fraser river current speed는 부정확한97 to 129 kilometers per hour를 반환함futura c-4 surfski weight는 다른 surfski의 무게인39 pounds를 반환함
비판에 대한 답변
- 이 비교는 peer-reviewed study가 아니며, 몇 개 쿼리에 대한 주관적 평가를 포함함
- 정보검색 분야 논문 경험과 best paper award를 근거로, 학술 논문이라고 해서 자동으로 더 엄밀한 것은 아니라고 봄
- Kagi 사용자들의 반박 중 일부는 GitHub 결과를 고정하거나, GitHub에서 좋은 결과가 나올 쿼리만 실행한 사례였다고 함
- 타이어, 트랜지스터, 눈 예보 쿼리에서 좋은 결과를 실제로 얻었다는 반박은 아직 없었다고 함
- 검색 품질 논쟁의 핵심은 숙련자의 검색 요령이 아니라, 단순 검색을 하는 일반 사용자가 사기성 광고와 SEO 스팸을 얼마나 쉽게 마주치는지에 있음