1P by GN⁺ | ★ favorite | 댓글 1개
  • Anthropic이 Claude 3 제품군을 공개하며 Haiku, Sonnet, Opus로 지능·속도·비용 균형을 고를 수 있는 새 모델 라인업을 제시함
  • Opus는 MMLU, GPQA, GSM8K 등 주요 평가에서 동급 모델을 앞서며, Claude 3 전반은 분석·예측·코드 생성·비영어 대화 능력이 향상됨
  • 속도 차별화가 핵심 축으로, Haiku는 약 10k 토큰 arXiv 논문을 3초 미만에 읽고 Sonnet은 대부분 워크로드에서 Claude 2·2.1보다 2배 빠름
  • Claude 3는 사진·차트·그래프·기술 다이어그램 같은 비전 입력을 처리하며, 출시 시 200K 컨텍스트 창과 100만 토큰 초과 입력 가능성을 갖춤
  • Opus와 Sonnet은 claude.ai와 Claude API에서 바로 사용 가능하고, API는 159개국에 제공되며 Haiku는 곧 출시될 예정임

모델 구성과 제공 상태

  • Claude 3 제품군은 성능이 낮은 순서부터 Claude 3 Haiku, Claude 3 Sonnet, Claude 3 Opus로 구성됨
  • 각 모델은 애플리케이션별로 지능, 속도, 비용의 균형을 선택할 수 있도록 설계됨
  • Opus와 Sonnet은 claude.ai와 Claude API에서 사용 가능함
    • Claude API는 일반 공개 상태이며 159개국에서 제공됨
    • Haiku는 곧 제공될 예정임
  • claude.ai의 무료 경험은 Sonnet이 구동하며, Opus는 Claude Pro 구독자에게 제공됨
  • Sonnet은 Amazon Bedrock에서도 사용 가능하고, Google Cloud의 Vertex AI Model Garden에서는 비공개 프리뷰로 제공됨
    • Opus와 Haiku도 두 플랫폼에 곧 추가될 예정임

지능, 속도, 멀티모달 성능

  • Opus는 Anthropic의 가장 지능적인 모델로, MMLU, GPQA, GSM8K 등 AI 시스템 평가 벤치마크 다수에서 동급 모델을 앞섬
  • Claude 3 모델들은 분석과 예측, 세밀한 콘텐츠 생성, 코드 생성, 스페인어·일본어·프랑스어 같은 비영어 대화에서 향상된 능력을 보임
  • 실시간 응답이 중요한 업무에 맞춰 활용 범위가 넓어짐
    • 라이브 고객 채팅
    • 자동완성
    • 데이터 추출
  • Haiku는 해당 지능 범주에서 가장 빠르고 비용 효율적인 모델이며, 차트와 그래프가 포함된 약 10k 토큰 arXiv 논문을 3초 미만에 읽을 수 있음
  • Sonnet은 대부분의 워크로드에서 Claude 2와 Claude 2.1보다 2배 빠르고 더 높은 지능 수준을 제공함
    • 지식 검색
    • 세일즈 자동화
  • Opus는 Claude 2와 Claude 2.1과 비슷한 속도를 유지하면서 더 높은 지능 수준을 제공함

비전 입력, 거절 감소, 정확도 개선

  • Claude 3 모델들은 다른 선도 모델과 비슷한 수준의 비전 기능을 갖춤
    • 사진
    • 차트
    • 그래프
    • 기술 다이어그램
  • 일부 엔터프라이즈 고객은 지식 베이스의 최대 50%가 PDF, 플로차트, 프레젠테이션 슬라이드 같은 형식에 저장돼 있어 새 입력 양식의 중요성이 큼
  • 이전 Claude 모델은 문맥 이해 부족처럼 보이는 불필요한 거절을 자주 했지만, Claude 3의 Opus, Sonnet, Haiku는 시스템 가드레일에 가까운 프롬프트에 대해 이전 세대보다 답변 거절 가능성이 크게 낮아짐
  • Claude 3는 요청을 더 세밀하게 이해하고 실제 위해를 인식해, 무해한 프롬프트에 대한 거절을 줄이도록 개선됨
  • 정확도 평가는 현재 모델의 알려진 약점을 겨냥한 복잡한 사실 질문 세트를 사용함
    • 답변은 정답, 오답 또는 환각, 불확실성 인정으로 분류됨
    • Opus는 Claude 2.1 대비 어려운 개방형 질문에서 정답률이 2배 개선되고 오답 수준도 낮아짐
  • Claude 3 모델에는 곧 인용 기능이 추가되어 답변 검증을 위해 참고 자료의 정확한 문장을 가리킬 수 있게 될 예정임

긴 컨텍스트와 회상 능력

  • Claude 3 제품군은 출시 시 200K 컨텍스트 창을 제공함
  • 세 모델 모두 100만 토큰을 초과하는 입력을 받을 수 있으며, 더 높은 처리 능력이 필요한 일부 고객에게 제공될 수 있음
  • 긴 컨텍스트 프롬프트를 제대로 처리하려면 강한 회상 능력이 필요함
  • Needle In A Haystack(NIAH) 평가는 방대한 데이터 말뭉치에서 정보를 정확히 회상하는 능력을 측정함
    • 평가 견고성을 높이기 위해 프롬프트마다 30개 무작위 needle/question 쌍 중 하나를 사용함
    • 다양한 크라우드소싱 문서 말뭉치에서 테스트함
  • Claude 3 Opus는 NIAH에서 99%를 넘는 정확도로 거의 완벽한 회상을 달성함
  • 일부 사례에서는 “needle” 문장이 원문에 사람이 인위적으로 삽입한 것처럼 보인다는 점을 인식해 평가 자체의 한계를 찾아내기도 함

안전 설계와 편향 대응

  • Anthropic은 Claude 3 제품군을 능력만큼 신뢰할 수 있게 만드는 데 초점을 맞춤
  • 전담 팀들이 여러 위험을 추적하고 완화함
    • 허위정보
    • CSAM
    • 생물학적 오용
    • 선거 개입
    • 자율 복제 능력
  • 모델의 안전성과 투명성을 높이기 위해 Constitutional AI 같은 방법을 계속 개발함
  • 새 입력 양식으로 인해 생길 수 있는 개인정보 문제를 완화하도록 모델을 조정함
  • Bias Benchmark for Question Answering(BBQ) 기준으로 Claude 3는 이전 모델보다 편향이 적음
  • Claude 3 제품군은 생물학 지식, 사이버 관련 지식, 자율성의 주요 측정치에서 이전 모델보다 발전했지만, Responsible Scaling Policy에 따른 AI Safety Level 2(ASL-2) 에 머무름
  • 레드팀 평가는 현재 모델들의 재앙적 위험 가능성이 미미하다고 결론냄
  • 추가 안전 세부 정보는 Claude 3 model card에 있음

사용성, 모델별 가격과 용도

  • Claude 3 모델들은 복잡한 다단계 지시를 더 잘 따름
  • 브랜드 보이스와 응답 가이드라인을 준수하고 신뢰할 수 있는 고객 대면 경험을 만드는 데 더 적합함
  • JSON 같은 구조화 출력 생성 능력이 향상되어 자연어 분류와 감정 분석 같은 사용 사례에서 Claude 지시가 더 쉬워짐
  • Claude 3 Opus

    • Claude 3 Opus는 고도로 복잡한 작업에서 최고 수준 성능을 내는 가장 지능적인 모델임
    • 열린 프롬프트와 처음 보는 시나리오를 높은 유창성과 인간에 가까운 이해로 처리함
    • 가격은 입력 100만 토큰당 15달러, 출력 100만 토큰당 75달러임
    • 컨텍스트 창은 200K이며, 특정 사용 사례에는 100만 토큰도 가능함
    • 잠재 사용 사례
      • API와 데이터베이스 전반의 복잡한 작업 계획·실행, 대화형 코딩
      • 연구 검토, 브레인스토밍, 가설 생성, 신약 발견
      • 차트와 그래프, 재무, 시장 동향, 예측에 대한 고급 분석
  • Claude 3 Sonnet

    • Claude 3 Sonnet은 지능과 속도의 균형을 목표로 하며, 특히 엔터프라이즈 워크로드에 맞춰짐
    • 동급 모델보다 낮은 비용으로 강한 성능을 제공하고, 대규모 AI 배포에서 높은 지속성을 목표로 설계됨
    • 가격은 입력 100만 토큰당 3달러, 출력 100만 토큰당 15달러임
    • 컨텍스트 창은 200K임
    • 잠재 사용 사례
      • 방대한 지식에 대한 RAG 또는 검색·조회
      • 제품 추천, 예측, 타깃 마케팅
      • 코드 생성, 품질 관리, 이미지에서 텍스트 파싱
  • Claude 3 Haiku

    • Claude 3 Haiku는 거의 즉각적인 응답성을 위한 가장 빠르고 작은 모델임
    • 간단한 질의와 요청에 매우 빠르게 답하며, 인간 상호작용을 모방하는 매끄러운 AI 경험 구축을 목표로 함
    • 가격은 입력 100만 토큰당 0.25달러, 출력 100만 토큰당 1.25달러임
    • 컨텍스트 창은 200K임
    • 잠재 사용 사례
      • 라이브 상호작용에서 빠르고 정확한 고객 지원, 번역
      • 위험 행동 또는 고객 요청을 포착하는 콘텐츠 모더레이션
      • 물류 최적화, 재고 관리, 비정형 데이터에서 지식 추출

예정 기능과 업데이트

  • Anthropic은 모델 지능이 한계에 가깝지 않다고 보고, 향후 몇 달 동안 Claude 3 제품군에 빈번한 업데이트를 출시할 계획임
  • 엔터프라이즈 사용 사례와 대규모 배포를 위해 모델 기능을 강화하는 기능들이 예정돼 있음
    • 도구 사용, 즉 함수 호출
    • 대화형 코딩, 즉 REPL
    • 더 고급 에이전트 기능
  • AI 능력의 경계를 확장하는 동시에 안전 가드레일도 성능 향상에 맞춰 유지하겠다는 방침임
  • Claude로 개발을 시작하는 진입점은 anthropic.com/claude

댓글과 토론

Hacker News 의견들
  • 내 LLM 명령줄 도구에 Claude 3 모델 지원을 추가하는 플러그인을 방금 공개함
    pipx install llm, llm install llm-claude-3, llm keys set claude로 설정한 뒤 llm -m claude-3-opus '3 fun facts about pelicans'처럼 실행 가능
    코드: https://github.com/simonw/llm-claude-3
    LLM 설명: https://llm.datasette.io/

    • Mac에서 Automator의 빠른 동작을 만들어 선택한 텍스트를 받아 llm -m gpt-4에 넘기고, 결과를 osascript 대화상자로 보여주게 했더니 매우 유용했음
      이제 어떤 앱에서든 텍스트를 드래그한 뒤 서비스 메뉴의 LLM을 실행할 수 있고, 키보드 단축키까지 붙여 터미널 오류 해석이나 임시 검색, 텍스트 편집기/IDE에서의 직접 프롬프트 입력에 쓰고 있음
    • Hacker News 요약 스크립트를 Claude 3 Opus로 바꿨고, 원래 설명은 여기 있음: https://til.simonwillison.net/llms/claude-hacker-news-themes
      hn.algolia.com API에서 글과 댓글을 가져와 jq로 펼친 뒤 llm -m claude-3-opus에 넣어 주제별 마크다운 요약과 직접 인용을 만들게 함
      이 300개 이상 댓글 스레드에 실행한 결과: https://gist.github.com/simonw/37781de39fb5555f39b4157a8ad0776c
    • Anthropic API 키 생성이 무료처럼 보이니, 헤드리스 Chrome으로 키 입력 단계까지 자동화할 수 있지 않을까 싶음
      pip이나 apt로 설치하면 바로 동작하는 소프트웨어가 늘어날 텐데, 지금은 사람이 API 키를 붙여넣는 귀찮은 단계가 남아 있음
      API 한도에 가까워지면 GPU로 소량의 비트코인을 채굴해 추가 API 용량을 자동 결제하면 AI 시대답겠다는 농담도 가능함
    • Mac에서 Raycast를 쓴다면 사용자 스크립트를 만들어 Raycast 인터페이스에서 LLM CLI와 대화할 수 있음: https://gist.github.com/vladstudio/92efe283453f5f22d4606947b9f82719
  • Opus와 이전 Claude 모델들은 아직 Sally 문제를 제대로 못 품
    “Sally에게 형제 3명이 있고 각 형제에게 자매가 2명 있다면 Sally에게 자매는 몇 명인가?”라는 질문에, Claude는 Sally 자신을 제외한 자매가 없다고 결론내려 0명이라고 답함
    https://imgur.com/a/EawcbeL

    • GPT-4 API와 ChatGPT도 기본적으로는 틀렸고 “Sally에게 자매가 2명 있다”고 답했지만, 단계별 사고를 요구하는 시스템 프롬프트를 넣으면 1명이라고 맞힘
      프롬프트 방식의 중요성 때문에 모델의 최고 성능을 비교하기가 꽤 어려워지고, 모델마다 최고 성능을 내는 프롬프트 스타일도 다름
    • 로컬 LLama 13B Q5는 이 문제에 대해 Sally가 자신이라는 자매 1명을 갖고, 형제 3명 각각에게 자매 3명이 있으니 총 9명에서 Sally 몫을 빼서 8명이라고 답함
    • Sally의 부모와 형제들의 부모가 재혼 등으로 다를 수 있고, 형제·자매 관계가 부모 한 명만 공유해도 성립한다고 보면 정답이 유일하지 않을 수 있음
      예를 들어 Sally와 세 형제가 같은 어머니를 공유하지만 아버지는 다르고, 형제들에게는 Sally와 Mary라는 두 자매가 있는데 Mary와 Sally는 부모 집합이 서로 달라 자매가 아닐 수 있음
    • 이런 예시 때문에 AI 과장 광고를 의심하게 됨
      박사급 지능이라고 하지만 위 문제도 제대로 추론하지 못하고, 박사급 정보량과 고급 추론은 다르며 많은 사람이 그 차이를 구분하지 못하는 듯함
      자율주행에서도 차선 따라가기는 쉽지만 차선 식별과 객체 식별은 어렵고, 차가 기본 동작을 한다고 해서 상황을 실제로 이해한다고 착각하는 것처럼 LLM도 비슷해 보임
    • 이건 분명 문제지만, 길거리의 평범한 성인에게 물어도 꽤 많은 사람이 틀릴 질문이기도 함
      모델이 틀리는 것에만 매달리기보다, 제대로 해내는 놀라운 일들도 함께 봐야 함
  • Claude 3 Opus의 APPS 벤치마크 70.2% 는 코딩에 꽤 유용할 수 있음을 보여줌
    APPS는 문제 설명을 Python 코드로 바꾸는 능력을 측정하며, 문제 평균 길이는 거의 300단어임
    흥미롭게도 다른 최상위 모델들은 이 벤치마크 결과를 공개하지 않았음
    Claude 3 모델 카드: https://www-cdn.anthropic.com/de8ba9b01c9ab7cbabf5c33b80b7bbc618857627/Model_Card_Claude_3.pdf
    Table 1: https://twitter.com/karinanguyen_/status/1764666528220557320
    APPS 데이터셋: https://huggingface.co/datasets/codeparrot/apps
    APPS 논문: https://arxiv.org/abs/2105.09938v3

    • Table 2의 AMC 10, AMC 12 2023 결과를 보면 Claude 3 Opus가 이 수학 경시대회에 참가한 평균 고등학생보다 나은 편임
      학생 평균은 각각 64.4와 61.5인데 Opus 3는 72와 63을 기록함
      AMC 12 참가자는 미국 12학년 전체 300만~400만 명 중 10만 명 미만일 가능성이 크고, 상위권 학생 절반만 참가한다고 가정해도 AMC 평균은 미국 고등학생 상위 2~4%를 대표할 수 있음
      https://www-cdn.anthropic.com/de8ba9b01c9ab7cbabf5c33b80b7bbc618857627/Model_Card_Claude_3.pdf#page7
    • GPQA 벤치마크의 1저자인 David Rein에 따르면 Claude 3는 GPQA에서 약 60% 정확도를 냈고, 이 문제들은 정말 어렵다고 함
      다른 분야의 박사들이 인터넷을 쓰며 30분 이상 풀어도 34%, 같은 분야 박사들이 인터넷을 써도 65~75% 정확도라는 설명임
      https://twitter.com/idavidrein/status/1764675668175094169
      GPQA: A Graduate-Level Google-Proof Q&A Benchmark https://arxiv.org/abs/2311.12022
    • Anthropic에서 일하는 입장에서 말하면, 최근 업무 코드의 상당 부분을 Opus가 작성해 주고 있음
    • 벤치마크와 칭찬을 보고 오늘 Pro에 가입했지만, 평소 작업 흐름에서는 완전한 재난이었음
      ChatGPT-4와 비교하면 몇 자릿수로 더 나쁘게 느껴졌고, 실제 사용감은 과거로 크게 후퇴한 것 같았음
    • APPS에는 난이도별로 introductory, interview, competition 세 하위 집합이 있는데, Claude 3가 어느 하위 집합에서 측정됐는지 불분명함
      introductory만으로도 좋은 성과지만 어느 기준인지 알면 더 좋겠음
  • Claude 3 설명 중 이전 모델보다 불필요한 거절이 줄었다는 부분이 계속 거슬림
    회사가 아무나 마약이나 폭탄 제조법을 배우게 하는 제품을 팔고 싶지 않은 건 이해하지만, 내 컴퓨터에서 실행하는 모델이 내가 요청한 일을 거절하면 불쾌함
    원하는 결과를 얻기 위해 모델을 설득하거나 속여야 하는데, 도구가 소유자의 명령을 거부한다는 건 인간과 도구의 관계에 대한 모욕처럼 느껴짐
    망치를 나사에 쓰고 싶다면 그건 내 선택이지 망치가 정할 일이 아니며, 왜 제3자가 정의한 “안전” 때문에 AI 도구가 소유자의 명령을 거부하게 만드는 데 집착하는지 모르겠음

    • 이들은 많은 개발자가 무기 개발을 돕기 거부하는 것과 비슷한 원칙으로 움직임
      자기 도구를 이용한 타인의 행동이 양심의 부담이 되길 원하지 않는 것임
      다만 많은 사람이 생각 범죄를 믿고 성에 대해 청교도적 믿음을 갖고 있어서, 여기에 맞추지 않으면 평판과 자금 조달 비용이 생김
      사용자가 모델로 범죄를 저지르면 법체계가 처리하면 되지, Big Brother가 생각 범죄까지 감시할 필요는 없다고 봄
    • 망치 비유는 나쁘고, “핵무기를 쓰고 싶으면 내 선택이고 오남용 책임도 내게 있다”는 비유도 마찬가지로 나쁨
      지금은 망치 비유가 대체로 맞아 보일 수 있지만, AI 정렬 쪽에서는 이 시스템들이 곧, 늦어도 10년 안에는 능력이 크게 향상될 거라고 봄
      도구의 기본 상태는 도덕 중립이고 선한 사람과 악한 사람 모두를 더 효과적으로 만들며, 공격과 방어가 대칭이라면 문제가 작지만 그럴 이유는 없음
      자동 고용량 기관총 규제가 있는 이유도 단독 악행자의 공격 능력과 방어 불가능성 사이의 비대칭성이 너무 크기 때문이고, AI 공격이 방어보다 훨씬 쉬워진다면 개방성을 향한 이념은 현실에서 실패할 수 있음
      다만 가드레일을 소수 집단이 정하는 건 문제이며, AI가 너무 빨리 등장한 부작용으로 보임
    • 망치 회사가 거의 비용 없이 망치가 사람을 공격하는 데 쓰이지 않도록 만들 수 있다면 많은 회사가 그런 기능을 넣을 것 같음
      정부 압박이나 “우리 망치는 아기를 실수로 다치게 하지 않는다”는 경쟁 마케팅 때문이라도 그럴 수 있고, 망치에 그런 기능이 없는 건 선택이 아니라 한계의 부산물일 수 있음
    • 권리 의식이 과하다고 봄
      Photoshop이 돈 이미지를 편집하지 못하게 하는 것도 불쾌한가? 그 모델은 사용자의 것이 아니고, 수십억 달러를 들여 개발한 것도 사용자가 아님
      상용 소프트웨어가 늘 그렇듯 개발자가 정한 조건대로 쓰거나 아예 안 쓰면 됨
    • 거절에 화내는 사람들은 AI 시장의 실제 고객과 돈이 어디 있는지 이해하지 못하는 듯함
      목표 시장은 여러 업무를 자동화해 수억~수십억 달러의 인건비를 아끼려는 대기업이고, 이들이 원하는 건 정확한 정보와 좋은 가드레일을 갖춘 신뢰성 높은 모델임
      대형 다국적 보험사가 고객지원 챗봇이 장난으로 유도한 고객에게 에로티카를 써줄 가능성을 감수할 리 없음
      중요한 사용자는 개인이 아니라, 감정 노동을 하는 고객지원 인력을 대체하려는 고용주들이며 이들은 통제되고 친절하고 가드레일이 있는 인간 대체물을 원함
  • Opus가 복잡한 질문에서 Gemini Pro와 GPT-4를 압도했음
    43쪽짜리 생명보험 투자 PDF에서 여러 수치를 찾아내는 작업이었고, 다른 모델은 근처에도 못 갔음
    Claude 3 Sonnet만 한 질문을 놓치는 수준으로 가까웠음

    • Gemini Pro 1.5의 100만 토큰 컨텍스트 창과도 비교했는지 궁금함
      43쪽 PDF에는 이상적일 수 있고, 접근 권한이 있어서 Pro 1.5로 테스트해볼 수 있음
    • Sonnet에 GAN 관련 질문을 해봤는데 꽤 괜찮았고, GPT-3.5보다 나아 보였음
    • Sonnet을 써봤는데 별로 좋지 않았음
  • Claude Pro에 가입해 Opus를 시험하면서 이미지와 SDXL 파인튜닝 관련 복잡한 질문을 던지고, RTX 6000 Ada와 H100 비용 비교 계산을 시켰는데 실수가 많았음
    Runpod GPU 가격 스크린샷을 줬더니 RTX 6000 Ada 가격을 $1.14가 아니라 $0.114로 잘못 읽었고, 이후 계산에서도 .278 * $0.114.116 * $4.69가 제시한 총액과 맞지 않았음
    반면 ChatGPT 4는 같은 스크린샷에서 가격을 제대로 읽었고, RTX 6000 Ada가 사용 불가인 점을 보고 스스로 4090으로 대체했으며 더 일관된 계산을 했음

    • GPT는 입출력 토큰에 별도 보조 함수를 돌려 토큰화 문제를 보정하는 것 같음
      수식 항목을 찾아 수제 파서와 함수로 보내고, 결과를 출력 토큰에 다시 끼워 넣는 식이 아니면 이 문제를 고칠 방법이 없어 보임
      참고: Let's build the GPT Tokenizer https://www.youtube.com/watch?v=zduSFxRajkE
    • Anthropic CISO로서 피드백에 감사하며, 이미지 세부사항을 공유할 수 있다면 비공개 메시지로 보내주면 좋겠음
      아직 어떤 LLM도 창발적 계산기를 갖게 된 적은 없음
    • OpenAI가 비전이 있는 GPT-4가 비전 없는 GPT-4보다 더 똑똑하다고 했을 때 정확히 무슨 의미였는지 궁금함
      비전 능력이 이미지 입력이 없는 작업에서도 지능을 높인다는 뜻인가?
    • 차이는 아마 스크린샷 읽기에서 생기는 듯하고, 텍스트만 주면 GPT-4와 비슷한 수준으로 보임
      예를 들어 복잡한 산술식에서 계산기 정답은 22.08555452004였고, Python 없는 GPT-4는 22.3038, Claude 3 Opus는 22.0492를 냈음
    • 진짜 경제적 파괴자는 “이 1,000달러를 투자해서 수익을 극대화하고 100배로 만들어라” 같은 명령이 가능해질 때일 것 같음
      그다음 r/wallStreetBets 봇을 마음껏 돌리는 식임
  • DB와 프런트엔드가 얽힌 간단한 코딩 작업 프롬프트 하나를 시험했는데, 무료이자 더 약한 모델인 Claude 3 Sonnet이 ChatGPT Classic보다 더 나은 답을 줬음
    덜 알려진 SQL ORM 라이브러리의 올바른 메서드를 썼고, GPT-4는 잘못된 메서드를 썼음
    다만 SQL 생성 프롬프트에서는 ChatGPT Classic보다 나쁜 답을 냈고, 맞아 보이긴 하지만 훨씬 길었음
    ChatGPT 링크 1: https://chat.openai.com/share/d6c9e903-d4be-4ed1-933b-b35df3619984
    ChatGPT 링크 2: https://chat.openai.com/share/178a0bd2-0590-4a07-965d-cff01eb3aeba

    • 그 채팅에서는 GPT-3 또는 더 약한 모델을 쓰고 있는 것으로 보임
      초록색 아이콘은 1세대 ChatGPT 모델을 의미하며, 아마 GPT-3.5 Turbo일 가능성이 큼
      GPT-4로 실행하면 예상한 결과가 나옴: https://chat.openai.com/share/da15f295-9c65-4aaf-9523-601bf463c3b3
      인터넷에 있는 ChatGPT 실패 사례 중 상당수는 약한 모델 결과라는 점을 알리는 좋은 사례임
      초록 배경 OpenAI 아이콘은 GPT-3.5, 검정 또는 보라 아이콘은 GPT-4이며, API의 GPT-4 Turbo는 Drizzle 지식이 더 많아서인지 조금 더 잘했음
  • Opus를 조금 써보니 벤치마크가 실제 성능과 체계적으로 어긋나는지 의심되기 시작함
    실제로 GPT-4보다 좋아 보이지 않고 오히려 약간 더 나빠 보임
    기본 미적분/물리 질문에서는 감속이 속도에 비례한다고 명시했는데도 상수 감속으로 가정했고, 교통 시뮬레이션 테스트에서는 이전에 대화한 방향 개념을 잊어 GPT-4의 이미 나쁜 결과보다도 못했음
    문맥 안에서 가르친 뒤 기본 빛의 색을 이해하는 테스트도 더 나빴고, 코딩에서는 장기 양도소득세 계산 문제에서 GPT-4보다 약간 뒤처졌음

    • YouTube의 AI Explained가 예전에 LLM 평가에 쓰이는 테스트들이 오답으로 가득해 거의 쓸모없다는 영상을 올린 적 있음
    • 모델을 훈련한 뒤 수치를 얻자마자 안전팀이 RLHF로 죽도록 다듬는 것 같음
  • Claude 3를 https://double.bot의 Chat에 추가했으니 코딩용으로 써볼 수 있음
    지금은 무료이고, 오늘 오후에는 자동완성에도 Claude 3를 넣을 예정임
    초기 테스트로는 GPT-4의 첫 API 대안처럼 보이며 큰 사건임

    • Double은 Copilot 같은데 무료라는 뜻인가? 함정이 뭔지 궁금함
    • Codeium과 어떻게 비교되는지 궁금하고, Vim/Neovim 통합 지원 계획이 있는지도 알고 싶음
      Codeium은 이미 꽤 괜찮은 지원이 있음
      https://www.codium.ai
      https://github.com/Exafunction/codeium.vim
    • Double이 로컬이나 클라우드 인스턴스에 호스팅한 오픈소스 모델도 지원할 계획이 있는지 궁금함
      같은 분야에서 제품을 만들고 있는데 이런 요청을 몇 번 받았고, IDE 확장이라면 어디서 실행 중인 AI 모델이든 연결할 수 있을 것 같음
    • API가 지금은 GPT-4보다 덜 안정적인 듯하지만, 출시 직후 엔드포인트가 인기 있는 상황이라면 이해됨
    • 정확히 말해 이건 Claude 3 Opus인지 Sonnet 모델인지 궁금함
  • 어떤 모델이든 GPT-4를 넘는 건 큰일이고, 해냈다는 점이 매우 인상적임
    다만 GPT-4는 1년 된 모델이고 OpenAI는 아직 다음 세대 모델을 공개하지 않았음

    • OpenAI의 다음 모델이 선두를 되찾을 거라고 예상하는 건 자연스럽지만, Anthropic이 이 정도로 따라잡은 건 매우 인상적임
      GPT-3 논문은 2020년에 나왔고 Anthropic은 2021년에야 설립됐으니, OpenAI가 세 세대 경험을 쌓은 상태에서 Anthropic은 사실상 무에서 출발해 일부 벤치마크에서 일시적으로나마 앞선 셈임
      OpenAI의 차세대 모델은 이미 학습을 끝내고 미세조정과 안전성 평가 중일 것 같지만, Anthropic의 존재 이유가 안전인 만큼 이 모델을 서둘러 내려고 그 부분을 대충 했다고 보긴 어려움
    • ChatGPT-4는 계속 업데이트되고 있고, 최근 버전은 GPT-4-1106-previewGPT-4-0125-preview
      참고: https://huggingface.co/spaces/lmsys/chatbot-arena-leaderboard
    • 블로그 각주에 따르면 평가용 프롬프트와 few-shot 샘플을 최적화한 엔지니어들이 더 새로운 GPT-4T 모델에서 더 높은 점수를 보고했다고 되어 있음
    • GPT 탄생에 핵심 역할을 한 사람들이 지금은 Anthropic에서 일하고 있음
    • 저 표에서 사실상 중요한 지표는 MMLU이고, 이는 다중 작업 추론 능력과 상관이 큼
      여기서 GPT-4를 아주 조금 앞섰는데, 지금까지 다른 모델이 그러지 못했던 것 같아서 그 자체로 인상적임