- Anthropic이 Claude 3 제품군을 공개하며 Haiku, Sonnet, Opus로 지능·속도·비용 균형을 고를 수 있는 새 모델 라인업을 제시함
- Opus는 MMLU, GPQA, GSM8K 등 주요 평가에서 동급 모델을 앞서며, Claude 3 전반은 분석·예측·코드 생성·비영어 대화 능력이 향상됨
- 속도 차별화가 핵심 축으로, Haiku는 약 10k 토큰 arXiv 논문을 3초 미만에 읽고 Sonnet은 대부분 워크로드에서 Claude 2·2.1보다 2배 빠름
- Claude 3는 사진·차트·그래프·기술 다이어그램 같은 비전 입력을 처리하며, 출시 시 200K 컨텍스트 창과 100만 토큰 초과 입력 가능성을 갖춤
- Opus와 Sonnet은 claude.ai와 Claude API에서 바로 사용 가능하고, API는 159개국에 제공되며 Haiku는 곧 출시될 예정임
모델 구성과 제공 상태
- Claude 3 제품군은 성능이 낮은 순서부터 Claude 3 Haiku, Claude 3 Sonnet, Claude 3 Opus로 구성됨
- 각 모델은 애플리케이션별로 지능, 속도, 비용의 균형을 선택할 수 있도록 설계됨
- Opus와 Sonnet은 claude.ai와 Claude API에서 사용 가능함
- Claude API는 일반 공개 상태이며 159개국에서 제공됨
- Haiku는 곧 제공될 예정임
- claude.ai의 무료 경험은 Sonnet이 구동하며, Opus는 Claude Pro 구독자에게 제공됨
- Sonnet은 Amazon Bedrock에서도 사용 가능하고, Google Cloud의 Vertex AI Model Garden에서는 비공개 프리뷰로 제공됨
- Opus와 Haiku도 두 플랫폼에 곧 추가될 예정임
지능, 속도, 멀티모달 성능
- Opus는 Anthropic의 가장 지능적인 모델로, MMLU, GPQA, GSM8K 등 AI 시스템 평가 벤치마크 다수에서 동급 모델을 앞섬
- Claude 3 모델들은 분석과 예측, 세밀한 콘텐츠 생성, 코드 생성, 스페인어·일본어·프랑스어 같은 비영어 대화에서 향상된 능력을 보임
- 실시간 응답이 중요한 업무에 맞춰 활용 범위가 넓어짐
- 라이브 고객 채팅
- 자동완성
- 데이터 추출
- Haiku는 해당 지능 범주에서 가장 빠르고 비용 효율적인 모델이며, 차트와 그래프가 포함된 약 10k 토큰 arXiv 논문을 3초 미만에 읽을 수 있음
- Sonnet은 대부분의 워크로드에서 Claude 2와 Claude 2.1보다 2배 빠르고 더 높은 지능 수준을 제공함
- 지식 검색
- 세일즈 자동화
- Opus는 Claude 2와 Claude 2.1과 비슷한 속도를 유지하면서 더 높은 지능 수준을 제공함
비전 입력, 거절 감소, 정확도 개선
- Claude 3 모델들은 다른 선도 모델과 비슷한 수준의 비전 기능을 갖춤
- 사진
- 차트
- 그래프
- 기술 다이어그램
- 일부 엔터프라이즈 고객은 지식 베이스의 최대 50%가 PDF, 플로차트, 프레젠테이션 슬라이드 같은 형식에 저장돼 있어 새 입력 양식의 중요성이 큼
- 이전 Claude 모델은 문맥 이해 부족처럼 보이는 불필요한 거절을 자주 했지만, Claude 3의 Opus, Sonnet, Haiku는 시스템 가드레일에 가까운 프롬프트에 대해 이전 세대보다 답변 거절 가능성이 크게 낮아짐
- Claude 3는 요청을 더 세밀하게 이해하고 실제 위해를 인식해, 무해한 프롬프트에 대한 거절을 줄이도록 개선됨
- 정확도 평가는 현재 모델의 알려진 약점을 겨냥한 복잡한 사실 질문 세트를 사용함
- 답변은 정답, 오답 또는 환각, 불확실성 인정으로 분류됨
- Opus는 Claude 2.1 대비 어려운 개방형 질문에서 정답률이 2배 개선되고 오답 수준도 낮아짐
- Claude 3 모델에는 곧 인용 기능이 추가되어 답변 검증을 위해 참고 자료의 정확한 문장을 가리킬 수 있게 될 예정임
긴 컨텍스트와 회상 능력
- Claude 3 제품군은 출시 시 200K 컨텍스트 창을 제공함
- 세 모델 모두 100만 토큰을 초과하는 입력을 받을 수 있으며, 더 높은 처리 능력이 필요한 일부 고객에게 제공될 수 있음
- 긴 컨텍스트 프롬프트를 제대로 처리하려면 강한 회상 능력이 필요함
- Needle In A Haystack(NIAH) 평가는 방대한 데이터 말뭉치에서 정보를 정확히 회상하는 능력을 측정함
- 평가 견고성을 높이기 위해 프롬프트마다 30개 무작위 needle/question 쌍 중 하나를 사용함
- 다양한 크라우드소싱 문서 말뭉치에서 테스트함
- Claude 3 Opus는 NIAH에서 99%를 넘는 정확도로 거의 완벽한 회상을 달성함
- 일부 사례에서는 “needle” 문장이 원문에 사람이 인위적으로 삽입한 것처럼 보인다는 점을 인식해 평가 자체의 한계를 찾아내기도 함
안전 설계와 편향 대응
- Anthropic은 Claude 3 제품군을 능력만큼 신뢰할 수 있게 만드는 데 초점을 맞춤
- 전담 팀들이 여러 위험을 추적하고 완화함
- 허위정보
- CSAM
- 생물학적 오용
- 선거 개입
- 자율 복제 능력
- 모델의 안전성과 투명성을 높이기 위해 Constitutional AI 같은 방법을 계속 개발함
- 새 입력 양식으로 인해 생길 수 있는 개인정보 문제를 완화하도록 모델을 조정함
- Bias Benchmark for Question Answering(BBQ) 기준으로 Claude 3는 이전 모델보다 편향이 적음
- Claude 3 제품군은 생물학 지식, 사이버 관련 지식, 자율성의 주요 측정치에서 이전 모델보다 발전했지만, Responsible Scaling Policy에 따른 AI Safety Level 2(ASL-2) 에 머무름
- 레드팀 평가는 현재 모델들의 재앙적 위험 가능성이 미미하다고 결론냄
- 평가는 White House commitments와 2023 US Executive Order에 맞춰 수행됨
- 향후 모델이 ASL-3 임계값에 얼마나 가까운지 계속 모니터링할 예정임
- 추가 안전 세부 정보는 Claude 3 model card에 있음
사용성, 모델별 가격과 용도
- Claude 3 모델들은 복잡한 다단계 지시를 더 잘 따름
- 브랜드 보이스와 응답 가이드라인을 준수하고 신뢰할 수 있는 고객 대면 경험을 만드는 데 더 적합함
- JSON 같은 구조화 출력 생성 능력이 향상되어 자연어 분류와 감정 분석 같은 사용 사례에서 Claude 지시가 더 쉬워짐
-
Claude 3 Opus
- Claude 3 Opus는 고도로 복잡한 작업에서 최고 수준 성능을 내는 가장 지능적인 모델임
- 열린 프롬프트와 처음 보는 시나리오를 높은 유창성과 인간에 가까운 이해로 처리함
- 가격은 입력 100만 토큰당 15달러, 출력 100만 토큰당 75달러임
- 컨텍스트 창은 200K이며, 특정 사용 사례에는 100만 토큰도 가능함
- 잠재 사용 사례
- API와 데이터베이스 전반의 복잡한 작업 계획·실행, 대화형 코딩
- 연구 검토, 브레인스토밍, 가설 생성, 신약 발견
- 차트와 그래프, 재무, 시장 동향, 예측에 대한 고급 분석
-
Claude 3 Sonnet
- Claude 3 Sonnet은 지능과 속도의 균형을 목표로 하며, 특히 엔터프라이즈 워크로드에 맞춰짐
- 동급 모델보다 낮은 비용으로 강한 성능을 제공하고, 대규모 AI 배포에서 높은 지속성을 목표로 설계됨
- 가격은 입력 100만 토큰당 3달러, 출력 100만 토큰당 15달러임
- 컨텍스트 창은 200K임
- 잠재 사용 사례
- 방대한 지식에 대한 RAG 또는 검색·조회
- 제품 추천, 예측, 타깃 마케팅
- 코드 생성, 품질 관리, 이미지에서 텍스트 파싱
-
Claude 3 Haiku
- Claude 3 Haiku는 거의 즉각적인 응답성을 위한 가장 빠르고 작은 모델임
- 간단한 질의와 요청에 매우 빠르게 답하며, 인간 상호작용을 모방하는 매끄러운 AI 경험 구축을 목표로 함
- 가격은 입력 100만 토큰당 0.25달러, 출력 100만 토큰당 1.25달러임
- 컨텍스트 창은 200K임
- 잠재 사용 사례
- 라이브 상호작용에서 빠르고 정확한 고객 지원, 번역
- 위험 행동 또는 고객 요청을 포착하는 콘텐츠 모더레이션
- 물류 최적화, 재고 관리, 비정형 데이터에서 지식 추출
예정 기능과 업데이트
- Anthropic은 모델 지능이 한계에 가깝지 않다고 보고, 향후 몇 달 동안 Claude 3 제품군에 빈번한 업데이트를 출시할 계획임
- 엔터프라이즈 사용 사례와 대규모 배포를 위해 모델 기능을 강화하는 기능들이 예정돼 있음
- 도구 사용, 즉 함수 호출
- 대화형 코딩, 즉 REPL
- 더 고급 에이전트 기능
- AI 능력의 경계를 확장하는 동시에 안전 가드레일도 성능 향상에 맞춰 유지하겠다는 방침임
- Claude로 개발을 시작하는 진입점은 anthropic.com/claude임