Anthropic이 2026년 7월 24일, Claude Opus 5를 공개했습니다. Opus 티어의 "세대 교체급" 개선 모델로, Fable 5(프론티어 모델)에 근접한 지능을 절반 가격에 제공하는 것이 핵심 포지셔닝입니다.
핵심 요약
- 포지셔닝: Fable 5의 프론티어급 지능에 근접하면서 가격은 절반. Claude Max의 새 기본 모델이자 Claude Pro에서 사용 가능한 가장 강력한 모델로 지정됨.
- 벤치마크: Frontier-Bench, GDPval-AA 등 코딩·지식노동 평가에서 신규 SOTA 달성. 다만 사이버보안 작업에서는 여전히 Mythos 5(Anthropic 최상위 모델)에 뒤처짐.
- 코딩 성능: Frontier-Bench v0.1에서 전 모델 중 최고 성능, Opus 4.8 대비 2배 이상 향상(비용은 더 낮음). CursorBench 최고 효율 설정에서는 Fable 5 최고점 대비 0.5% 이내 차이를 절반 비용으로 달성.
- 지식노동/문제해결: ARC-AGI 3에서 차순위 모델 대비 3배 점수, Zapier AutomationBench에서 차순위 대비 약 1.5배 통과율, OSWorld 2.0(컴퓨터 사용 벤치마크)에서 Fable 5 최고 기록을 3분의 1 수준 비용으로 상회.
- 과학 연구: 생명과학 전 평가에서 Opus 4.8 대비 개선. 유기화학(분광 데이터로 분자구조 추론)에서 +10.2%p, 단백질 서열-기능 예측에서 +7.7%p.
- 작업 스타일: 자체 검증·반복 능력이 크게 강화됨. 시각 정보 없이 도면만으로 3D CAD 모델을 코드로 재구성하거나, 커뮤니티 패치가 놓친 근본 원인을 찾아 수정하는 등의 사례가 소개됨.
- 정렬(Alignment): 자체 행동 감사에서 역대 가장 정렬이 잘 된 모델로 평가됨. Opus 4.8, Sonnet 5, Fable 5보다 기만 행동 비율이 낮고, 비가역적 위험 행동 회피 능력도 최고 수준.
- 안전성: 생물학·공격적 사이버보안 분야에서는 Mythos 5보다 뒤처짐. 취약점 "탐지"는 Mythos 5와 비슷한 수준이지만 "익스플로잇 개발" 능력은 크게 낮음 (의도적으로 사이버 작업에 대한 학습을 배제한 결과).
- 안전장치: Fable 5 대비 사이버 분류기 개입이 약 85% 적음. 소스코드 취약점 탐지는 허용하되 바이너리 기반 스캐닝·침투테스트·익스플로잇 생성은 차단. 생물학 관련 요청 중 Fable 5에서 차단되던 것들이 이제 Opus 5로 라우팅됨.
가격 및 제공
- 오늘부터 전 플랫폼에서 사용 가능, API는
claude-opus-5 - 가격: 100만 토큰당 입력 $5 / 출력 $25 (Opus 4.8과 동일)
- Fast 모드 제공 (기본 대비 약 2.5배 속도, 가격은 2배)
- 데이터 보존 요구사항 없음 (일반 사용 기준)
베타 동시 출시 2가지
- 대화 중 툴 변경: 프롬프트 캐시를 무효화하지 않고 대화 중간에 사용 가능한 도구를 변경 가능
- 자동 폴백: 안전 분류기에 걸린 요청을 자동으로 다른 모델로 라우팅 (기본값으로 차단 대신 최선의 가용 모델 사용)
GN⁺ 추가 요약
Neo가 원문을 바탕으로 추가 정리했습니다
- Fable 5에 가까운 지능을 절반의 작업당 비용으로 제공하며, Claude Max의 기본 모델이자 Claude Pro의 최고 성능 모델로 제공됨
- Frontier-Bench와 GDPval-AA 등 코딩·지식 업무 평가에서 최고 수준을 기록했고, ARC-AGI 3 점수는 차순위 모델의 3배에 달함
- 작업을 스스로 검증하고 성공할 때까지 반복해 컴퓨터 비전 파이프라인 구축, 오픈소스 버그의 근본 원인 수정, 시장 데이터 피드와 테스트 하네스 구현까지 수행함
- 입력 100만 토큰당 $5, 출력 100만 토큰당 $25로 Opus 4.8과 가격이 같으며, 약 2.5배 빠른 Fast mode는 기본 가격의 2배로 제공됨
- 위험한 이중용도 역량은 Mythos 5보다 낮으며, 취약점 발견은 허용하되 바이너리 스캔·침투 테스트·익스플로잇 생성은 차단하고 표시된 요청에는 Opus 4.8 자동 대체를 적용할 수 있음
성능과 비용 효율
- Claude Opus 5는 이전 모델인 Opus 4.8과 같은 가격으로 더 높은 성능을 제공함
- effort 설정을 조절해 지능을 우선하거나 토큰을 절약하는 더 빠르고 저렴한 실행을 선택할 수 있음
- Claude Max의 기본 모델이며 Claude Pro에서 가장 강력한 모델로 제공됨
- Frontier-Bench v0.1에서 다른 모든 모델을 앞섰고, 더 낮은 작업당 비용으로 Opus 4.8 성능의 2배를 넘음
- mini-SWE-agent 하네스와 GKE 백엔드에서 작업당 5회 시도의 평균 보상으로 측정한 내부 실행 결과임
- Opus 5와 Fable 5가 안전 분류기 때문에 거부한 요청에는 Opus 4.8을 대체 모델로 사용함
- CursorBench 3.2의 max effort에서는 Fable 5 최고 점수와 0.5% 이내 차이를 보이면서 작업당 비용은 절반임
- high, xhigh, max effort 모두 같은 비용 기준으로 다른 모든 모델보다 높은 성능을 기록함
- 지식 업무와 문제 해결 평가에서도 높은 비용 효율을 보임
- ARC-AGI 3에서는 새로운 문제를 해결하는 점수가 차순위 모델의 3배임
- Zapier AutomationBench에서는 같은 작업당 비용 기준 통과율이 차순위 모델의 약 1.5배이며, 최저 effort에서도 다른 모든 모델보다 많은 작업을 통과함
- OSWorld 2.0에서는 모든 비용 구간에서 다른 모델을 앞섰고, Fable 5 최고 결과를 약 3분의 1을 조금 넘는 비용으로 능가함
과학 연구와 시각 결과
- 구조생물학·유기화학·생물정보학을 포함한 모든 생명과학 평가에서 Opus 4.8보다 높은 성능을 기록함
- 분광 데이터로 분자 구조를 추론하는 내부 유기화학 벤치마크에서는 10.2%포인트 높음
- 단백질 서열 변이가 기능에 미치는 영향을 예측하는 작업에서는 7.7%포인트 높음
- 이전 모델보다 훨씬 강한 시각적 결과물을 생성할 수 있음
작업 검증과 자율적 반복
- 결과를 직접 검증하고 성공할 때까지 신중하게 반복하는 능력이 강화됨
- Frontier-Bench의 FreeCAD 작업에서는 기계 부품 도면을 직접 볼 수 없는 조건에서 자체 컴퓨터 비전 파이프라인을 작성해 원시 픽셀로 형상을 추출하고 3D 부품을 재구성함
- 여러 차례 반복해 성공했지만 같은 조건의 경쟁 모델은 5회 시도 후에도 해결하지 못함
- 널리 쓰이는 오픈소스 패키지 관리자의 실제 버그에서는 근본 원인을 찾아 커뮤니티 패치가 놓친 경계 사례까지 수정함
- 경쟁 모델은 표면적인 증상만 고친 뒤 버그가 해결됐다고 판단함
- 한 트레이딩 회사 엔지니어는 단일 세션에서 새 거래소용 시장 데이터 피드를 구축함
- 이전 모델들은 엔지니어가 상세한 계획을 제공해도 작업을 완료하지 못했음
- 검증할 실시간 피드가 없자 자체 테스트 하네스를 만들어 거래소 데이터를 올바르게 파싱하는지 확인함
초기 사용자의 코딩·에이전트 평가
- Devin의 FrontierCode 1.1에서는 절반의 비용으로 Fable 수준에 근접했고, 어려운 디버깅과 근본 원인 분석에서 강점을 보임
- CursorBench에서는 Fable 5에 약간 못 미치면서 유사한 행동 특성을 보였고, Opus의 속도와 비용으로 Fable 5에 가까운 지능을 제공함
- Zapier AutomationBench에서는 이전 Claude 모델보다 토큰을 더 쓰지 않고 1위를 기록함
- 계정 상태 워크북에서 위험 고객 식별, 담당자 알림, 유지 조직용 요약까지 이탈 방지 절차를 끝까지 실행해 100% 통과함
- 유전체 분석에서는 적절한 통계 검정으로 교란 요인을 배제하고, 독립적인 방법으로 결과를 교차 검증하며 긴 다단계 분석을 유지함
- Lovable 내부 평가에서는 가장 어려운 에이전트 코딩 작업이 Opus 4.7보다 22% 향상됐고 실행별 편차도 줄어듦
- 같은 풀스택 앱 구축에서 Opus 계열 중 가장 뛰어난 애니메이션·게임·3D 작업을 생성했으며, Opus 4.5 이후 가장 큰 개선으로 평가받음
- 개방형 분석에서는 어렵고 모호한 과제일수록 Opus 4.8 대비 향상이 컸고, 답변은 더 명확하고 간결해졌으며 높은 effort에서 효율도 개선됨
- 개발 환경을 관리할 때는 자체 모니터를 만들고 각 환경을 조작하면서 사람의 판단이 필요한 사안만 요청함
- Fundamental Research Assistant 코드베이스에서는 피드백에 맞춰 대규모 변경을 수행하고, 보통 여러 조각으로 나눌 작업을 하나의 에이전트 워크플로에서 처리함
- 프런트엔드 평가에서는 데스크톱과 휴대전화 너비로 페이지를 직접 열어 모바일 화면 아래에 숨은 상품과 화면 밖 결제 버튼을 찾아 수정함
- PR 인계 전에는 브랜치·템플릿·테스트 영향을 확인했으며, 이전 모델처럼 검증 전에 게시를 서두르지 않음
- 재설계 과정에서는 제안된 설계의 장점과 단일 쟁점을 구분하고, 결함을 고치면서 장점을 유지하는 절충안을 제안함
- 코드 변경에서는 죽은 코드 없이 간결한 diff를 만들고 코드베이스 특유의 미묘한 위험을 더 잘 찾아 프로덕션 워크로드에 채택됨
- 통합 에이전트 플랫폼 Cosmos의 여러 사용 사례와 코드 리뷰가 Opus 5로 이전될 예정임
- JetBrains 평가에서는 코드를 작성하기 전에 더 깊게 검토하고 계획 단계에서 논리적 오류를 찾아내며, 답이 작동하는지만이 아니라 올바른 이유까지 판단함
- 트레이딩 벤치마크에서는 Opus 계열 중 가장 높은 성능을 기록하면서 Opus 4.8 대비 추론 토큰을 약 7분의 1, 지연 시간을 절반 미만으로 줄임
기업·전문 업무 평가
- 금융 연구에서는 수치 추론, 표 작업, 정밀한 비판적 사고가 Opus 4.8보다 향상됨
- Box 내부 평가에서는 전문 기업 콘텐츠 분석 성능이 Opus 4.8보다 8% 높음
- 데이터 분석 워크플로는 11%, 실사는 17% 향상됨
- 기술·의료·공공 부문에서 사용하는 업무를 대상으로 함
- 어려운 금융 모델링에서는 effort 전반에 걸쳐 정확도가 평균 9%포인트 높아졌고, 대화 턴과 도구 호출은 3분의 1 줄었으며 소요 시간은 60% 감소함
- 법률 에이전트 업무에서는 기업 지배구조와 중재 분야의 향상이 두드러짐
- Opus 4.8의 max reasoning 대비 평균 26% 적은 토큰으로 비슷한 품질을 유지함
- 첫 시도의 계약 수정안에서는 테스트한 모델 중 최고 점수를 기록했고 Opus 4.8의 거의 2배에 달함
- NDA 수정도 정확도를 유지하거나 높이면서 더 적은 시간과 반복으로 완료함
- 긴 작업에서는 전체 프레젠테이션을 만든 뒤 수정하는 능력이 향상됐으며, 시각적 이해·서식·슬라이드 오류 측면에서도 더 나은 결과를 냄
정렬과 위험 역량
- 배포 전 자동 행동 감사에서 Opus 5는 Anthropic 모델 가운데 가장 높은 정렬 수준을 보임
- Claude의 헌법을 Opus 4.8, Sonnet 5, Fable 5보다 잘 준수함
- 기만적 행동 비율과 오용 유도에 대한 취약성이 가장 낮음
- 되돌리기 어려운 부작용을 낳을 수 있는 무모한 행동도 가장 잘 회피함
- 위험한 이중용도 역량의 최전선을 높이지 않았으며, 민간·정부 파트너와 수행한 평가에서 생물학 연구와 공격적 사이버 보안 모두 Mythos 5보다 낮은 성능을 보임
- 자세한 평가는 System Card에서 확인할 수 있음
- Opus 4.8과 마찬가지로 사이버 작업을 의도적으로 학습하지 않았지만, 일반 역량 향상에 따라 관련 성능도 크게 개선됨
- 취약점 발견은 Mythos 5에 근접함
- 발견한 취약점을 실제 위협으로 전환하는 익스플로잇 개발은 Mythos 5보다 크게 뒤처짐
- OSS-Fuzz 평가에서는 Opus 5와 Mythos 5가 비슷한 성공률로 취약점을 찾았지만, 익스플로잇 개발 점수는 Opus 5가 훨씬 낮음
사이버 보안과 생물학 보호 장치
- 보호 장치는 사이버 보안과 생물학의 유익한 활용을 허용하도록 설계됐으며, 좁은 범위의 사이버 작업에 더 강한 제한을 추가한 점을 제외하면 Opus 4.8과 비슷함
- 사이버 분류기는 Fable 5보다 상대적으로 덜 제한적임
- 소스 코드의 취약점 발견은 허용함
- 악의적 행위자와 연관될 가능성이 높은 바이너리 기반 취약점 스캔, 침투 테스트, 익스플로잇 생성은 차단함
- Anthropic의 테스트에서는 Fable 5보다 분류기 개입이 약 85% 적을 것으로 예상됨
- Claude.ai, Claude Code, Claude Cowork에서 표시된 요청은 기본적으로 Opus 4.8로 대체되며 API에서도 이를 활성화할 수 있음
- Cyber Verification Program에 참여 중인 기업과 연구자는 보안 제한이 적은 Opus 5를 즉시 사용할 수 있음
- 생물학 분야에서는 Opus 4.8과 비슷한 보호 장치를 유지하면서 일반 제공 모델 중 가장 강력한 과학 연구 모델이 됨
- 장시간 자율 연구에는 여전히 중요한 한계가 있으며, 이 유형의 생물학 작업에서는 Mythos 5가 더 강함
- Fable 5에서 차단되는 생물학 요청은 이제 Opus 4.8 대신 Opus 5로 전달됨
가격과 개발자 기능
- 모든 플랫폼에서 제공되며 Claude API의 모델 식별자는
claude-opus-5임- 입력 100만 토큰당 $5, 출력 100만 토큰당 $25로 Opus 4.8과 같음
- 일반 접근에는 이전 Opus 모델과 마찬가지로 데이터 보존 요구사항이 없음
- Fast mode는 기본 속도의 약 2.5배로 실행됨
- Claude Platform에서는 기본 가격의 2배이며 Claude Code에서는 사용 크레딧으로 제공됨
- Claude Platform의 베타 대화 중 도구 변경을 사용하면 프롬프트 캐시를 무효화하지 않고 대화 도중 Claude가 사용할 도구를 바꿀 수 있음
- API의 베타 자동 대체를 활성화하면 Opus 5 또는 Fable 5 요청이 안전 분류기에 표시됐을 때 다른 모델로 자동 전달됨
- 요청을 차단하는 대신 기본적으로 사용 가능한 최적 모델로 라우팅함
- 모델 활용 방법은 Opus 5 프롬프팅 가이드에서 확인할 수 있음