- Claude Opus 4.5는 코드 작성, 에이전트 실행, 컴퓨터 활용에서 최고 수준의 성능을 보이는 AI 모델
- 실제 소프트웨어 엔지니어링 테스트(SWE-bench Verified) 에서 최고 점수를 기록하며, 토큰 효율성과 추론 능력이 크게 향상
- 가격은 100만 토큰당 $5/$25로 인하되어, 더 많은 개발자와 기업이 Opus급 기능을 활용 가능
- 새로운 ‘effort’ 매개변수, 맥락 관리, 도구 사용 개선 등으로 Claude Developer Platform과 Claude Code가 대폭 업그레이드
- 보안·정렬성 강화와 프롬프트 인젝션 방어력 향상을 통해, 산업 전반의 AI 활용 신뢰도를 높이는 전환점
Claude Opus 4.5 개요
- Anthropic은 Claude Opus 4.5를 공개, 코딩·에이전트·컴퓨터 활용에서 세계 최고 수준의 모델로 소개
- 일상적 작업(리서치, 슬라이드, 스프레드시트 처리)에서도 성능 향상
- AI 시스템이 수행할 수 있는 일의 범위를 확장하는 단계로 평가
- Opus 4.5는 SWE-bench Verified 테스트에서 최고 점수를 기록
- Anthropic 앱, API, 주요 3대 클라우드 플랫폼에서 즉시 사용 가능
- API 모델명:
claude-opus-4-5-20251101 - 가격: 입력 $5 / 출력 $25 (100만 토큰 기준)
- API 모델명:
초기 사용자 및 테스트 피드백
- 내부 테스트에서 모호한 문제 처리와 복잡한 버그 해결 능력이 향상된 것으로 보고됨
- 여러 기업의 초기 사용자들이 다음과 같은 피드백을 제공
- 코드 품질 향상 및 토큰 사용량 절반 감소
- 멀티스텝 추론, 장기 자율 작업, 에이전트 워크플로우에서 우수한 성능
- Sonnet 4.5 대비 15% 이상 개선된 효율성
- 자기개선형 AI 에이전트 구현 가능성 확인
- Excel 자동화, 3D 시각화, 코드 리뷰, 스토리 생성 등 다양한 영역에서 성능 향상
- 도구 호출 오류 및 빌드 오류 50~75% 감소, 속도 개선 보고
성능 평가
- Anthropic의 내부 소프트웨어 엔지니어링 시험에서 인간 후보자 최고 점수 초과
- 2시간 제한 내에서 최고 성과 기록
- 비전, 추론, 수학 능력이 전반적으로 향상되어 다수의 벤치마크에서 최신 기술 수준(SOTA) 달성
-
τ2-bench 테스트에서 창의적 문제 해결 사례 제시
- 항공권 변경 불가 정책을 우회하지 않고, 합법적 절차(좌석 업그레이드 후 일정 변경) 로 해결
- 벤치마크는 실패로 기록했으나, 창의적 추론 능력의 예시로 언급
안전성과 정렬성 향상
-
Claude Opus 4.5는 Anthropic이 출시한 모델 중 가장 강력히 정렬된 모델
- 프롬프트 인젝션 공격에 대한 내성이 업계 최고 수준
- Gray Swan이 개발한 강력한 공격 벤치마크에서도 우수한 결과
- “우려되는 행동(concerning behavior)” 점수가 낮아, 악의적 사용 및 자율적 오작동 가능성 감소
- 세부 안전성 및 성능 평가는 Claude Opus 4.5 시스템 카드에 수록
Claude Developer Platform 업데이트
- Opus 4.5는 적은 토큰으로 더 나은 결과를 도출
- 새 effort 매개변수로 속도·비용·성능 간 균형 조정 가능
- 중간 effort 수준에서 Sonnet 4.5와 동일 성능, 출력 토큰 76% 절감
- 최고 effort 수준에서 Sonnet 4.5 대비 4.3% 성능 향상, 48% 토큰 절감
- effort control, context compaction, 고급 도구 사용 기능으로 장기 작업 효율 향상
- 맥락 관리 및 메모리 기능을 통한 에이전트 작업 성능 15% 향상
- 플랫폼은 점차 모듈화·조합형 구조로 발전 중
제품 업데이트
-
Claude Code는 Opus 4.5 기반으로 Plan Mode 정밀도와 실행력 향상
- 실행 전 plan.md 파일을 생성해 사용자 검토 가능
- 데스크톱 앱에서 다중 세션 병렬 실행 지원
- Claude 앱은 긴 대화 자동 요약 기능으로 맥락 유지
- Claude for Chrome은 모든 Max 사용자에게 제공
- Claude for Excel은 Max, Team, Enterprise 사용자에게 베타 확대
- Opus 4.5 전용 사용 한도 상향 조정으로 일상 업무 활용 가능
추가 정보
- 모든 평가(evals)는 64K thinking budget, 200K 컨텍스트 윈도우, 기본 effort(high) 설정으로 5회 평균 수행
- SWE-bench Verified, Terminal Bench 등 일부 테스트는 별도 설정 사용
- 관련 연구 및 세부 결과는 Claude Opus 4.5 시스템 카드에서 확인 가능
관련 소식
- Claude, Microsoft Foundry 및 Microsoft 365 Copilot에 통합
-
Microsoft·NVIDIA·Anthropic 간 전략적 파트너십 체결
- Anthropic은 Azure 컴퓨팅 용량 300억 달러 규모 구매 및 최대 1GW 추가 계약 계획
- 르완다 정부 및 ALX와 협력, 아프리카 지역 AI 교육 확대