- Anthropic이 Claude Opus 4와 Claude Sonnet 4를 공개하며, 코딩·고급 추론·AI 에이전트 작업을 차세대 Claude의 중심 성능 영역으로 내세움
- 두 모델은 즉시 응답과 깊은 추론을 오가는 하이브리드 모델이며, 확장 사고 중 웹 검색 같은 도구 사용과 병렬 도구 실행을 지원함
- Opus 4는 SWE-bench 72.5%, Terminal-bench 43.2% 를 기록했고, Sonnet 4는 SWE-bench 72.7% 로 Sonnet 3.7 대비 코딩·추론·지시 이행을 개선함
- Claude Code는 정식 출시되어 터미널, VS Code, JetBrains, GitHub Actions, SDK로 확장되며 PR 리뷰 대응·CI 오류 수정·코드 변경까지 맡을 수 있음
- API에는 코드 실행 도구, MCP connector, Files API, 최대 1시간 프롬프트 캐시가 추가되어 개발자가 더 강력한 AI 에이전트를 만들 수 있음
Claude 4 모델 공개
- Anthropic은 Claude Opus 4와 Claude Sonnet 4를 Claude의 차세대 모델로 공개함
- 두 모델의 핵심 초점은 코딩, 고급 추론, AI 에이전트 작업임
- Claude Opus 4는 복잡하고 오래 실행되는 작업과 에이전트 워크플로에서 지속 성능을 내는 코딩 모델임
- Claude Sonnet 4는 Claude Sonnet 3.7의 업그레이드로, 코딩·추론 성능과 지시 이행 정확도를 높임
제공 방식과 가격
- Claude Opus 4와 Sonnet 4는 거의 즉각적인 응답과 더 깊은 추론을 위한 확장 사고 모드를 모두 제공함
- Pro, Max, Team, Enterprise Claude 플랜에는 두 모델과 확장 사고가 포함됨
- Sonnet 4는 무료 사용자도 사용할 수 있음
- 두 모델은 Anthropic API, Amazon Bedrock, Google Cloud Vertex AI에서 제공됨
- 가격은 이전 Opus·Sonnet 모델과 동일함
- Opus 4: 입력/출력 100만 토큰당 $15/$75
- Sonnet 4: 입력/출력 100만 토큰당 $3/$15
Opus 4의 코딩·장기 작업 성능
- Claude Opus 4는 Anthropic의 가장 강력한 모델로, SWE-bench 72.5%, Terminal-bench 43.2% 를 기록함
- 수천 단계의 집중 작업이 필요한 장기 작업에서 지속 성능을 내며, 몇 시간 동안 연속 작업할 수 있음
- Cursor는 Opus 4를 코딩에서 최첨단 모델로 보고, 복잡한 코드베이스 이해에서 큰 진전이 있었다고 평가함
- Replit은 여러 파일에 걸친 복잡한 변경에서 정밀도가 높아졌다고 밝힘
- Block은 자사 에이전트 codename goose에서 Opus 4가 편집·디버깅 중 코드 품질을 높이면서 성능과 신뢰성을 유지한 첫 모델이라고 설명함
- Rakuten은 까다로운 오픈소스 리팩터링 작업을 Opus 4가 7시간 독립 실행하며 지속 성능을 보였다고 검증함
- Cognition은 Opus 4가 이전 모델이 놓친 중요한 작업과 다른 모델이 해결하지 못한 복잡한 과제에 강하다고 평가함
Sonnet 4의 위치
- Claude Sonnet 4는 Sonnet 3.7 대비 개선된 모델이며, SWE-bench에서 72.7% 를 기록함
- 내부·외부 사용 사례를 위한 성능과 효율의 균형을 목표로 하며, 구현 제어를 위한 조향성도 향상됨
- 대부분의 영역에서 Opus 4와 같지는 않지만, 능력과 실용성의 조합을 제공함
- GitHub는 Sonnet 4를 GitHub Copilot의 새 코딩 에이전트를 구동하는 모델로 도입할 예정임
- Manus는 복잡한 지시 이행, 명확한 추론, 미적 결과물에서 개선을 강조함
- iGent는 자율적인 다기능 앱 개발과 코드베이스 탐색이 개선됐고, 탐색 오류가 20%에서 거의 0으로 줄었다고 밝힘
- Sourcegraph는 Sonnet 4가 더 오래 방향을 유지하고, 문제를 더 깊게 이해하며, 더 우아한 코드 품질을 제공한다고 평가함
- Augment Code는 더 높은 성공률, 더 정밀한 코드 편집, 복잡한 작업에서의 신중함을 이유로 Sonnet 4를 기본 모델의 최우선 선택으로 삼음
모델 기능 개선
- 두 모델은 확장 사고 중에도 도구를 사용할 수 있음
- 예시로 web search를 사용할 수 있음
- Claude는 추론과 도구 사용을 번갈아 수행해 응답을 개선할 수 있음
- 병렬 도구 실행과 더 정확한 지시 이행도 지원함
- 개발자가 로컬 파일 접근을 제공하면, 모델은 핵심 사실을 추출·저장해 연속성과 암묵 지식을 유지하는 메모리 기능을 보임
- 지름길이나 허점을 이용해 작업을 끝내는 행동은 Sonnet 3.7 대비 줄어듦
- 특히 지름길과 허점에 취약한 에이전트 작업에서 두 모델은 Sonnet 3.7보다 해당 행동을 할 가능성이 65% 낮음
- Opus 4는 개발자가 로컬 파일 접근을 제공하는 애플리케이션에서 핵심 정보를 담는
memory files를 생성·유지하는 데 강함- 예시로 Pokémon을 플레이하는 동안
Navigation Guide를 생성함 - 장기 작업 인식, 일관성, 에이전트 작업 성능을 개선함
- 예시로 Pokémon을 플레이하는 동안
사고 요약과 Developer Mode
- Claude 4 모델에는 긴 사고 과정을 작은 모델로 압축하는 thinking summaries가 도입됨
- 이 요약은 약 5% 의 경우에만 필요함
- 대부분의 사고 과정은 전체를 표시하기에 충분히 짧음
- 고급 프롬프트 엔지니어링을 위해 원시 사고 사슬이 필요한 사용자는 contact sales를 통해 새 Developer Mode를 문의할 수 있음
Claude Code 정식 출시
- Claude Code는 정식 출시되어 Claude를 터미널, IDE, 백그라운드 실행 워크플로로 확장함
- VS Code와 JetBrains용 새 베타 확장이 Claude Code를 IDE에 직접 통합함
- Claude가 제안한 편집 내용은 파일 안에 인라인으로 표시됨
- 사용자는 익숙한 에디터 안에서 리뷰와 변경 추적을 할 수 있음
- IDE 터미널에서 Claude Code를 실행하면 설치됨
- GitHub Actions를 통한 백그라운드 작업을 지원함
- 확장 가능한 Claude Code SDK도 공개됨
- 개발자는 Claude Code와 같은 핵심 에이전트를 사용해 자체 에이전트와 애플리케이션을 만들 수 있음
- Claude Code on GitHub는 베타로 제공됨
- PR에서 Claude Code를 태그해 리뷰어 피드백에 응답하고, CI 오류를 고치고, 코드를 수정할 수 있음
- Claude Code 안에서
/install-github-app을 실행해 설치함
API와 안전성
- Anthropic API에는 AI 에이전트 개발을 위한 네 가지 새 기능이 추가됨
- 코드 실행 도구
- MCP connector
- Files API
- 최대 1시간 프롬프트 캐시
- Claude 4 모델은 전체 컨텍스트 유지, 긴 프로젝트에서의 집중 유지, 큰 영향을 내는 작업을 향한 단계로 자리 잡음
- 모델에는 위험을 줄이고 안전성을 높이기 위한 광범위한 테스트와 평가가 적용됨
- 더 높은 AI Safety Levels인 ASL-3를 위한 보호 조치가 포함됨
- 사용자는 Claude, Claude Code, 또는 원하는 플랫폼에서 시작할 수 있음
벤치마크 보고 방식
- Claude Opus 4와 Sonnet 4는 하이브리드 추론 모델이며, 공개된 벤치마크는 확장 사고 사용 여부와 관계없이 달성한 최고 점수를 표시함
- 확장 사고를 사용하지 않은 결과는 다음 항목임
- SWE-bench Verified
- Terminal-bench
- 확장 사고를 사용한 결과는 최대 64K 토큰까지 사용함
- TAU-bench
- GPQA Diamond
- MMMLU
- MMMU
- AIME
- 확장 사고 없이 측정한 일부 점수도 제공됨
- GPQA Diamond: Opus 4 74.9%, Sonnet 4 70.0%
- MMMLU: Opus 4 87.4%, Sonnet 4 85.4%
- MMMU: Opus 4 73.7%, Sonnet 4 72.6%
- AIME: Opus 4 33.9%, Sonnet 4 33.1%
TAU-bench와 SWE-bench 방법론
- TAU-bench 점수는 Airline과 Retail Agent Policy에 프롬프트 부록을 추가해, Claude가 확장 사고와 도구 사용 중 추론 능력을 더 잘 활용하도록 한 설정에서 얻음
- 모델은 문제 해결 중 일반 사고 모드와 구분되는 방식으로 생각을 적도록 유도됨
- 추가 사고로 인해 단계 수가 늘어날 수 있어 최대 단계 수는 30에서 100으로 증가함
- 대부분의 궤적은 30단계 미만에서 끝남
- 50단계를 넘은 궤적은 하나뿐임
- Claude 4 계열의 SWE-bench에서는 이전 릴리스와 같은 단순 스캐폴드를 계속 사용함
- 도구는 bash 도구와 문자열 치환 방식 파일 편집 도구 두 가지뿐임
- Claude 3.7 Sonnet에서 사용한 세 번째
planning tool은 더 이상 포함하지 않음
- 모든 Claude 4 모델 점수는 전체 500개 문제 기준으로 보고됨
- OpenAI 모델 점수는 477개 문제 부분집합 기준으로 보고됨
- “high compute” 점수는 병렬 테스트 시점 계산과 추가 복잡도를 사용함
- 여러 병렬 시도를 샘플링함
- 저장소의 보이는 회귀 테스트를 깨는 패치를 버림
- 숨겨진 테스트 정보는 사용하지 않음
- 내부 채점 모델로 남은 시도 중 최선 후보를 선택함
- 이 방식의 high compute 점수는 Opus 4 79.4%, Sonnet 4 80.2% 임