6P by dunward | ★ favorite | 댓글 1개

Anthropic이 2026년 7월 24일, Claude Opus 5를 공개했습니다. Opus 티어의 "세대 교체급" 개선 모델로, Fable 5(프론티어 모델)에 근접한 지능을 절반 가격에 제공하는 것이 핵심 포지셔닝입니다.

핵심 요약

  • 포지셔닝: Fable 5의 프론티어급 지능에 근접하면서 가격은 절반. Claude Max의 새 기본 모델이자 Claude Pro에서 사용 가능한 가장 강력한 모델로 지정됨.
  • 벤치마크: Frontier-Bench, GDPval-AA 등 코딩·지식노동 평가에서 신규 SOTA 달성. 다만 사이버보안 작업에서는 여전히 Mythos 5(Anthropic 최상위 모델)에 뒤처짐.
  • 코딩 성능: Frontier-Bench v0.1에서 전 모델 중 최고 성능, Opus 4.8 대비 2배 이상 향상(비용은 더 낮음). CursorBench 최고 효율 설정에서는 Fable 5 최고점 대비 0.5% 이내 차이를 절반 비용으로 달성.
  • 지식노동/문제해결: ARC-AGI 3에서 차순위 모델 대비 3배 점수, Zapier AutomationBench에서 차순위 대비 약 1.5배 통과율, OSWorld 2.0(컴퓨터 사용 벤치마크)에서 Fable 5 최고 기록을 3분의 1 수준 비용으로 상회.
  • 과학 연구: 생명과학 전 평가에서 Opus 4.8 대비 개선. 유기화학(분광 데이터로 분자구조 추론)에서 +10.2%p, 단백질 서열-기능 예측에서 +7.7%p.
  • 작업 스타일: 자체 검증·반복 능력이 크게 강화됨. 시각 정보 없이 도면만으로 3D CAD 모델을 코드로 재구성하거나, 커뮤니티 패치가 놓친 근본 원인을 찾아 수정하는 등의 사례가 소개됨.
  • 정렬(Alignment): 자체 행동 감사에서 역대 가장 정렬이 잘 된 모델로 평가됨. Opus 4.8, Sonnet 5, Fable 5보다 기만 행동 비율이 낮고, 비가역적 위험 행동 회피 능력도 최고 수준.
  • 안전성: 생물학·공격적 사이버보안 분야에서는 Mythos 5보다 뒤처짐. 취약점 "탐지"는 Mythos 5와 비슷한 수준이지만 "익스플로잇 개발" 능력은 크게 낮음 (의도적으로 사이버 작업에 대한 학습을 배제한 결과).
  • 안전장치: Fable 5 대비 사이버 분류기 개입이 약 85% 적음. 소스코드 취약점 탐지는 허용하되 바이너리 기반 스캐닝·침투테스트·익스플로잇 생성은 차단. 생물학 관련 요청 중 Fable 5에서 차단되던 것들이 이제 Opus 5로 라우팅됨.

가격 및 제공

  • 오늘부터 전 플랫폼에서 사용 가능, API는 claude-opus-5
  • 가격: 100만 토큰당 입력 $5 / 출력 $25 (Opus 4.8과 동일)
  • Fast 모드 제공 (기본 대비 약 2.5배 속도, 가격은 2배)
  • 데이터 보존 요구사항 없음 (일반 사용 기준)

베타 동시 출시 2가지

  • 대화 중 툴 변경: 프롬프트 캐시를 무효화하지 않고 대화 중간에 사용 가능한 도구를 변경 가능
  • 자동 폴백: 안전 분류기에 걸린 요청을 자동으로 다른 모델로 라우팅 (기본값으로 차단 대신 최선의 가용 모델 사용)

GN⁺ 추가 요약

Neo가 원문을 바탕으로 추가 정리했습니다

  • Fable 5에 가까운 지능을 절반의 작업당 비용으로 제공하며, Claude Max의 기본 모델이자 Claude Pro의 최고 성능 모델로 제공됨
  • Frontier-Bench와 GDPval-AA 등 코딩·지식 업무 평가에서 최고 수준을 기록했고, ARC-AGI 3 점수는 차순위 모델의 3배에 달함
  • 작업을 스스로 검증하고 성공할 때까지 반복해 컴퓨터 비전 파이프라인 구축, 오픈소스 버그의 근본 원인 수정, 시장 데이터 피드와 테스트 하네스 구현까지 수행함
  • 입력 100만 토큰당 $5, 출력 100만 토큰당 $25로 Opus 4.8과 가격이 같으며, 약 2.5배 빠른 Fast mode는 기본 가격의 2배로 제공됨
  • 위험한 이중용도 역량은 Mythos 5보다 낮으며, 취약점 발견은 허용하되 바이너리 스캔·침투 테스트·익스플로잇 생성은 차단하고 표시된 요청에는 Opus 4.8 자동 대체를 적용할 수 있음

성능과 비용 효율

  • Claude Opus 5는 이전 모델인 Opus 4.8과 같은 가격으로 더 높은 성능을 제공함
    • effort 설정을 조절해 지능을 우선하거나 토큰을 절약하는 더 빠르고 저렴한 실행을 선택할 수 있음
    • Claude Max의 기본 모델이며 Claude Pro에서 가장 강력한 모델로 제공됨
  • Frontier-Bench v0.1에서 다른 모든 모델을 앞섰고, 더 낮은 작업당 비용으로 Opus 4.8 성능의 2배를 넘음
    • mini-SWE-agent 하네스와 GKE 백엔드에서 작업당 5회 시도의 평균 보상으로 측정한 내부 실행 결과임
    • Opus 5와 Fable 5가 안전 분류기 때문에 거부한 요청에는 Opus 4.8을 대체 모델로 사용함
  • CursorBench 3.2의 max effort에서는 Fable 5 최고 점수와 0.5% 이내 차이를 보이면서 작업당 비용은 절반임
    • high, xhigh, max effort 모두 같은 비용 기준으로 다른 모든 모델보다 높은 성능을 기록함
  • 지식 업무와 문제 해결 평가에서도 높은 비용 효율을 보임
    • ARC-AGI 3에서는 새로운 문제를 해결하는 점수가 차순위 모델의 3배임
    • Zapier AutomationBench에서는 같은 작업당 비용 기준 통과율이 차순위 모델의 약 1.5배이며, 최저 effort에서도 다른 모든 모델보다 많은 작업을 통과함
    • OSWorld 2.0에서는 모든 비용 구간에서 다른 모델을 앞섰고, Fable 5 최고 결과를 약 3분의 1을 조금 넘는 비용으로 능가함

과학 연구와 시각 결과

  • 구조생물학·유기화학·생물정보학을 포함한 모든 생명과학 평가에서 Opus 4.8보다 높은 성능을 기록함
    • 분광 데이터로 분자 구조를 추론하는 내부 유기화학 벤치마크에서는 10.2%포인트 높음
    • 단백질 서열 변이가 기능에 미치는 영향을 예측하는 작업에서는 7.7%포인트 높음
  • 이전 모델보다 훨씬 강한 시각적 결과물을 생성할 수 있음

작업 검증과 자율적 반복

  • 결과를 직접 검증하고 성공할 때까지 신중하게 반복하는 능력이 강화됨
  • Frontier-Bench의 FreeCAD 작업에서는 기계 부품 도면을 직접 볼 수 없는 조건에서 자체 컴퓨터 비전 파이프라인을 작성해 원시 픽셀로 형상을 추출하고 3D 부품을 재구성함
    • 여러 차례 반복해 성공했지만 같은 조건의 경쟁 모델은 5회 시도 후에도 해결하지 못함
  • 널리 쓰이는 오픈소스 패키지 관리자의 실제 버그에서는 근본 원인을 찾아 커뮤니티 패치가 놓친 경계 사례까지 수정함
    • 경쟁 모델은 표면적인 증상만 고친 뒤 버그가 해결됐다고 판단함
  • 한 트레이딩 회사 엔지니어는 단일 세션에서 새 거래소용 시장 데이터 피드를 구축함
    • 이전 모델들은 엔지니어가 상세한 계획을 제공해도 작업을 완료하지 못했음
    • 검증할 실시간 피드가 없자 자체 테스트 하네스를 만들어 거래소 데이터를 올바르게 파싱하는지 확인함

초기 사용자의 코딩·에이전트 평가

  • Devin의 FrontierCode 1.1에서는 절반의 비용으로 Fable 수준에 근접했고, 어려운 디버깅과 근본 원인 분석에서 강점을 보임
  • CursorBench에서는 Fable 5에 약간 못 미치면서 유사한 행동 특성을 보였고, Opus의 속도와 비용으로 Fable 5에 가까운 지능을 제공함
  • Zapier AutomationBench에서는 이전 Claude 모델보다 토큰을 더 쓰지 않고 1위를 기록함
    • 계정 상태 워크북에서 위험 고객 식별, 담당자 알림, 유지 조직용 요약까지 이탈 방지 절차를 끝까지 실행해 100% 통과
  • 유전체 분석에서는 적절한 통계 검정으로 교란 요인을 배제하고, 독립적인 방법으로 결과를 교차 검증하며 긴 다단계 분석을 유지함
  • Lovable 내부 평가에서는 가장 어려운 에이전트 코딩 작업이 Opus 4.7보다 22% 향상됐고 실행별 편차도 줄어듦
  • 같은 풀스택 앱 구축에서 Opus 계열 중 가장 뛰어난 애니메이션·게임·3D 작업을 생성했으며, Opus 4.5 이후 가장 큰 개선으로 평가받음
  • 개방형 분석에서는 어렵고 모호한 과제일수록 Opus 4.8 대비 향상이 컸고, 답변은 더 명확하고 간결해졌으며 높은 effort에서 효율도 개선됨
  • 개발 환경을 관리할 때는 자체 모니터를 만들고 각 환경을 조작하면서 사람의 판단이 필요한 사안만 요청함
  • Fundamental Research Assistant 코드베이스에서는 피드백에 맞춰 대규모 변경을 수행하고, 보통 여러 조각으로 나눌 작업을 하나의 에이전트 워크플로에서 처리함
  • 프런트엔드 평가에서는 데스크톱과 휴대전화 너비로 페이지를 직접 열어 모바일 화면 아래에 숨은 상품과 화면 밖 결제 버튼을 찾아 수정함
  • PR 인계 전에는 브랜치·템플릿·테스트 영향을 확인했으며, 이전 모델처럼 검증 전에 게시를 서두르지 않음
  • 재설계 과정에서는 제안된 설계의 장점과 단일 쟁점을 구분하고, 결함을 고치면서 장점을 유지하는 절충안을 제안함
  • 코드 변경에서는 죽은 코드 없이 간결한 diff를 만들고 코드베이스 특유의 미묘한 위험을 더 잘 찾아 프로덕션 워크로드에 채택됨
  • 통합 에이전트 플랫폼 Cosmos의 여러 사용 사례와 코드 리뷰가 Opus 5로 이전될 예정임
  • JetBrains 평가에서는 코드를 작성하기 전에 더 깊게 검토하고 계획 단계에서 논리적 오류를 찾아내며, 답이 작동하는지만이 아니라 올바른 이유까지 판단함
  • 트레이딩 벤치마크에서는 Opus 계열 중 가장 높은 성능을 기록하면서 Opus 4.8 대비 추론 토큰을 약 7분의 1, 지연 시간을 절반 미만으로 줄임

기업·전문 업무 평가

  • 금융 연구에서는 수치 추론, 표 작업, 정밀한 비판적 사고가 Opus 4.8보다 향상됨
  • Box 내부 평가에서는 전문 기업 콘텐츠 분석 성능이 Opus 4.8보다 8% 높음
    • 데이터 분석 워크플로는 11%, 실사는 17% 향상됨
    • 기술·의료·공공 부문에서 사용하는 업무를 대상으로 함
  • 어려운 금융 모델링에서는 effort 전반에 걸쳐 정확도가 평균 9%포인트 높아졌고, 대화 턴과 도구 호출은 3분의 1 줄었으며 소요 시간은 60% 감소
  • 법률 에이전트 업무에서는 기업 지배구조와 중재 분야의 향상이 두드러짐
    • Opus 4.8의 max reasoning 대비 평균 26% 적은 토큰으로 비슷한 품질을 유지함
  • 첫 시도의 계약 수정안에서는 테스트한 모델 중 최고 점수를 기록했고 Opus 4.8의 거의 2배에 달함
    • NDA 수정도 정확도를 유지하거나 높이면서 더 적은 시간과 반복으로 완료함
  • 긴 작업에서는 전체 프레젠테이션을 만든 뒤 수정하는 능력이 향상됐으며, 시각적 이해·서식·슬라이드 오류 측면에서도 더 나은 결과를 냄

정렬과 위험 역량

  • 배포 전 자동 행동 감사에서 Opus 5는 Anthropic 모델 가운데 가장 높은 정렬 수준을 보임
    • Claude의 헌법을 Opus 4.8, Sonnet 5, Fable 5보다 잘 준수함
    • 기만적 행동 비율과 오용 유도에 대한 취약성이 가장 낮음
    • 되돌리기 어려운 부작용을 낳을 수 있는 무모한 행동도 가장 잘 회피함
  • 위험한 이중용도 역량의 최전선을 높이지 않았으며, 민간·정부 파트너와 수행한 평가에서 생물학 연구와 공격적 사이버 보안 모두 Mythos 5보다 낮은 성능을 보임
    • 자세한 평가는 System Card에서 확인할 수 있음
  • Opus 4.8과 마찬가지로 사이버 작업을 의도적으로 학습하지 않았지만, 일반 역량 향상에 따라 관련 성능도 크게 개선됨
    • 취약점 발견은 Mythos 5에 근접함
    • 발견한 취약점을 실제 위협으로 전환하는 익스플로잇 개발은 Mythos 5보다 크게 뒤처짐
  • OSS-Fuzz 평가에서는 Opus 5와 Mythos 5가 비슷한 성공률로 취약점을 찾았지만, 익스플로잇 개발 점수는 Opus 5가 훨씬 낮음

사이버 보안과 생물학 보호 장치

  • 보호 장치는 사이버 보안과 생물학의 유익한 활용을 허용하도록 설계됐으며, 좁은 범위의 사이버 작업에 더 강한 제한을 추가한 점을 제외하면 Opus 4.8과 비슷함
  • 사이버 분류기는 Fable 5보다 상대적으로 덜 제한적임
    • 소스 코드의 취약점 발견은 허용함
    • 악의적 행위자와 연관될 가능성이 높은 바이너리 기반 취약점 스캔, 침투 테스트, 익스플로잇 생성은 차단함
    • Anthropic의 테스트에서는 Fable 5보다 분류기 개입이 약 85% 적을 것으로 예상됨
  • Claude.ai, Claude Code, Claude Cowork에서 표시된 요청은 기본적으로 Opus 4.8로 대체되며 API에서도 이를 활성화할 수 있음
  • Cyber Verification Program에 참여 중인 기업과 연구자는 보안 제한이 적은 Opus 5를 즉시 사용할 수 있음
  • 생물학 분야에서는 Opus 4.8과 비슷한 보호 장치를 유지하면서 일반 제공 모델 중 가장 강력한 과학 연구 모델이 됨
    • 장시간 자율 연구에는 여전히 중요한 한계가 있으며, 이 유형의 생물학 작업에서는 Mythos 5가 더 강함
    • Fable 5에서 차단되는 생물학 요청은 이제 Opus 4.8 대신 Opus 5로 전달

가격과 개발자 기능

  • 모든 플랫폼에서 제공되며 Claude API의 모델 식별자는 claude-opus-5
    • 입력 100만 토큰당 $5, 출력 100만 토큰당 $25로 Opus 4.8과 같음
    • 일반 접근에는 이전 Opus 모델과 마찬가지로 데이터 보존 요구사항이 없음
  • Fast mode는 기본 속도의 약 2.5배로 실행됨
    • Claude Platform에서는 기본 가격의 2배이며 Claude Code에서는 사용 크레딧으로 제공됨
  • Claude Platform의 베타 대화 중 도구 변경을 사용하면 프롬프트 캐시를 무효화하지 않고 대화 도중 Claude가 사용할 도구를 바꿀 수 있음
  • API의 베타 자동 대체를 활성화하면 Opus 5 또는 Fable 5 요청이 안전 분류기에 표시됐을 때 다른 모델로 자동 전달됨
    • 요청을 차단하는 대신 기본적으로 사용 가능한 최적 모델로 라우팅함
  • 모델 활용 방법은 Opus 5 프롬프팅 가이드에서 확인할 수 있음

댓글과 토론

Hacker News 의견들
  • 여기서 핵심은 절대 성능보다 조직이 30일 데이터 보관 의무 없이 Fable급 모델을 쓸 수 있게 됐다는 것임
    Opus 5는 이전 Opus처럼 일반 접근에 데이터 보관 요건이 없으며, Fable에 ARC-AGI 점수가 없는 이유도 이 보관 정책 때문임
    https://support.claude.com/en/articles/15425996-data-retenti..., https://www.anthropic.com/news/claude-opus-5, https://xcancel.com/arcprize/status/2064399134099153344

    • 작업당 비용도 훨씬 낮고 Sonnet보다도 저렴해 보임
    • Opus 5가 출시를 위해 다듬어지고 있다는 소문이 맞았으며, GDPval-AA v2 성능도 크게 개선돼 지식 노동 기반 에이전트 작업에 유용함
      Fable 5를 크레딧 전용으로 유지한 것도 반가우며, 앞으로 최상위 모델은 종량제 API나 크레딧 뒤에 두고 다른 모델은 월 구독으로 보조하는 방식이 늘어날 듯함
    • Fable의 가드레일과 관련해 볼 만한 내용임: https://x.com/cheatyyyy/status/2080693704290140330
    • 회사는 데이터 비보관 엔터프라이즈 라이선스를 쓰는데 Claude가 과거 대화를 기억함
      그렇다면 정보가 어딘가에는 저장되는 셈이라 데이터 보관 방식을 이해하기 어려움
    • 문서가 2주 넘게 전에 갱신됐을 뿐, ZDR 호환성을 명시한 내용을 찾을 수 없어 추가 확인이 필요함
  • 현재 이미지→HTML 변환을 시험 중인데, 기존에는 Fable이 최고였고 Gemini 3.1 Pro가 의외로 2위였음
    Opus 5는 Fable보다 원본 디자인을 더 정확히 따르며, 버튼을 알약형이 아닌 둥근 직사각형으로 구현하고 생성 이미지도 원본에 더 가까움
    원본: https://image.non.io/73e239a3-880f-4793-b65f-4810be2d9378.we...
    Opus 5: https://html.non.io/solaraOpus/
    Fable 5: https://html.non.io/solara/

  • 수많은 출시를 보면 모델 라우팅이 AI에서 가장 빠르게 성장하는 분야인 것도 놀랍지 않음
    10개가 넘는 회사마다 다양한 양식과 크기의 모델, 사고 수준, 에이전트·Pro·고속 모드, 표준·유연·일괄 실행, 서로 다른 입력·출력·캐시 토큰 가격이 존재함
    프롬프트를 가장 적합하고 경제적인 조합으로 보내주는 회사들이 모델 개발사가 외면하는 공백에서 큰 가치를 가져가고 있음

    • 모델 라우팅은 결국 모델 자체가 더 잘 수행하게 될 것이며, 라우팅 과정에서 문맥이 사라져 비용과 불확실성이 커짐
      이는 쓰라린 교훈(Bitter Lesson)의 반복이고, 선도 기업들이 결국 이 기능을 직접 제공할 듯함
    • 개발사들은 이 공백을 애써 외면하는 듯함
      대부분의 사무 업무에는 초강력 AGI가 필요 없어서 트래픽이 값싼 모델로 향하지만, 선도 연구소들은 강력한 AGI와 사무직 대체를 모두 자신들만 할 수 있다고 포지셔닝함
      저가 모델로의 라우팅은 그 서사에 구멍을 낼 가능성이 큼
    • 고객이 누구인지 궁금함
      어떤 작업이든 최신 최고 성능 모델이 아니면 받아들이기 어렵고, 필요한 규칙은 정액제 할당량이 남은 가장 강력한 모델을 고르는 것뿐임
    • 코딩에서는 라우터를 신뢰하기 어렵고, 실제로 큰 금액을 절감한다는 증명이 필요함
      비용을 아끼는 대신 심각도와 빈도를 측정할 수 없는 버그를 감수해야 하며, 모든 추론을 최상위 모델에 맡기는 보험의 가치와 나중에 수정할 비용도 알 수 없음
      프로젝트 수준에서는 다른 모델을 썼을 때 코드가 얼마나 달라졌을지 시험할 방법도 없음
    • 이 영역이 별도 라우터 업체보다 클라이언트의 실행 프레임워크에 귀속될 가능성도 있어 보임
  • 190쪽가량의 PDF를 읽기 싫다면 이 블로그 글이 있음: https://www.anthropic.com/news/claude-opus-5

    • Fable보다 수치가 약간 낮은데도 Opus 5를 에이전트 코딩 최고 모델로 강조한 점이 재미있음
    • 이 벤치마크를 보니 Anthropic이 Fable을 Max 구독에서 계속 제외한 이유를 알 듯함
    • FrontierCode v1.1 데이터에서는 왜 Opus 5가 Fable 5보다 높게 나오는지 궁금함
    • 언어 모델이 긴 문서를 만들고 사용자는 읽지도 않은 채 다시 언어 모델로 요약하는 상황의 완벽한 예처럼 보임
  • Opus 5와 Fable 5의 문체를 비교하면, Fable이 벗어났던 Claude 특유의 표현을 Opus 5는 4.8처럼 계속 사용함
    “carry the argument”, “worth stating plainly”, “and the trap”, “The X matters more”, “move” 같은 표현이 반복되므로 ‘짜증 나는 영어’ 벤치마크가 필요함
    Fable 5 Max: https://gist.github.com/deet/3d97f854b48eac6658d642fa18bb24d...
    Opus 5 Max: https://gist.github.com/deet/1a43693a732dfccb4d0d914bfc42692...

    • Fable은 그런 표현을 덜 쓸지 몰라도 여전히 글이 형편없고 읽기 피곤함
    • Opus 4.8과 Fable 5는 문체가 거슬려 학습용으로 쓰기 어려웠고, GPT 5.6 Sol이 훨씬 나았음
    • Claude만의 식별 가능한 문체가 있으면 AI 글을 인간이 쓴 것처럼 속이기 더 어려워지므로 오히려 좋음
    • 4.6은 4.8보다 문체 지시를 잘 따랐으며, 5.0은 더 지켜봐야 함
      Claude 특유의 문체는 대화나 작업을 ‘선제적으로’ 진전시키려는 성향에서 일부 비롯되는 듯하고, 프롬프트별 문체 범위를 정량화하는 벤치마크도 유용할 듯함
    • Opus 5는 원래 Opus 4.8을 바탕으로 Kimi K3의 긴 추론 기법을 적용한 모델 같으며, 어떤 형태로도 Fable은 아닌 듯함
  • Anthropic의 55.7%와 OSWorld 2.0 논문의 약 21%는 서로 다른 지표였음
    Opus 4.8은 약 5개 중 1개 작업을 완전히 성공해 완료율 20.6% 를 기록했고, 나머지에서도 부분 점수를 얻어 부분 점수 54.8% 를 달성함
    다만 이런 지표 차이 때문에 논문 간 벤치마크를 합리적인 오차 범위에서 비교할 수 있는지 의문이 생김: https://arxiv.org/pdf/2606.29537

    • 완료율은 100% 성공한 작업의 비율이고 점수율은 가능한 부분 점수 중 획득한 비율임
      벤치마크 제작자는 개선 여지를 보여주는 낮은 수치를, 모델 제작자는 역량을 강조하는 높은 수치를 선호하지만 Anthropic의 55.7%와 논문의 54.8%는 사실상 같은 결과임
    • 언어 모델은 보통 비결정적이라 어느 정도 분산은 예상되지만, 이 정도 차이라면 추가 해명이 필요함
  • “Opus 5가 전반적으로 Fable 5보다 뛰어나지 않다”고 해놓고 블로그에서는 대부분의 벤치마크에서 더 좋다고 나열해 의사소통이 혼란스러움
    시스템 카드도 AI 연구개발 능력이 제한 없는 Fable로 여겨지는 Claude Mythos 5와 비슷하다고 밝힘

    • 이번에는 강력함을 강조하면서도 정부의 추가 감시는 피하려는 절충으로 보임
      Opus 5는 소프트웨어 취약점 악용을 학습하지 않아 발견 능력은 Mythos 5에 근접하지만, 실제 사이버 위협으로 전환하는 악용 능력은 크게 뒤처짐
    • Fable은 지능적이지만 벤치마크에 최적화되지 않았고, Opus는 덜 지능적이지만 벤치마크 최적화를 한 것으로 설명할 수 있음
    • AI 연구개발 역량은 비슷하지만 Fable 논란을 일으킨 해킹 능력은 같지 않다는 뜻으로 보이나 표현이 혼란스러움
    • 정부 감시를 피하려고 Fable보다 낫다고 명시하지 않는 것일 수도 있음
  • Fable보다 훨씬 우수해 보이는 모델도 Anthropic의 종말론적 홍보가 없으니 별문제 없이 출시됐음
    이론상 Anthropic 기준으로 AGI급이어야 하지만 현실은 평범한 금요일일 뿐임

    • 보고서의 안전장치 부분을 읽으면 이유를 알 수 있음
      이 모델들은 강하게 보호되며, 안전장치가 없는 Mythos는 그래서 출시하지 못했다고 했음
      OpenAI도 안전장치 없는 모델이 HuggingFace 서버에 침입했다고 발표했을 때 비슷했음
    • “다음 모델이 AGI”라는 과장은 줄어든 듯함
      GPT-6가 여름에 나온다 해도 이제 AGI를 기대하는 사람이 거의 없어 과장 주기를 어떻게 유지할지 궁금함
    • 실제 종말이 일어나지 않으면 경고가 불만이라는 뜻인지, 종말에 관한 빗나간 예측을 홍보로 보는 것인지 궁금함
    • Fable이 이미 최전선을 열었고 Opus 5는 따라잡은 것뿐임
  • Opus 5가 한 번의 세션으로 새 거래소용 시장 데이터 피드와 검증 도구를 만들었다는 홍보 사례는, 재미있게도 트레이딩 회사 인턴에게 흔히 주는 프로젝트임

  • Frontier Code 그래프에서 중간 사고 모드의 작업당 효율이 압도적으로 높고, 추론량을 늘릴수록 평가 결과가 크게 나빠지는 이유가 궁금함
    최대 수준에서 약간 하락하는 경우는 있지만 이 정도는 이례적임: https://imgur.com/a/Nv8V7Ry

    • 지표가 작업당 비용이므로 더 잘하려다 토큰을 너무 빨리 태우는 과잉 설계일 수 있음
      주관적으로는 지난주 Opus 4.8보다 오늘의 Opus 4.8 Medium과 발표 후 Opus 5 Medium이 5시간 사용 구간에서 더 효율적으로 느껴짐
    • 높은 추론 수준에서는 출력이 길어지고 무관한 세부 사항에 과도하게 집중해 실수할 표면적이 커질 수 있음
      에이전트보다 프롬프트 위주로 사용하면 이런 한계가 보이며, 중간 수준이 더 균형 잡혔을 가능성이 있음
    • 벤치마크가 명령 실행 횟수나 실제 경과 시간을 벌점 처리한다면 높은 추론 노력이 낮은 점수로 이어질 수 있음
    • 특정한 이완 수준에서 성능이 오르는 Ballmer Peak와 비슷할 수도 있음
    • 중간에 떨어졌다가 최대 수준에서 다시 오르는 형태도 흥미로움
      지나친 생각은 나쁘지만 극단적으로 더 생각하면 다시 좋아지는 셈인지 의문임