- OpenAI가 새로 공개한 GPT‑5.1‑Codex‑Max는 장기적이고 복잡한 개발 작업을 수행하도록 설계된 최신 에이전틱 코딩 모델로, Codex 환경에서 사용 가능
- 새로운 ‘compaction’ 기술을 통해 여러 컨텍스트 윈도우를 넘나들며 수백만 토큰 규모의 프로젝트를 일관되게 처리
- 토큰 효율성이 향상되어 동일한 추론 수준에서 30% 적은 토큰으로 더 나은 성능을 달성하며, 비용 절감 효과 기대
- 장시간 독립적으로 작업하며 24시간 이상 지속되는 리팩터링 및 디버깅 수행 가능
- 보안 샌드박스와 사이버보안 모니터링 체계를 강화해 안전한 AI 코딩 파트너로 발전 중
GPT‑5.1‑Codex‑Max 소개
-
GPT‑5.1‑Codex‑Max는 OpenAI의 새로운 에이전틱 코딩 모델로, 소프트웨어 엔지니어링·수학·연구 등 다양한 분야의 작업을 학습한 추론 기반 모델 업데이트 버전
- Codex CLI, IDE 확장, 클라우드, 코드 리뷰 환경에서 즉시 사용 가능
- API 접근은 곧 제공 예정
- 모델은 속도·지능·토큰 효율성이 향상되어 개발 주기 전반에서 더 신뢰할 수 있는 코딩 파트너 역할 수행
- Compaction 과정을 통해 여러 컨텍스트 윈도우를 넘나들며 수백만 토큰 규모의 작업을 일관되게 처리
프런티어 코딩 성능
- 실제 소프트웨어 엔지니어링 작업(PR 생성, 코드 리뷰, 프런트엔드 코딩, Q&A) 으로 훈련되어 이전 모델 대비 다수의 평가에서 우수한 성능
- Windows 환경에서 작동하는 최초의 Codex 모델이며, Codex CLI 협업 성능 향상을 위한 작업도 포함
- 벤치마크 향상뿐 아니라 실제 사용성에서도 개선된 결과 확인
속도와 비용 효율
- SWE‑bench Verified 기준, 동일한 추론 수준에서 GPT‑5.1‑Codex 대비 30% 적은 토큰 사용으로 더 높은 성능 달성
- ‘xhigh’ 추론 모드는 더 긴 사고 시간을 통해 품질 향상을 제공하며, 일반 작업에는 ‘medium’ 모드 권장
- 토큰 효율성 향상은 개발자 비용 절감으로 이어질 것으로 예상
- 예: GPT‑5.1‑Codex‑Max는 유사한 기능과 미학을 가진 프런트엔드 디자인을 훨씬 낮은 비용으로 생성
장기 실행 작업
-
Compaction 기능으로 컨텍스트 한계를 넘는 복잡한 리팩터링과 장기 에이전트 루프 수행 가능
- 세션이 한계에 도달하면 자동으로 압축(compact)하여 진행 중인 작업을 유지한 채 새 컨텍스트 확보
- 내부 평가에서 24시간 이상 지속 작업 수행 사례 확인
- 테스트 실패 수정과 반복 구현을 통해 최종적으로 성공적 결과 도출
- 장기적 일관성 유지 능력은 일반적이고 신뢰할 수 있는 AI 시스템으로 나아가는 핵심 기반
안전하고 신뢰할 수 있는 AI 에이전트 구축
- 장기 추론 평가에서 성능이 크게 향상되어, 사이버보안 및 장기 코딩 과제에서 개선된 결과 제공
-
Cybersecurity Preparedness Framework 기준 ‘High’ 수준에는 미달하지만, 현재까지 배포된 모델 중 가장 강력한 사이버보안 성능 보유
- Aardvark 프로그램 등을 통해 방어적 활용 강화
- 사이버보안 전용 모니터링으로 악용 시도를 탐지·차단하며, 의심 활동은 정책 검토 시스템으로 전달
- Codex는 기본적으로 보안 샌드박스에서 실행되며, 파일 접근과 네트워크 사용이 제한됨
- 인터넷 접근 시 프롬프트 인젝션 위험 존재
- 개발자는 배포 전 에이전트의 작업 검토 필요
- Codex는 터미널 로그, 도구 호출, 테스트 결과를 기록하며, 인간 리뷰를 대체하지 않고 보조 역할 수행
- 사이버보안 기능은 방어와 공격 모두에 활용될 수 있어, 점진적 배포와 보호 조치 강화를 병행
제공 및 배포
- GPT‑5.1‑Codex‑Max는 ChatGPT Plus, Pro, Business, Edu, Enterprise 플랜의 Codex에서 사용 가능
- Codex CLI를 API 키로 사용하는 개발자에게도 곧 제공 예정
- 오늘부터 Codex 내 기본 모델로 GPT‑5.1‑Codex‑Max가 GPT‑5.1‑Codex를 대체
- GPT‑5.1은 범용 모델이며, Codex‑Max는 에이전틱 코딩 작업 전용으로 권장
결론
- GPT‑5.1‑Codex‑Max는 장기 코딩 작업 지속성, 복잡한 워크플로 관리, 고품질 구현에서 큰 진전
- CLI, IDE 확장, 클라우드 통합, 코드 리뷰 도구의 개선과 결합되어 엔지니어링 생산성 70% 향상
- OpenAI 내부 엔지니어의 95%가 Codex를 주간 사용
- 에이전트 기능의 확장과 함께, 개발 생산성의 새로운 단계로 진입
부록: 모델 평가 결과
- SWE‑bench Verified (n=500) : GPT‑5.1‑Codex 73.7% → GPT‑5.1‑Codex‑Max 77.9%
- SWE‑Lancer IC SWE: 66.3% → 79.9%
- Terminal‑Bench 2.0: 52.8% → 58.1%