- OpenAI는 모델·추론 시스템·에이전트 하네스의 효율 향상을 가격과 처리 속도에 반영해 기업용 AI의 달러당 성능을 높임
- 7월 30일부터 Luna 가격은 80%, Terra 가격은 20% 인하되며, API 100만 토큰당 Luna는 입력 $0.20·출력 $1.20, Terra는 입력 $2·출력 $12가 적용됨
- Luna는 1년 전 최첨단급 모델과 비슷한 성능을 작업당 약 6%의 비용과 거의 9배의 속도로 제공하며, Agents’ Last Exam에서는 Fable 5보다 높은 성능과 약 99% 낮은 추정 작업 비용을 기록함
- GPT‑5.6 Sol의 Fast mode는 기존 Priority Processing을 대체하고, 지능 수준을 유지하면서 Standard 대비 최대 2.5배 빠른 속도를 2배 가격에 제공함
- 기업은 계획과 불확실성 해소에는 Sol을, 명확한 구현과 테스트에는 Luna를 배치하는 식으로 단계별 평가를 거쳐 지능·속도·비용의 균형을 조정할 수 있음
Luna·Terra 가격 인하와 Sol 속도 개선
- GPT‑5.6의 실행 효율 향상이 Luna·Terra의 가격 인하와 Sol의 API 처리 속도 개선으로 이어짐
- 가장 빠르고 저렴한 모델인 Luna는 80%, 일상 업무용 균형 모델인 Terra는 20% 저렴해짐
- Codex와 ChatGPT Work 유료 구독에서도 두 모델의 사용량이 더 적은 크레딧으로 계산됨
- 구독 가격과 할당량 예산 자체는 바뀌지 않음
- Luna는 도구를 사용해 여러 단계의 워크플로를 완료할 수 있어, 높은 품질이 필요한 대량 작업의 운영 비용을 낮춤
- Sol 가격은 변경되지 않음
작업 결과에 맞춘 모델 선택
- 효율적인 AI 활용을 위해서는 작업의 중요도·오류 비용·긴급성·규모에 맞춰 지능, 속도, 신뢰성, 비용의 균형을 정해야 함
- 같은 워크플로에서도 단계마다 최적점이 달라질 수 있음
- Luna는 1년 전 최첨단급이었던 모델과 비슷한 성능을 작업당 약 6%의 비용과 거의 9배의 속도로 제공함
- 전문 업무를 측정하는 Agents’ Last Exam에서는 Fable 5보다 높은 성능을 보이면서 추정 작업당 비용을 약 99% 절감함
- 기업은 필요한 결과와 품질 기준을 먼저 정하고, 평가를 통해 추가 지능이 결과를 실질적으로 개선하는 구간과 저비용 처리가 같은 품질을 내는 구간을 구분할 수 있음
- 코딩 워크플로에서는 Sol이 불확실성을 해소하고 계획을 수립함
- 명확히 정의된 변경의 구현, 테스트 작성·실행, 결과 평가는 Luna가 담당할 수 있음
- GPT‑5.6 제품군은 단계별로 필요한 지능을 적용하고, 창출되는 가치에 맞춰 비용을 지불할 선택 폭을 넓힘
모델부터 에이전트까지 이어진 효율 개선
- 효율 향상은 모델, 모델을 실행하는 추론 시스템, 도구와 컨텍스트를 연결하는 에이전트 하네스에서 함께 이뤄짐
- GPT‑5.6 모델은 작업을 더 직접적인 경로로 처리함
- 개선된 라우팅으로 하드웨어 활용도가 높아짐
- 최적화된 프로덕션 소프트웨어가 토큰을 더 효율적으로 생성함
- 향상된 컨텍스트 관리는 에이전트가 완료된 작업을 반복하지 않도록 도움
- 같은 컴퓨팅 자원으로 더 많은 유용한 작업을 완료해 결과당 시간·토큰·비용을 줄임
Sol이 지원한 추가 최적화
- 사람이 주도하는 과정에서 GPT‑5.6 Sol은 프로덕션 커널을 자율적으로 재작성하고 최적화함
- 토큰 생성을 개선하기 위해 수백 건의 실험을 설계·실행하고, 학습을 감시하다 문제가 발생하면 개입함
- 커널 작업은 모델 제공의 종단 간 비용을 20% 절감했으며, 실험을 통해 토큰 생성 효율도 15% 이상 향상됨
- 모델의 성능과 자율성이 높아질수록 다음 효율 개선을 찾는 속도도 빨라지는 피드백 루프가 형성됨
- 관련 엔지니어링 과정은 GPT‑5.6 효율 개선 소개에서 확인할 수 있음
확장성을 뒷받침하는 컴퓨팅 전략
- 풍부한 지능 수요를 충족하려면 더 많은 컴퓨팅 자원뿐 아니라 생산성이 높은 컴퓨팅도 필요함
- OpenAI는 복원력 있는 인프라 포트폴리오를 구축하고 각 워크로드를 실행에 가장 적합한 시스템에 배치함
- Luna와 Terra의 가격 인하로 대량 작업을 더 큰 규모에서 경제적으로 운영할 수 있음
- Fast mode는 응답 시간이 중요한 Sol 작업에 더 빠른 API 접근을 제공함
- 대규모 문서 분석, 고객 상호작용 분류, 반복적인 구현 작업을 폭넓게 운영할 경제성이 높아짐
- 복잡한 Sol 워크로드는 추가 비용을 정당화할 만큼 속도가 중요할 때 더 빠르게 처리할 수 있음
- 더 강력한 모델이 기술팀의 후속 개선을 지원하면서 성능 향상과 비용 절감에 걸리는 시간을 단축함
Fast mode의 동작과 호환성
- API의 Fast mode는 Priority Processing을 대체하며 Codex의
/fast와 대응함 - GPT‑5.6 Sol에서 지능 수준을 바꾸지 않고 Standard 처리보다 최대 2.5배 빠른 속도를 2배 가격에 제공함
- 하위 호환성을 유지해 기존
priority태그가 지정된 API 요청도 계속 작동함
제공 범위와 API 요금
- GPT‑5.6 Terra와 Luna는 ChatGPT Work, Codex, OpenAI API에서 계속 제공됨
- ChatGPT Work와 Codex의 Free·Go 사용자는 Terra에 접근할 수 있음
- Plus·Pro·Business·Enterprise 사용자는 Terra와 Luna를 선택할 수 있음
- 7월 30일부터 API 100만 토큰당 가격은 다음과 같음
- Terra: 입력 $2, 출력 $12
- Luna: 입력 $0.20, 출력 $1.20
- ChatGPT와 Codex의 구독 가격 및 할당량 예산은 유지되지만, Terra와 Luna 사용 시 소비되는 크레딧은 감소함
- AWS에는 가격 변경이 7월 30일 늦게부터 순차적으로 적용됨
- 전체 요금은 API 가격 정보에서 확인할 수 있음