1P by GN⁺ | ★ favorite | 댓글 1개
  • OpenAI는 모델·추론 시스템·에이전트 하네스의 효율 향상을 가격과 처리 속도에 반영해 기업용 AI의 달러당 성능을 높임
  • 7월 30일부터 Luna 가격은 80%, Terra 가격은 20% 인하되며, API 100만 토큰당 Luna는 입력 $0.20·출력 $1.20, Terra는 입력 $2·출력 $12가 적용됨
  • Luna는 1년 전 최첨단급 모델과 비슷한 성능을 작업당 약 6%의 비용과 거의 9배의 속도로 제공하며, Agents’ Last Exam에서는 Fable 5보다 높은 성능과 약 99% 낮은 추정 작업 비용을 기록함
  • GPT‑5.6 Sol의 Fast mode는 기존 Priority Processing을 대체하고, 지능 수준을 유지하면서 Standard 대비 최대 2.5배 빠른 속도를 2배 가격에 제공함
  • 기업은 계획과 불확실성 해소에는 Sol을, 명확한 구현과 테스트에는 Luna를 배치하는 식으로 단계별 평가를 거쳐 지능·속도·비용의 균형을 조정할 수 있음

Luna·Terra 가격 인하와 Sol 속도 개선

  • GPT‑5.6의 실행 효율 향상이 Luna·Terra의 가격 인하와 Sol의 API 처리 속도 개선으로 이어짐
  • 가장 빠르고 저렴한 모델인 Luna는 80%, 일상 업무용 균형 모델인 Terra는 20% 저렴해짐
    • Codex와 ChatGPT Work 유료 구독에서도 두 모델의 사용량이 더 적은 크레딧으로 계산됨
    • 구독 가격과 할당량 예산 자체는 바뀌지 않음
  • Luna는 도구를 사용해 여러 단계의 워크플로를 완료할 수 있어, 높은 품질이 필요한 대량 작업의 운영 비용을 낮춤
  • Sol 가격은 변경되지 않음

작업 결과에 맞춘 모델 선택

  • 효율적인 AI 활용을 위해서는 작업의 중요도·오류 비용·긴급성·규모에 맞춰 지능, 속도, 신뢰성, 비용의 균형을 정해야 함
    • 같은 워크플로에서도 단계마다 최적점이 달라질 수 있음
  • Luna는 1년 전 최첨단급이었던 모델과 비슷한 성능을 작업당 약 6%의 비용과 거의 9배의 속도로 제공함
  • 전문 업무를 측정하는 Agents’ Last Exam에서는 Fable 5보다 높은 성능을 보이면서 추정 작업당 비용을 약 99% 절감
  • 기업은 필요한 결과와 품질 기준을 먼저 정하고, 평가를 통해 추가 지능이 결과를 실질적으로 개선하는 구간과 저비용 처리가 같은 품질을 내는 구간을 구분할 수 있음
    • 코딩 워크플로에서는 Sol이 불확실성을 해소하고 계획을 수립함
    • 명확히 정의된 변경의 구현, 테스트 작성·실행, 결과 평가는 Luna가 담당할 수 있음
  • GPT‑5.6 제품군은 단계별로 필요한 지능을 적용하고, 창출되는 가치에 맞춰 비용을 지불할 선택 폭을 넓힘

모델부터 에이전트까지 이어진 효율 개선

  • 효율 향상은 모델, 모델을 실행하는 추론 시스템, 도구와 컨텍스트를 연결하는 에이전트 하네스에서 함께 이뤄짐
    • GPT‑5.6 모델은 작업을 더 직접적인 경로로 처리함
    • 개선된 라우팅으로 하드웨어 활용도가 높아짐
    • 최적화된 프로덕션 소프트웨어가 토큰을 더 효율적으로 생성함
    • 향상된 컨텍스트 관리는 에이전트가 완료된 작업을 반복하지 않도록 도움
  • 같은 컴퓨팅 자원으로 더 많은 유용한 작업을 완료해 결과당 시간·토큰·비용을 줄임

Sol이 지원한 추가 최적화

  • 사람이 주도하는 과정에서 GPT‑5.6 Sol은 프로덕션 커널을 자율적으로 재작성하고 최적화함
  • 토큰 생성을 개선하기 위해 수백 건의 실험을 설계·실행하고, 학습을 감시하다 문제가 발생하면 개입함
  • 커널 작업은 모델 제공의 종단 간 비용을 20% 절감했으며, 실험을 통해 토큰 생성 효율도 15% 이상 향상
  • 모델의 성능과 자율성이 높아질수록 다음 효율 개선을 찾는 속도도 빨라지는 피드백 루프가 형성됨
  • 관련 엔지니어링 과정은 GPT‑5.6 효율 개선 소개에서 확인할 수 있음

확장성을 뒷받침하는 컴퓨팅 전략

  • 풍부한 지능 수요를 충족하려면 더 많은 컴퓨팅 자원뿐 아니라 생산성이 높은 컴퓨팅도 필요함
  • OpenAI는 복원력 있는 인프라 포트폴리오를 구축하고 각 워크로드를 실행에 가장 적합한 시스템에 배치함
    • Luna와 Terra의 가격 인하로 대량 작업을 더 큰 규모에서 경제적으로 운영할 수 있음
    • Fast mode는 응답 시간이 중요한 Sol 작업에 더 빠른 API 접근을 제공함
  • 대규모 문서 분석, 고객 상호작용 분류, 반복적인 구현 작업을 폭넓게 운영할 경제성이 높아짐
  • 복잡한 Sol 워크로드는 추가 비용을 정당화할 만큼 속도가 중요할 때 더 빠르게 처리할 수 있음
  • 더 강력한 모델이 기술팀의 후속 개선을 지원하면서 성능 향상과 비용 절감에 걸리는 시간을 단축함

Fast mode의 동작과 호환성

  • API의 Fast mode는 Priority Processing을 대체하며 Codex의 /fast와 대응함
  • GPT‑5.6 Sol에서 지능 수준을 바꾸지 않고 Standard 처리보다 최대 2.5배 빠른 속도를 2배 가격에 제공함
  • 하위 호환성을 유지해 기존 priority 태그가 지정된 API 요청도 계속 작동함

제공 범위와 API 요금

  • GPT‑5.6 Terra와 Luna는 ChatGPT Work, Codex, OpenAI API에서 계속 제공됨
    • ChatGPT Work와 Codex의 Free·Go 사용자는 Terra에 접근할 수 있음
    • Plus·Pro·Business·Enterprise 사용자는 Terra와 Luna를 선택할 수 있음
  • 7월 30일부터 API 100만 토큰당 가격은 다음과 같음
    • Terra: 입력 $2, 출력 $12
    • Luna: 입력 $0.20, 출력 $1.20
  • ChatGPT와 Codex의 구독 가격 및 할당량 예산은 유지되지만, Terra와 Luna 사용 시 소비되는 크레딧은 감소함
  • AWS에는 가격 변경이 7월 30일 늦게부터 순차적으로 적용됨
  • 전체 요금은 API 가격 정보에서 확인할 수 있음

댓글과 토론

Hacker News 의견들
  • “광고비의 절반은 낭비되지만 어느 절반인지 모른다”는 John Wanamaker의 말은 모델 선택에 더 잘 들어맞음. 대부분의 작업에 강력한 모델이 필요 없다는 건 알지만, 단순한 작업과 어려운 작업을 구분하는 것 자체가 풀기 어렵고 어쩌면 결정 불가능한 문제임

    • 별로 어렵지 않음. 먼저 정지 문제를 적당히 해결하는 라이브러리만 찾으면 바로 시작할 수 있음
    • 아직 에이전트 1,000개를 동시에 돌리는 단계에는 이르지 못했음. 지금은 에이전트가 수행하는 중요한 작업을 직접 신경 써서 관리하므로, 굳이 최첨단보다 낮은 모델을 택할 이유가 없음. 코딩 외 작업에서는 달라질 수도 있음
    • 에이전트와 사용자가 있다면 평가를 실행해 모델의 한계를 확인할 수 있음. Luna는 도구 호출이 가장 뛰어나진 않지만 문제와 도구를 명확히 정의하면 훨씬 저렴한 비용으로 Gemini 4 Flash에 견줄 만함
    • https://news.ycombinator.com/item?id=49113236의 관점이 잘 맞음
      HN은 1970년대 하드웨어로도 BBS처럼 운영할 수 있지만, 실제로는 트랜지스터 약 1만 개가 아닌 약 100억 개짜리 CPU로 사실상 같은 일을 하면서도 이를 고민하지 않음
  • “오늘부터 가장 빠르고 저렴한 모델 GPT‑5.6 Luna의 비용을 80% 낮춘다”니 할 말을 잃게 됨. 수개월에 걸쳐 5~10% 개선되는 정체 구간에 들어섰다고 생각했는데, 이런 급격한 변화가 나타나니 가격의 바닥이 어디인지 의문이 듦

    • 모델 지능이 현재 지식 노동의 90~95% 를 안정적으로 처리하게 되면 가중치를 실리콘에 새겨 가격 대비 성능이 다시 10배 개선될 것임
      동적 GPU 클러스터는 나머지 5%와 최첨단 영역 확장에 쓰이고, 지금은 대부분의 지식 노동자에게 너무 어려워 수행되지 않는 작업도 새롭게 처리되기 시작할 것임
    • 현재 가격 중 실제 비용이 얼마고 투자자 보조를 통한 시장 장악 전략이 얼마인지는 알 수 없음. OpenAI가 자금력에 자신이 있다면 대표 제품을 보유한 Anthropic을 압박하려는 시도일 수도 있음
    • 믿기 어려울 만큼 인상적인 수치임. 성능이 몇 퍼센트 낮더라도 경쟁사보다 80% 이상 저렴하고 미국 기업이 미국 초대형 클라우드에서 제공한다면, 대부분의 기업은 다른 선택을 정당화하기 어려움
    • 비용이 80% 줄었다는 뜻이지 효율이 80% 개선됐다는 뜻은 아님. Luna가 처음부터 비쌌을 수도 있고 모델 자체에 관한 정보도 부족함
      실제 효율 개선이라면 공격적인 양자화나 KV 캐시 압축으로 품질이 나빠지는 등의 대가가 있을 듯함
    • 수개월마다 5~10% 개선되는 것만으로도 상당히 놀라움. Kimi 3가 Anthropic, OpenAI, Google 내부에 어떤 압박을 주고 있을지 궁금함
      토큰이 매년 더 빠르고 저렴해질수록 전문가 팀을 모방하는 AI 공장과 훨씬 높은 병렬성이 현실화될 것임
  • 이미 저렴하고 성능도 뛰어난 Luna를 5배 더 저렴하게 만든 것은 놀라움. 직장에서는 Sol, 집에서는 Luna를 쓰는데 차이는 분명하지만 압도적이지는 않음. 1년간 가격이 계속 오르다가 Luna, Kimi K3, GLM 5.2를 계기로 다시 하락하는 느낌

    • 이를 Kimi나 GLM과 같은 흐름으로 보기는 어려움. GLM 5.2는 중국 모델 기준 큰 폭의 인상이었고 Kimi K3는 거기서 더 올랐으며, OpenAI 가격에 근접했음
      OpenAI와 Anthropic도 수개월간 가격을 올린 뒤 미국 연구소가 대폭 가격을 인하했으니 오히려 반대 흐름으로 보임
    • 기업들이 시장을 차지하려고 밤낮없이 경쟁 중이므로 결국 시간문제
    • Kimi가 정말 저렴한지는 의문이며, 오히려 상당히 비싼 모델임
    • 버그 수정처럼 결과를 검증할 수 있는 작업은 적절한 검증 절차만 작성하면 어떤 모델이든 활용 가능함
  • “커널 작업으로 모델 제공의 종단 간 비용을 20% 줄였고, 실험을 통해 토큰 생성 효율을 15% 이상 높였다”고 함. GPT-5.6 제공 비용이 20% 줄었다면 매달 수십억 달러를 절감하는 셈인지 궁금함
    SpaceX IPO 자료에 따르면 Anthropic은 두 Colossus 데이터센터의 추론 용량 임대에 12억5천만 달러를 썼지만, 기존 AWS 등의 용량을 고려하면 전체 중 얼마인지는 알 수 없음. OpenAI의 월간 추론 비용도 수십억 달러 규모일 가능성이 크므로 20% 절감은 엄청난 변화임

    • 약 2년 전 Gemini 2.5가 자체 커널 개선을 도와 겨우 효율 1% 향상에 도달했는데, 지금은 20%까지 올라옴
    • 이력서에 “추론 비용을 20% 줄여 회사가 매달 수십억 달러를 절감하게 함”이라고 쓸 수 있다고 상상해 봄
  • 이번 변화는 전화접속에서 광대역으로 넘어가던 전환처럼 느껴짐. 이미 심층 연구에 Luna를 적극 추천했는데 같은 비용으로 5배 더 실행할 수 있다는 건 엄청남
    현재도 가설 생성을 위해 에이전트 10개를 병렬 실행하는데 50개는 상상하기 어려움. 동일한 프롬프트와 모델을 수십 번 실행해도 비용 부담이 작다면 통계가 훨씬 흥미롭고 강력해짐

    • ‘심층 연구’는 구체적으로 어떻게 실행하는지 궁금함
    • 가설 생성과 연구 절차를 더 알고 싶음. 좋은 아이디어에는 추론 능력이 더 필요하다고 보고 Sol을 사용했지만, 어느 지점부터는 품질보다 수량이 더 나을 수도 있어 보임
    • 어떤 작업이 에이전트 수 증가의 효과를 보고 어떤 작업은 그렇지 않은지 궁금함
  • Luna의 새 가격은 예상 밖이며, 이 가격 대비 성능과 경쟁할 제품은 시장에 없어 보임
    프로덕션 앱에서는 이제 OpenAI가 명백히 최고의 제공업체임. API가 안정적이고 기능이 풍부하며 모델 전반의 가격 대비 성능도 뛰어남. 오랫동안 Fireworks에서 Kimi K2.5 같은 공개 가중치 모델을 사용했지만 간헐적 문제가 있었고 Anthropic과 Google도 마찬가지였음. OpenAI는 빠르고 거의 모든 지능 수준에서 더 나은 가격 대비 성능을 보여줌

    • OpenAI API는 매우 안정적이며, 마지막 장애나 중단이 언제였는지 기억나지 않을 정도임
  • 보통 OpenRouter의 가격 대비 성능 그래프를 확인하고 오른쪽의 "Show Pareto"를 활성화함. 개인 프로젝트에서는 아직 GLM-5.2를 썼지만 이제 Luna가 손쉬운 선택이 됨

    • OpenRouter가 출시 때부터 Luna와 Terra를 50% 할인하지 않았는지 궁금함. 이번 인하 후 그 할인은 어떻게 될지 모르겠음
    • 공식 문서상 Luna는 이전 Nano 모델 계열에 가까운데, 코딩 성능도 정말 좋은지 궁금함
  • Luna의 80% 가격 인하는 매우 공격적임. 최첨단 지능이 필요 없는 대부분의 작업에서 압도적으로 좋은 선택이며, Luna가 Opus 5와 견줄 때도 있음

    • Luna는 Haiku와 경쟁하도록 만든 모델인데, 어떤 작업에서 Opus와 동급인지 궁금함
    • Sol의 xhigh와 Luna의 max 사이에는 눈에 띄는 차이가 있었음. Sol이 프롬프트를 더 잘 이해하고, Luna에는 더 구체적이고 명확하게 지시해야 함
  • DeepSeek v4 flash 토큰을 많이 선결제했으며 다 쓰고 나면 한동안 Luna 토큰을 구매해 보고 싶음. 저렴하고 빠른 모델을 선호하고 은퇴한 상태라, 가끔 더 강한 모델로 직접 전환하느라 시간이 걸려도 괜찮음

  • Luna가 80% 저렴해진 것은 놀라움. 컴퓨팅 비용이 계속 하락하므로 내년에는 강력한 모델의 API 사용료가 구독료보다 저렴해질 수도 있음

    • 구독은 사용자를 계속 묶어 두어 기업에 큰 가치를 주므로 API가 구독보다 저렴해지지는 않을 것