- OpenAI의 오픈소스 LLM인 GPT-OSS-120B를 NVIDIA GPU 환경에서 초당 500개 이상 토큰 처리 성능으로 최적화함
- TensorRT-LLM, vLLM, SGLang 등 다양한 추론 프레임워크를 병렬 테스트하며 Hopper와 Blackwell 아키텍처 모두 지원
- 호환성 버그를 수정하고 Harmony 같은 신규 응답 포맷 통합, KV 캐시 인지 라우팅 및 Eagle 기반 추측 디코딩 등 최적화 적용
- 텐서 병렬화와 전문가 병렬화를 비교한 결과, 낮은 지연 시간을 위해 텐서 병렬화 채택 및 Blackwell에서 TensorRT-LLM MoE 백엔드 사용
- 향후 성능 향상을 위해 소형 드래프트 모델을 사용하는 추측(Speculative) 디코딩을 포함해 추가 최적화할 계획
개요
- OpenAI의 최신 오픈소스 대형 언어 모델인 GPT-OSS-120B가 공개됨과 동시에 Baseten은 최고 성능 구현에 도전함
- Baseten은 OpenAI의 공식 런치 파트너임
- OpenRouter에서 공개된 실 사용자 데이터를 통해 NVIDIA GPU 기반 환경에서 타사 대비 앞선 성능을 입증
- Flexible inference stack과 모델 엔지니어팀의 전문성으로, 시간 단위로 최적화 패치를 신속하게 적용함
- 블로그 작성 몇 시간 동안만에도 초당 100토큰 추가 증가 및 100% 가동시간을 유지했음
성능 최적화 노력
- TensorRT-LLM, vLLM, SGLang과 같은 다양한 추론 프레임워크에서 테스트 및 벤치마킹을 수행
- Hopper, Blackwell GPU 아키텍처와의 호환성 확보를 병행
- Baseten의 Flexible Inference Stack 및 NVIDIA Dynamo 등 주요 컴포넌트와 통합
- KV cache-aware routing과 Speculative decoding(Eagle 기반) 등 꾸준히 검증된 성능 최적화 기법을 적용
아래에는 SOTA 성능과 전체 컨텍스트 윈도우 지원을 동시에 실현하기 위한 핵심 단계
Step 1: 최초 추론 실행
- 어떤 방식이라도 최초 추론(baseline inference) 을 빠르게 실행하는 것이 출발점
- GPU에서 영감을 받아 여러 엔지니어가 동시에 vLLM, SGLang, TensorRT-LLM의 실험을 병행
- 가장 우수한 성능을 보이는 TensorRT-LLM을 빠르게 구동에 성공
- Hopper(가장 많은 H100 GPU)와 Blackwell(B200 GPU로 속도가 뛰어남) 모두에서 TensorRT-LLM 지원을 확보
- Baseten Inference Runtime의 유연성 덕분에 새 아키텍처 모델 대응과 스택 내 툴 신속 교체가 용이했음
Step 2: 호환성 버그 수정
- 새로운 모델 아키텍처 등장에는 프레임워크 통합 시 잦은 버그가 동반
- GPT OSS에는 새로운 Harmony 응답 포맷 등 신기술이 추가되어 기존 프레임워크와의 통합 시 버그 발생
- 속도와 정확성을 동시에 확보하기 위해 반복적인 수정·테스트 수행하고, 효과적인 수정 사항은 오픈소스에 기여했음
- 글로벌 오픈소스 커뮤니티의 협업으로, 다양한 최적화 경로나 버그 수정이 빠르게 이뤄지고 있음
Step 3: 모델 구성 최적화
- OpenAI는 GPT OSS 120B가 단일 H100에서도 동작한다고 명시하지만, 실질적으로 4~8개의 GPU 병렬화가 성능에 유리함
- Tensor Parallelism은 지연 시간(latency)에, Expert Parallelism은 시스템 처리량(throughput)에 강점을 보임
- Baseten은 지연 시간 최적화가 목표라 Tensor Parallelism을 선택함
- Blackwell에서는 TensorRT-LLM MoE Backend를 적용해 이전 Triton 백엔드 대비 CUDA 커널 성능 향상
- Hopper 및 Blackwell 환경 각각에 최적화된 설정을 공개했고, Model API에서는 Blackwell 기반 세팅을 채택함
추가적인 성능 최적화
- 1차 최적화만으로도 SOTA 수준의 처리량과 지연 시간을 실현했지만, 더 개선할 여지가 충분함
- 주요 업데이트 예정 사항은 Speculative Decoding 도입
- 이 방식은 더 빠른 작은 “draft” 모델이 예측 토큰을 생성, 본 모델이 검증
- Baseten은 Eagle 3을 권장하지만, 추론 스택 내 10개 이상의 알고리듬을 상황에 따라 유동적으로 운용함
- Speculative decoding은 한 번에 여러 토큰의 추론을 진행해 효율적인 속도 향상을 지원