- AI 붐 이후 Nvidia GPU 수요가 폭증한 가운데, 새 Blackwell 세대는 대형 모델 학습·배포용 공급자 지위를 더 강화하려는 발표임
- 첫 Blackwell 칩 GB200은 올해 말 출하 예정이며, H100이 속한 Hopper 세대보다 AI 성능이 4 petaflops에서 20 petaflops로 높아짐
- GB200은 두 개의 B200 Blackwell GPU와 Arm 기반 Grace CPU를 묶고, Amazon·Google·Microsoft·Oracle이 클라우드 접근을 판매할 예정임
- 새 소프트웨어 NIM은 기존 Nvidia GPU에서도 AI 추론 배포를 쉽게 만들며, Nvidia enterprise 라이선스는 GPU당 연 4,500달러임
- Nvidia는 칩 판매를 넘어, 고객이 경쟁 칩보다 Nvidia 생태계에 머물도록 만드는 소프트웨어 플랫폼 전략을 강화함
Blackwell 발표와 Nvidia의 AI 공급자 지위
- Nvidia는 2024년 3월 18일 San Jose 개발자 콘퍼런스에서 새 AI 칩 세대와 AI 모델 실행용 소프트웨어를 발표함
- 발표 당시 기업과 소프트웨어 업체들은 여전히 현세대 Hopper H100 및 유사 칩 확보를 두고 경쟁 중이었음
- Jensen Huang은 “Hopper는 훌륭하지만, 더 큰 GPU가 필요하다”고 말함
- OpenAI의 ChatGPT가 2022년 말 AI 붐을 촉발한 뒤 Nvidia 주가는 5배 올랐고, 총매출은 3배 이상 증가함
- Microsoft와 Meta 같은 기업들은 Nvidia 고급 서버 GPU 구매에 수십억 달러를 지출함
- Nvidia 주가는 월요일 시간외 거래에서 1% 넘게 하락함
-
GB200 구성과 성능
- 새 AI 그래픽 프로세서 세대 이름은 Blackwell이며, 첫 Blackwell 칩은 GB200임
- Nvidia는 약 2년마다 GPU 아키텍처를 갱신해 큰 폭의 성능 향상을 제공함
- 2022년에 발표된 Hopper 아키텍처는 H100 같은 칩에 사용됐고, 지난 1년간 공개된 많은 AI 모델이 Hopper 기반으로 학습됨
- Blackwell 기반 GB200의 AI 성능은 20 petaflops로, H100의 4 petaflops보다 높음
- 늘어난 연산 성능은 AI 기업이 더 크고 복잡한 모델을 학습하는 데 쓰일 수 있음
- 칩에는 ChatGPT 기반 핵심 기술 중 하나인 transformer 기반 AI를 실행하기 위한 transformer engine이 포함됨
- Blackwell GPU는 TSMC가 제조하며, 별도로 만들어진 두 개의 다이를 하나의 칩으로 결합함
-
서버와 클라우드 제공
- GB200은 두 개의 B200 Blackwell GPU와 하나의 Arm 기반 Grace CPU를 결합함
- Nvidia는 72개의 Blackwell GPU와 다른 Nvidia 부품을 묶은 전체 서버 GB200 NVLink 2도 제공함
- Amazon, Google, Microsoft, Oracle은 클라우드 서비스로 GB200 접근을 판매할 예정임
- Amazon Web Services는 20,000개 GB200 칩을 갖춘 서버 클러스터를 구축할 예정임
- 이 시스템은 27조 파라미터 모델을 배포할 수 있으며, 보도상 1.7조 파라미터로 알려진 GPT-4보다 훨씬 큰 규모임
- Nvidia는 GB200 또는 이를 사용하는 시스템 가격을 공개하지 않음
- 애널리스트 추정 기준 Hopper 기반 H100은 칩당 25,000~40,000달러이며, 전체 시스템은 최대 200,000달러임
- Nvidia는 전체 서버 랙을 차지하는 완성 시스템 형태로도 B200 그래픽 프로세서를 판매할 예정임
NIM과 Nvidia의 플랫폼 전략
- Nvidia는 Nvidia enterprise 소프트웨어 구독에 NIM(Nvidia Inference Microservice) 이라는 새 제품을 추가함
- NIM은 AI 소프트웨어를 실행하는 과정인 추론을 기존 Nvidia GPU에서 더 쉽게 수행하도록 만듦
- 추론은 새 AI 모델의 초기 학습보다 연산 요구량이 낮음
- 기업들이 이미 보유한 수억 개 Nvidia GPU를 계속 활용할 수 있게 하는 것이 목적임
- OpenAI 같은 회사에서 AI 결과를 서비스로 구매하는 대신, 자체 AI 모델을 실행하려는 기업이 NIM의 주요 대상임
- Nvidia 기반 서버 구매 고객을 Nvidia enterprise 구독으로 연결하는 것이 핵심 전략임
- 라이선스 비용은 GPU당 연 4,500달러임
-
모델 배포와 개발자 사용 방식
- Nvidia는 Microsoft, Hugging Face 같은 AI 기업과 협력해 AI 모델이 호환 가능한 Nvidia 칩 전체에서 실행되도록 조정할 예정임
- 개발자는 NIM을 사용해 긴 설정 과정 없이 자체 서버나 클라우드 기반 Nvidia 서버에서 모델을 효율적으로 실행할 수 있음
- Manuvir Das는 기존 코드에서 OpenAI를 호출하던 부분을 Nvidia에서 받은 NIM으로 가리키도록 한 줄 바꾸는 방식이라고 말함
- 이 소프트웨어는 클라우드 서버뿐 아니라 GPU 탑재 노트북에서도 AI 실행을 돕는다고 Nvidia는 밝힘
-
칩 회사에서 소프트웨어 플랫폼으로
- NIM은 고객이 경쟁 칩 대신 Nvidia 칩에 머물 이유를 더해 주는 제품임
- Nvidia는 용병식 칩 공급자에 머무르지 않고, 다른 회사가 소프트웨어를 구축할 수 있는 플랫폼 제공자에 가까워지고 있음
- Huang은 “Blackwell은 칩이 아니라 플랫폼의 이름”이라고 말함
- Das는 과거에는 판매 가능한 상업 제품이 GPU였고 소프트웨어는 GPU 활용을 돕는 역할이었지만, 이제 Nvidia에 상업적 소프트웨어 비즈니스가 생겼다고 말함