2P by GN⁺ | ★ favorite | 댓글 2개
  • AI 붐 이후 Nvidia GPU 수요가 폭증한 가운데, 새 Blackwell 세대는 대형 모델 학습·배포용 공급자 지위를 더 강화하려는 발표임
  • 첫 Blackwell 칩 GB200은 올해 말 출하 예정이며, H100이 속한 Hopper 세대보다 AI 성능이 4 petaflops에서 20 petaflops로 높아짐
  • GB200은 두 개의 B200 Blackwell GPU와 Arm 기반 Grace CPU를 묶고, Amazon·Google·Microsoft·Oracle이 클라우드 접근을 판매할 예정임
  • 새 소프트웨어 NIM은 기존 Nvidia GPU에서도 AI 추론 배포를 쉽게 만들며, Nvidia enterprise 라이선스는 GPU당 연 4,500달러임
  • Nvidia는 칩 판매를 넘어, 고객이 경쟁 칩보다 Nvidia 생태계에 머물도록 만드는 소프트웨어 플랫폼 전략을 강화함

Blackwell 발표와 Nvidia의 AI 공급자 지위

  • Nvidia는 2024년 3월 18일 San Jose 개발자 콘퍼런스에서 새 AI 칩 세대와 AI 모델 실행용 소프트웨어를 발표함
  • 발표 당시 기업과 소프트웨어 업체들은 여전히 현세대 Hopper H100 및 유사 칩 확보를 두고 경쟁 중이었음
  • Jensen Huang은 “Hopper는 훌륭하지만, 더 큰 GPU가 필요하다”고 말함
  • OpenAI의 ChatGPT가 2022년 말 AI 붐을 촉발한 뒤 Nvidia 주가는 5배 올랐고, 총매출은 3배 이상 증가함
    • Microsoft와 Meta 같은 기업들은 Nvidia 고급 서버 GPU 구매에 수십억 달러를 지출함
    • Nvidia 주가는 월요일 시간외 거래에서 1% 넘게 하락함
  • GB200 구성과 성능

    • 새 AI 그래픽 프로세서 세대 이름은 Blackwell이며, 첫 Blackwell 칩은 GB200
    • Nvidia는 약 2년마다 GPU 아키텍처를 갱신해 큰 폭의 성능 향상을 제공함
    • 2022년에 발표된 Hopper 아키텍처는 H100 같은 칩에 사용됐고, 지난 1년간 공개된 많은 AI 모델이 Hopper 기반으로 학습됨
    • Blackwell 기반 GB200의 AI 성능은 20 petaflops로, H100의 4 petaflops보다 높음
    • 늘어난 연산 성능은 AI 기업이 더 크고 복잡한 모델을 학습하는 데 쓰일 수 있음
    • 칩에는 ChatGPT 기반 핵심 기술 중 하나인 transformer 기반 AI를 실행하기 위한 transformer engine이 포함됨
    • Blackwell GPU는 TSMC가 제조하며, 별도로 만들어진 두 개의 다이를 하나의 칩으로 결합함
  • 서버와 클라우드 제공

    • GB200은 두 개의 B200 Blackwell GPU와 하나의 Arm 기반 Grace CPU를 결합함
    • Nvidia는 72개의 Blackwell GPU와 다른 Nvidia 부품을 묶은 전체 서버 GB200 NVLink 2도 제공함
    • Amazon, Google, Microsoft, Oracle은 클라우드 서비스로 GB200 접근을 판매할 예정임
    • Amazon Web Services는 20,000개 GB200 칩을 갖춘 서버 클러스터를 구축할 예정임
    • 이 시스템은 27조 파라미터 모델을 배포할 수 있으며, 보도상 1.7조 파라미터로 알려진 GPT-4보다 훨씬 큰 규모임
    • Nvidia는 GB200 또는 이를 사용하는 시스템 가격을 공개하지 않음
    • 애널리스트 추정 기준 Hopper 기반 H100은 칩당 25,000~40,000달러이며, 전체 시스템은 최대 200,000달러임
    • Nvidia는 전체 서버 랙을 차지하는 완성 시스템 형태로도 B200 그래픽 프로세서를 판매할 예정임

NIM과 Nvidia의 플랫폼 전략

  • Nvidia는 Nvidia enterprise 소프트웨어 구독에 NIM(Nvidia Inference Microservice) 이라는 새 제품을 추가함
  • NIM은 AI 소프트웨어를 실행하는 과정인 추론을 기존 Nvidia GPU에서 더 쉽게 수행하도록 만듦
    • 추론은 새 AI 모델의 초기 학습보다 연산 요구량이 낮음
    • 기업들이 이미 보유한 수억 개 Nvidia GPU를 계속 활용할 수 있게 하는 것이 목적임
  • OpenAI 같은 회사에서 AI 결과를 서비스로 구매하는 대신, 자체 AI 모델을 실행하려는 기업이 NIM의 주요 대상임
  • Nvidia 기반 서버 구매 고객을 Nvidia enterprise 구독으로 연결하는 것이 핵심 전략임
    • 라이선스 비용은 GPU당 연 4,500달러임
  • 모델 배포와 개발자 사용 방식

    • Nvidia는 Microsoft, Hugging Face 같은 AI 기업과 협력해 AI 모델이 호환 가능한 Nvidia 칩 전체에서 실행되도록 조정할 예정임
    • 개발자는 NIM을 사용해 긴 설정 과정 없이 자체 서버나 클라우드 기반 Nvidia 서버에서 모델을 효율적으로 실행할 수 있음
    • Manuvir Das는 기존 코드에서 OpenAI를 호출하던 부분을 Nvidia에서 받은 NIM으로 가리키도록 한 줄 바꾸는 방식이라고 말함
    • 이 소프트웨어는 클라우드 서버뿐 아니라 GPU 탑재 노트북에서도 AI 실행을 돕는다고 Nvidia는 밝힘
  • 칩 회사에서 소프트웨어 플랫폼으로

    • NIM은 고객이 경쟁 칩 대신 Nvidia 칩에 머물 이유를 더해 주는 제품임
    • Nvidia는 용병식 칩 공급자에 머무르지 않고, 다른 회사가 소프트웨어를 구축할 수 있는 플랫폼 제공자에 가까워지고 있음
    • Huang은 “Blackwell은 칩이 아니라 플랫폼의 이름”이라고 말함
    • Das는 과거에는 판매 가능한 상업 제품이 GPU였고 소프트웨어는 GPU 활용을 돕는 역할이었지만, 이제 Nvidia에 상업적 소프트웨어 비즈니스가 생겼다고 말함

댓글과 토론

  • Nvidia 개발자 컨퍼런스: 블랙웰 칩과 미래 기술 소개
  • Nvidia는 초당 10테라바이트의 데이터를 전송하는 하나의 거대한 칩을 만들기 위해 두 개의 다이에 인접한 280억 개의 트랜지스터를 갖춘 혁신적인 플랫폼인 Blackwell을 소개하며, Hopper와의 형태 맞춤 기능 호환성을 제공합니다.
  • 500억 개의 트랜지스터가 탑재된 Blackwell의 MVY 링크 스위치는 GPU 간의 최고 속도 통신을 가능하게 하여 하나의 랙에서 엑사플롭스 AI 시스템을 구축할 수 있게 합니다.
  • Nvidia 블랙웰은 AWS, 구글, 오라클, 마이크로소프트와 파트너십을 맺고 다양한 AI 서비스를 가속화하고 엔비디아 기술을 해당 플랫폼에 통합한다고 발표했습니다.
  • Nvidia는 제너레이티브 AI 솔루션 및 AI 팩토리 구축을 위해 SAP, ServiceNow, Cohesity, Snowflake, Dell과 같은 기업과 협력하는 AI 파운드리를 공개했습니다.
  • 옴니버스 클라우드를 비전 프로에 스트리밍하여 다양한 디자인 툴 간의 원활한 통합과 워크플로우를 지- 원하고, 엔비디아는 AI 기반 로봇을 위한 프로젝트 그루트, 아이작 랩, 오스모를 소개합니다.
  • Jetson으로 구동되는 디즈니의 bdx 로봇이 특별 출연하여 Isaac Sim에서 학습 기능을 선보입니다.

코얼리(corely.ai)로 요약한 CNET 영상 내용입니다 (https://www.youtube.com/watch?v=bMIRhOXAjYk)

Hacker News 의견들
  • 키노트 현장과 컨퍼런스 내용을 보면 Nvidia가 좋은 하드웨어 업체들이 흔히 하듯 스택 위쪽으로 올라가고 있음
    당연히 더 큰 하드웨어도 계속 만들겠지만, 핵심은 LLM용 Docker 같은 NIM을 만들고 있다는 점임. NIM을 내려받거나 구매해서 Nvidia 하드웨어에 쉽게 배포하는 컨테이너 시스템을 구축 중이라, 이게 AI 스타트업들에 어떤 영향을 줄지 지켜보는 재미가 있겠음

    • 소비자 대상 AI 대부분에는 별 영향이 없을 것 같음. 이미 UI와 편의성이 큰 판매 포인트이기 때문임
      더 큰 위협은 사업의 핵심 기능이 주류 소프트웨어에 들어가는 경우임. 요즘은 iPhone이 배경 제거를 해주니 유료 배경 제거 수요가 사라진 것처럼, AI 제품이 기존 업무용 앱의 기능 하나로 쉽게 들어갈 수 있다면 그 사업은 시간을 빌려 쓰는 상태
    • 오픈소스 대안도 있음: https://github.com/geniusrise
    • AI 분야의 모든 흐름을 따라가지는 못하고 있는데, 여기서 어떤 종류의 AI 스타트업을 염두에 둔 건지 궁금함
      “인프라”를 제공하는 AI-as-a-Service 스타트업 같은 쪽인지?
  • “Nvidia가 용병식 칩 공급업체에서 Microsoft나 Apple처럼 다른 회사가 소프트웨어를 만들 수 있는 플랫폼 제공자에 가까워지고 있다”는 방향은 성장 관점에서는 이해됨
    AI용 플랫폼 서비스가 되면 Nvidia에 더 수익성이 좋겠지만, 이미 AWS와 Microsoft 같은 파트너십과 균형을 맞추기는 어려움. 앞으로 인수나 경쟁용 맞춤형 솔루션이 나올 것 같고, 다행히 Nvidia 입장에서는 AI 상당 부분이 아직 CUDA에 의존하고 있어 전개가 흥미로움

    • Nvidia는 고객 절반인 하이퍼스케일러는 GPU와 CUDA만 쓰고, 나머지 긴 꼬리 고객은 더 수익성 높은 상위 플랫폼을 쓰는 세상을 준비하는 것 같음
      고객을 한쪽으로 강제할 정도의 지렛대는 없고, 그냥 GPU만 파는 게 더 쉽겠지만, 정교한 고객은 다른 칩으로 갈아탈 수 있는 반면 플랫폼은 작은 고객을 묶어두는 효과가 있다는 걸 아는 듯함
    • 결국 반독점 소송이 생기고 CUDA 표준을 열도록 요구받은 뒤 AMD가 경쟁자가 될 것이라고 봄
      Nvidia가 원한다면 이런 소송을 피하려고 자발적으로 표준을 열 수도 있고, 개인적으로는 그게 현명한 선택이라고 보지만, 역사상 거의 모든 기업은 자발적 개방 대신 소송을 택했음
    • AWS가 ARM을 강하게 밀고 있지만, 사람들은 여전히 x86/x64 컴퓨트를 대량으로 구매함
      AWS가 신경망용 자체 하드웨어+소프트웨어 솔루션을 갖추더라도 CUDA 플랫폼에서 벗어나려면 몇 년, 어쩌면 수십 년이 걸릴 수 있음
    • AMD/Intel GPU가 Nvidia만큼 성능이 있고 널리 쓰였다면 Microsoft와 AWS도 그쪽과 파트너십을 맺었을 것임
      Microsoft는 OpenAI와도, Mistral과도 파트너십이 있음. 지금의 편의성이 미래에도 유지된다는 보장은 없고, Nvidia도 그걸 잘 알고 있음
  • FP4가 뭔가, 4비트 부동소수점인가? 그렇다면 Hopper 대비 30배라는 비교 그래프 [0]는 좀 오해의 소지가 있었음
    [0] https://youtu.be/Y2F8yisiS6E?t=4698

    • FP4는 4비트 부동소수점이고, 8비트 부동소수점의 두 배 속도임. FP6도 있는데 FP8보다 계산이 빠르지는 않지만 6비트 형식의 더 나은 메모리 대역폭과 캐시 활용을 이용할 수 있음
      일부는 4비트 LLM 관련 이 논문 [1]과 연결해 보고 있고, 저자 중 Nvidia 직원도 한 명 있음
      1: https://arxiv.org/pdf/2310.16836.pdf
    • 부분적으로만 오해의 소지가 있음. LLM에서는 FP4가 FP8의 절반만큼만 유용한 게 아니기 때문임
      FP4에서 압도적인 장비가 있다면 그걸 쓰고, 정확도 손실을 최소화하면서 속도 향상을 얻을 수 있음. 마케팅식 창의성이 섞여 있긴 하지만, 실제 사용량을 재는 척도로 완전히 틀린 건 아님
    • https://arxiv.org/pdf/2310.10537.pdf
      이전 글에서도 다뤄졌음: https://news.ycombinator.com/item?id=37930663
    • 4비트가 어떻게 충분할 수 있는지 궁금함. 중간 계산은 더 넓은 폭으로 하고 다시 FP4로 낮추는 건가?
    • 맞음. 정밀도 인식 트랜스포머 엔진 얘기가 있었고, 그게 FP4 사용을 더 쉽게 해줄 수는 있지만 같은 조건에서 30배 빠른 건 아님
      사실상 약간 개선된 공정 노드 위에 Hopper 두 개를 나란히 둔 것에 가까우니 놀랄 일은 아니고, 그런 새 기능이나 늘어난 메모리를 활용하지 않는 경우에는 2.5배 정도가 더 그럴듯해 보임
  • 몇 년 전 Bright Cluster Manager를 인수했는데, 다음 인수 대상은 누가 될까? 고객에게 전체 스택을 제공하려는 것처럼 보임

    • Canonical은 무르익은 대상임. Canonical은 지난 몇 년간 Ubuntu와 다른 도구들을 엔터프라이즈 세계에서 키우려 했지만 큰 성공은 못 냈고, Nvidia 개발 키트의 상당 부분이 Ubuntu를 중심으로 만들어져 있음
    • Run:AI https://news.ycombinator.com/item?id=39738342
    • Anthropic이나 Mistral을 인수해서 AGI/ASI를 만들 수도 있음
  • 두 자릿수 페타플롭이 대량 생산되는 시대임
    “인간 뇌의 관련 활동을 복제하는 데 필요한 계산 능력은 여러 저자에 의해 10^12부터 10^28 FLOPS까지로 추정됐다.” 페타플롭은 10^15임. 미친 시대임

    • 이걸로 실현 가능한 핵융합 발전소를 설계한다면 기쁠 것 같음. 대부분 광고 타기팅에 쓰인다면 크게 실망할 듯함
  • Softbank의 Masayoshi Son이 안타깝게 됐음. 2019년에 Nvidia 지분 31억 달러를 들고 있었는데, 지금이면 19배인 600억 달러였을 것임
    AI와 로보틱스에 엄청 낙관적이었지만 시대를 너무 앞서갔음

    • 사소한 정정: Masayoshi Son
  • 여기서 “플랫폼 회사”라는 게 다중 칩을 뜻하는 건가?
    단일 다이에 그렇게 많은 트랜지스터를 밀어 넣는 게 비현실적으로 되어가니 논리적으로 보임

    • 제품군의 큰 그림은 잘 모르겠지만, Jensen이 자랑하던 물리적 수치와 구성을 보면 사실상 메인프레임식 게임을 하려는 것 같음
      독점 섀시, 독점 클러스터 상호연결망, 독점 미들웨어 위에서 돌아가는 고급 애플리케이션을 묶어두려는 방향임. Mellanox 인수가 떠오름
    • 대규모 데이터센터에 필요한 주요 칩 전부와 그 위의 소프트웨어 계층 상당수를 뜻함
      하드웨어로는 GPU, GPU-GPU 패브릭인 NVLINK, CPU, NIC, 네트워크 패브릭인 InfiniBand, 스위치가 포함됨. 여기에 CUDA, Riva, Megatron, Omniverse 같은 여러 소프트웨어 스택 계층을 사람들이 그 위에 만들도록 기여하고 밀고 있음
    • 아니, 이건 지대 추구를 뜻함
      AWS가 세상의 모든 컴퓨터까지 판다고 상상해보면 됨. 이제는 거기서만 빌릴 수 있게 되는 구조임
  • 업계가 언제쯤 LLM의 확장성 문제를 다루기 시작할지 궁금함. Nvidia 입장에서는 더 크고 좋은 GPU를 계속 내는 게 당연히 이익이지만, 공동의 이익은 무엇인가?
    충분한 자원이 있으면 좋은 언어 모델이 가능하다는 건 이미 증명됐음. 이제 과제는 평균적인 사용 사례에 상상하기 어려운 양의 자원을 요구하지 않는 솔루션에 이 모델들을 넣는 것임

    • 낭비적인 소프트웨어 개발은 쉽고 개발의 추진력을 유지해 줌. 성장이 왕인 한, 빠르고 지저분한 방식은 언제나 잘 최적화된 작은 시스템을 이김
      이건 AI만의 문제가 아니라 우리가 쓰는 모든 소프트웨어의 문제임. 최적화하고 더 작은 시스템에 맞추려는 집단은 두 부류뿐임. 열정적인 프로그래머와, 그 일을 하라고 돈을 받는 사람들임. 예를 들면 휴대폰 제조사의 소프트웨어 팀 같은 곳임
  • 시간외 거래에서 주가가 변하지 않았음. 큰 발표로 크게 튀길 기대한 사람이 많았음

    • 주가는 Nvidia의 개발 상황은 물론 어느 회사든 단기 지표로 좋지 않음. Nvidia는 일을 아주 잘하고 있음
      다만 그 주식은 정말 우스울 정도로 고평가되어 있음
    • 시가총액 2조 달러면 이미 다 반영된 상태임
    • 그런 급등을 원한다면 실적 전망을 기다리고 있을 것임. 지금은 극도로 과매수 상태라 주당 1,000달러를 넘겨 움직이기 버거워하고 있음
      당장은 Microsoft와 OpenAI가 이 칩을 쓰겠지만, 장기적으로는 이걸 보면서 자체 칩을 만들고 Nvidia 의존도를 줄이려 할 것이고, 계약이 끝나면 갈아탈 준비를 할 것임
    • Nvidia는 비밀스러운 종목이 아님. 주식 안에 숨은 가치가 있다면 이미 대부분 반영되어 있을 가능성이 큼
    • 그뿐 아니라 장중에도 힘이 빠졌음. 너무 과열돼서 이제는 어떤 뉴스로도 더 끌어올리기 어려운 상태였을 수 있음
  • 전력 소비를 25배 줄였다고 주장하는데, 그게 맞을 수가 있나? 이 숫자가 어디서 나온 건지 아는 사람이 있나?

    • 여기 [1]에서 나온 숫자임. 기본적으로 H 100랙 대 B 8랙 비교임
      다만 오타가 있을 수도 있다고 봄. 아마 액체 냉각 대 공랭까지 포함한 비교일 것임
      [1] https://nvdam.widen.net/s/xqt56dflgh/nvidia-blackwell-archit...
    • 링크된 기사에서 읽은 건가? 나는 찾지 못했음
      아마 성능 향상 5배에 따른 효율 개선과, 이제 1.7조가 아니라 27조 매개변수를 사용할 수 있다는 점 때문에 같은 작업량을 1/25 시간에 끝낼 수 있고, 그래서 전력 소비 감소라고 한 것일 수 있음. 말한 대로 최대 전력 소모 자체가 25배 낮아졌다는 건 회의적임