- 개인 LLM 실험 규모가 커지면서 8x RTX 3090과 총 192GB VRAM을 갖춘 전용 AI 서버를 집에 직접 구축함
- 기존 48GB VRAM 환경으로는 실험을 따라가기 어려워져, Meta의 Llama-3.1 405B 실행까지 염두에 둔 멀티 GPU 노드로 확장함
- 구성은 Asrock Rack ROMED8-2T, AMD Epyc Milan 7713, 512GB DDR4-3200 RDIMM, 1600W 전원공급장치 3개, 4x NVLink로 묶은 8개 RTX 3090이 중심임
- NVLink는 GPU 쌍마다 112GB/s 전송률을 제공하며, PCIe 레인·라이저·추론 엔진·파인튜닝 같은 병목도 후속 글의 주요 주제로 남아 있음
- 가정용 대형 LLM 서버 구축은 가능하지만, 조립 난점과 비용이 큰 실수가 많아 하드웨어 선택과 검증 과정이 성패를 좌우함
지하실 LLM 서버의 목표
- 최신 사이드 프로젝트인 AI from The Basement는 전용 LLM 서버로, 8x RTX 3090 그래픽카드와 총 192GB VRAM을 갖춤
- 목표 중 하나는 Meta의 Llama-3.1 405B 실행임
- 기존에는 LLM 실험에 48GB VRAM을 사용했지만, 2024년 3월 무렵 이 용량으로는 실험을 따라가기 어렵다고 판단함
- 하드웨어 선택 과정에서는 CPU와 플랫폼, 메모리 속도, PCIe 레인 수, 2^n 개 GPU 구성, 텐서 병렬성, 추론 엔진 선택을 함께 검토함
하드웨어 구성과 구축 과정의 쟁점
- 최종 플랫폼은 서버급 메인보드와 EPYC CPU, 대용량 메모리, 다중 전원공급장치, 8개 GPU 조합으로 구성됨
- Asrock Rack ROMED8-2T 메인보드: 7x PCIe 4.0 x16 슬롯, 128 PCIe 레인
- AMD Epyc Milan 7713 CPU: 2.00GHz, 부스트 3.675GHz, 64코어/128스레드
- 512GB DDR4-3200 3DS RDIMM 메모리
- 1600W 전원공급장치 3개
- 8x RTX 3090 GPU와 4x NVLink
- NVLink는 각 GPU 쌍 사이에서 112GB/s 데이터 전송률을 제공함
- 실제 조립에서는 금속 프레임 구멍 가공, 30A 240V 차단기 추가, CPU 소켓 핀 휨 같은 물리적 문제가 발생함
- PCIe 라이저 문제와 오류 없는 PCIe 연결을 위해 SAS Device Adapter, Redriver, Retimer의 중요성도 다뤄짐
- 후속 글에서는 NVLink 속도, PCIe 레인 대역폭, VRAM 전송 속도, Nvidia가 소프트웨어 수준에서 P2P 네이티브 PCIe 대역폭을 차단한 결정이 이어질 예정임
- TensorRT-LLM, vLLM, Aphrodite Engine 같은 텐서 병렬성 지원 추론 엔진 벤치마크와 자체 LLM 학습·파인튜닝도 다음 주제로 남아 있음
- 2004년에 60GB HDD를 갖고 기뻐했던 경험과 비교해, 20년 뒤 한 머신의 그래픽카드에 그 세 배가 넘는 용량을 갖게 된 점을 기술 발전의 예로 듦
- 프로젝트의 목적은 미래에 등장할 멋진 것들을 만드는 데 기여하는 것이며, 언젠가 192GB VRAM도 많지 않았다고 돌아볼 수 있다고 봄
- Part II of this Blogpost Series가 이어지는 글로 제공됨