- 대규모 언어 모델(LLM) 직접 호스팅 하는 비용은 얼마나 될까?
- Llama-3 8B-Instruct 모델을 EKS에서 호스팅할 경우, 100만 토큰당 약 $17
- 같은 작업을 ChatGPT를 사용하면 100만 토큰당 $1
- 하드웨어를 셀프 호스팅하면 100만 토큰당 비용이 $0.01 이하로 줄어들고, 손익분기점 도달까지 약 5.5년 소요
- 4x NVidia Tesla T4 GPU 및 기타 하드웨어 비용($3800) + 월간 비용(전기세 및 기타) $100 으로 계산
최적의 하드웨어를 결정한 과정
-
테스트 환경: 모든 테스트는 EKS 클러스터에서 실행됨
-
첫 번째 시도: Nvidia Tesla T4 GPU를 사용하는 AWS
g4dn.2xlarge인스턴스.- 스펙: 1 NVidia Tesla T4, 32GB 메모리, 8 vCPUs.
- 결과: Llama 3의 8B 또는 70B 파라미터 버전 실행 불가.
- 문제: OOM(Out of Memory) 발생 및 응답 시간 약 10분 소요.
-
두 번째 시도: Nvidia Tesla T4 GPU 4개를 사용하는 AWS
g4dn.16xlarge인스턴스.- 스펙: 4 NVidia Tesla T4, 192GB 메모리, 48 vCPUs.
- 결과: 응답 시간이 10초 이내로 감소.
초기 구현
- 구현 방법: Hugging Face의 Llama-3 코드를 복사하여 사용.
- 비용 계산:
g5dn.12xlarge인스턴스 사용 비용: 시간당 $3.912.- 월간 비용 계산 시, 100만 토큰당 약 $167.17 비용 발생.
- ChatGPT 3.5 Turbo 비용: 100만 토큰당 $1.
문제 해결
- 문제 인식: 기존 방법이 잘못되었음을 깨닫고,
vLLM사용. - 개선 결과:
- API 서버 호스팅을 위해
ray와vllm설치. —tensor-parallel-size 4옵션으로 4개의 GPU 모두 사용.- 결과: 응답 시간 2044ms로 크게 개선.
- 비용 계산 시, 100만 토큰당 약 $17 비용 발생.
- API 서버 호스팅을 위해
대안 접근법
- 자가 하드웨어 호스팅:
- 필요한 하드웨어: 4x NVidia Tesla T4 GPU, eBay에서 약 $700.
- 기타 비용 포함, 총 설치 비용 약 $3,800.
- 월간 에너지 비용 약 $50.
- 총 월간 비용 약 $100로 계산.
- 손익분기점 도달까지 약 66개월 (5.5년) 소요.
결론
- 장점: 자가 하드웨어 호스팅 시 비용 절감 가능.
- 단점: 하드웨어 관리 및 스케일링 필요
- 100% 활용 가정이 비현실적이므로 실제 상황에 맞게 평가 필요.