- Petals는 대형 언어 모델 전체를 한 기기에 올리지 않고, 가정용 GPU나 Google Colab으로 일부만 실행해 텍스트 생성과 파인튜닝을 가능하게 함
- Llama 3.1 최대 405B, Mixtral 8x22B, Falcon 40B+, BLOOM 176B까지 지원해 개인 장비로도 대형 모델을 다룰 수 있음
- 사용자는 자신이 맡은 모델 조각을 로드한 뒤, 나머지 조각을 제공하는 참여자 네트워크에 연결되는 BitTorrent식 구조로 동작함
- 단일 배치 추론은 Llama 2 70B에서 최대 6 tokens/sec, Falcon 180B에서 최대 4 tokens/sec로 챗봇과 대화형 앱에 쓸 수 있는 수준임
- 일반 LLM API보다 넓게 파인튜닝·샘플링 방식을 고르고, 모델 내부 경로와 hidden states까지 다룰 수 있음
분산 방식으로 대형 모델 실행
- Petals는 대형 언어 모델을 집에서 실행하는 것을 목표로 하며, BitTorrent처럼 여러 사용자가 모델의 서로 다른 부분을 제공하는 방식으로 동작함
- 사용자는 모델 전체를 로드하지 않고 모델 일부만 올린 뒤, 나머지 부분을 제공하는 네트워크에 참여함
- 지원 모델:
- Llama 3.1: 최대 405B
- Mixtral: 8x22B
- Falcon: 40B+
- BLOOM: 176B
- 가정용 GPU 또는 Google Colab으로 텍스트 생성과 작업별 파인튜닝을 수행할 수 있음
- 단일 배치 추론 성능:
- Llama 2 70B: 최대 6 tokens/sec
- Falcon 180B: 최대 4 tokens/sec
- 이 속도는 챗봇과 대화형 앱에 충분한 수준임
API보다 넓은 제어 범위
- Petals는 전통적인 LLM API를 넘어 파인튜닝과 샘플링 방법을 직접 선택할 수 있게 함
- 모델을 통과하는 커스텀 경로를 실행하거나 hidden states를 확인할 수 있음
- API의 편의성과 PyTorch, 🤗 Transformers의 유연성을 함께 제공함
- 바로 실행해 볼 수 있는 Colab 노트북과 GitHub 문서가 제공됨
- GPU를 제공해 Petals 용량을 늘리는 참여 방법이 있으며, 개발 소식은 Discord에서 따라갈 수 있음
- 이 프로젝트는 BigScience 연구 워크숍의 일부임