- distributed-llama v0.12.2에서
deepseek_r1_distill_llama_8b_q40모델을 Raspberry Pi 5 8GB 4대로 실행한 결과, 2대 구성보다 평가와 생성 속도가 모두 높게 나옴 - 2대 구성은 Evaluation 7.70 tok/s, Prediction 3.54 tok/s를 기록했고, 4대 구성은 Evaluation 11.68 tok/s, Prediction 6.43 tok/s를 기록함
- 4대 구성의 Prediction 로그는 토큰당 약 155.60ms, 2대 구성은 토큰당 약 282.22ms로 표시되어, 같은 모델에서 노드 수 증가에 따른 처리 속도 차이가 드러남
- 다른 사용자는 v0.12.7에서 8개 노드, 2.5G LAN, 오래된 Intel CPU 기반 구성으로 Evaluation 33.64 tok/s와 Prediction 16.63 tok/s를 공유함
- Raspberry Pi 5 8GB 2대에서 메모리 부족으로 프로세스가 종료되는 사례에는
--max-seq-len 4096으로 컨텍스트 크기 축소가 필요하다는 답변이 붙음
Raspberry Pi 5 8GB 구성의 실행 결과
- 테스트 모델은
deepseek_r1_distill_llama_8b_q40, distributed-llama 버전은 0.12.2임 - 비교 대상은 2 x Raspberry Pi 5 8GB와 4 x Raspberry Pi 5 8GB 구성임
| 구성 | Evaluation | Prediction |
|---|---|---|
| 2 x Raspberry Pi 5 8GB | 7.70 tok/s | 3.54 tok/s |
| 4 x Raspberry Pi 5 8GB | 11.68 tok/s | 6.43 tok/s |
2대 구성의 로그 수치
- 2 x Raspberry Pi 5 8GB 구성은 Evaluation에서 다음 수치를 기록함
nBatches: 32nTokens: 19tokens/s: 7.70129.89 ms/tok
- Prediction에서는 다음 수치를 기록함
nTokens: 77tokens/s: 3.54282.22 ms/tok
- 실행 종료 시 로그에는 Network is closed가 표시됨
4대 구성의 로그 수치
- 4 x Raspberry Pi 5 8GB 구성은 Evaluation에서 다음 수치를 기록함
nBatches: 32nTokens: 19tokens/s: 11.6885.63 ms/tok
- Prediction에서는 다음 수치를 기록함
nTokens: 77tokens/s: 6.43155.60 ms/tok
- 로그에는 토큰 생성 중 송신
864 kB, 수신1191 kB가 반복적으로 표시됨
다른 사용자의 8노드 결과
- 한 사용자는 distributed-llama v0.12.7에서 8개 노드를 사용한 결과를 공유함
- 대부분 오래된 Intel CPU, 4코어 또는 6코어 구성
- AVX2 지원
- 2.5G LAN 연결
- 이 구성의 실행 결과는 다음과 같음
- Evaluation:
33.64 tok/s,29.73 ms/tok - Prediction:
16.63 tok/s,60.13 ms/tok - Prediction 토큰 수는
245
- Evaluation:
- 사용한 명령은
./dllama inference에 모델, 토크나이저,--buffer-float-type q80,--nthreads 6,--max-seq-len 4096, 여러--workers,--steps 256을 지정하는 형태임
실행 문제와 답변
- Raspberry Pi 5 8GB 2대 구성에서 실행 중 RequiredMemory: 20474 MB가 표시된 뒤
Killed로 종료되는 사례가 공유됨- 루트 노드 명령에는
--buffer-float-type q80,--steps 16,--nthreads 4, worker 주소 1개가 포함됨 - 답변은
--max-seq-len 4096으로 컨텍스트 크기를 줄여야 한다는 내용임
- 루트 노드 명령에는
- 다른 사용자는 여러 worker에 연결된 뒤
what is 99+12프롬프트에 대해 공백과 점만 출력되는 현상을 공유함- 로그에는
RopeScaling: f=8.0, l=1.0, h=4.0, o=8192,RequiredMemory: 3310 MB,Chat template: deepSeek3가 표시됨 - 관리자는 사용 중인 버전을 물었고, 마지막 변경 사항을 pull했는지와 어떤 CPU에서 실행하는지 확인해 달라고 답함
- 로그에는