Llama.cpp 의 모델 가중치 로딩 속도를 10~100배 개선

(github.com/ggerganov)

13P by xguru 2023-04-03 | ★ favorite | 댓글 1개

파일 포맷 변경으로 read() 없이 mmap() 가능해져서 가중치 로딩 속도가 10~100배 빨라짐
싱글 파일인 7B 및 멀티 파일인 13B 등도 지원해졌고, 로딩 코드가 훨씬 심플해짐
또한, 이 변경으로 인해 텐서들이 32바이트 경계에서 정렬이 되어, 특정 프로세서에서 추가적인 성능향상을 기대해 볼수 있게 됨

xguru 2023-04-03 [-]

LLaMA - Meta가 공개한 65b 파라미터 LLM
llama.cpp - 페이스북의 LLaMA 모델을 순수 C/C++로 추론하기