1P by GN⁺ | ★ favorite | 댓글 1개
  • IPEX-LLM은 Intel GPU, NPU, CPU에서 LLM을 가속하는 PyTorch용 라이브러리지만, 현재 프로젝트는 아카이브되어 Intel의 개발·지원 보장이 없음
  • 지원 범위는 로컬 PC의 iGPU, Arc·Flex·Max 같은 discrete GPU, Intel Core Ultra NPU, CPU를 포함하며, llama.cpp, Ollama, vLLM, HuggingFace transformers, LangChain, LlamaIndex 등과 통합됨
  • 70개 이상 모델이 ipex-llm에서 최적화 또는 검증되었고, Llama, Phi, Mistral, Mixtral, DeepSeek, Qwen, ChatGLM, MiniCPM, Qwen-VL, MiniCPM-V 등이 포함됨
  • 최신 업데이트에는 DeepSeek V3/R1 671B, Qwen3MoE 235B를 1~2개 Intel Arc GPU에서 FlashMoE로 실행하는 내용과 ipex-llm 2.2.0, PyTorch 2.6 GPU 지원, Ollama·llama.cpp Portable Zip 지원이 포함됨
  • README는 알려진 보안 이슈가 있다고 명시하며, Intel은 유지보수·버그 수정·신규 릴리스·업데이트를 보장하지 않고 패치도 더 이상 받지 않음

프로젝트 상태와 기본 목적

  • IPEX-LLM은 Intel 하드웨어에서 LLM을 가속하기 위한 LLM 가속 라이브러리
  • 대상 하드웨어는 Intel GPU, NPU, CPU임
    • GPU 예시는 로컬 PC의 iGPU, Arc, Flex, Max 같은 discrete GPU
    • NPU는 Intel Core Ultra 계열을 대상으로 함
  • 프로젝트 상단에는 아카이브 상태가 명시되어 있음
    • Intel은 개발 또는 지원을 제공하거나 보장하지 않음
    • 유지보수, 버그 수정, 신규 릴리스, 업데이트가 보장되지 않음
    • Intel은 이 프로젝트에 대한 패치를 더 이상 받지 않음
    • 알려진 보안 이슈가 있음

통합되는 생태계

  • ipex-llm은 여러 LLM 실행·서빙·개발 도구와 연동
    • llama.cpp
    • Ollama
    • vLLM
    • HuggingFace transformers
    • LangChain
    • LlamaIndex
    • Text-Generation-WebUI
    • DeepSpeed-AutoTP
    • FastChat
    • Axolotl
    • HuggingFace PEFT
    • HuggingFace TRL
    • AutoGen
    • ModelScope
  • 빠른 시작 문서는 Ollama, llama.cpp, Arc B580, NPU, PyTorch/HuggingFace, vLLM, FastChat, 다중 Intel GPU 서빙, Text-Generation-WebUI, Axolotl, 벤치마킹을 다룸
  • Docker 가이드는 C++ GPU 추론, Python GPU 추론, vLLM GPU·CPU, FastChat GPU, VSCode GPU 개발 환경을 포함함

모델과 최적화 범위

  • README는 70개 이상 모델이 ipex-llm에서 최적화 또는 검증되었다고 밝힘
  • 예시 모델군은 다음과 같음
    • LLaMA/LLaMA2/LLaMA 3 계열
    • Mistral, Mixtral, Gemma
    • LLaVA, Whisper
    • ChatGLM2/ChatGLM3
    • Baichuan/Baichuan2
    • Qwen/Qwen-1.5/Qwen2 계열
    • InternLM
    • DeepSeek, MiniCPM, Qwen-VL, MiniCPM-V 등
  • 지원 정밀도와 양자화는 저비트 추론 중심으로 구성됨
    • FP8, FP6, FP4, INT4
    • INT8
    • INT2는 llama.cpp IQ2 메커니즘 기반으로 제공됨
  • 저장·로드 예시는 INT4, FP4, FP6, INT8, FP8, FP16 등 저비트 모델과 GGUF, AWQ, GPTQ 모델 로드를 포함함

최신 업데이트에서 강조된 기능

  • 2025년 5월 업데이트는 ipex-llm의 FlashMoE로 DeepSeek V3/R1 671BQwen3MoE 235B를 1~2개 Intel Arc GPU에서 실행할 수 있다고 밝힘
    • 예시 GPU는 Arc A770 또는 B580
  • 2025년 4월에는 ipex-llm 2.2.0이 릴리스되었고 Ollama Portable Zip과 llama.cpp Portable Zip이 포함됨
  • llama.cpp Portable Zip에는 보안 경고가 붙어 있음
    • mmap 기반 모델 로딩은 멀티테넌트 또는 공유 호스트 환경에서 사이드채널로 데이터가 유출될 수 있음
    • --no-mmap 옵션으로 mmap을 비활성화할 수 있음
  • 2025년 4월에는 Intel GPU용 PyTorch 2.6 지원이 추가됨
  • 2025년 3월에는 Gemma3 모델 지원과 DeepSeek-R1-671B-Q4_K_M을 Xeon의 1~2개 Arc A770에서 실행하는 내용이 추가됨
  • 2025년 2월에는 Intel GPU용 Ollama Portable Zip, Intel GPU·NPU용 llama.cpp Portable Zip, Intel Arc GPU의 vLLM 0.6.6 지원이 추가됨
  • 2024년 12월에는 Intel Core Ultra NPU에 대해 Python과 C++ 지원이 추가되었고, 대상 시리즈는 100H, 200V, 200K, 200H임

데모와 성능·정확도 자료

  • 데모는 로컬 LLM을 Intel Core Ultra iGPU, Intel Core Ultra NPU, 단일 Arc GPU, 다중 Arc GPU에서 실행하는 예시를 제공함
    • Intel Core Ultra iGPU: Ollama로 Mistral-7B Q4_K 실행
    • Intel Core Ultra NPU: HuggingFace로 Llama3.2-3B SYM_INT4 실행
    • 2개 Intel Arc dGPU: llama.cpp로 DeepSeek-R1-Distill-Qwen-32B Q4_K 실행
    • Intel Xeon + Arc dGPU: FlashMoE로 Qwen3MoE-235B Q4_K 실행
  • 성능 섹션은 Intel Core Ultra와 Intel Arc GPU에서의 토큰 생성 속도 자료를 제공함
  • 벤치마킹 가이드를 통해 ipex-llm 성능 벤치마크를 직접 실행할 수 있음
  • 모델 정확도 섹션은 Wikitext 데이터셋에서 측정한 Perplexity 결과를 제공함
    • 비교 정밀도는 sym_int4, q4_k, fp6, fp8_e5m2, fp8_e4m3, fp16
    • 대상 모델에는 Llama-2-7B-chat-hf, Mistral-7B-Instruct-v0.2, Baichuan2-7B-chat, Qwen1.5-7B-chat, Llama-3.1-8B-Instruct, gemma-2-9b-it 등이 포함됨
  • 성능은 사용 방식, 구성, 기타 요인에 따라 달라지며, ipex-llm은 비 Intel 제품에서 같은 수준으로 최적화되지 않을 수 있음

개발·활용 예시

  • 코드 예시는 저비트 추론, FP16/BF16 추론, 분산 추론, 저장·로드, 파인튜닝, 커뮤니티 라이브러리 통합으로 나뉨
  • 파인튜닝은 Intel GPU에서 LoRA, QLoRA, DPO, QA-LoRA, ReLoRA를 포함함
  • Intel CPU에서도 QLoRA 파인튜닝 예시가 제공됨
  • 애플리케이션 가이드는 GraphRAG, RAGFlow, LangChain-Chatchat, Continue, Open WebUI, PrivateGPT, Dify에서 ipex-llm을 사용하는 흐름을 다룸
  • API 문서는 HuggingFace Transformers 스타일 Auto Classes API와 임의 PyTorch 모델 최적화 API를 제공함

댓글과 토론

Hacker News 의견들
  • 4코어를 오래 고집했던 회사가 다음 소비자용 GPU에서 지난 10년간 AMD와 Nvidia가 사실상 강요해 온 8~16GB VRAM 고착을 깨뜨리며 만회할 기회가 있음
    부담스럽지 않은 가격에 32~48GB가 나오면 꽤 시적인 장면일 듯하고, Intel은 소프트웨어 지원 면에서도 제대로 움직이는 것처럼 보임

    • Intel은 AI 분야에서 Nvidia를 따라잡는 중인데, 가장 큰 이유는 제품 경쟁력이 부족하기 때문임
      2022년 10월 출시된 Intel Arc A770 16GB는 약 300달러, Nvidia 4060 Ti 16GB는 약 500달러인데 실제 AI 작업에서는 4060 Ti가 두 배쯤 빠름: https://cdn.mos.cms.futurecdn.net/FtXkrY6AD8YypMiHrZuy4K-120...
      이론상으로는 Arc A770이 더 빠르다는 점이 문제를 더 크게 만듦. TFLOPS 기준 성능은 Nvidia 4060의 두 배 이상임: https://cdn.mos.cms.futurecdn.net/Q7WgNxqfgyjCJ5kk8apUQE-120...
      그런데 AI 관련 생태계가 전부 Nvidia의 CUDA에서 돌아가도록 개발·최적화돼 있어서 실제 성능이 낮게 나옴
      결국 인지도와 생태계의 문제임. Intel이 32GB나 64GB VRAM을 가진 워크스테이션 GPU를, 말도 안 되게 비싼 엔터프라이즈 괴물이 아니라 개발자가 살 수 있는 형태로 내놓으면 엄청나게 팔릴 것임
      가장 빠른 카드일 필요도 없음. 경쟁 제품보다 VRAM만 더 많이 주면 됨. 지금은 학습이나 영상 생성에서 GPU 속도보다 VRAM 부족이 더 큰 병목인데, Intel이 이걸 왜 못 보는지 모르겠음
    • 24GB 초과 VRAM은 GDDR7이 나오기 전까지 싸지기 어려울 듯하고, GDDR7도 36GB 정도까지만 밀어 올릴 수 있을 것 같음
      더 고급인 적층 GDDR6 계열은 꽤 비쌀 가능성이 높고, 신호 무결성 문제 때문에 다이를 그냥 더 붙일 수도 없음
    • 우리에게는 뻔해 보이는 일이 제품 관리자에게는 업계 표준으로 보임
      업계 플레이어가 기존 질서를 흔든 걸 마지막으로 본 게 언제였는지 생각해보면, Intel도 그렇게 많이 변한 회사는 아님
    • 부담 없는 가격에 32~48GB가 나오면 멋지겠다는 말에 동의함
      일부 Asrock 메인보드 BIOS에서는 Ryzen5에서 VRAM을 64GB까지 설정할 수 있다고 들었고, 지금 여러 AMD 하드웨어로 조사해보는 중임
    • AMD가 고품질 드라이버를 만든다면 돈 내고라도 구경하고 싶음 :-)
  • 벤치마크 데이터가 궁금함
    예시에서 보인 속도는 꽤 좋아 보였음

  • 이걸 쓸 수 있는 VRAM 많은 Intel GPU 추천이 있는지 궁금함

    • 데이터센터용 제품인 Max GPU(Ponte Vecchio) 가 있고, 128GB HBM2e 메모리, 408MB L2 캐시, 64MB L1 캐시를 제공함
      Gaudi도 비슷한 수치지만, 마케팅 자료 기준으로는 AI 작업에 특화된 코어를 갖춘 쪽임
      Dell과 Supermicro의 완제품에서 구할 수 있음: https://www.supermicro.com/en/accelerators/intel
      더 읽을거리: https://www.servethehome.com/intel-shows-gpu-max-1550-perfor...
    • 소비자용으로는 Intel Arc A770 16GB VRAM이 있음
      그 이상은 엔터프라이즈 제품군으로 넘어가기 시작함
  • llamafile이나 다른 것과 비교한 성능 벤치마크가 있는지 궁금함
    [0] - https://github.com/mozilla-Ocho/llamafile

    • 이미 llama.cpp에서 Intel GPU를 사용할 수 있고, ARC와 내장 GPU 모두 여러 백엔드를 지원함
      지원 백엔드는 SYCL, Vulkan, OpenCL임
      직접 하드웨어를 갖고 있지는 않지만, Intel이 데이터센터 쪽에서 밀고 있는 만큼 ARC에서는 SYCL이 더 빠를 것 같음
      [1]: https://www.intel.com/content/www/us/en/developer/articles/t...
  • 예제를 실행할 수 있는 클라우드 GPU 스크립트가 같이 있으면 좋겠음
    호환되는 GPU를 추측하게 하기보다 클라우드 제공자에서 바로 실행하게 해주는 방식이면 유용할 듯하고, 직접 만들어볼까 고민 중임

  • 주요 클라우드 제공자 중에는 Intel GPU를 제공하는 곳이 없음

    • Intel GPU는 동남아 시장에서는 꽤 침투했고, Intel도 새 세대를 곧 내놓을 예정임
      게다가 Nvidia의 GRID 라이선스와 달리 추가 라이선스 비용 없이 GPU 가상화를 허용해서, 호스팅 사업자가 카드를 쪼개서 제공할 수 있음
      앞으로 Intel 기반 제공이 훨씬 늘어날 것 같은 느낌임
    • 클라우드는 아니지만 소비자용으로는 꽤 좋은 제안임
      16GB 메모리와 4060 Ti 근처 성능을 가격의 65% 정도에 제공함
    • 그래도 Intel CPU를 제공하는 곳은 많음