댓글과 토론

Hacker News 의견들
  • 가중치와 하드웨어가 있을 때 이 모델을 가장 쉽게 돌리는 방법이 궁금함
    모델 절반을 RAM으로 오프로딩하더라도 어떤 도구로 로드해야 하는지, Ollama인지 Llama.cpp인지, 아니면 Python 라이브러리로 가져오면 되는지 알고 싶음
    또 다른 모델과 비교하려면 벤치마크를 어떻게 하는 게 좋은지, 바로 쓸 수 있는 도구가 있는지도 궁금함
    • llamafile 방식이 가장 좋아 보임
      바이너리가 명령줄에서 동작하거나 작은 웹서버를 띄워줌
      llamafile은 Mixtral-8x7B-Instruct 빌드를 제공하니, 이 모델도 아마 패키징될 수 있고 양자화 형식일 가능성도 있음
      생태계를 더 잘 아는 사람에게 확인은 필요하지만, 새 모델도 그대로 llamafile에서 실행할 수 있을 것 같음
      https://github.com/Mozilla-Ocho/llamafile
    • 가장 쉬운 방법은 vllm(https://github.com/vllm-project/vllm)로 A100 두 장 정도에서 돌리는 것이고, 벤치마크는 lm-evaluation-harness(https://github.com/EleutherAI/lm-evaluation-harness)로 가능함
    • MacBook에서 LLM을 테스트하기에는 LM Studio가 훌륭함: https://lmstudio.ai/
      앱 안에서 Hugging Face의 새 모델을 검색해 바로 테스트하기가 아주 쉬움
    • Hugging Face에 The Bloke라는 사용자가 있는데, 전체 크기 모델이 나오고 얼마 안 지나 미리 양자화된 모델을 올려줌
      그 페이지를 지켜보면서 4비트 모델이 GPU에 들어가길 빌면 됨
      이미 작업 중일 것 같음
    • Together에서 여기로 시험해볼 수 있음:
      https://api.together.xyz/playground/language/mistralai/Mixtral-8x22B
  • 중복 글은 여기 있음: https://news.ycombinator.com/item?id=39986047
    프로필 대신 트윗 링크가 들어간 글임:
    https://twitter.com/MistralAI/status/1777869263778291896
  • 8x22B라니, 이게 Mixtral 8x7B만큼 좋다면 정말 재미있는 시기가 될 것 같음
    • Command R이 벤치마크에서 GPT-4를 이긴 첫 오픈소스라는 얘기를 들었음
    • 이미 8x7B가 있는데 또 다른 8x7B를 원할 이유는 없으니, 더 좋다는 뜻이겠지?
  • 주제에서 조금 벗어나지만, 이제 사람들이 마법 같다고 했던 시절의 ChatGPT 4 성능까지 다시 온 건지 궁금함
    정치적으로 더 올바르게 만들면서 성능이 크게 떨어지기 전 기준을 말함
    • MacBook에서 여러 LLM을 테스트해봤는데, 어느 시점의 GPT-4와 비교해도 아직은 모두 한참 못 미친다고 봄
      다만 GPT-3 수준인 모델은 많고, 특정 작업에 맞춰 미세조정된 모델도 꽤 있음
      오픈 모델에서 크게 빠진 부분은 언어 지원
      노르웨이어로 쓸 만한 결과를 내는 모델은 하나밖에 못 봤고, GPT-4에서는 한 번도 문제가 된 적이 없었음
    • 오픈 모델 기준으로는 적어도 ChatGPT 4 초기 릴리스 성능에는 도달했다고 봄
  • Llama 3가 나오기 전에 각자 최고의 작은 모델을 내놓으려는 경쟁인가?
    • 262GB는 딱히 작다고 하긴 어려움
      그래도 다들 Llama 3보다 못한 결과가 나올 경우 나중에 공개하기 민망해질 수 있으니, 지금 내보내는 분위기로 보임
    • Llama 3가 앞으로 2주 안에 나온다는 소문을 보면 꽤 그럴듯함
  • Mixtral 8x7B는 써보기 좋았고, 이 모델도 시험해보는 게 기대됨
  • 비공식 벤치마크는 여기 있음:
    https://huggingface.co/mistral-community/Mixtral-8x22B-v0.1/discussions/4
    • 여기에 GPT-4가 있었으면 좋겠음
      아직 넘어야 할 대상은 그 모델임
  • 4비트 양자화는 VRAM 85GB가 필요할 것 같으니, 24GB 소비자용 GPU 4장에 잘 들어가고 KV 캐시 최적화용 여유도 조금 남을 것임
    • 4비트라면 이보다 덜 쓸 수 있음
      전문가 모델 사이에 공유되는 매개변수가 꽤 있기 때문임
      다만 배치 크기 1로 돌리는 게 아니라면 8장 GPU 구성보다 괴로울 수 있음
      배치 안에서 대부분 또는 모든 전문가가 활성화될 가능성이 거의 확실함
    • Mixtral 8x7B의 2비트 양자화는 8GB GPU에서도 일부 용도로 쓸 만했음
      이 새 모델이 8~16GB급 저렴한 GPU 구성에서 어떻게 동작할지 궁금함
  • 이건 기반 모델이지 지시형 모델이 아니라는 점이 아주 중요함
    채팅에 유용한 건 지시 미세조정된 모델임
    • 강력한 기반 모델을 직접 써보면 어떤 느낌인지 궁금함
      그냥 프롬프트 텍스트를 이어 쓰듯 완성하는 식일까?
  • Llama 3가 공개되는 시점에 딱 맞춰 나왔음
    • 같은 날 Google Gemini Pro가 거의 완전한 오픈 장문 맥락 멀티모달 접근을 내놓고, OpenAI도 GPT-4-Turbo를 업그레이드했으니 뉴스가 쏟아진 큰 하루였음