Hacker News 의견들
-
다른 LLM 소식으로, 아직 문서화되지 않은 neural alignment라는 새 기법으로 학습한 Mistral/Yi 파인튜닝 모델들이 Hugging Face 리더보드에서 다른 모델들을 크게 앞서고 있음
7B가 대부분의 70B 모델을 “이기고” 있고, 테스트 중인 34B도 매우 좋아 보임
https://huggingface.co/fblgit/una-xaberius-34b-v1beta
https://huggingface.co/fblgit/una-cybertron-7b-v2-bf16
이론적으로는 이 기법을 Mistral MoE에도 적용할 수 있어서, 일반 Mistral 7B와 같은 상승폭이 나오고 Mistral MoE 자체도 좋다면 결과물은 꽤 무서운 모델이 될 수 있음
데스크톱에서 실행 가능한 오픈소스 모델이 GPT-4를 정말 바짝 추격하기 시작하는 변곡점일지도 모름- 7B 버전을 써봤는데, 이전에 써본 것들과 확실히 다르게 느껴짐
Docker Compose 파일을 설명할 수 있었고, 간단한 Vue 애플리케이션 컴포넌트도 생성했음
예시를 두고 조금 더 물어봤더니 대화 전체에서 이상할 정도로 일관되고 집중력이 좋았고, 문맥을 지우지 않은 상태에서도 새 주제로 넘어가는지 이전 내용을 가리키는지 잘 구분했음
특히 “What does following mean [docker compose 내용]”이라고 물었더니 cybertron-7b가 “제공된 YAML 구성에서 ‘following’은 의존성 지정을 의미합니다”처럼 내 표현을 그대로 따옴표로 잡아 답했는데, 이런 식으로 정확한 표현을 대화에서 인용하는 모델은 처음 봄 - 흥미가 생겨서 가장 작은 변형을 대상으로 TheBloke의 GGUF 버전[1]으로 ollama modelfile을 만들어봤는데, 이렇게 작은 모델치고는 정말 GPT-4 같은 느낌이 꽤 남
이전에 로컬 LLM으로 주로 쓰던 openhermes2.5-mistral보다 더 일관적으로 느껴짐
ollama가 설치되어 있다면ollama run nollama/una-cybertron-7b-v2로 실행해볼 수 있음
[1]: https://huggingface.co/TheBloke/una-cybertron-7B-v2-GGUF - 맞음. UNA는 MoE를 여러 계층, 전문가, 거의 신경망의 어떤 부분에도 정렬할 수 있어 보임
Xaberius 34B v1 “BETA”가 왕인데, 말 그대로 아직 베타일 뿐임
이제 Mixtral에 집중할 예정이고, 이런 식으로 모듈식이라 크리스마스 선물 같음. 실험실을 열어준 @mistral에 감사함 - 이제 LLM 벤치마크는 잘해봐야 무의미하고, 나쁘면 거짓말에 가깝지 않나?
- 맞음. Mistral은 ‘안전성 학습’으로 모델을 거세하듯 약화시키는 데 별로 신경 쓰지 않음
그래서 Anthropic/Google/OpenAI보다 매개변수당 성능이 훨씬 좋으면서도 조종 가능성도 더 높을 수 있음
- 7B 버전을 써봤는데, 이전에 써본 것들과 확실히 다르게 느껴짐
-
Andrej Karpathy의 해석:
@MistralAI의 새 오픈 가중치 LLM
params.json 기준으로hidden_dim / dim = 14336/4096 => 3.5X MLP 확장,n_heads / n_kv_heads = 32/8 => 4X multiquery,"moe" => 전문가 혼합 8X top 2
관련 코드로 보이는 것:
https://github.com/mistralai/megablocks-public
이상하게도 “AI의 혁명”을 말하는 과하게 리허설된 전문 출시 영상은 없음
지금 AI 활동이 유난히 많은 이유가 궁금하다면, 가장 큰 딥러닝 학회인 NeurIPS가 다음 주이기 때문임
https://twitter.com/karpathy/status/1733181701361451130- NeurIPS가 다음 주라면, 여러 회사에서 새 아키텍처나 모델 같은 큰 발표를 기대해도 되는 건가? 연구 학회 문화에 익숙하지 않아서 궁금함
hidden_dim / dim = 14336/4096 => 3.5X MLP 확장과n_heads / n_kv_heads = 32/8 => 4X는 둘 다 기존 Mistral-7B와 정확히 같음- EMNLP 2023도 지금 열리고 있어서 발표가 몰리는 것임
-
Mistral은 설명에 크게 공들이지 않는 듯하지만, 이런 방식이 Google의 매끈하고 기업적이며 영혼 없는 Gemini 발표보다 제품에 훨씬 더 신뢰감을 줌
- 문서보다 가중치 공개가 더 좋음
Google 직원이 Gemini의 가중치, 그것도 작은 모바일 Gemini만 공개했다고 다른 회사보다 관대한 조치인 것처럼 자랑하던 모습이 떠오름
- 문서보다 가중치 공개가 더 좋음
-
거창한 발표가 꼭 필요한가? 90년대 방식으로 하면 됨: https://twitter.com/erhartford/status/1733159666417545641/ph...
- 명백히 조작되고 비현실적인 마케팅 페이지나 영상을 내놓는 것보다 훨씬 대담하고 자신감 있는 방식으로 보임
-
전문가 혼합(MoE)으로 보이고,
params.json은 다음과 같음
{ "dim": 4096, "n_layers": 32, "head_dim": 128, "hidden_dim": 14336, "n_heads": 32, "n_kv_heads": 8, "norm_eps": 1e-05, "vocab_size": 32000, "moe": { "num_experts_per_tok": 2, "num_experts": 8 } }- 이 맥락에서 전문가가 정확히 무엇을 뜻함?
- 거기에는 코드가 안 보이는데, 어떤 런타임이 이 가중치를 로드할 수 있음?
-
목표가 정확히 비슷한 회사들은 아니지만, 이 모델 발표를 이틀 전 Google의 Gemini 발표와 대비하면 꽤 웃김
-
이번 주 초 Google의 “데모만 있고 모델은 없는” 접근과 극명하게 대비됨
Stanford의 Megablocks로 학습한 것처럼 보임: https://github.com/mistralai/megablocks-public -
논쟁적일 수 있지만 Mistral 7B가 실제 LLM 최첨단이라고 봄
ChatGPT 4가 놀라운 건 맞고 첫날부터 구독해왔지만, 거대하고 멀리 있는 서버팜에서 돌아가며 거의 블랙박스임
Mistral은 작고, 크기에 비해 일반 질문과 코드 모두에서 놀라울 정도로 일관적이고 유용하며, 검열도 없고, 1년 만에 가능하리라 믿기 어려운 도약임
MacBook Air에서 12 tok/s로 돌릴 수 있고, 데스크톱에서 써보는 게 기대됨- MacBook Air에서 실행 가능한 범위에서는 최첨단이지만, LLM 전체나 오픈소스 전체의 최첨단은 아님
Yi 34B와 Llama2 70B가 아직 더 잘함 - 인터넷에서 소비되는 정보의 50%가 최근 24시간 안에 만들어진다면, 작은 모델이 큰 모델보다 꽤 큰 이점을 가질 수 있음
LLM이나 SmallLM을 매주 또는 매일 계속 재학습하거나 파인튜닝해서 최신 정보를 반영할 수 있다면, 1~2년 전 학습된 낡은 모델은 따라가기 어려움
라이선스는 모르겠지만 OpenAI가 Mistral7B 같은 작은 모델을 GPT 스택에 넣고 매주 처음부터 다시 학습한 뒤 GPT-4와 같은 가격을 받을 수도 있음
성능은 약해도 최신성이 있는 모델을 선호할 사용자는 분명 있을 것 같음 - 동의함. Mistral 7B는 정말 놀라울 정도로 좋음
Intel 버전이나 Berkeley Starling 같은 파인튜닝 모델들은 7B에 불과한데도 gpt3.5T에 꽤 근접한 느낌이 남
13B Mistral을 정말 기대했는데, 이 MoE가 24GB 3090에서 돌아갈지는 모르겠음
양자화, 오프로딩, 앞으로 나올 기법들로 실행 가능해지길 바람 - MacBook Air에서 12 tok/s라면 좀 낮아 보임
llama.cpp에서 Metal GPU 가속을 쓰고 있나? MacBook은 없지만 llama.cpp 벤치마크를 보면 GPU 가속으로 거의 30 tok/s까지 갈 수 있는 것 같았음 - 정말 그렇다. 적어도 llama2 13b와 동급처럼 느껴짐
mistral 70b가 존재했고 7b 크기에서 llama2 대비 보여준 개선폭만큼 llama2 70b보다 나았다면, 분명 gpt3.5와 비슷한 수준이었을 것임
- MacBook Air에서 실행 가능한 범위에서는 최첨단이지만, LLM 전체나 오픈소스 전체의 최첨단은 아님
-
이제 실험적으로 동작하는 Hugging Face 버전이 있음: https://huggingface.co/DiscoResearch/mixtral-7b-8expert
-
Google은 가짜 데모, Mistral은 마그넷 링크 하나로 끝냄