- Meta의 Llama 페이지는 Llama 모델군을 배포 용이성, 비용 효율, 성능, 대규모 확장을 겨냥한 오픈소스 AI로 묶어 소개하며, Llama 4와 Llama 3 계열을 함께 다룸
- Llama 4 Maverick과 Llama 4 Scout는 텍스트와 비전 토큰을 함께 사전학습하는 early fusion 기반 네이티브 멀티모달 모델이며, 둘 다 10M 토큰 컨텍스트를 내세움
- Llama 3 계열은 3.1·3.2·3.3으로 나뉘며, 8B·70B·405B, 1B·3B·11B·90B, 70B 등 크기와 텍스트·엣지·멀티모달 용도별 선택지를 제공함
- 성능 비교는 MMLU Pro, GPQA Diamond, LiveCodeBench, MMMU, ChartQA, DocVQA, MMLU Multi, MTOB 등을 포함하며, Llama 4 Maverick은 MMLU Pro 80.5, Scout는 74.3을 기록함
- Stoque와 Shopify 사례에서는 기술지원 반복 질의 50% 감소, 내부 만족도 11% 증가, 토큰 처리량 76% 증가, JSON 출력 기반 컴퓨트 비용 33% 절감 같은 도입 결과가 나옴
Llama 모델군과 버전별 선택지
- Llama는 자체 조건에 맞춰 구축할 수 있는 모델군으로, 손쉬운 배포와 비용 효율, 성능, 수십억 사용자 규모 확장을 겨냥함
- 최신 Llama 모델의 주요 축은 네이티브 멀티모달, 고급 추론, 긴 컨텍스트 윈도우임
- 모델 카드와 프롬프트 형식은 Model overview에서 확인할 수 있음
-
Llama 4: 네이티브 멀티모달과 10M 컨텍스트
- Llama 4는 early fusion으로 라벨 없는 텍스트와 비전 데이터를 함께 사전학습하는 네이티브 멀티모달 모델군임
- Llama 4 Maverick은 이미지와 텍스트 이해를 지원하며, 10M 토큰 컨텍스트로 긴 형식 작업을 처리함
- 메모리, 개인화, 멀티모달 애플리케이션이 주요 용도임
- Llama 4 Scout는 텍스트와 시각 지능을 제공하는 모델로, 단일 H100 GPU 효율성과 10M 컨텍스트 윈도우를 내세움
- 긴 문서 분석이 Scout의 주요 사용처로 제시됨
- 세부 정보는 Llama 4 모델 문서에서 제공됨
-
Llama 3: 크기와 용도별 모델군
- Llama 3는 파인튜닝, 증류, 어디서나 배포가 가능한 오픈소스 AI 모델군임
- Llama 3.3은 70B로 제공되는 다국어 오픈소스 대형 언어 모델이며, 405B 수준의 성능과 품질을 더 낮은 비용으로 경험할 수 있다고 안내됨
- 합성 데이터 생성 같은 텍스트 기반 용도에 맞춰져 있으며, 세부 정보는 Llama 3.3 모델 문서에서 확인할 수 있음
- Llama 3.2는 엣지 용도에 맞춘 유연하고 비용 효율적인 모델군임
- 1B와 3B는 가볍고 비용 효율적이어서 어디서나 실행할 수 있음
- 11B와 90B는 고해상도 이미지를 추론하고 텍스트를 출력할 수 있는 멀티모달 모델임
- 세부 정보는 Llama 3.2 모델 문서에서 제공됨
- Llama 3.1은 유연성과 제어를 위한 오픈 파운데이션 모델로, 8B·70B·405B 크기로 제공됨
- 일반 지식, 조정 가능성, 수학, 도구 사용, 다국어 번역 역량을 포함하며 텍스트 요약, 다국어 에이전트, 코딩 용도에 쓰임
- 세부 정보는 Llama 3.1 모델 문서에서 확인 가능함
성능 지표와 실제 도입 결과
-
Llama 4 벤치마크와 평가 조건
- Llama 4의 역량은 네이티브 멀티모달, 긴 컨텍스트, 이미지 그라운딩으로 정리됨
- 모든 Llama 4 모델은 라벨 없는 텍스트와 비전 토큰을 대량으로 함께 사전학습할 수 있도록 early fusion을 활용함
- 벤치마크는 Llama 4 Maverick과 Llama 4 Scout를 비교함
- 추론: MMLU Pro는 Maverick 80.5, Scout 74.3이며 GPQA Diamond는 Maverick 69.8, Scout 57.2임
- 코딩: LiveCodeBench는 Maverick 43.4, Scout 32.8임
- 멀티모달 이미지: MMMU는 Maverick 73.4, Scout 69.4이고 ChartQA는 Maverick 90.0, Scout 88.8이며 DocVQA는 둘 다 94.4임
- 다국어: MMLU Multi는 Maverick 84.6, Scout 74.3임
- 긴 컨텍스트: MTOB Half Book은 Maverick 54.0 / 46.4, Scout 42.2 / 36.6이고 MTOB Full Book은 Maverick 50.8 / 46.7, Scout 39.7 / 36.3임
- 효율: 1M 토큰당 비용은 둘 다 $0.19–$0.49로 제시됨
- 방법론과 주석에 따르면 Llama 결과는 temperature 0의 0-shot 평가이며, majority voting이나 병렬 테스트 시간 컴퓨트를 쓰지 않음
- GPQA Diamond와 LiveCodeBench처럼 분산이 큰 벤치마크는 불확실성을 줄이기 위해 여러 생성 결과를 평균냄
- 긴 컨텍스트 전문 평가는 일반 모델에서 전통적으로 보고되지 않아 내부 실행 결과를 공유함
- Llama 4 Maverick의 $0.19/Mtok 비용은 분산 추론을 가정한 3:1 blended 추정치이며, 단일 호스트에서는 $0.30–$0.49/Mtok로 제공 가능하다고 전망함
-
Stoque와 Shopify의 활용 사례
- Stoque는 Llama로 내부 인텔리전스를 전환해 팀이 인사이트를 더 빠르게 찾고, 마찰을 줄이며, 대규모로 더 효율적으로 일하도록 했음
- 기술지원 반복 질의는 50% 감소했고, 관리 및 지원 작업 완료는 30% 늘어남
- 내부 사용자 만족도는 11% 증가함
- Shopify는 Llama를 제품 페이지 생성, 콘텐츠 현지화, 지원 자동화에 사용함
- 이전 모델보다 토큰 처리량이 76% 높고, 의도 감지에서 Macro-F1 정확도 97.7%를 기록함
- JSON 출력으로 컴퓨트 비용을 33% 절감함
- 생성형 AI 보호 장치는 시스템 수준 보호를 통해 잠재적 위험을 사전에 식별·완화하고, 개발자가 생성형 AI를 더 책임감 있게 배포하도록 돕는 역할을 함