- 1월에 출시한 Qwen2.5-VL 시리즈를 기반으로 강화 학습을 통해 모델을 최적화하고, 32B 파라미터 규모의 새로운 VL 모델 Qwen2.5-VL-32B-Instruct를 Apache 2.0 라이선스 하에 오픈 소스화
- 이전 모델과 비교하여, 이 32B VL 모델의 특징:
- 인간 선호도에 더 잘 맞춘 응답: 출력 스타일을 조정하여 더 상세하고 잘 정리된 답변을 제공함.
- 수학적 추론: 복잡한 수학 문제 해결의 정확성이 크게 향상됨.
- 세밀한 이미지 이해 및 추론: 이미지 파싱, 콘텐츠 인식, 시각적 논리 추론 등의 작업에서 정확성과 세부 분석이 강화됨.
성능
- 동급의 최신 모델들과 광범위한 벤치마킹을 통해, Qwen2.5-VL-32B-Instruct는 Mistral-Small-3.1-24B 및 Gemma-3-27B-IT와 같은 기준 모델을 능가하며, 더 큰 Qwen2-VL-72B-Instruct도 뛰어넘는 성과를 보임.
- 특히 MMMU, MMMU-Pro, MathVista와 같은 복잡하고 다단계의 추론을 요구하는 멀티모달 작업에서 상당한 이점을 가짐.
- MM-MT-Bench에서는 주관적인 사용자 경험 평가를 강조하며, Qwen2-VL-72B-Instruct보다 상당한 차이로 우수한 성과를 보임.
- 시각적 능력뿐만 아니라, 동일한 규모에서 순수 텍스트 능력에서도 최고 수준의 성과를 달성함.