- OCR 성능을 분석하는 Omni OCR 벤치마크에서 최근 출시된 Qwen 2.5 VL(72B, 32B), Gemma-3-27B, DeepSeek-v3-0324, mistral-ocr 등의 모델을 포함하여 비교
- Qwen 2.5 VL 72b/32b 모델이 가장 높은 정확도 기록
- 둘 다 약 75% 정확도로 GPT-4o 수준의 성능을 보여줌
- Qwen 72b는 32b보다 0.4% 높은 정확도 기록, 사실상 오차 범위 내 유사한 성능임
- 두 Qwen 모델이 mistral-ocr(72.2%) 성능을 넘김
- mistral-ocr은 OCR에 특화되어 훈련된 모델임에도 불구하고 Qwen에 밀림
- Gemma-3 (27B) 모델은 **42.9%**의 낮은 정확도
- Gemini 2.0 아키텍처 기반인데도 낮은 성능이어서 다소 의외의 결과
Omni OCR Benchmark
- OCR 및 데이터 추출 기능을 비교하는 벤치마킹 도구로, GPT-4o와 같은 대규모 멀티모달 모델의 텍스트 및 JSON 추출 정확도를 평가
- 이 벤치마크의 목표는 전통적인 OCR 제공자와 멀티모달 언어 모델 전반에 걸쳐 OCR 정확도의 포괄적인 벤치마크를 게시하는 것
- 평가 데이터셋과 방법론은 모두 오픈 소스로 제공되며, 추가 제공자를 포함하도록 이 벤치마크를 확장하는 것을 권장