- Voyage AI가 공개한
voyage-multimodal-3는 텍스트와 이미지가 섞인 지식베이스를 하나의 임베딩 모델로 검색하려는 RAG·의미 검색용 모델임 - PDF, 슬라이드, 표, 그림, 문서 스크린샷처럼 레이아웃 정보가 중요한 자료를 문서 파싱 없이 벡터화할 수 있다는 점이 핵심 차별점임
- CLIP 계열 모델의 혼합 모달리티 검색 한계를 줄이기 위해 텍스트와 시각 정보를 같은 Transformer 인코더에서 처리하며, 모달리티가 섞인 입력의 문맥 관계를 보존함
- 20개 멀티모달 검색 데이터셋에서 다음으로 성능이 좋은 멀티모달 임베딩 모델보다 평균 19.63% 높은 검색 정확도를 보였고, 34개 텍스트 검색 데이터셋에서도 OpenAI v3 large를 앞섬
- 스크린샷 비율이 높아질수록 CLIP 기반 모델은 품질이 떨어졌지만
voyage-multimodal-3는 전 구간에서 성능 저하가 작아, 화면 캡처 기반 검색 파이프라인에 실용적임
voyage-multimodal-3가 겨냥하는 사용처
voyage-multimodal-3는 Voyage AI의 첫 멀티모달 임베딩 모델로, 시각 자료와 텍스트가 함께 많은 지식베이스의 RAG와 의미 검색을 목표로 함- 입력 대상은 텍스트와 콘텐츠가 많은 이미지이며, 대표 예시는 다음과 같음
- 텍스트 스크린샷
- 그림과 표
- PDF 스크린샷
- 슬라이드 덱
- 기타 문서 이미지
- 생성된 벡터는 텍스트 의미뿐 아니라 글꼴 크기, 텍스트 위치, 여백 같은 시각 특징도 반영함
- 복잡한 레이아웃이나 그림·사진이 섞인 문서는 휴리스틱 기반 파싱에서 정확도 문제가 생길 수 있어, 모델은 원본 화면을 바로 검색용 벡터로 만드는 접근을 취함
- 기능 예시는 sample notebook에서 확인할 수 있음
CLIP 계열과 다른 임베딩 방식
- Amazon Titan Multimodal G1, Google Vertex AI multimodal, Cohere multimodal v3 같은 기존 멀티모달 임베딩 모델은 OpenAI CLIP 기반 구조를 사용함
- CLIP 계열 구조는 서로 다른 모달리티를 독립 네트워크로 처리함
- 이미지는 vision tower를 통해 벡터화됨
- 텍스트는 text tower를 통해 벡터화됨
- 이 구조에서는 텍스트와 이미지가 섞인 입력을 한 번에 처리하기 어려움
voyage-multimodal-3는 두 모달리티를 같은 Transformer 인코더 안에서 직접 벡터화함- 텍스트와 시각 특징이 별도 구성요소가 아니라 통합 표현의 일부로 다뤄짐
- 최신 비전-언어 모델의 아키텍처를 생성이 아니라 벡터화에 적용한 형태임
- 덕분에 섞인 텍스트와 이미지, 문서 스크린샷, 복잡한 PDF, 주석이 있는 이미지에서 시각 정보와 텍스트 정보의 문맥 관계를 함께 벡터에 담을 수 있음
스크린샷이 섞인 검색에서 드러난 차이
- CLIP 유사 모델은 모달리티 갭(modality gap) 때문에 혼합 모달리티 검색에서 성능이 낮아질 수 있음
- 예시에서 “I address you, members of the Seventy-Seventh Congress…”라는 텍스트 조각과 가장 가까운 벡터는 해당 스크린샷이 아니라 다른 텍스트였음
- 이런 현상은 텍스트 벡터가 관련 이미지보다 관련 없는 같은 모달리티 항목에 더 가까워지는 검색 편향으로 이어짐
- Voyage AI는 PyTorch 문서로 정량 실험을 구성함
- 동일한 내용을 가진 문서 세트를 일반 텍스트 문자열과 스크린샷으로 각각 만듦
- 텍스트 기반 문서 일부와 나머지 문서의 스크린샷을 섞어 혼합 모달리티 데이터셋을 구성함
- 스크린샷 비율은 0%부터 100%까지 다르게 설정함
- 각 모델은 코사인 유사도로 상위 10개 결과를 검색하고 NDCG@10으로 평가됨
- CLIP 기반 모델은 스크린샷 비율이 90%까지 늘어날수록 검색 품질이 낮아졌고, 모든 텍스트를 이미지로 바꾼 경우에도 성능이 낮았음
voyage-multimodal-3는 모든 비율에서 가장 높은 성능을 보였고, 전반적인 성능 저하도 거의 없었음- 이 결과는 스크린샷 안의 의미 정보를 벡터에 담는 능력과, 모든 입력 모달리티를 같은 백본으로 처리하는 접근의 견고함을 보여줌
평가 데이터셋과 비교 대상
- 멀티모달 평가는 3개 작업, 총 20개 데이터셋에서 진행됨
- 표/그림 검색: charxiv, mmtab-test, ChartQA, Chartve, FintabnetQA, PlotQA
- 문서 스크린샷 검색: ViDoRe benchmark의 Energy, Healthcare Industry, Artificial Intelligence, Government Report, InfoVQA, DocVQA, ArxivQA, TabFQuad, TAT-DQA, Shift Project
- 텍스트-사진 검색: meme-cap, mm-imdb, winoground, docci
- 표준 텍스트 검색 평가는 법률, 금융, 대화, 코드, 웹, 기술 등 6개 도메인 34개 데이터셋에서 진행됨
- 모든 데이터셋에서 쿼리는 텍스트이며, 문서는 그림, 사진, 텍스트, 문서 스크린샷 또는 이들의 조합일 수 있음
- 멀티모달 작업의 비교 모델은 다음과 같음
- OpenAI CLIP large (
clip-vit-large-patch14-336) - Amazon Titan Multimodal Embeddings G1 (
amazon.titan-embed-image-v1) - Cohere multimodal v3 (
embed-multimodal-v3.0) - SigLIP So400M (
siglip-so400m-patch14-384) - ColQwen2 v0.1 (
colqwen-v0.1)
- OpenAI CLIP large (
- 표준 텍스트 검색에서는 OpenAI v3 large (
text-embeddings-3-large), Cohere multimodal/English 1 v3,voyage-3와 비교함 - Cohere multimodal v3는 순수 텍스트에서 Cohere English v3 (
embed-english-v3.0)를 text tower로 사용하므로, 차트에서는 혼동을 줄이기 위해 “Cohere multimodal v3” 라벨만 사용함
검색 정확도 결과
voyage-multimodal-3는 20개 멀티모달 검색 데이터셋 전체에서 다음으로 성능이 좋은 멀티모달 임베딩 모델보다 평균 19.63% 높은 검색 정확도를 기록함- 표/그림 검색에서는 OpenAI CLIP large, Amazon Titan Multimodal G1, Cohere multimodal v3, SigLIP So400M, ColQwen2 v0.1 대비 각각 41.44%, 45.00%, 43.37%, 20.66%, 6.14% 앞섬
- 문서 스크린샷 검색에서는 같은 비교 모델 대비 각각 26.54%, 37.68%, 25.84%, 35.62%, 0.98% 높은 성능을 보임
- 텍스트-사진 검색에서는 같은 비교 모델 대비 각각 6.55%, 5.16%, 5.86%, 3.42%, 10.34% 앞섬
- 표준 텍스트 검색에서는 OpenAI v3 large보다 5.13%, Cohere multimodal/English 1 v3보다 13.70% 높은 성능을 냄
- 순수 텍스트 문서 검색 정확도는
voyage-3보다 0.05% 높아 두 모델이 거의 비슷한 수준임 - 전체 평가 결과는 스프레드시트에 공개되어 있음
사용 시작과 제공 자료
voyage-multimodal-3는 공개 당일부터 사용할 수 있음- 첫 2억 토큰은 무료임
- 시작 자료는 sample notebook과 docs에서 제공됨
- 파인튜닝 임베딩 모델에 관심 있는 사용자는
contact@voyageai.com으로 연락할 수 있음