- Qwen VLo는 QwenVL·Qwen2.5 VL의 이미지 이해 능력을 이미지 생성으로 확장한 프리뷰 모델로, Qwen Chat에서 바로 써볼 수 있음
- 이미지를 한 번에 완성하지 않고 왼쪽에서 오른쪽, 위에서 아래로 구성하는 점진적 생성으로 결과의 일관성과 조화를 높임
- 원본 이미지의 의미와 구조를 유지하면서 색상·스타일·객체를 바꾸는 이미지 재창작에 초점을 맞춤
- 자연어 지시만으로 배경 교체, 객체 추가·삭제, 스타일 변환, 텍스트 편집, 포스터 제작, 깊이맵·분할맵·검출맵·엣지 정보 생성까지 처리할 수 있음
- 아직 프리뷰 단계라 부정확성, 원본과의 불일치, 지시 미준수 가능성이 있으며 다중 이미지 입력과 극단적 비율 생성 일부 기능은 공식 출시 전임
Qwen VLo의 역할과 접근 방법
- Qwen VLo는 멀티모달 이해와 생성을 통합해, 이미지를 이해하는 데서 나아가 그 이해를 바탕으로 이미지를 다시 만드는 모델임
- 현재 버전은 프리뷰이며 Qwen Chat에서 사용할 수 있음
- 텍스트만으로 이미지를 만들거나, 이미지를 올린 뒤 자연어로 수정할 수 있음
- “Generate a picture of a cute cat”처럼 텍스트 프롬프트로 이미지 생성 가능
- 고양이 이미지를 업로드한 뒤 “Add a cap on the cat’s head”처럼 지시해 이미지 수정 가능
왼쪽에서 오른쪽으로 만드는 점진적 생성
- Qwen VLo는 이미지를 순차적으로 구성하는 점진적 생성 방식을 사용함
- 생성 중 예측을 계속 정제하고 최적화해 최종 이미지의 일관성과 조화를 높이도록 설계됨
- 이 메커니즘은 시각 품질을 높이고, 사용자가 더 유연하게 결과를 제어하는 창작 경험을 제공함
- 동적 해상도 생성과 결합해 긴 텍스트가 들어간 광고나 만화 패널처럼 세밀한 제어가 필요한 작업에 적합함
- 생성 과정을 점진적으로 확인하며 실시간 조정 가능
이해에서 생성으로 확장된 기능
-
원본 구조를 유지하는 재창작
- 기존 멀티모달 모델은 생성 과정에서 의미가 어긋나거나, 자동차를 다른 객체로 오해하거나, 원본의 핵심 구조를 유지하지 못할 수 있음
- Qwen VLo는 세부 포착 능력을 강화해 생성 중 높은 수준의 의미 일관성을 유지하는 것을 목표로 함
- 자동차 사진에 “색상 변경”을 요청하면 차량 모델을 식별하고 원래 구조를 유지하면서 색상 스타일을 바꿀 수 있음
-
자연어 기반 이미지 편집
- “이 그림을 Van Gogh 스타일로 바꿔줘”, “19세기 사진처럼 만들어줘”, “맑은 하늘을 추가해줘” 같은 지시를 처리할 수 있음
- 예술 스타일 변환, 장면 재구성, 세부 보정 같은 작업을 지원함
- 깊이맵, 분할맵, 검출맵, 엣지 정보 예측 같은 전통적인 시각 인식 작업도 편집 지시로 수행 가능
- 객체 수정, 텍스트 편집, 배경 변경 같은 복합 지시를 하나의 명령 안에서 처리할 수 있음
-
다국어 지시 지원
- 중국어와 영어를 포함한 여러 언어를 지원함
- 사용자는 언어와 관계없이 요구사항을 설명하고 결과물을 받을 수 있음
데모에서 확인할 수 있는 작업 유형
-
이미지 생성과 연속 편집
- 귀여운 Shiba Inu를 생성한 뒤 배경을 초원으로 바꾸고, 빨간 모자와 검은 투명 선글라스를 추가하며, 모자에 “QwenVLo” 텍스트를 넣는 흐름을 보여줌
- 같은 이미지를 Ghibli 스타일, 3D Q-version 스타일로 바꾸거나 수정한 객체를 이어지는 편집 맥락에서 계속 활용함
- 펜을 파란 마스크로 검출하거나, 강아지 가장자리를 분홍 마스크로 분할하는 작업도 포함됨
-
스타일 변환과 재해석
- 만화를 실제 사진으로 바꾸고, 배경을 Eiffel Tower로 교체하거나, 인물을 풍선처럼 공중에 뜨게 만들 수 있음
- 커플 사진을 미니멀 플랫 일러스트 스티커나 3D 렌더링 수집 피규어로 변환하고, “Happy Wedding” 텍스트를 추가하는 작업도 포함됨
- Ghibli, One Piece, Dragon Ball, SpongeBob, Minecraft, 픽셀 아트 스타일 전환을 다룸
- 고양이를 Pixar 3D 스타일로 바꾸거나, Miami 야경 스카이라인을 젤리 질감의 특수 소재 모델링 스타일로 변환하는 예시도 있음
-
복잡한 프롬프트 처리
- 지하철에서 검은 모자를 쓴 남성, 빨간 선글라스를 쓴 여성, Husky, 창밖의 Statue of Liberty, “Qwen VLo” 역 표지판을 함께 포함한 사진을 생성할 수 있음
- 다이어그램을 노트에 그리는 1인칭 시점 장면, Isaac Newton이 프리즘으로 실험을 시연하는 장면처럼 이전 결과를 이어받는 지시도 처리함
- 검은 고양이를 주인공으로 동물 무리, 외계인, 비행접시가 대치하는 광각 대형 사진을 만드는 포스터형 프롬프트도 포함됨
포스터와 텍스트 이미지 생성
- Qwen VLo는 텍스트와 이미지 입력을 함께 쓰는 작업뿐 아니라 텍스트-이미지 생성도 지원함
- 일반 이미지 외에 중국어·영어가 포함된 양방향 포스터를 만들 수 있음
- “Qwen VLo!”라는 텍스트가 에너지로 만들어진 밤의 마법사 애니메이션 아트
- 선글라스와 귀마개를 쓴 오렌지 고양이 셀피 장면
- “2025”, “A New Beginning”, “新的开始”, “长安”, “Father’s Day” 같은 텍스트가 포함된 포스터형 이미지
- 광고 포스터에서는 커피 캔, 핸드드립 주전자, 커피 색상 팔레트, “一杯咖啡,唤醒你的清晨” 같은 제목 배치를 다룸
- 다른 포스터 예시는 조명 제품을 중앙 시각 요소로 두고, 어두운 파란 배경과 따뜻한 주황빛 후광, “Illuminating not just the desk, but an attitude.” 텍스트를 배치함
지각·위치 인식까지 포함한 생성
- Qwen VLo는 생성과 편집 외에도 기존 이미지 위에 주석을 추가할 수 있음
- 예시 작업은 다음을 포함함
- 과일이 가득한 테이블을 생성한 뒤 엣지 검출 맵 예측
- 이미지 속 바나나 가장자리를 빨간 마스크로 분할
- 어지러운 책상 이미지에서 휴대폰을 빨간 박스로 표시
- 표시된 휴대폰을 지우고 책상 위에 커피 추가
- 최종 이미지를 엣지 검출 이미지로 변환
- 통합 이해·생성 모델이기 때문에 생성한 이미지도 다시 분석할 수 있음
- 강아지와 고양이를 생성한 뒤 품종을 묻는 예시에서, 강아지는 Beagle 또는 Beagle mix, 고양이는 Tabby cat으로 식별함
해상도, 화면비, 다중 이미지 입력
- Qwen VLo는 동적 해상도 학습을 사용해 동적 해상도 생성을 지원함
- 입력과 출력 모두 임의 해상도와 화면비의 이미지를 허용함
- 고정 포맷에 묶이지 않고 포스터, 일러스트, 웹 배너, 소셜 미디어 커버 같은 시나리오에 맞춘 이미지를 만들 수 있음
- 4:1 또는 1:3 같은 길쭉한 포맷도 다룰 수 있음
- 다만 극단적 화면비 이미지 생성 기능은 아직 공식 출시 전임
- 여러 입력 이미지를 이해하고 생성하는 기능도 포함됨
- 세면용품 이미지를 빨간 바구니 이미지 안에 넣는 작업이 예시로 쓰임
- 다중 이미지 입력 기능은 아직 공식 출시 전임
프리뷰 단계의 한계와 다음 방향
- Qwen VLo는 아직 프리뷰 단계라 여러 한계가 남아 있음
- 생성 과정에서 부정확성이 나타날 수 있음
- 원본 이미지와 일치하지 않는 결과가 나올 수 있음
- 지시를 따르지 못할 수 있음
- 생성 이미지의 의도를 인식하고 이해하는 안정성이 부족할 수 있음
- 향후에는 안정성과 견고성을 계속 개선할 계획임
- 멀티모달 대형 모델이 텍스트와 시각 입력·출력을 양방향으로 다루면서, 답변을 텍스트뿐 아니라 이미지로도 전달할 수 있음
- 다이어그램 생성, 보조선 추가, 핵심 영역 주석은 더 다양한 커뮤니케이션 도구로 활용될 수 있음
- 분할맵이나 검출맵 같은 중간 결과를 생성해 모델이 자신의 이해를 확인하고 성능을 개선하는 방향도 계속 탐색할 계획임