- Qwen-Image 시리즈의 3세대 기반 이미지 생성 모델로, 보기 좋은 이미지를 넘어 생산성 작업에 활용할 수 있는 ‘Real(实)’을 핵심 목표로 삼음
- 최대 4.5k 토큰 입력을 처리해 신문·스토리보드·시험지처럼 정보량이 많은 레이아웃과 여러 개념이 병렬·중첩된 이미지를 한 번에 생성함
- 10px 크기의 글자와 LaTeX 수식, 손글씨 주석을 읽을 수 있게 렌더링하고 모공·머리카락·피부·붓질 같은 미세 질감도 재현함
- 12개 언어와 여러 글꼴, 100개 이상의 예술 스타일, 웹·게임·라이브스트리밍 UI를 지원하며 인터넷에서 최신 정보를 검색해 이미지에 반영할 수도 있음
- 신문 PDF, 숏드라마 스토리보드, 복잡한 UI를 비롯해 디자인·콘텐츠 제작·교육·전자상거래에서 이미지 생성을 배포 가능한 생산성 도구로 확장하려는 모델임
‘Real’을 향한 3세대 모델
- Qwen-Image-3.0은 Qwen-Image 시리즈의 3세대 기반 이미지 생성 모델임
- 세대별 핵심 방향은 다음과 같음
- Qwen-Image-1.0: Precision
- Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
- Qwen-Image-3.0: Real(实)
- ‘Real’은 세 가지 역량으로 구성됨
- 풍부한 콘텐츠: 최대 4.5k 토큰 입력과 복잡한 레이아웃 지원
- 사실적인 디테일: 10px 글자와 모공·머리카락 같은 미세 요소 재현
- 깊이 있는 지식: 12개 언어, 다양한 UI와 세계 지식을 활용한 생성
- 이미지 생성을 ‘사용 가능’에서 ‘실용적’으로, ‘보기 좋은 것’에서 유용한 것으로 발전시키는 데 목표를 둠
풍부한 콘텐츠와 복잡한 배치
- 수학 슬라이드에서 공간 관계, 수학 기호, 정리 설명과 각 요소의 상대적 위치를 함께 렌더링할 수 있음
- 약 3.7k 토큰의 지시문으로 여러 이미지를 이어 붙이지 않고 하나의 3×3 그리드를 단일 패스로 생성함
- 각 셀은 중국어·영어 문장, 수식, 차트, 만화 캐릭터가 결합된 복잡한 인포그래픽으로 구성됨
- 터널 안전 만화, 공간기하학 수업, 「Chu Shi Biao」 문체 분석, 포물선 운동, 기생충학, 오른쪽 흉통 의학 도표, Sylow 정리, 은행 내부통제, 세포 DNA 구조 비교를 한 이미지에 배치함
- 최대 4.5k 토큰의 지시문을 받아 정보 밀도가 높은 시각적 레이아웃을 이해하고 렌더링함
-
수평 확장
- 단일 캔버스에 여러 병렬 요소를 배치하는 능력을 뜻함
- 의미적 병치와 공간 제어를 활용해 여러 개념이 서로 방해하지 않도록 정돈함
-
수직 깊이
- 의미를 분해하고 논리적으로 중첩된 인터페이스를 단계별로 표현하는 능력임
- 단일 지시문으로 VSCode 프로그래밍 화면, Qwen Chat, WeChat, 핸드드립 커피 포스터가 겹쳐진 다중 화면 구조를 생성함
- 각 계층은 해당 UI의 스타일과 세부 요소를 유지함
작은 글자부터 회화 복원까지
-
작은 글자와 복잡한 조판
- 10px 크기의 작은 글자도 읽을 수 있도록 렌더링함
- 고래상어 지식 인포그래픽처럼 글과 삽화가 많은 영역을 함께 생성할 수 있음
- 대수기하학 논문 한 페이지에서 LaTeX 수식, 위첨자·아래첨자, 그리스 문자, 정리 번호, 중괄호, 분수선, 여러 줄 정렬을 재현함
- 작은 글꼴에서도 수식과 본문의 가독성을 유지함
- 사실적인 종이 질감과 조밀한 텍스트를 결합해 신문 형태의 이미지를 생성함
-
편집과 손글씨
- 책 페이지 위에 빨간색 손글씨 주석을 추가할 수 있음
- 밑줄, 물결선, 원, 화살표, 짧은 메모를 포함함
- 고등학생의 수업 필기와 같은 자연스러운 손글씨 스타일을 구현함
-
질감 표현과 복원
- 인물 사진에서 모공, 머리카락, 피부 질감 같은 미세 요소를 묘사하며 다른 사물의 섬세한 질감도 표현할 수 있음
- 손상되거나 일부가 사라진 전통 회화를 원래 화풍과 붓질에 맞춰 복원함
- 독수리 전투 그림의 먹 농담, 깃털 질감, 구도 균형을 유지하면서 곰팡이 얼룩과 손상 흔적을 제거하고 누락된 부분을 완성함
언어·UI·세계 지식의 활용
- 12개 언어와 여러 글꼴, 100개 이상의 예술 스타일, 다양한 UI 인터페이스를 지원함
- 일본어·한국어·스페인어를 정확하게 렌더링하는 사례가 포함됨
- 웹 페이지, 게임, 라이브스트리밍 등 여러 종류의 사실적인 UI 화면을 생성할 수 있음
-
지식 기반 인포그래픽
- 실제 곤충 사진의 주요 피사체를 유지하면서 연구용 인포그래픽으로 확장함
- 분류학 정보, 형태적 특징 주석, 확대 상세 화면, 축척 막대를 포함함
- 결과물을 학술 출판에 바로 사용할 수 있는 연구 도표 형태로 구성함
-
최신 정보와 IP 활용
- 모델이 보유한 지식뿐 아니라 인터넷에 연결해 최신 정보를 검색할 수 있음
- 7월 21일 Hangzhou 날씨를 검색해 일기예보 이미지를 생성함
- 특정 IP 인물을 찾아 이를 바탕으로 이미지를 만들 수 있음
- Qi Baishi와 Van Gogh가 라이브스트리밍 방에서 Qwen-Image-3.0을 소개하는 장면을 생성함
생산성 작업으로의 확장
- 세 가지 핵심 역량을 바탕으로 신문 PDF, 숏드라마 스토리보드, 복잡한 UI 인터페이스 같은 고가치 작업을 지원함
- 이미지 생성 역량을 디자인, 콘텐츠 제작, 교육, 전자상거래 등 더 많은 분야의 생산성 가치로 연결하는 것을 목표로 함