# Qwen-Image-3.0 - 풍부한 콘텐츠, 사실적 디테일, 깊이 있는 지식

> Clean Markdown view of GeekNews topic #31666. Use the original source for factual precision when an external source URL is present.

## Metadata

- GeekNews HTML: [https://news.hada.io/topic?id=31666](https://news.hada.io/topic?id=31666)
- GeekNews Markdown: [https://news.hada.io/topic/31666.md](https://news.hada.io/topic/31666.md)
- Type: GN+
- Author: [xguru](https://news.hada.io/@xguru)
- Published: 2026-07-22T07:14:11+09:00
- Updated: 2026-07-22T07:14:11+09:00
- Original source: [qwen.ai](https://qwen.ai/blog?id=qwen-image-3.0)
- Points: 2
- Comments: 1

## Topic Body

- Qwen-Image 시리즈의 3세대 기반 이미지 생성 모델로, 보기 좋은 이미지를 넘어 생산성 작업에 활용할 수 있는 ‘**Real(实)**’을 핵심 목표로 삼음
- 최대 **4.5k 토큰 입력**을 처리해 신문·스토리보드·시험지처럼 정보량이 많은 레이아웃과 여러 개념이 병렬·중첩된 이미지를 한 번에 생성함
- **10px 크기의 글자**와 LaTeX 수식, 손글씨 주석을 읽을 수 있게 렌더링하고 모공·머리카락·피부·붓질 같은 미세 질감도 재현함
- **12개 언어**와 여러 글꼴, 100개 이상의 예술 스타일, 웹·게임·라이브스트리밍 UI를 지원하며 인터넷에서 최신 정보를 검색해 이미지에 반영할 수도 있음
- 신문 PDF, 숏드라마 스토리보드, 복잡한 UI를 비롯해 디자인·콘텐츠 제작·교육·전자상거래에서 이미지 생성을 **배포 가능한 생산성 도구**로 확장하려는 모델임

---

### ‘Real’을 향한 3세대 모델
- [Qwen-Image-3.0](https://chat.qwen.ai/?inputFeature=t2i)은 Qwen-Image 시리즈의 **3세대 기반 이미지 생성 모델**임
- 세대별 핵심 방향은 다음과 같음
  - Qwen-Image-1.0: **Precision**
  - Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
  - Qwen-Image-3.0: **Real(实)**
- ‘Real’은 세 가지 역량으로 구성됨
  - **풍부한 콘텐츠**: 최대 4.5k 토큰 입력과 복잡한 레이아웃 지원
  - **사실적인 디테일**: 10px 글자와 모공·머리카락 같은 미세 요소 재현
  - **깊이 있는 지식**: 12개 언어, 다양한 UI와 세계 지식을 활용한 생성
- 이미지 생성을 ‘사용 가능’에서 ‘실용적’으로, ‘보기 좋은 것’에서 **유용한 것**으로 발전시키는 데 목표를 둠

### 풍부한 콘텐츠와 복잡한 배치
- 수학 슬라이드에서 공간 관계, 수학 기호, 정리 설명과 각 요소의 상대적 위치를 함께 렌더링할 수 있음
- 약 **3.7k 토큰**의 지시문으로 여러 이미지를 이어 붙이지 않고 하나의 3×3 그리드를 단일 패스로 생성함
  - 각 셀은 중국어·영어 문장, 수식, 차트, 만화 캐릭터가 결합된 복잡한 인포그래픽으로 구성됨
  - 터널 안전 만화, 공간기하학 수업, 「Chu Shi Biao」 문체 분석, 포물선 운동, 기생충학, 오른쪽 흉통 의학 도표, Sylow 정리, 은행 내부통제, 세포 DNA 구조 비교를 한 이미지에 배치함
- 최대 **4.5k 토큰**의 지시문을 받아 정보 밀도가 높은 시각적 레이아웃을 이해하고 렌더링함
- ## 수평 확장
  - 단일 캔버스에 여러 병렬 요소를 배치하는 능력을 뜻함
  - **의미적 병치**와 공간 제어를 활용해 여러 개념이 서로 방해하지 않도록 정돈함
- ## 수직 깊이
  - 의미를 분해하고 논리적으로 중첩된 인터페이스를 단계별로 표현하는 능력임
  - 단일 지시문으로 VSCode 프로그래밍 화면, Qwen Chat, WeChat, 핸드드립 커피 포스터가 겹쳐진 **다중 화면 구조**를 생성함
  - 각 계층은 해당 UI의 스타일과 세부 요소를 유지함

### 작은 글자부터 회화 복원까지
- ## 작은 글자와 복잡한 조판
  - **10px 크기의 작은 글자**도 읽을 수 있도록 렌더링함
  - 고래상어 지식 인포그래픽처럼 글과 삽화가 많은 영역을 함께 생성할 수 있음
  - 대수기하학 논문 한 페이지에서 LaTeX 수식, 위첨자·아래첨자, 그리스 문자, 정리 번호, 중괄호, 분수선, 여러 줄 정렬을 재현함
  - 작은 글꼴에서도 수식과 본문의 가독성을 유지함
  - 사실적인 종이 질감과 조밀한 텍스트를 결합해 **신문 형태의 이미지**를 생성함
- ## 편집과 손글씨
  - 책 페이지 위에 빨간색 손글씨 주석을 추가할 수 있음
  - 밑줄, 물결선, 원, 화살표, 짧은 메모를 포함함
  - 고등학생의 수업 필기와 같은 자연스러운 손글씨 스타일을 구현함
- ## 질감 표현과 복원
  - 인물 사진에서 모공, 머리카락, 피부 질감 같은 **미세 요소**를 묘사하며 다른 사물의 섬세한 질감도 표현할 수 있음
  - 손상되거나 일부가 사라진 전통 회화를 원래 화풍과 붓질에 맞춰 복원함
  - 독수리 전투 그림의 먹 농담, 깃털 질감, 구도 균형을 유지하면서 곰팡이 얼룩과 손상 흔적을 제거하고 누락된 부분을 완성함

### 언어·UI·세계 지식의 활용
- **12개 언어**와 여러 글꼴, 100개 이상의 예술 스타일, 다양한 UI 인터페이스를 지원함
- 일본어·한국어·스페인어를 정확하게 렌더링하는 사례가 포함됨
- 웹 페이지, 게임, 라이브스트리밍 등 여러 종류의 사실적인 **UI 화면**을 생성할 수 있음
- ## 지식 기반 인포그래픽
  - 실제 곤충 사진의 주요 피사체를 유지하면서 연구용 인포그래픽으로 확장함
  - 분류학 정보, 형태적 특징 주석, 확대 상세 화면, 축척 막대를 포함함
  - 결과물을 학술 출판에 바로 사용할 수 있는 연구 도표 형태로 구성함
- ## 최신 정보와 IP 활용
  - 모델이 보유한 지식뿐 아니라 인터넷에 연결해 **최신 정보**를 검색할 수 있음
  - 7월 21일 Hangzhou 날씨를 검색해 일기예보 이미지를 생성함
  - 특정 IP 인물을 찾아 이를 바탕으로 이미지를 만들 수 있음
  - Qi Baishi와 Van Gogh가 라이브스트리밍 방에서 Qwen-Image-3.0을 소개하는 장면을 생성함

### 생산성 작업으로의 확장
- 세 가지 핵심 역량을 바탕으로 **신문 PDF**, 숏드라마 스토리보드, 복잡한 UI 인터페이스 같은 고가치 작업을 지원함
- 이미지 생성 역량을 디자인, 콘텐츠 제작, 교육, 전자상거래 등 더 많은 분야의 생산성 가치로 연결하는 것을 목표로 함

## Comments



### Comment 62185

- Author: neo
- Created: 2026-07-22T07:14:13+09:00
- Points: 1

###### [Hacker News 의견들](https://news.ycombinator.com/item?id=48989701) 
- 온라인 쇼핑에 이런 모델을 밀어붙이는 게 이상하게 느껴짐. 옷이 몸에 잘 맞도록 보정하고 조명까지 보기 좋게 만들기 때문에, **실제 옷의 착용감과 핏**은 도입 전과 마찬가지로 알기 어려움
  - 단기 목표는 상품 판매지만, 더 야심 찬 장기 목표는 **광고와 현실의 경계**를 흐려 구매 시점에 보통 사람들이 이런 의문조차 품지 않도록 문화적 규범을 바꾸는 것임  
    50년 뒤에는 ‘광고의 진실성’ 자체가 되찾을 수 없는 이상적인 과거로 여겨질 수도 있음
  - 일부가 원하는 건 생성형 AI 자체보다 “유능한 사진가가 찍은 것처럼 바꿔줘” 같은 **이미지 간 변환**일 수 있음  
    하지만 매달 신규 상품이 1천 개씩 올라오는 플랫폼이라면 실제의 불완전한 사진이 구매 전환에도 더 유리할 듯함. 특히 모든 색상 변형이 똑같아 보이는 3D풍 이미지는 오히려 거부감이 듦
  - Facebook Marketplace의 중고 가구 광고에서도 비슷함. 대부분의 이미지는 **Pottery Barn 카탈로그**처럼 AI로 꾸며 놓고, 마지막에야 흠집과 손상이 가득한 실제 물건이 어수선한 차고에 놓인 사진을 보여줌
  - 완벽한 조명 아래 전문 사진가가 모델에게 셔츠를 입혀 찍는 기존 방식보다 정말 **왜곡이 덜할지** 의문임

- HTML의 **메타 키워드**에 hentai, nudes 등 성인물 관련 항목이 100개 넘게 들어 있어 흥미로움
  - 이 키워드가 성적 콘텐츠에 제품을 사용하지 말라고 요청하는 [https://qwen.ai/usagepolicy](<https://qwen.ai/usagepolicy>) 같은 페이지에도 전역으로 적용돼 있음  
    콘솔에서 `document.querySelector('meta[name="keywords"]').content`를 실행하면 전체 태그를 볼 수 있음
  - 일부 검색 엔진 최적화 도구가 메타 키워드를 자동으로 추가한 듯함. `qwen`이 들어간 흔한 검색어를 수집하면서 성인물 맥락의 `gwen`이나 `ben` 오타까지 포함했을 가능성이 있음
  - 요즘 `keywords` 메타 태그가 무슨 가치가 있는지 모르겠고, **77KB 이상**의 쓸모없는 데이터만 페이지에 더하고 있음
  - Qwen 팀도 성인물 커뮤니티가 Civitai에서 보듯 새 이미지 생성 모델을 빠르게 채택한다는 사실을 알 것임. 이들이 이미 확인하는 검색 결과에 모델을 노출하려는 **검색 엔진 최적화 전략**으로 보임

- GPT Image 1 출력으로 학습한 듯하며, 특유의 **노란 색조**가 분명함  
  [https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...](<https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/image3/whale.jpg>)  
  [https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...](<https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/image3/update5.png>)  
  [https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...](<https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/image3/mlp.png>)  
  [https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...](<https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/image3/image%20-%202026-07-21T003745.645.png>)
  - GPT Image 1도 다른 이미지 생성 모델의 출력으로 학습하지 않고 노란 색조가 생겼음. 사람들이 부드러운 석양빛 사진을 선호하고 선호도 모델이 이를 쉽게 포착하기 때문에, 미적 매력을 최적화하면 의도적으로 억제하지 않는 한 모든 이미지에 약한 색조가 생김
  - **노란색·붉은색 색조**는 학습 사진의 출처와 무관하게 매우 흔한 문제임. 사진 관련 스타트업에서 원본 이미지로 학습해도 색조가 생겼으며, 이를 막기가 계속 어려웠음
  - AI 생성 이미지가 이미 웹의 일부가 됐으므로, 일반적인 **웹 스크래핑**으로는 생성 이미지를 학습 데이터에서 피할 수 없음

- 대표 이미지 제목의 **아랍어**가 명백하게 망가졌지만 실제 모델 사용 시에는 그렇지 않음. 대표 이미지가 Qwen Image 3.0으로 생성된 게 아닐 수도 있음
  - 새 모델을 시험하기 좋은 기준임. Tamil과 아랍어 꾸란 구절로 GPT Image 2와 Nano Banana Pro를 시험했을 때는 제대로 생성했으며, 방대한 학습 데이터 덕분일 가능성이 있음

- “3×3 격자 전체를 정확히 묘사하는 데 **3,700토큰**이 필요하다”고 했지만 프롬프트를 공개하지 않아 시연의 설득력이 떨어짐

- **가중치 공개 시점과 여부**에 관한 내용이 전혀 없는데, 따로 적힌 곳이 있는지 궁금함
  - Qwen-Image-2.0 가중치도 공개되지 않았으므로 이번에도 가능성이 낮아 보임
  - Z-Image와 최초 Qwen-Image 이후 완전히 **폐쇄형 모델**로 전환한 듯함. 공개된 이미지만 보면 Qwen-Image 3.0은 gpt-image-2나 nb-pro 같은 독점 모델보다 못한 대안에 불과해 보임
  - 공개해 봐야 Cursor, Azure, Amazon이 수익화할 텐데 굳이 그럴 이유가 없음. OpenAI가 실제로 개방하지 않는 한 가능성은 희박함

- 실제 로고 2개, 완전한 디자인 언어 명세, 애플리케이션 화면 캡처 3장을 제공했지만 끔찍한 이미지 3개만 나왔고, 어느 것도 전달한 **원본 로고**와 같지 않았음

- chat.qwen.ai에서 시험한 결과 구성과 해부학적 정확성 모두 **Qwen Image 1 수준**에도 미치지 못함. 다리가 세 개이거나 눈이 빛나는 결과가 나오며, 철회된 Microsoft Lens 정도의 품질임

- 대학 시절 이런 모델이 있었다면 좋았을 것 같음. 시각적 학습자로서 긴 글보다 **도해와 설명 그림**을 통해 일부 주제를 훨씬 쉽게 이해했을 것임
  - 하지만 생성된 도해는 모사물에 불과함. 원자의 구성 요소를 정확히 설명하는 포스터를 요청해도 확률 구름과 관련된 표현 대신 빨강·파랑·회색 탁구공이 원형 궤도를 도는 그림이 나오고, 운이 좋아야 전자 껍질 도표를 얻을 것임  
    Nano Banana 2에 “원자의 작동 원리를 설명하는 학부생용 인포그래픽 포스터”를 요청해 보니 중학교 과학 교과서 같은 **보어 모형**이 생성됐음
  - 아내가 모든 요리법을 ChatGPT 이미지 생성에 넣어 잡지풍 페이지로 만들었는데 결과가 훌륭함. 아이들이 어린 시절 먹었던 요리를 알 수 있도록 **가족 요리책**을 만드는 중임

- 여전히 이미지 곳곳에 **누런 필터**가 남아 있음
