알리바바는 21일(현지시간) 이미지 생성·편집 통합형 멀티모달 AI 모델 '큐원 이미지 2.1(Qwen-Image-2.1)'을 공개했다. 시각 생성 구성 요소에 70억개 매개변수를 적용한 경량 모델로, 텍스트-이미지 생성과 편집을 하나의 체크포인트에서 실행한다. 최대 10개의 참조 이미지를 입력해 인물, 제품, 의상 등을 한 이미지로 조합할 수 있고, 마스크나 원형 표시를 이용해 헤어스타일이나 의상 같은 일부 영역만 바꾸는 편집도 지원한다.
이 모델은 배경이 투명한 이미지(RGBA)를 처음부터 생성하거나 편집할 수 있고, 이미지에서 특정 피사체만 분리하는 누끼 따기 기능도 기본으로 제공한다. 여러 이미지 입력을 효율적으로 처리하기 위해 텍스트에는 토큰 단위 인과 마스크를, 이미지 생성에는 청크 단위 마스크를 적용하는 '혼합 세분화 어텐션' 구조를 사용한다. 또 입력 이미지와 편집 지시문을 첫 단계에서 계산한 뒤 KV 캐시를 재사용해, 여러 참조 이미지를 활용하는 편집 과정의 연산량과 메모리 사용량을 줄이도록 설계됐다.
알리바바는 인포그래픽, 파노라마, 스토리보드, 가상 피팅 등 다양한 작업을 지원하며, 타이포그래피와 인물 조명, 세부 묘사도 개선했다고 밝혔다. 최대 2048×2048 해상도와 여러 화면 비율을 지원하며, 허깅페이스와 Diffusers, ComfyUI, vLLM-Omni, SGLang, AMD ROCm 환경 등에서 활용할 수 있다. 다만 기사에서는 부분 수정이나 피사체 추출 같은 핵심 기능이 기존 모델들에도 이미 있었고, 생성 품질과 연구용 비상업 라이선스 적용을 두고 비판이 나온다고 전했다.






