알리바바가 이미지 생성·편집 모델 '큐원 이미지 2.1 터보'를 공개했다. 기존 '큐원 이미지 2.1'을 바탕으로 만들었고, 70억개 매개변수 구조와 기능 범위는 유지한 채 디노이징 단계를 기본 40단계에서 8단계로 줄였다. 디노이징은 확산 모델이 노이즈를 덜어 최종 이미지를 만드는 과정이다. 단계 수를 줄이면 반복 계산 부담을 낮출 수 있지만, 실제 생성 시간은 모델 로딩과 디코딩, GPU 메모리 처리 같은 다른 작업에도 영향을 받는다.
이 모델은 원본과 같은 2K 해상도 생성·편집을 지원하며, 인물 사진, 투명 배경, 포스터, 타이포그래피, UI 레이아웃 생성과 기존 이미지 변환, 참조 이미지 조합 작업도 다룬다. 구조는 32개 레이어의 단일 스트림 DiT를 쓰고, 텍스트와 이미지 이해에는 '큐원3-VL' 8B 인코더를 활용한다. RGBA 오토인코더와 접두부 KV 캐싱도 포함해 첫 단계 계산 결과를 뒤에서 재사용한다. 디퓨저스와 클라우드 API로 쓸 수 있지만, 터보의 품질과 실제 속도는 환경과 입력 조건에 따라 달라질 수 있다.
