Qwen, 이미지 생성·편집 통합 모델 공개

Qwen이 9월 20일 이미지 생성과 편집을 하나로 통합한 오픈소스 모델 ‘Qwen-Image-2.1’을 공개했다. Qwen 공식 발표에 따르면 시각 생성부는 70억 개 매개변수와 32개 싱글스트림 DiT 레이어로 구성됐으며, 일반 이미지뿐 아니라 투명 채널을 포함한 이미지의 생성·편집도 기본 지원한다.

Qwen-Image-2.1은 프롬프트에 따라 일반 이미지와 투명 이미지를 구분해 출력한다. 투명 배경을 유지하면서 인물 표정이나 레이어 속 문자를 바꿀 수 있고, RGB 사진에서 피사체를 추출해 투명한 RGBA 레이어로 만드는 기능도 갖췄다. 이는 2025년 12월 별도 모델로 선보였던 Qwen-Image-Layered의 기능을 통합한 것이다.

편집에는 최대 10장의 참조 이미지를 사용할 수 있다. Qwen은 여러 인물의 단체 사진 합성, 모델·의류·신발·가방·모자를 결합한 가상 착용, 가구 10종을 활용한 실내 구성 사례를 제시했다. 토큰 단위와 이미지 청크 단위 마스크를 함께 쓰는 어텐션 구조와 KV 캐시 재사용으로 다중 이미지 편집의 연산량과 메모리 사용도 줄였다고 설명했다. 다만 자료에는 경쟁 모델과의 구체적인 벤치마크 수치가 제시되지 않았다.

반응 확인 중

읽기 목록은 이 브라우저에 저장됩니다.

출처

  1. Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation — Qwen 공식 연구·발표 · 자료: 2026. 9. 20.

이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.