이미지·영상 생성
Qwen-Image 2.1, 내 컴퓨터에서 이미지 생성과 편집을 함께
마음에 드는 이미지가 나왔는데 배경만 바꾸고 싶을 때가 있습니다. 다시 생성하면 피사체까지 달라지고, 편집용 모델을 따로 받으려니 설정부터 번거롭습니다. Qwen-Image 2.1은 이 사이를 좁힌 모델입니다. 한 장을 만드는 것에서 끝내지 않고, 참조 사진을 받아 고치거나 배경이 투명한 소재로 만드는 작업까지 이어집니다.
새 모델이 반가운 건, 작업을 처음부터 다시 하지 않아도 되기 때문입니다
개인 프로젝트에 넣을 그림을 만든다고 생각해보세요. 처음에는 찻잔 하나와 나무 책상이면 충분했습니다. 막상 화면에 넣어보니 배경 색이 맞지 않고, 찻잔을 조금 오른쪽으로 옮겨야 합니다. 좋은 첫 결과를 얻는 것만큼 그 결과를 내 작업에 맞게 고치는 일이 중요해지는 순간입니다. 생성과 편집이 따로 떨어져 있으면 이 작은 수정이 의외로 오래 걸립니다.
Qwen-Image 2.1은 텍스트에서 새 이미지를 만들면서 기존 이미지를 입력받는 편집도 같은 모델로 처리합니다. 도구가 지원한다면 인물을 유지한 채 옷이나 배경을 바꾸고, 제품의 형태를 참고해 다른 구도로 만들 수 있습니다. 다만 참조 이미지를 넣는다고 원본의 모든 세부가 보존되지는 않습니다. 작은 로고, 글자, 얼굴과 손 같은 부분은 최종 결과를 확대해서 확인해야 합니다.

2512의 새 파일이 아니라, 실행 구성이 바뀐 2.1입니다
Qwen-Image-2512를 이미 쓰고 있다면 모델 파일만 바꾸고 기존 설정을 유지하고 싶을 수 있습니다. 하지만 2.1은 7B 규모의 시각 생성 본체와 Qwen3-VL-8B 인코더를 사용하는 별도 구성입니다. 이전 Qwen-Image용 VAE1를 그대로 연결하는 방식은 맞지 않습니다. ComfyUI라면 2.1을 지원하는 버전과 노드, 그 버전용 워크플로를 함께 확인하는 것이 빠릅니다.
이 사이트에서는 2512 항목을 지우지 않고 2.1을 따로 추가했습니다. 기존 작업을 다시 열어야 할 때도 있고, 라이선스 조건도 같지 않기 때문입니다. 새 모델이 나왔다고 지금 쓰는 파이프라인2을 즉시 교체할 필요는 없습니다. 같은 프롬프트 몇 개를 두 모델에서 돌려본 뒤, 내가 자주 고치는 부분에서 실제로 도움이 되는지 살펴보는 편이 낫습니다.
투명 배경은 배경이 흰 이미지와 다릅니다
흰 바탕에 놓인 물체를 이미지로 만들면 다른 화면에 붙일 때 흰 사각형도 따라옵니다. RGBA의 알파 채널은 어느 부분을 비워둘지 함께 저장하므로, 배경 색이 다른 곳에도 피사체를 올릴 수 있습니다. Qwen-Image 2.1은 이런 투명 이미지 생성과 투명 레이어 편집을 지원합니다. 앱에서 일반 RGB 출력만 선택했다면 모델이 지원해도 투명도가 저장되지 않을 수 있습니다.
결과를 PNG나 투명도를 지원하는 WebP로 저장하고, 밝은 배경과 어두운 배경 위에 각각 올려보세요. 머리카락이나 유리 가장자리의 경계가 어색하지 않은지 보기 좋습니다. JPEG로 바꾸면 알파 채널이 사라집니다. 이 글의 수채화 그림은 개념 설명용 삽화이며, Qwen-Image 2.1의 실제 출력 품질을 보여주는 샘플은 아닙니다.

참조 이미지는 한 장부터, 요청도 한 가지부터
모델은 최대 10장의 참조 이미지를 받을 수 있습니다. 그렇다고 처음부터 열 장을 넣는 것이 좋은 출발점은 아닙니다. 대상과 배경이 섞이고 이미지마다 빛이나 시점이 다르면 무엇을 유지할지 전달하기 어려워집니다. 먼저 같은 물체가 선명하게 나온 한 장을 넣고 배경만 바꿔보세요. 이 결과가 안정되면 구도나 재질처럼 다음 조건을 추가합니다.
참조 입력은 처리해야 할 이미지 토큰3과 메모리를 늘립니다. 텍스트에서 한 장을 만든 시간을 그대로 편집 시간으로 생각하면 실제 대기가 길게 느껴질 수 있습니다. 생성 성능 화면은 우선 텍스트→이미지 기준입니다. 사진 편집에 쓸 장비를 고른다면 한 장짜리 생성 수치와 함께, 참조를 넣었을 때의 메모리 여유도 확인해야 합니다.
내 장비에서는 어느 실행 방법부터 보면 될까요
NVIDIA에서는 Diffusers나 ComfyUI처럼 설정 자료가 많은 도구가 출발점이 됩니다. RTX 5090에서는 LightX2V의 전용 최적화 경로도 확인할 수 있습니다.
Mac에서는 Metal을 사용하는 ComfyUI GGUF4와 stable-diffusion.cpp 계열을 살펴볼 수 있습니다. 같은 Q4라는 이름이라도 다른 도구의 파일을 아무 로더에나 넣을 수 있는 것은 아닙니다.
변환본이 요구하는 실행기를 먼저 맞추세요.
12~16GB급 실행 안내는 양자화5와 오프로딩6을 전제로 합니다. 파일이 들어가는 것과 편하게 반복하는 것은 다릅니다. 먼저 1024 정사각형, 한 장 생성으로 시작하고 문제가 없을 때 해상도를 올리세요. 지금 가진 장비로 가끔 이미지를 만드는 것과, 하루 종일 여러 후보를 뽑는 일은 필요한 속도가 다르므로 구매 판단도 달라져야 합니다.
2K보다 먼저 확인할 것은 내가 반복하는 작업입니다
네이티브 2K 지원은 출력 선택지가 넓다는 뜻이지 1K와 같은 속도라는 뜻은 아닙니다. 가로와 세로가 두 배면 픽셀은 네 배이고, 연산과 메모리의 증가폭은 그보다 클 수도 있습니다. 작은 썸네일에 쓸 그림이라면 낮은 해상도에서 구도와 문구를 먼저 정하는 편이 효율적입니다. 마음에 드는 후보를 고른 뒤 큰 출력으로 확인하면 기다리는 횟수도 줄어듭니다.
이 사이트에서는 Qwen-Image 2.1을 고른 뒤 장비와 해상도를 바꿔 예상 대기를 체감할 수 있습니다. 샘플을 재생하는 화면이지 방문자의 장비에서 Qwen을 실행하는 기능은 아닙니다. 생성 이미지를 보고 품질을 판단하기보다는, 한 번 더 수정하고 기다릴 만한 시간인지 살펴보는 용도로 사용하세요. 실제 설치는 이어지는 GGUF 가이드에서 시작하면 됩니다.

개인 실험과 상업 이용은 구분해야 합니다
Qwen-Image 2.1의 가중치는 Qwen Research License로 배포됩니다. 비상업 연구·평가 범위와 별도 허가가 필요한 상업 이용을 구분하는 조건입니다. 이전 Qwen-Image-2512의 Apache 2.0을 보고 2.1도 같은 조건이라고 생각하면 안 됩니다. Unsloth GGUF로 변환된 파일을 받는다고 원본의 이용 조건이 사라지는 것도 아닙니다.
유료 서비스, 고객 납품, 판매용 콘텐츠에 연결하려면 작업을 시작하기 전에 해당 라이선스의 적용 범위를 확인하세요. 개인 장비에서 이미지 생성이 가능한지 평가하는 일과 사업에 사용하는 일은 다른 판단입니다. 장비를 살 때도 속도만 보지 말고 실제로 쓸 모델의 허용 범위를 함께 확인해야 나중에 실행 환경을 통째로 바꾸는 일을 줄일 수 있습니다.
용어 각주
VAE — Variational Autoencoder의 약자입니다. 입력을 압축된 잠재 표현으로 바꾸거나, 그 표현에서 결과를 복원하는 데 쓰입니다.
본문으로 돌아가기파이프라인 — 입력부터 결과까지 이어지는 처리 단계의 묶음입니다. 각 단계에서 서로 다른 모델이나 도구를 사용할 수 있습니다.
본문으로 돌아가기토큰 — 모델이 입력이나 출력을 나누어 처리하는 단위입니다. 토큰 하나가 글자 하나나 일정한 시간 길이에 해당하지는 않습니다.
본문으로 돌아가기GGUF — 모델 정보를 담는 파일 형식으로 llama.cpp 계열 도구에서 널리 사용됩니다. 파일 형식만으로 특정 하드웨어 호환성이나 속도가 보장되지는 않습니다.
본문으로 돌아가기양자화 — 모델의 수치를 더 적은 비트로 표현하는 방법입니다. 메모리 사용량과 함께 정확도나 실행 속도도 달라질 수 있으며, 영향은 형식과 구현에 따릅니다.
본문으로 돌아가기오프로딩 — 메모리가 부족할 때 모델 데이터 일부를 GPU 메모리에서 시스템 RAM이나 저장장치로 옮겨 처리하는 방식입니다. 데이터 이동이 추가됩니다.
본문으로 돌아가기