알리바바가 배경 없는 그림을 바로 뽑는 모델을 풀었습니다 — 큐원 이미지 2.1과 연구 전용 라이선스
이미지를 만들어 주는 AI는 이제 흔합니다. 그런데 만든 다음에 배경을 지우는 일은 여전히 사람 몫이었습니다.
알리바바 큐원팀이 9월 20일 공개한 큐원 이미지 2.1은 그 단계를 없앴습니다. 배경이 비어 있는 그림을 모델이 처음부터 그렇게 만들어 냅니다. 여기에 생성과 편집이 한 모델에 들어갔고, 2048 곱하기 2048 크기가 기본입니다.
좋은 소식만 있는 것은 아닙니다. 라이선스를 보면 이야기가 조금 복잡해집니다. 차례대로 살펴보겠습니다.

알리바바 큐원이 9월 20일 이미지 2.1을 풀었습니다
알리바바의 큐원팀이 2026년 9월 20일 큐원 이미지 2.1을 공개했습니다. 가중치는 같은 날 허깅페이스와 모델스코프에 올라갔습니다.
큐원은 알리바바가 만드는 모델 계열의 이름입니다. 언어 모델로 잘 알려져 있는데 이미지 쪽 계열도 따로 이어 오고 있었고 이번이 그 갱신판입니다.
2.1이라는 번호가 말해 주듯 큰 도약이라기보다 앞선 판을 다듬은 성격입니다. 다만 다듬어진 지점이 실무에서 꽤 크게 와닿습니다.
생성과 편집이 한 모델에 들어갔습니다
예전에는 그림을 만드는 모델과 고치는 모델이 따로 있었습니다. 만들 때 한 모델을 쓰고 고칠 때 다른 모델을 불러와야 했습니다.
큐원 이미지 2.1은 둘을 하나로 합쳤습니다. 만든 그림을 그 자리에서 고치라고 말할 수 있습니다.
설치하고 관리할 것이 줄어든다는 점도 있지만, 더 중요한 것은 만든 것과 고친 것 사이의 그림체가 어긋나지 않는다는 점입니다.

시각 생성부는 70억 파라미터입니다
이 모델에서 그림을 실제로 그려 내는 부분의 크기는 70억 파라미터입니다. 요즘 기준으로는 작은 편에 속합니다.
그런데도 대부분의 벤치마크에서 비공개 상용 이미지 모델 다수를 앞선다고 큐원팀은 밝혔습니다.
작은 모델이 큰 모델을 이기는 일은 이미지 쪽에서 종종 일어납니다. 그림은 글보다 필요한 지식의 폭이 좁아서 학습을 잘 시키면 크기를 덜 타기 때문입니다.
알파 채널 — 배경이 비어 있는 그림이 바로 나옵니다
큐원 이미지 2.1의 가장 큰 변화는 네 번째 채널입니다. 보통 그림은 빨강과 초록과 파랑 세 채널로 이루어지는데, 여기에 투명도를 뜻하는 알파 채널이 붙었습니다.
즉 로고나 아이콘, 오려낸 인물처럼 배경이 비어 있는 그림이 모델에서 곧바로 나옵니다.
이 방식은 나중에 배경을 지우는 것과 결과가 다릅니다. 머리카락 끝이나 유리처럼 반투명한 부분이 훨씬 자연스럽게 남습니다.

배경 제거 한 단계가 통째로 사라집니다
디자인 작업에서 배경 제거는 가장 자주 반복되면서 가장 지루한 일입니다. 자동 도구를 써도 경계가 지저분해서 손을 보게 됩니다.
그 단계가 없어지면 절약되는 것은 시간만이 아닙니다. 단계가 하나 줄면 그만큼 실수할 자리도 줄어듭니다.
여러 장을 한꺼번에 만들어야 하는 작업이라면 차이가 더 크게 벌어집니다.
2K가 확대가 아니라 원래 크기입니다
큐원 이미지 2.1은 2048 곱하기 2048 크기를 바로 만들어 냅니다. 작게 그린 다음 키운 것이 아니라 처음부터 그 크기로 그린 것입니다.
확대한 그림과 원래 그 크기로 그린 그림은 자세히 보면 다릅니다. 확대는 없던 세부를 지어내지만 원본 생성은 세부가 처음부터 있습니다.
여러 화면 비율도 함께 지원합니다. 가로로 긴 것, 세로로 긴 것, 정사각형 모두 가능합니다.

참조 이미지를 열 장까지 넣습니다
원하는 분위기나 대상을 보여 주는 참조 이미지를 최대 열 장까지 넣을 수 있습니다.
한 장만 넣을 때와 여러 장을 넣을 때는 결과가 꽤 다릅니다. 여러 장을 넣으면 모델이 그 사이의 공통점을 잡아내기 때문에 한 장에만 있는 우연한 특징에 덜 끌려갑니다.
같은 인물이나 같은 제품을 여러 장면에 반복해서 등장시켜야 하는 작업에 특히 유용합니다.
동그라미를 치거나 덧칠해서 고칠 곳을 지정합니다
부분 수정을 지시하는 방법이 늘었습니다. 고치고 싶은 자리에 동그라미를 치거나, 색을 덧칠하거나, 따로 마스크 이미지를 주는 방식을 모두 받습니다.
말로만 설명하면 모델이 엉뚱한 곳을 건드리는 일이 흔합니다. 화면에서 직접 가리킬 수 있으면 그 오해가 크게 줄어듭니다.
다만 화면에 표시하는 작업 자체가 어려운 환경이라면 여전히 말로 지시하는 방법을 쓰게 됩니다. 두 방법을 섞어 쓸 수 있다는 점이 중요합니다.

사람과 제품의 생김새를 유지합니다
이미지 편집에서 가장 흔한 실패는 고치고 났더니 사람 얼굴이 다른 사람이 되어 있는 것입니다.
큐원 이미지 2.1은 편집을 거쳐도 인물과 제품의 생김새를 유지하는 쪽을 강화했다고 밝혔습니다.
제품 사진을 여러 배경에 올려야 하는 상업 작업에서 이 부분은 품질 기준 자체입니다. 병 모양이 미묘하게 달라지면 쓸 수 없습니다.
큐원 이미지 벤치에서 60.28을 받았습니다
큐원팀이 공개한 큐원 이미지 벤치의 29개 모델 비교에서 이 모델은 종합 60.28점을 기록했습니다.
다만 이 점수는 모델을 만든 쪽이 설계한 시험에서 나온 숫자입니다. 자체 벤치마크는 참고 자료로 보시는 편이 맞습니다.
실제 품질은 결국 본인 작업에 맞는지로 판단해야 합니다. 이미지 모델은 특히 취향과 용도를 많이 타는 분야입니다.

그런데 라이선스가 연구 전용입니다
여기서 조건이 하나 붙습니다. 큐원 이미지 2.1은 큐원 리서치 라이선스로 배포됩니다.
이 라이선스는 비상업적 목적에 한해 무료 사용을 허락합니다. 상업적 사용은 허용 범위 밖입니다.
가중치가 공개된 것은 맞지만 아무 데나 써도 된다는 뜻은 아닙니다. 이 구분을 놓치면 나중에 곤란해질 수 있습니다.
오픈 가중치와 상업적으로 써도 된다는 다른 말입니다
오픈 가중치라는 말은 파일을 받을 수 있다는 뜻일 뿐입니다. 그 파일로 무엇을 해도 되는지는 라이선스가 따로 정합니다.
아파치나 MIT 같은 라이선스라면 상업적 사용까지 열려 있습니다. 반면 연구 전용 라이선스는 실험과 학습에만 허용합니다.
모델을 고를 때는 성능표보다 라이선스 파일을 먼저 여시는 편이 안전합니다. 나중에 되돌리기가 훨씬 어려운 쪽이 라이선스이기 때문입니다.

상업 사용은 따로 허가를 받아야 합니다
상업적으로 쓰시려면 알리바바 쪽 법인과 별도 계약을 맺어야 합니다. 문의 창구가 라이선스 문서에 안내돼 있습니다.
개인 창작자 입장에서는 현실적으로 문턱이 높습니다. 작은 규모의 작업 하나를 위해 대기업과 계약을 협의하기는 어렵습니다.
그래서 당분간 이 모델의 자리는 실험과 학습, 그리고 개인적인 용도가 될 가능성이 큽니다.
내려받을 수 있는 곳 — 허깅페이스와 모델스코프
가중치는 허깅페이스와 모델스코프, 그리고 큐원 자체 저장소에서 받을 수 있습니다. 세 곳 모두 공개 당일부터 열렸습니다.
허깅페이스는 전 세계 AI 모델이 모이는 공간이고 모델스코프는 알리바바가 운영하는 비슷한 곳입니다.
국내에서는 허깅페이스 쪽이 접속이 안정적인 편입니다. 다만 파일이 커서 내려받는 데 시간이 꽤 걸립니다.

컴피UI에서 바로 돌아갑니다
로컬에서 이미지 생성을 다루는 도구로 널리 쓰이는 컴피UI가 공개 직후 이 모델을 지원했습니다.
컴피UI는 블록을 연결해 작업 흐름을 만드는 방식이라 처음에는 낯설지만, 한 번 만들어 두면 같은 설정을 계속 재사용할 수 있습니다.
SVIL에서도 블로그 삽화를 만들 때 컴피UI를 씁니다. 새 모델이 나왔을 때 바로 시험해 볼 수 있다는 점이 로컬 환경의 장점입니다.
그래픽카드 메모리는 얼마나 필요한가요
정밀도를 낮추지 않고 그대로 올리면 대략 27기가바이트에서 30기가바이트 사이를 씁니다. 개인용 그래픽카드로는 벅찬 수치입니다.
24기가바이트 카드와 시스템 메모리 64기가바이트 정도면 원본 상태로 다룰 수 있다는 안내가 나옵니다.
즉 아무 조치 없이 그냥 돌리기에는 요구 사양이 높습니다. 다행히 줄이는 방법이 있습니다.

7B라는 숫자가 실제 용량을 말해 주지 않는 이유
70억이라는 숫자는 그림을 그리는 부분만 센 것입니다. 실제로 돌리려면 글을 읽어 이해하는 인코더 등 다른 부품이 함께 올라갑니다.
그래서 파라미터 수만 보고 메모리를 계산하면 실제보다 한참 적게 나옵니다.
모델 크기를 볼 때는 파라미터 수와 함께 실제 파일 용량, 그리고 함께 필요한 구성 요소를 같이 보셔야 합니다.
4비트로 줄이면 4기가 안쪽까지 내려갑니다
양자화는 모델 안의 숫자를 더 거친 단위로 바꿔 용량을 줄이는 기법입니다. 4비트로 줄이면 필요한 메모리가 약 3.9기가바이트까지 내려간다는 측정이 나와 있습니다.
물론 공짜는 아닙니다. 세부 표현이 조금씩 무뎌지고 글자나 미세한 질감에서 차이가 나타나는 경우가 있습니다.
다만 대부분의 개인 작업에서는 그 차이가 실제 문제가 되지 않는 수준입니다. 먼저 줄인 판으로 시험해 보시길 권합니다.

16기가 카드에서 한 장에 25초였습니다
16기가바이트 메모리를 가진 그래픽카드에서 1024 곱하기 1024 크기 한 장을 20스텝으로 만드는 데 약 25초가 걸렸다는 측정이 공유됐습니다.
한 장에 25초면 앉아서 기다릴 만한 시간입니다. 열 장을 만들어도 5분이 안 됩니다.
2K 크기로 올리면 시간이 더 늘어납니다. 초안은 작게 여러 장 뽑고 마음에 드는 것만 크게 다시 만드는 방식이 효율적입니다.
양자화 버전도 같은 날 돌기 시작했습니다
공개 당일에 이미 용량을 줄인 배포판과 그 사용법 안내가 돌기 시작했습니다. 요즘 오픈 가중치 모델의 전형적인 풍경입니다.
공식 배포는 원본만 내놓고, 줄이는 작업은 커뮤니티가 몇 시간 안에 해치웁니다.
덕분에 개인 장비에서 쓸 수 있게 되는 시점이 예전보다 훨씬 빨라졌습니다.

투명 배경이 실제로 바꾸는 작업들
가장 먼저 떠오르는 것은 로고와 아이콘, 스티커입니다. 배경이 없어야 어디에든 올릴 수 있는 종류입니다.
발표 자료나 블로그 삽화에서 인물이나 사물만 오려 쓰는 작업도 훨씬 쉬워집니다.
여러 장을 겹쳐 한 장면을 만드는 합성 작업에서는 단계가 줄어드는 정도가 아니라 작업 방식 자체가 달라집니다.
로컬에서 돌린다는 것의 의미 — 비용과 사생활
모델을 내 컴퓨터에서 돌리면 장당 요금이 없습니다. 전기값과 시간만 들어갑니다. 많이 만들수록 차이가 벌어집니다.
더 중요한 것은 자료가 밖으로 나가지 않는다는 점입니다. 가족 사진이나 아직 공개하지 않은 작업물을 다룰 때 이 차이는 큽니다.
대신 처음 설치와 설정에 품이 듭니다. 한 번 넘고 나면 그다음부터는 수월해집니다.

저시력 작업자에게 유용한 지점
배경 제거는 정교한 눈과 정밀한 마우스 조작을 요구하는 작업입니다. 화면을 크게 확대해 쓰는 분들에게는 특히 부담이 큽니다.
그 단계가 통째로 사라지면 작업의 난이도가 눈에 띄게 내려갑니다. 손으로 다듬던 경계를 모델이 처음부터 정리해 주기 때문입니다.
다만 동그라미를 쳐서 고칠 곳을 지정하는 기능은 반대 방향입니다. 말로 지시하는 방법도 함께 남아 있다는 점을 기억해 두시면 좋겠습니다.
쓰기 전에 확인해야 할 것 세 가지
첫째는 라이선스입니다. 상업적으로 쓰실 계획이라면 지금 상태로는 쓰실 수 없습니다.
둘째는 장비입니다. 원본은 24기가바이트 이상을 요구하니 본인 카드 용량에 맞는 양자화 판을 찾으셔야 합니다.
셋째는 용도입니다. 투명 배경과 부분 편집이 필요 없는 작업이라면 이미 쓰시던 모델을 바꿀 이유가 크지 않을 수 있습니다.

핵심 정리
알리바바 큐원이 9월 20일 큐원 이미지 2.1을 공개했습니다. 시각 생성부 70억 파라미터로 생성과 편집을 한 모델에 담았습니다.
핵심은 네 채널 투명 이미지를 모델이 직접 만들어 낸다는 점입니다. 2048 곱하기 2048 원본 생성, 참조 이미지 열 장, 동그라미와 덧칠로 하는 부분 수정도 함께 들어갔습니다.
가중치는 허깅페이스와 모델스코프에서 받을 수 있고 컴피UI에서 바로 돌아갑니다. 다만 라이선스가 연구 전용이라 상업적 사용은 별도 허가가 필요합니다.
참고하실 만한 것
SVIL 블로그에서는 로컬에서 AI 이미지를 다루는 방법을 꾸준히 다루고 있습니다. 블로그 삽화도 전부 로컬에서 만들고 있어서 겪은 문제를 그대로 적어 두는 편입니다.
장비 사양별로 무엇까지 돌아가는지, 어떤 설정이 실제로 차이를 만드는지에 대한 글도 함께 올리고 있습니다.
궁금하신 점이나 다뤄 주셨으면 하는 주제가 있으시면 아래 메일로 알려 주세요.
출처
- Alibaba Qwen open-sources Qwen-Image-2.1 for unified image generation and editing (TechNode)
- Qwen/Qwen-Image-2.1 (Hugging Face)
- Alibaba Opens Qwen-Image-2.1: 7B Gen-and-Edit Model With Native RGBA (Pandaily)
- Qwen-Image 2.1 on Comfy: Open-Weight Image Generation and Editing (comfy.org)
- Qwen-Image-2.1: 7B Open Weights You Cannot Ship (CellCog)
- Alibaba releases Qwen-Image-2.1 with transparent editing and research-only weights (RuntimeWire)
- Qwen-Image-2.1 VRAM Requirements (Spheron GPU Recommender)
- How to Use Qwen-Image 2.1 GGUF in ComfyUI (kombitz)
협업문의 : kuroicode@gmail.com
블로그 : https://blog.svil.dev/
홈페이지 : https://svil.dev/