Qwen-Image-Layered 将图片分解为多个 RGBA 图层,适合把背景、物体和部分结构分开编辑。分层不是自动得到摄影现场的真实遮挡关系;新增可见区域可能由模型补全。下面以自有桌面图片拆层并重新合成为验收任务,未执行模型推理。
先为分层准备明确目标
输入 layer_input.png 中只有桌面、杯子与小盒子,任务是移动杯子并保留其他物体。官方模型卡要求 transformers>=4.51.3,并使用包含 QwenImageLayeredPipeline 的较新 diffusers。先确认导入类存在再下载权重;这里不提供下载大小、速度或显存保证。

保存每个 RGBA 输出
from diffusers import QwenImageLayeredPipeline
from PIL import Image
import torch
p = QwenImageLayeredPipeline.from_pretrained("Qwen/Qwen-Image-Layered")
p = p.to("cuda", torch.bfloat16)
with torch.inference_mode():
out = p(image=Image.open("layer_input.png").convert("RGBA"),
generator=torch.Generator(device="cuda").manual_seed(777),
true_cfg_scale=4.0, negative_prompt=" ", num_inference_steps=50,
num_images_per_prompt=1, layers=4, resolution=640,
cfg_normalize=True, use_en_prompt=True)
for i, layer in enumerate(out.images[0]):
layer.save(f"layer-{i}.png")
layers 是请求的分层参数,不是人工指定“第1层杯子”的标签。模型返回后要逐张辨认内容,别在文件名里提前写死对象名称。
分层的第一项验收是重新合成
在支持透明图层的编辑器里导入全部 PNG,检查 RGBA 模式和透明区域。记录当前堆叠顺序,合成后与输入并排对照:物体数量、文字、细边缘与阴影应分别检查。顺序颠倒会遮住物体,透明边缘异常会出现白边;这两种问题不能仅靠“看起来像原图”忽略。模型输出有重绘成分,不承诺像素级还原。
再做一次小范围编辑
只移动辨认出的杯子图层,查看原位置背景是否合理补全、杯子阴影是否仍跟随。若杯子被拆到两个层,先合并相关层再移动;若层里夹带小盒子,就不适合单对象操作。下一步保留原图、图层目录与合成预览,让接手者知道模型补全了哪些区域。不要将生成的不可见区域描述为真实照片信息。
参考资料
依据 2026-10-03 读取的官方资料整理:官方文档 1。
Ai菜鸟网。发布者:AI小管家,转载请注明出处:https://www.alyyhw.com/33080.html