Page 426 - 《软件学报》2026年第4期
P. 426
何子健 等: 基于扩散模型的个性化图像生成方法综述 1867
学习像素变换, 因此应用场景十分有限, 也容易受到遮挡和环境的影响. 后续 Stable VITON [78] 、TryOnDiffusion [79] 、
OOTDiffusion [80] 、IDM-VTON [81] 等工作采用基于扩散模型并且一步直接生成的设计. 为增强虚拟试衣效果, 它们
还使用了双 U-Net 架构, 即除主 U-Net 去生成图像外, 额外引入服装提取 U-Net, 通过交叉注意力机制将提取的服
装特征动态注入生成过程. 相较于传统方法, 该技术方案在保持服装图案、材质等细粒度特征方面展现出明显优
势, 为虚拟试衣的实际应用提供了更可靠的技术支持. BooW-VTON [82] 通过建立高质量伪掩码数据实现了无需掩
码的虚拟试衣, 这种无需掩码的设计避免了空间信息的损失, 使得服装的个性化生成更加鲁棒以及更好地应用于
复杂的姿态和遮挡. 图 11 给出了基于扩散模型和双 U-Net 架构的多概念服装组合试衣示意图.
多服装 服装提取 U-Net
特征
服装 1
··· ··· ··· ··· ···
服装 N
服装特征注入
姿态图
主 U-Net
自编码器 ··· ··· ··· 自解码器
人像图 添加噪声
A man is sitting in a chair, wearing a [gray coat] and [brown jeans]. 生成图像
文本输入
图 11 多概念服装组合试衣示意图
然而, 这些方法仍然将虚拟试衣视为基于模板的编辑任务, 需要在原有人物图像上进行编辑. 此时编辑受到人
物模板的影响, 无法自由进行概念属性组合, 在实际应用场景中灵活性不足. 一些方法通过尽可能保留文生图基座
模型的生成能力实现更自由的虚拟试衣. StableGarment [83] 和 IMAGDressing [84] 重新定义了虚拟试穿的任务, 其目标
是基于给定衣服和人物以及其他可选条件 (如姿态、场景、表情等) 灵活地生成可控的人物图像. StableGarment
和 IMAGDressing 借助服装 U-Net 去提取细粒度的服装特征的同时, 引入一个混合注意力的模块去将这些特征在
[85]
扩散模型去噪过程中注入, 实现了能人物服装多属性自由组合的虚拟试衣. Magic Clothing 设计了一个联合 classifier-
free 引导去平衡服装特征以及文本输入, 尽可能保持文生图基座模型的生成能力. DreamFit [86] 则提出一个轻量级
的服装编码器, 使用可训练的 LoRA [29] 层代替平行 U-Net 去提取服装特征, 轻量级服装特征提取的设计同样使得
不容易损害原生文生图基座的能力. 尽管如此, 这些方法仅适用于单件服装, 缺乏对多条件的支持, 限制了自由搭
配多种服装的能力.
为实现服装概念的灵活组合生成, AnyDressing [87] 提出了多服装虚拟试衣任务框架, 支持根据文本提示或控制
条件生成穿着任意服装组合的人物图像. 该任务面临以下挑战: 1) 服装保真度: 防止多件服装之间的混淆, 同时保
留每件服装的复杂纹理; 2) 文本-图像一致性: 最小化多件服装对无关区域的影响, 确保生成图像与文本提示的一
致性; 3) 插件兼容性: 实现与社区控制插件的无缝集成. 为解决上述问题, AnyDressing 设计了一种能够根据任意
组合的服装和个性化文本提示定制人物图像的新方法. AnyDressing 依然由服装提取 U-Net 以及主 U-Net 两个核
心网络组成, 记为 GarmentsNet 和 DressingNet. GarmentsNet 利用核心的服装特定特征提取器 (GFE) 模块, 通过共

