Page 426 - 《软件学报》2026年第4期
P. 426

何子健 等: 基于扩散模型的个性化图像生成方法综述                                                       1867


                 学习像素变换, 因此应用场景十分有限, 也容易受到遮挡和环境的影响. 后续                      Stable VITON [78] 、TryOnDiffusion [79] 、
                 OOTDiffusion [80] 、IDM-VTON [81] 等工作采用基于扩散模型并且一步直接生成的设计. 为增强虚拟试衣效果, 它们
                 还使用了双    U-Net 架构, 即除主   U-Net 去生成图像外, 额外引入服装提取 U-Net, 通过交叉注意力机制将提取的服
                 装特征动态注入生成过程. 相较于传统方法, 该技术方案在保持服装图案、材质等细粒度特征方面展现出明显优
                 势, 为虚拟试衣的实际应用提供了更可靠的技术支持. BooW-VTON                 [82] 通过建立高质量伪掩码数据实现了无需掩
                 码的虚拟试衣, 这种无需掩码的设计避免了空间信息的损失, 使得服装的个性化生成更加鲁棒以及更好地应用于
                 复杂的姿态和遮挡. 图      11  给出了基于扩散模型和双        U-Net 架构的多概念服装组合试衣示意图.


                                          多服装        服装提取 U-Net
                                          特征
                                 服装 1
                                            ···  ···      ···      ···  ···




                                 服装 N
                                                     服装特征注入
                    姿态图
                                                       主 U-Net


                              自编码器               ···      ···      ···          自解码器



                    人像图             添加噪声
                                       A man is sitting in a chair, wearing a [gray coat] and [brown jeans].  生成图像
                                                        文本输入
                                               图 11 多概念服装组合试衣示意图

                    然而, 这些方法仍然将虚拟试衣视为基于模板的编辑任务, 需要在原有人物图像上进行编辑. 此时编辑受到人
                 物模板的影响, 无法自由进行概念属性组合, 在实际应用场景中灵活性不足. 一些方法通过尽可能保留文生图基座
                 模型的生成能力实现更自由的虚拟试衣. StableGarment          [83] 和  IMAGDressing [84] 重新定义了虚拟试穿的任务, 其目标
                 是基于给定衣服和人物以及其他可选条件               (如姿态、场景、表情等) 灵活地生成可控的人物图像. StableGarment
                 和  IMAGDressing  借助服装  U-Net 去提取细粒度的服装特征的同时, 引入一个混合注意力的模块去将这些特征在
                                                                                   [85]
                 扩散模型去噪过程中注入, 实现了能人物服装多属性自由组合的虚拟试衣. Magic Clothing 设计了一个联合                        classifier-
                 free 引导去平衡服装特征以及文本输入, 尽可能保持文生图基座模型的生成能力. DreamFit                      [86] 则提出一个轻量级
                 的服装编码器, 使用可训练的         LoRA [29] 层代替平行  U-Net 去提取服装特征, 轻量级服装特征提取的设计同样使得
                 不容易损害原生文生图基座的能力. 尽管如此, 这些方法仅适用于单件服装, 缺乏对多条件的支持, 限制了自由搭
                 配多种服装的能力.
                    为实现服装概念的灵活组合生成, AnyDressing         [87] 提出了多服装虚拟试衣任务框架, 支持根据文本提示或控制
                 条件生成穿着任意服装组合的人物图像. 该任务面临以下挑战: 1) 服装保真度: 防止多件服装之间的混淆, 同时保
                 留每件服装的复杂纹理; 2) 文本-图像一致性: 最小化多件服装对无关区域的影响, 确保生成图像与文本提示的一
                 致性; 3) 插件兼容性: 实现与社区控制插件的无缝集成. 为解决上述问题, AnyDressing                 设计了一种能够根据任意
                 组合的服装和个性化文本提示定制人物图像的新方法. AnyDressing                 依然由服装提取      U-Net 以及主  U-Net 两个核
                 心网络组成, 记为     GarmentsNet 和  DressingNet. GarmentsNet 利用核心的服装特定特征提取器    (GFE) 模块, 通过共
   421   422   423   424   425   426   427   428   429   430   431