Page 434 - 《软件学报》2026年第4期
P. 434

何子健 等: 基于扩散模型的个性化图像生成方法综述                                                       1875




                      参考服装
                                       “A girl,
                                       red hair,       “A girl          “A girl,  “A girl  “A girl,  “A girl,
                                “A man,  wearing a  “A girl, on  sitting on  “A girl with  winter,  sitting on  red hair,  sky, in a
                      文本指令     in the gym”  hat, by a  the stage”  the grass”  a bag in the  night,  the grass”  wearing a  field of
                                                                                       hat, by a
                                                               classroom”
                                        Fence”                           snow”          Fence”  flowers”

                    MagicClothing [85]




                    StableGarment [83]




                    IMAGDressing  [84]




                     AnyDressing [87]

                                         (a) 单服装试衣                            (b) 多衣服组合
                                            图 17 自由生成的虚拟试衣方法定性对比

                  5   挑战和展望


                  5.1   挑 战
                    (1) 过拟合
                    因参考训练图像数量有限, 当前个性化概念合成系统仍然面临过拟合这一关键挑战. 该过拟合问题表现为两
                 种形式: 1) 主体对象可编辑性丧失. 个性化模型生成的图像往往简单复制参考图像中的主体对象, 例如总是以相同
                 姿势呈现猫咪; 2) 无关语义混入. 参考图像在训练时模型混入了与主体无关的信息                        (如背景或不相干物体), 导致输
                 出中会生成当前语境无关的元素. 为探究其根源, Compositional inversion         [100] 研究发现, 相比预训练词汇形成的中
                 心分布, 学习到的词嵌入位于分布外区域. 另一研究               [101] 也发现可学习词嵌入显著偏离初始嵌入分布. 此外, 还有文
                 献表明  [23,100,102] 中, 特定修饰符会压制其他  token, 导致其他语义特征缺失.
                    针对该问题, 目前已提出多种解决方案, 例如排除冗余背景、注意力操控、可学习参数正则化和数据增强等.
                 然而该问题尚未完全解决, 特别是当主体对象具有非刚性外观                    [100] , 或上下文提示词与参考图像中无关元素存在语
                 义关联时   [103] . 很明显, 解决个性化生成中的过拟合问题, 不仅是一个技术挑战, 而且是确保这些提出的方法以及系
                 统在多样且动态的现实环境中得以实际部署和扩展的必要条件. 因此, 迫切需要一种有效的策略和可靠的评估指
                 标, 以便在实际应用中实现更广泛的应用并获得更高的用户满意度.
                    (2) 在主体保真度与生成自由性方面的权衡
                    个性化内容合成的终极目标是构建能够同时实现两种关键能力的系统: 一方面需要以高保真度呈现特定主
                 体, 另一方面要能灵活响应多样化文本或图像等提示. 然而, 这两种需求本质上存在显著矛盾. 首先主体保真度要
                 求模型通过最小化重建损失来精确捕捉和复现参考主体的细微特征, 包括材质纹理、微观结构等细节特征. 这种
                 精确复现通常需要模型具备强大的特征记忆能力. 而文本对齐则要求系统根据文本或参考图像等描述灵活调整主
   429   430   431   432   433   434   435   436   437   438   439