Page 435 - 《软件学报》2026年第4期
P. 435

1876                                                       软件学报  2026  年第  37  卷第  4  期


                 体属性, 包括改变姿态、表情、环境或艺术风格等. 这种创造性调整往往需要打破对参考图像的机械复制. 在物体
                 驱动学习方面, 基于优化的方法这个问题尤为突出, 因为这些大多仅在少量样本上微调基座模型, 这种做法在训练
                 时间较长的情况下很容易产生过拟合损坏原有基座模型的生成能力. 如果较少训练时长, 则模型可能欠拟合, 导致
                 主体保真度低. Perfusion  [104] 方法通过正则化注意力投影机制, 在特征空间构建双重约束. 但这种方法在复杂场景
                 下容易导致特征混淆. Cao      等人  [105] 设计了双路解耦架构, 将条件引导过程分离为独立的保真度通道和文本适应通
                 道. 虽然缓解了冲突, 但增加了模型复杂度, 且难以处理跨模态的细粒度交互.
                    (3) 多概念组合生成冲突
                    当前个性化生成方法主要集中于特定领域, 如物体主体、人脸、服装或风格等方向的定制化生成, 但在实际
                 应用中, 用户往往期望能够在一张图像中融合多个定制化概念. 当多个概念进行组合生成时, 部分概念很可能会压
                 制其他概念的生成, 导致最后生成的结果没办法包含用户所需的全部概念. 在适配器组合方法中, 训练时间较长的
                 适配器获得一个相对基座模型更大的偏移量, 后续组合适配器时, 偏移量较大的一个容易压制其他适配器并使其
                 失效. 而对于自定义      token  组合方法, 虽然  token  间的学习是独立的, 但是这些自定义         token  的语义很可能存在冲
                 突, 例如相似动物或同类别物体同时组合时, 这种冲突会使得这些                    token  对应的语义区域相互影响      [58] . 如何解耦适
                 配器或者自定义      token  的学习仍然是个性化生成的一大挑战. 这些显著的语义冲突和组合灵活性不足的问题使得
                 用户无法实现自由创作.
                    (4) 缺乏面向个性化生成的审慎推理机制
                    在某些以内容质量优先于时间效率的个性化场景中, 比如数字广告领域, 广告商通常每天只为每个用户投放
                 最适合的几条广告. 受大语言模型推理方面取得巨大成功的启发, 审慎推理会注重事先进行的广泛逻辑推理和上
                 下文推理, 从而能够对用户偏好进行全面分析, 以推动更有效的内容个性化                       [106] . 然而, 目前的个性化生成缺乏多轮
                 优化的做法或是用户反馈的过程, 只能采用大量生成的办法覆盖用户需求, 但这种做法生成效率和质量较为低下.
                    (5) 评估体系不足
                    尽管个性化生成技术日益流行, 但该领域仍缺乏标准化的测试数据集和能够全面评估不同方法性能的指标体
                 系. 现有的评估方式存在明显缺陷, 首先是过度依赖               CLIP  相似度. 当前广泛采用的视觉保真度评估方法主要基于
                 CLIP  图像相似度计算, 但这种方法存在严重偏差: 1) 当模型对参考图像过拟合时, 会虚高评估分数; 2) 无法区分简
                 单复制和语义级保真; 3) 对细粒度属性变化的敏感度不足. 除                 CLIP  相似度外, 其他评估维度也呈现单一化: 1) 缺
                 乏对主体可编辑性的量化标准; 2) 忽视生成多样性等关键指标; 3) 对多模态对齐能力的评估不完善.
                    (6) 伦理隐忧
                    个性化生成技术在推动创意表达和数字内容创新的同时, 也伴随着深刻的伦理隐忧和滥用风险, 尤其是在人
                 像生成领域, 技术的双刃剑效应尤为突出. 深度伪造技术的泛滥使得伪造身份、制造虚假新闻或恶意诽谤成为可
                 能, 不仅威胁个人隐私与名誉, 还可能被用于政治操纵、金融诈骗等系统性危害, 动摇社会信任基础. 生成技术的
                 高真实度模糊了真实与虚构的边界, 导致公众对数字内容的信任危机, 而现有法律体系在肖像权、数据来源合法
                 性等方面的滞后性进一步加剧了责任认定的困难. 一些文章开始对个人照片隐私保护进行研究, Anti-DreamBooth                          [107]
                 设计了一个防御系统对抗         LoRA [29] 和  DreamBooth  [13] 等个性化生成. 这个防御系统通过对图像增加微妙的噪声扰
                 动显著降低了     LoRA  [29] 和  DreamBooth [13] 的个性化生成质量. 对于基于编码器的人像生成方法, 例如        InstantID [30] 、
                         [20]         [27]        [108]
                 IP-Adapter  和  PhotoMaker  , IDProtector  提出了一种对抗性噪声编码器进行人像保护. 它的方法是在单次前
                 向传播的过程中为人像照片添加难以察觉的对抗噪声. 尽管如此, 目前隐私保护的研究仍然不足, 未来研究需要构
                 建动态演进的保护框架, 既能适应生成模型的快速迭代, 又能满足不同应用场景下隐私保护与可用性的双重需求.
                  5.2   研究趋势
                    (1) 防止过拟合
                    过拟合一直是困扰少样本训练的问题, 为突破现有局限, 可以从下面                      3  个维度进行创新: 1) 动态特征门控机
                 制: 开发能自动识别任务需求         (保真/创意) 的智能开关, 在特征提取层实现自适应处理. 2) 层次化训练策略: 分阶段
   430   431   432   433   434   435   436   437   438   439   440