Page 421 - 《软件学报》2026年第4期
P. 421
1862 软件学报 2026 年第 37 卷第 4 期
微调的人脸识别模型, 将该模型对人脸的特征嵌入作为条件进行个性化图像生成, 这种引入的动态身份保留策略
进一步确保了生成图像与原始图像身份的高度相似性.
此外, 一些研究还专注于多 ID 图像生成, 即在同一张图像中生成多个不同身份的人物. 例如, MM-Diff [32] 通过
在训练阶段对不同主题的交叉注意力图施加约束, 实现了无需预定义输入的多 ID 图像生成. UniPortrait [33] 则采用
ID 路由模块来统一多 ID 定制, 从而避免身份混合问题. FastComposer [34] 是一种无需微调的高效多主体生成方法,
通过结合图像编码器提取的主题嵌入和通用文本条件, 仅需单次前向传播即可完成个性化图像生成, 显著降低了
计算成本. StoryMaker [35] 方法在这一领域进一步扩展了应用范围. 它不仅专注于保留面部特征, 还确保生成图像中
服装、发型和身体的一致性. 对于多角色生成任务, StoryMaker 引入了位置感知重采样器和注意力损失机制, 以解
决多角色混合问题. 这些创新使得 StoryMaker 在生成复杂场景和多角色图像时表现出色. MagicNaming [36] 提出了
一种无需微调 U-Net 的解决方案. 通过引入 NN 空间, MagicNaming [36] 能够在不损害模型生成能力的情况下, 兼容
任何 SDXL 模型变体. 这一创新不仅保留了模型的原始生成能力, 还提升了技术的可扩展性和实用性.
包含细致人像的全身生成最近也受到了研究者的关注. Nam 等人 [37] 提出了一个人类全身个性化生成的基座
模型. 该模型致力于解决两个关键问题, 一是生成符合文本指令的全身图像, 包含脸部表情, 姿态, 动作等的描述;
二是全身人像的一致性, 包括人脸, 服装和饰品等. 为解决这 2 个问题, Nam 等人提出了一个数据构造流程并构造
了一个 580k 人像样本对的 Visual Persona-500K 数据集, 并提出一种基于预训练文本到图像扩散模型的 Transformer
编码器-解码器架构. 该架构首先将输入图像解耦为不同身体区域, 将这些区域编码为局部外观特征后, 独立映射
为稠密身份嵌入向量, 进而引导扩散模型生成定制化图像.
目前身份保留的个性化图像生成技术在面部保真度、多 ID 生成和语义一致性方面取得了显著进展. 然而, 如
何在保持身份一致性的同时, 进一步提升生成图像的多样性和质量, 仍然是未来研究的重要方向. 此外, 探索无需
微调的高效方法, 以及提升技术的通用性和可扩展性, 也将成为该领域的关键挑战. 随着深度学习技术和多模态学
习方法的不断发展, 身份保留的个性化图像生成技术有望在更多实际场景中得到广泛应用, 为人工智能生成内容
领域带来更多创新和突破.
2.3 图像驱动个性化视频生成
图像驱动个性化视频生成的核心目标是通过结合参考图像和一系列运动信号, 合成具有高度真实感和一致性
的动画视频序列. 基于文本生成图像的扩散模型, 我们可以通过简单在 U-Net 每个模块增加一个时序注意力层实
[38]
现从图像生成到视频生成的拓展. 个性化视频生成最重要的一个应用是人物图像的视频生成. Animate Anyone
[2]
使用动作序列引导参考人体静态图像的运动. 它基于 Stable Diffusion 设计的框架 (如图 8 所示), 对 2D U-Net 加
入时序注意力模块, 将图像生成拓展到参考图像的个性化视频生成. 该方法的网络架构采用双 U-Net 设计, 通过多
层次特征融合实现外观一致性和运动控制. 具体而言, 参考 U-Net 首先提取参考图像的多尺度特征, 随后在每个模
块中通过创新的空间注意力机制与主 U-Net 的生成特征进行融合. 该空间注意力机制的操作流程包括 3 个步骤:
1) 将参考图像特征沿时间维度复制 t 次; 2) 在通道维度上与生成图像特征进行拼接; 3) 通过自注意力计算实现特
征交互. 这种设计不仅保留了参考图像的细节特征, 还确保了时序上的连贯性. 结合姿态引导器的运动控制. 后续
的研究如 MimicMotion [39] 和 UniAnimate [40] 则进一步改进了基础框架. MimicMotion [39] 利用预训练的视频扩散能力,
设计了 PoseNet 来注入骨架信息; UniAnimate [40] 则通过 Mamba 时间建模技术, 在时间维度上堆叠参考图像, 以实
现更高效的角色动画生成. 此外, 一些研究探索了不同的运动控制信号. 例如, DisCo [41] 和 MagicAnimate [42] 使用
DensePose 作为人体表示, 而 Champ [43] 则采用 3D 参数化人体模型 SMPL 来整合多模态信息, 包括深度、法线和
语义信号.
使用动作序列信号等去引导个性化视频生成虽然取得了一定的成功, 但也存在着很大的局限性. 在当前的跨
身份动画工作流中, 运动信号通常是从不同的视频中提取的, 而个性化内容则来源于静态图像. 这种分离的处理方
式导致生成的角色动画在空间关系和交互性方面存在明显不足. 具体而言, 角色与其环境之间的空间关系往往缺
乏真实感, 人与物体之间的内在交互也被破坏. 例如, 一个角色在复杂场景中的行走或与物体的互动可能显得生硬

