Page 422 - 《软件学报》2026年第4期
P. 422
何子健 等: 基于扩散模型的个性化图像生成方法综述 1863
或不自然. 因此, 大多数现有方法仅限于生成简单的动作 (如单独的手势或舞蹈), 而无法充分捕捉角色与其环境之
间复杂的空间和交互关系. 这些局限性严重限制了角色动画技术的进一步发展, 尤其是在需要高度真实感和复杂
交互的场景中. 因此, 一些工作开始研究利用扩散模型生成与场景或交互物体上下文一致的图像或视频, 通过插入
或修复技术将人物融入给定场景中, 增强个性化视频的真实性. 例如, Text2Place [44] 通过学习语义掩码并使用文本
引导来定位区域, 从而将人物放置在背景场景中. InVi [45] 则通过图像修复和扩展注意力机制生成帧, 实现物体插
入. 此外, 一些研究专注于角色与场景或物体的交互动画. 例如, MovieCharacter [46] 将动画角色结果合成到去除人物
的视频序列中, 而 AnchorCrafter [47] 则专注于人-物体交互建模, 通过同时感知交互外观特征和注入交互运动模式,
实现了高质量的产品推广视频生成. MIMO [48] 通过空间分解扩散方法, 将视频分解为人类、背景和遮挡物, 并基于
3D 深度重新组合这些元素以生成角色视频. Animate Anyone 2 [49] 设计了一种框架, 从源视频中捕捉环境表示作为
条件输入, 使模型能够以端到端的方式学习角色与环境之间的内在关系. Animate Anyone 2 通过移除角色区域来
构建环境表示, 并生成与环境上下文一致的角色填充这些区域. 为了进一步提升生成效果, 它开发了一种形状无关
的掩码策略, 更好地表示角色与其上下文场景之间的边界关系. 这种策略不仅能够有效缓解形状泄漏问题, 还能实
现角色与场景的高效整合.
生成图像 参考图像
参考 U-Net t 特征 特征
h h
w w
自编码器 ··· ··· ···
空间注意力模块
CLIP 生成视频序列
参考图像
主 U-Net
跨注意力模块
姿态
编码器 ··· ··· ··· 自解码器
时序注意力模块
迭代去噪
模块详情
姿态序列
噪声图像
序列
图 8 图像驱动视频生成示意图
除了个性化人物视频生成外, 通过相机轨迹操控动态视频生成是另一种个性化视频生成的形式. MotionCtrl [50]
和 CameraCtrl [51] 是这方面经典的工作, 它们通过文本输入生成控制轨迹的语义向量, 并最终基于此引导参考图像
的运动并生成具有特定相机运动效果的视频. 除文本描述外, Motion-I2V [52] 设计了一种支持基于图像引导的视频
生成方法. 它允许用户通过拖拽注释来调整物体的运动, 例如调整眼睛的方向或指示腿部的运动. 然而, Motion-
I2V [52] 的功能较为有限, 仅支持小幅度的物体运动, 无法实现复杂的相机运动效果 (如环绕拍摄或镜头推拉).
MOFA-Video [53] 是另一种能够实现像素级运动控制的方法. 它支持对输入图像中每个局部区域的运动方向进行精
确控制, 从而实现小范围的相机运动. 然而, 为了确保动态视频的全局一致性, MOFA-Video 要求用户为输入图像
中可能移动的每个局部区域指定运动方向, 确保了高精度的控制和动态视频的全局一致性. AnimateAnything [54] ,
通过多尺度控制特征融合网络将不同条件 (如相机轨迹、文本提示和用户注释) 统一转化为逐帧光流, 并结合光
流作为运动先验来指导视频生成; 同时, 引入基于频率的稳定化模块, 确保视频频域一致性, 有效减少大尺度运动
引起的闪烁问题.
综上所述, 个性化视频生成技术在角色动画与环境交互方面取得了显著进展, 但仍面临生成质量、复杂交

