Page 109 - 《软件学报》2026年第5期
P. 109
1988 软件学报 2026 年第 37 卷第 5 期
分离、人体肢体属性的分离以及对人脸的关注. 这种方法通过局部和全局特征的分离, 使生成模型能够在关注细
节的局部区域的同时, 保持全局结构的一致性, 从而提高生成结果的精度和稳定性.
例如, BodyROI7 [38] 、Yoon 等人 [2] 和 LWG [39] 通过分离前景与背景, 使得背景成为可编辑对象, 同时确保人物
外观特征在复杂场景中的有效保留. BodyROI7 通过将输入图像的前景、背景和姿态解耦, 并编码为不同的嵌入
特征, 从而实现对这些属性在生成过程中的可控性. 然而, 这种方法在生成质量上出现了下降, 提示在特征解耦时
需要平衡精度与灵活性. Animate Anyone 2 [40] 在人物掩码上做了改进, 通过动态边界避免传统精确掩码导致的形
状泄露 (比如服装变形等). 为了避免姿态变化对外观的干扰, 一些方法 [18,41,42] 进一步探索将参考图像的外观和姿态
进行解耦, 从而避免姿态变化对外观的干扰. 这些方法能够有效将姿态变化和外观特征进行独立处理, 使得生成模
型更专注于各自的特征, 从而提高生成效果的精细度.
为了更加关注人体的细粒度信息, 许多研究 [2,38,43–47] 选择使用人体解析图像的方法, 分别提取躯干、四肢等不
同人体属性的特征, 从而在生成过程中更好地保留服装等外观细节. 这些方法通过分离人体各部分的特征, 使得生
成过程能更灵活地控制各部位的细节表现. 在这些方法中, 一些使用现有的自动解析器来进行人体解析图像的生
成 [44,45] , 并将不同人体部位的嵌入拼接形成风格编码. Pu 等人 [45] 意识到当属性类别数量庞大时, 该方法需要承担
巨大的内存开销, 所以提出 ADGAN++使用串行编码策略来缓解这一问题.
在一些应用场景下, 使用者除了关注服装的纹理, 通常也高度关注人脸的真实性与一致性. 为了提高面部生成
的自然性和一致性, 一些方法 [48,49] 专门设计了保留人脸细节的策略. 例如, Chan 等人 [49] 使用 pix2pixHD 框架结合
专门的人脸生成对抗网络, 通过学习二维关键点姿态与图像之间的映射关系, 来实现更精确的面部生成. APS [50] 则
提出了一种更为灵活的策略, 旨在解耦和重新耦合多个不同的属性, 例如前景与背景、外观与姿态、局部细节与
全局结构等. 通过这一方法, 生成模型能够在高灵活性和可控性的基础上, 生成高质量的行人图像, 从而满足不同
应用需求的多样化要求.
2.2 对外观信息进行重排
在姿态控制生成任务中, 为了有效地保留外观信息并提升生成质量, 以上这些方法尝试提取具有强大表达能
力的特征向量. 然而, 这些方法通常将特征向量均匀、平等地应用在对生成过程的控制中, 一些关键细节可能在最
终输出中丢失或模糊. 为了实现空间自适应调整, 更多的技术通过估计密集变形对参考图像的外观进行扭曲以对
齐特征. 如图 5 所示, 这些方法从寻求局部纹理细节指导的角度出发, 进行了从像素级或者特征级对信息进行扭曲
的尝试.
基于粗略的仿射变换矩阵进行变换
基于注意力/相关性矩阵建立映射
纹理扭曲
显式 3D 人体建模
3D 建模辅助变换
隐式集成 3D 信息
外观信息的重排
基于薄板样条变换处理变形
深层特征扭曲
基于全局流迁移外观细节
基于流 引入局部注意力机制
渐进式生成
图 5 重排外观信息的不同方法
2.2.1 纹理扭曲
纹理扭曲方法 [43,47,51–57] 旨在通过几何变换对输入图像的纹理信息进行调整, 以适配目标姿态, 从而更好地保
留外观特征的细节和一致性. 这类方法通常借助仿射变换或结合 3D 建模技术, 完成纹理和外观特征的空间对齐,

