Page 427 - 《软件学报》2026年第4期
P. 427
1868 软件学报 2026 年第 37 卷第 4 期
享 U-Net 架构中的并行自注意力层提取多件服装的细节特征, 并结合 LoRA 机制减少参数增加, 避免服装混淆并
确保网络效率. DressingNet 采用着装注意力 (DA) 机制, 将多件服装特征无缝集成到去噪过程中, 并通过实例级服
装定位 (IGL) 学习策略, 确保每件服装仅影响其对应区域, 从而提高生成图像与文本提示的一致性. 此外, Any-
Dressing 还设计了服装增强纹理学习 (GTL) 策略, 通过感知特征和高频信息的约束, 增强对服装细节的监督. 得益
于这些设计, AnyDressing 可以作为插件模块, 轻松集成到任何基于扩散模型的社区控制扩展中, 从而提升合成图
像的多样性和可控性.
多概念服装组合试衣是多概念个性化生成的一个重要应用, 服装试衣的自由度和服装一致的保真度是该任务
核心要求. 随着个性化生成的发展, 相信服装这种特殊的概念最终也能更可控地引导用户需要的试衣图像生成.
4 评估方法
本节对上述介绍的个性化生成的 6 个任务分别进行方法对比. 第 4.1 节先介绍个性化生成的常用数据集, 第
4.2 节介绍定量评估中常用的指标, 第 4.3 节则给出具体的方法定量和定性的对比结果.
4.1 数据集
下面是个性化生成的常用数据集.
● DreamBench [13] : 一个主要的评价个性化物体生成的公开数据集, 包含 30 个对象, 涵盖背包、动物、汽车和
玩具等类别. 对于每个对象, 纳入了 25 条提示词, 以确保进行多样化的评估, 这些提示词涵盖了各种情境、配饰和
属性.
● DreamBench++ [88] : 是对 DreamBench 数据集的扩展, 包含 150 张图像和 1 350 条提示词, 为评估模型性能提
供了一个更广泛的评价框架.
● 互联网人物数据集: StoryMaker [35] 使用的互联网收集的人物图像, 包含 30 万单人物图像和 20 万的双人物
图像, 图像说明使用 CogVLM [89] 生成, 主要用于人像个性化生成的评估. 由于人像数据的敏感性, 目前该数据集暂
未开源.
● PPR10K 数据集 [90] : 一个包含多样视角的真实人像图像数据集, 包含 11 161 张高质量的人像照片. 这些照片
被分为 1 681 个场景, 每个场景包含多张照片.
● TikTok benchmark [91] : 一个由 TikTok 短视频平台下载的人物舞蹈数据集, 总共包含 300 个舞蹈视频, 每个视
频大约是 10–15 s. 该数据集可以用于图像驱动个性化视频生成.
● CelebA [92] : 一个大型人脸属性数据集, 包含 202 599 张名人的面部图像, 涵盖 10 177 个不同的身份, 主要用
于计算机视觉中与人脸相关的研究和任务. 数据图像大小为 178×218, 每个图像附有 40 条人脸属性标注. 由于
CelebA 数据集分辨率较低且背景简单, 难以衡量个性化生成的多样性, 一般用于人像驱动学习方法的训练但不用
于评估.
● VITON-HD [93] : 一个经典的高分辨率虚拟试衣数据集, 包含 13 679 对服装与人物上身着衣图像, 主要用于虚
拟试衣算法的训练和测试.
● Dressing-Pair [87] : 由 AnyDressing 提出的三元组 (上身衣服, 下身衣服和人物图像) 服装组合数据集. 该数据
集包含了从公开数据集 Dresscode 提取的 26 114 个三元组对以及从互联网收集的私有的 37 065 个三元组对.
● BlobBench [66] : 由 BlobCtrl [66] 提出的综合性的用于评估元素级生成和能力的数据集. BlobBench 包含 100 张
图像, 来自不同场景的真实世界图像和人工智能生成的图像, 如室内和室外场景、动物和风景等, 以确保评估的公
平性和有效性. 这些图像均匀地包含多种元素级操作, 并且标注了椭圆参数、前景掩模和详细的文字描述.
4.2 评估指标
定量评估使用的评估指标一般是利用生成图像的像素、深度特征并借助某种算法或者预训练模型对生成结
果量化评估的. 下面列举了常见的个性化生成的评估指标, 包括图像以及视频.
● Frechet inception distance (FID) [94] : 使用深度网络 Inception-v3 [95] 提取特征, 计算生成图像的特征分布与真实

