Page 428 - 《软件学报》2026年第4期
P. 428

何子健 等: 基于扩散模型的个性化图像生成方法综述                                                       1869


                 图像的特征分布距离. FID       可以衡量生成图像的质量, 分数越低代表生成图像的分布越接近真实图像, 说明质量
                 越好.
                    ● Frechet video inception distance (FVD) [96] : 一种用于评估视频生成质量的指标, 类似于图像生成领域中常用
                 的  FID. FVD  使用预训练的  3D  卷积神经网络    (如  I3D  模型) 提取视频的特征表示, 并计算生成视频特征分布与真
                 实视频特征分布之间的        Frechet 距离  (即两个多元高斯分布之间的差异). FVD         值越低, 表明生成视频的质量越高,
                 与真实视频的分布越接近.
                    ● 峰值信噪比    (PSNR): 评估图像失真程度, 值越大代表失真程度越低, 生成图像的质量越高.
                    ● 结构相似性差异      (SSIM) [97] : 评估生成图像和真实图像之间的结构相似性, 数值越大代表生成图像与真实图
                 像越相似.
                    ● 学习感知图像块相似性        (LPIPS) [98] : 使用深度特征评估生成图像与真实图像之间的相似度. 数值越低表示两
                 张图像越相似, 反之代表生成图像的多样性越高
                    ● BLIP-VQA score  [17] : 基于 BLIP  模型的视觉问答  (VQA) 任务的评估指标. BLIP 是一种先进的视觉-语言预
                 训练模型, 能够同时理解图像内容和自然语言问题, 并生成准确的文本回答. BLIP-VQA score 通过评估模型在
                 VQA 任务中的表现来衡量生成图像与文本问题之间的对齐程度. 其优势在于它不仅评估图像的视觉质量, 还评估
                 图像与文本语义的一致性. 值越高代表生成图片和文本语义越一致.
                    ● CLIP-T [16] : 一种基于 CLIP  模型的评估指标, 用于衡量生成图像与文本描述之间的语义一致性. CLIP 是由
                 OpenAI 提出的一种多模态预训练模型, 能够同时理解图像和文本, 并在共享的嵌入空间中对齐两者的语义表示.
                 CLIP-T 的优势在于它能够捕捉图像和文本之间的高层次语义关联, 而不仅是低层次的视觉特征匹配. CLIP-T 得
                 分的范围通常在 [−1, 1] 之间, 得分越高, 表明生成图像与文本描述的语义一致性越好.
                    ● CLIP-I [16] : 一种基于 CLIP  模型的评估指标, 用于衡量生成图像与概念图像之间的语义一致性. 得分越高表
                 明它们之间越相似.
                    ● CLIP-AS [16] : 一个基于  CLIP  模型相似度计算的图像美学评分指标, 范围通常在           0–10  分, 分数越高代表图像
                 越符合人类主流审美标准         (如构图、色彩、风格等). 该指标通过对比图像与预设美学文本提示                      (如“高质量照片”)
                 的匹配度生成.
                    ● DINO-I [68] : 一种基于  DINO  模型的评估指标, 与  CLIP-I 类似, 用于衡量生成图像与概念图像之间的语义一
                 致性. 得分越高表明它们之间越相似.
                  4.3   方法对比
                                                                                                [14]
                    本节将对个性化生成方法进行定量和定性评估. 对于物体驱动学习方法, 表                      1 列出了  Textual Inversion 、Dream-
                 Booth [13] 、Custom Diffusion [99] 、ELITE [18] 、BLIP-Diffusion [19] 、IP-Adapter [20] 、Subject-Diffusion [22] 、OmniGen [24]
                 和  UniReal [25] 这  9  个方法在  DreamBench  数据集上的定量对比结果. 可视化结果对比在图       12  中给出. 基于学习的
                 方法需要大规模图像数据对图像编码器进行预训练, 应用时无须对给定图片进行网络微调, 因而速度较快, 对于分
                 辨率为   512×512  的图像生成, 这些方法在     A100  显卡上耗时基本小于       5 s. 然而, 该类方法对于纹理复杂的物体存
                 在一定的保真度不足, 例如图         12  中第  1  行展示  Textual Inversion [14] 、DreamBooth  [13] 、Custom Diffusion [99] 这  3  个
                 方法对汽水罐的编辑结果. 这主要是由于难以学习一个特定的单词向量对这些复杂的物体进行描述. 而基于优化
                 的方法则需要根据给定图片进行网络微调, 本文采用常用的学习率为                          1E–5, 批次大小为    8, 训练迭代次数为
                 200  次, 训练设备为  2  张  A100  显卡的训练设置进行对比. 这些方法的效果很大程度上取决于图像编码器的训练以
                 及图像特征的注入方式, 如图          12  所示, IP-Adapter  [20] 这种轻量级设计无法保存足够的细节, 基于         DiT  网络的
                 OmniGen [24] 和  UniReal [25] 注入参考图像  token  方式在文本指令匹配和细节保持两方面都取得了较好的效果. 在模
                 型大小和显存消耗方面, 前        7  个方法是基于    Stable Diffusion  上进行微调, 模型参数量在   1B  左右, 推理显存消耗一
                 般在  6–8 GB  之间, OmniGen [24] 和  UniReal [25] 则是基于  DiT  模型, 模型大小在  12B  左右, 推理显存消耗在  40 GB  左
                 右. Custom Diffusion [99] 训练的参数仅占用  75 MB  左右的显存, 在显存占用和训练速度在基于优化的方法取得领先.
   423   424   425   426   427   428   429   430   431   432   433