Page 307 - 《软件学报》2026年第7期
P. 307

2992                                                       软件学报  2026  年第  37  卷第  7  期


                 和  Mixup  的特点, 它将一个样本的部分区域替换为另一个样本的对应区域, 同时保持混合后的标签不变. 调整了
                 CutOut 和  Mixup  两种方法的不足, 通过有效地利用训练像素并保留区域              dropout 的正则化效果, 在   ImageNet 弱监
                 督定位任务上取得了不错的增强效果.
                    除了基本的人为设置数据增强手段, 更智能的数据增强方法是在搜索空间自动搜索增强方法. Cubuk                                  等
                 人  [30] 提出的随机增强通过删除一个单独的搜索, 大大减少了数据增强的搜索空间还进一步提高了自动增强和
                 PBA [31] 的性能. 扩展到模型的特征空间, Li 等人      [32] 提出了一种隐式数据增强方法特征增强, 通过利用模型中间的
                 潜在张量增强模型训练过程. 最近的图像数据增强策略通常利用                     GAN [33] 模型生成新的样本. 其中典型的      StarGAN
                 系列  [34] 实现在一个数据集中进行多领域的图像转换任务, 可以合并包含不同标签的数据集, 对其中任意的标签属
                 性灵活进行图像转换, 将输入图像转换到任何所需的目标域上. 然而, 这些方法主要关注提升标准训练下的泛化性
                 能, 在改善对抗性方向决策边际过度增加问题上作用有限. 生成的数据与对抗样本分布缺乏紧密联系, 难以保证模
                 型最终的对抗鲁棒性.
                  1.2   概率生成模型
                    概率生成模型是一种利用概率统计理论来生成数据的模型. 这类模型通过对数据的概率分布进行建模, 可以
                 生成与真实数据具有相似特性的新数据样本. 例如生成对抗网络                     (GAN)、变分自编码器       (variational autoencoder,
                 VAE)、隐马尔可夫模型       (hidden Markov model, HMM) 等. 概率生成模型通常基于某种概率分布         (如正态分布、泊
                 松分布等) 来描述数据的特性, 并通过学习得到模型的参数. 学习与训练过程通常涉及最大似然估计、贝叶斯推断
                 等方法, 以求解模型的最优参数.
                    GAN  是一种利用生成器与鉴别器相互博弈实现训练的网络架构. 由于训练既不需要知道真实数据分布, 也不
                 需要任何数学假设, 因而得以广泛应用. 最开始的               GAN  中, 生成模型和判别模型使用         MLP  进行定义. 后来, 由于
                 卷积神经网络     (CNN) 在图像表示上优于       MLP  模型, 产生了深度卷积生成对抗网络          (deep convolutional generative
                 adversarial network, DCGAN) [33] . 之后发展的  GAN  也大多基于  DCGAN  的架构. 使用自注意力机制的    SAGAN [35]
                 允许对图像生成任务的注意进行驱动, 并对生成模型和判别模型都使用了光谱归一化技术, 来提高训练的效果.
                 BigGAN [36] 则在  SAGA  的基础上, 使用扩大了的网络结构并结合“截断技巧”, 提升了生成图像的质量和训练的稳
                 定性. StyleGAN [37] 使用一种基于风格的条件生成器和使用联合训练的鉴别器, 从而实现了对生成图像中特定尺度
                 属性的控制.
                    最先进的生成模型能够建模当前的大规模图像数据集的分布, 可以隐式地学习给定数据集的概率分布, 即
                 P(X). 因此, 它能够产生高保真的人工样本. GAN          架构由两个神经网络组成, 即生成器           G  和鉴别器   D. 其中生成器
                 G  从训练样本中学习数据的分布以生成尽可能相似的新的样本, 而鉴别器                       D  则被训练来尽可能地区分出真实数
                 据样本和合成新样本. 这些组件在一个对抗性的过程中同时进行训练. 在训练过程中, 首先从一个已知的概率分
                 布  N(Z) 中采样一个噪声向量      z, 通常是高斯分布, 并输入      G. 然后, G  将  z 从  N(Z) 所在分布转换为  x 所在分布. 另
                 一方面, D  通过比较    G  的输出与来自数据集的真实样本           x 来检查  G  的分布获取性能如何. 在训练过程中, 通过优
                 化公式   (1) 实现模型的训练, 其中最为常用的损失函数如公式              (2) 所示:

                                                                  ′
                                                    min G max D L JS  (D, p ; p)                      (1)
                                                            GAN
                                               ′
                                        L JS  (D, p ; p) = E x∼p(X) [log(D(x)]+ E x∼p ′ (X) [log(1− D(x))]  (2)
                                         GAN
                 其中,  p  是由固定的先验分布      N(Z) 中采样后再由    G  所生成的分布. 为了使     GAN  训练的过程更加稳定, 生成更高质
                      ′
                                           L GAN  的选择, 如  WGAN-GP [38] 判别器损失函数如公式   (3) 所示, 利用  Wasserstein
                 量的合成样本, 研究人员不断调整
                 距离代替了原先的      JS  距离, 并加入了梯度惩罚项: 公式前两项为基础的            WGAN  判别器损失函数. 最后一项是添加的
                                                                                             .
                                                                                             ′
                                                                                          ′
                 梯度约束限制.     x∼ ˆp 是每一批次的生成样本和真实样本中加权和的采样, 即               x∈ ˆp=εx∈ p+(1−ε)x ∈ p ||∇ x D(X)|| 2 −1
                 是对权重的裁剪项.

                                                                                 2
                                       L GAN = −E x∼p [D(x)]+ E x∼p ′[D(x)]+λE x∼ ˆp [(||∇ x D(x)|| 2 −1) ]  (3)
                    概率生成模型能利用概率统计理论对数据分布建模, 生成与真实数据相似的新样本. 如                             GAN  通过生成器和
   302   303   304   305   306   307   308   309   310   311   312