Page 272 - 《软件学报》2026年第2期
P. 272
杭均一 等: 基于不变性注入的多标记类属特征学习 751
为两类, 即类属特征变换方法和类属特征选择方法.
类属特征变换方法利用特征变换技术构造类属特征. 这类方法将刻画各个标记数据分布特性的聚类原型作为特
[8]
征变换基, 从而将样本投影到类属特征空间中, 实现类属特征构造. 代表性方法 LIFT 首先通过聚类分析技术获取各
个标记的聚类原型, 然后通过查询样本与这些聚类原型间的距离构造类属特征. 后续工作尝试对 LIFT 方法的技术框
架进行改进. 例如, 利用聚类集成技术 [29,30] 或谱聚类技术 [31] 缓解聚类原型过程的随机性; 引入近邻信息 [32−34] 或全局
拓扑信息 [11,35−37] 对基于度量的类属特征进行增广; 借助深度生成式模型实现原型和特征构造过程的判别优化 [38] .
类属特征选择方法利用特征选择技术构造类属特征. 代表性方法 LLSF 在 [9] LASSO 回归 [12] 框架下为各个标记
分别选择判别过程的相关特征子集, 并引入成对标记共现关系约束嵌入式特征选择过程. 后续工作从多个角度增
强 LLSF 方法. 例如, 在保留的相关特征子集上施加非稀疏性约束 [39,40] 、引入判别导向的正则项 [41−43] 以及在嵌入
空间中进行特征选择 [44−47] 等.
上述方法均关注如何利用特征处理技术对样本中标记判别的相关特征进行提取, 忽略了无关特征操纵在学习
类属特征时的潜在能力. DELA 方法 [13] 是目前仅有的一种基于无关特征操纵的类属特征学习方法. 在随机特征扰
动框架下, 该方法根据模型输出关于输入扰动的灵敏度差异辨识各个标记的无关特征, 通过求解概率放松的扰动
风险最小化问题赋予分类模型关于无关特征的不变性. 与 DELA 方法相比, 本文提出的 INVA 方法使用了基于统
计矩信息的无关特征辨识技术, 通过显式建模数据分布特性增强无关特征辨识过程的可靠性. 此外, INVA 方法推
导了扰动风险最小化问题的理论上界, 有效降低了问题求解的计算复杂度.
1.2 特征不变性
特征不变性是计算机视觉领域一个经典的研究课题. 特征工程时期, 一些研究试图通过人工设计具有尺度不
变性 [48] 、旋转不变性 [49] 的特征. 深度学习时期的工作则直接借助数据增广 [50] 和表示解耦 [51] 等技术赋予模型关于
特定干扰因子的不变性. 本文的 INVA 方法借鉴了这一思想, 并将其推广到类属特征学习问题中. 与已有工作预先
指定判别过程的无关特征因子 (例如, 尺度、旋转、颜色等) 不同, INVA 方法尝试通过学习来辨识各个标记判别
的无关特征.
1.3 特征扰动技术
特征扰动是机器学习中一类得到广泛应用的技术手段. 例如, Dropout 技术 [52−54] 通过在模型计算过程中对网
络特征层的神经元施加随机失活扰动, 能够增强分布式表示各维度特征的冗余性. 而本文利用特征扰动技术旨在
移除分类模型对样本表示中判别无关特征的依赖性. 对抗攻击 [55,56] 试图寻找最脆弱的特征方向对样本进行扰动,
从而最大化模型在扰动样本上的预测误差. 与此目标不同, 本文在标记判别的无关特征方向上对样本进行扰动, 实
现扰动样本上预测风险的最小化. 此外, 模型可解释性的研究中, 特征扰动被用于模型预测的事后归因 [57,58] . 而本
文在学习过程中进行特征扰动, 旨在提升分类模型的泛化性能.
2 基于不变性注入的多标记类属特征学习方法 INVA
本节首先给出多标记分类问题的形式化定义, 然后对无关特征操纵视角下的 DELA 方法进行简要介绍. 在此
基础上, 阐述本文提出的 INVA 方法的主要思想, 并详细介绍其技术细节.
2.1 概 览
}
{
d
令 X = R 表示输入空间, y = l 1 ,l 2 ,...,l q 表示包含 q 个类别标记的标记集合. 一个多标记样例记为 (x,Y), 其中
x ∈ X 表示样例的 d 维特征向量 (即样本), Y ⊆ y 表示样例的相关标记集合. 多标记分类旨在从给定的多标记训练集
y
D = {(x i ,Y i )|1 ⩽ i ⩽ m} 中导出一个多标记预测模型 h : X → 2 , 实现从输入空间到输出空间 (标记集合 y 的幂集) 的
h(u) ∈ y.
映射. 对于任意未见样本 u ∈ X, 该预测模型能够对其相关标记进行预测, 即
[ ] q
为保证本文注释系统的简洁性, 引入一个 q 维指示向量 y = y 1 ,y 2 ,...,y q ∈ {0,1} 来表示样例 (x,Y) 的相关标记
集合 Y. 其中, 若标记 l k 是样例的相关标记, 即 l k ∈ Y, 则 y k = 1; 否则, y k = 0.
在随机特征扰动框架下, DELA 方法构造了一个扰动风险最小化问题, 同时辨识各个标记判别的无关特征, 并

