表征学习 · 基础知识

基础知识

表征学习的数学模型和研究目的

数学模型

可以先把所有模型抽象成:

xfθzgϕyx \xrightarrow{f_\theta} z \xrightarrow{g_\phi} y

其中:

  • xx:原始数据,例如图像、文本、语音;
  • fθf_\theta:编码器;
  • zz:学习到的特征;
  • gϕg_\phi:分类头、生成器、检索器或者决策模块;
  • yy:最终输出。

表征学习真正关心的不是“用了什么网络”,而是:保留了输入中的什么信息,舍弃了什么信息,以及这种信息组织方式能否迁移到新的任务。

研究目的

经典的表征学习综述把这个问题描述为:数据背后存在若干解释性变化因素,而不同表示会以不同程度把这些因素纠缠或者分离。

例如一张猫的照片包含:

猫的图片属性示例

动物类别:猫
姿态:趴着
颜色:橘色
背景:沙发
光照:较暗
拍摄角度:侧面
纹理、像素噪声……

对于猫分类来说,理想表征应该:

  • 保留“猫”的语义;
  • 对轻微光照变化保持稳定;
  • 对背景变化不过度敏感;
  • 可能保留姿态,但不一定依赖姿态;
  • 丢弃无意义的传感器噪声。

但对于姿态估计任务,姿态又必须被保留。

所以没有脱离任务和环境的“绝对好表征”。更准确的问题是:

对于哪些任务、哪些变化、哪些数据分布,这个表征是好的?

线性表征跟非线性表征的比较

比较维度线性非线性
公式Z=WX+bZ = WX + bZ=σ(WX+b)Z = \sigma(WX + b)
表示空间线性子空间(超平面)弯曲流形
捕获的统计量二阶(协方差)高阶、非欧
训练方式有闭式解(SVD / 矩阵分解)需要梯度下降(BP + SGD)
最优解保证全局最优不保证(可能陷入局部最优)
堆叠多层等价于一层(线性闭包)产生层次抽象
代表方法PCA、SVD、NMF、ICA、LDADeep AE、VAE、SimCLR、ViT

从形式上看,差距确实就一个激活函数——但这个“差距”打开了一整个新世界。

双轴框架

双轴框架用两个相互独立的问题定位表征学习方法:想学到什么、信号从哪里来

主轴:学习目标

主轴回答:希望表示保留什么信息,或者在表示空间中形成什么性质?

主轴不是互斥分类。一个方法可以同时承担多个目标。

重建—生成

保留恢复输入、生成样本或建模数据分布所需的信息。

  • 典型方法:AE、VAE、Diffusion
  • 常见目标:像素重建、似然建模、去噪、隐变量生成
  • 主要风险:模型可能保留大量局部细节,却未必形成便于迁移的语义表示

预测—上下文

保留预测缺失部分、未来状态、相邻区域或上下文所需的信息。

  • 典型方法:BERT、MAE、CPC
  • 常见目标:掩码预测、下一步预测、未来潜变量预测
  • 主要价值:迫使模型利用跨位置、跨时间或跨模态的上下文关系

对齐—关系

规定不同样本、视图或模态在表示空间中的几何关系。

  • 典型方法:SimCLR、BYOL、CLIP、度量学习
  • 常见目标:正样本靠近、负样本分离、不同维度去相关、聚类结构稳定
  • 主要价值:直接塑造表示空间,使表示适合分类、检索与迁移

副轴:监督信号来源

副轴回答:训练时用于约束模型的目标、配对或反馈从哪里产生?

副轴记录一个主要来源;当方法同时依赖其他来源时,再增加辅助标签,不强制互斥。

人工标注

人专门为训练任务创建的类别、属性、边界框、分割掩码或偏好标签。

天然配对

数据产生过程中自然形成的共现关系,例如图像与网页文本、视频画面与声音、相邻视频帧。CLIP 的图文配对属于这一类,而不是人为逐样本制作的类别标签。

数据自指

由数据本身构造目标,例如裁剪与增强、掩码、加噪、旋转或把输入的一部分作为另一部分的预测目标。

模型自举

目标由模型或历史模型产生,例如动量教师、伪标签、在线聚类和教师—学生预测。

环境反馈

模型与环境交互后获得的奖励、成败结果、状态转移或行为后果。

方法坐标示例

下表使用统一字段描述典型方法。主轴可以多选,信号来源区分主要与辅助。

方法表征约束主要信号来源辅助来源
监督分类对齐—关系人工标注
AE重建—生成数据自指
VAE重建—生成数据自指随机隐变量
Diffusion重建—生成数据自指人工噪声过程
BERT预测—上下文数据自指语料上下文
MAE重建—生成+预测—上下文数据自指原始输入目标
SimCLR对齐—关系数据自指批内样本关系
MoCo对齐—关系数据自指模型自举
BYOL对齐—关系数据自指模型自举
DINO对齐—关系模型自举数据自指
Barlow Twins对齐—关系数据自指
VICReg对齐—关系数据自指
CLIP对齐—关系天然配对数据筛选
CPC预测—上下文+对齐—关系天然上下文数据内负样本
DeepCluster对齐—关系模型自举数据自指
度量学习对齐—关系人工标注或天然配对样本挖掘

常见的几类自监督方法

实现机制回答:模型通过什么损失、结构和训练过程获得目标表示?

深度度量与对比学习

通过样本之间的相似度、距离或排序关系塑造表示空间。

  • 代表方法:SimCLR、MoCo、CPC、CLIP
  • 常见组件:正负样本、InfoNCE、温度系数、投影头、负样本队列
  • 可以服务的目标:对齐—关系,也可以同时承担上下文预测

自蒸馏

学生网络预测教师网络产生的目标表示,教师通常由学生的历史参数或停止梯度分支得到。

  • 代表方法:BYOL、SimSiam、DINO
  • 常见组件:动量教师、predictor、停止梯度、中心化、锐化
  • 典型信号来源:模型自举+数据自指

典型相关与冗余消除

在对齐不同视图的同时,约束表示各维度保持方差并减少冗余。

  • 代表方法:Barlow Twins、VICReg、W-MSE
  • 常见组件:互相关矩阵、方差约束、协方差惩罚
  • 主要目标:对齐—关系

掩码建模

遮挡输入的一部分,让模型根据可见上下文恢复缺失内容或目标表示。

  • 代表方法:BERT、MAE、BEiT
  • 常见组件:掩码策略、编码器、轻量解码器、离散或连续目标
  • 可以服务的目标:预测—上下文,也可能同时属于重建—生成

生成建模

学习数据分布或从隐变量、噪声中生成样本。

  • 代表方法:VAE、GAN、Diffusion
  • 常见组件:似然目标、变分下界、对抗损失、去噪过程
  • 主要目标:重建—生成

聚类、原型与伪标签

模型先产生类别、原型或软目标,再用这些目标更新表示。

  • 代表方法:DeepCluster、SwAV
  • 常见组件:K-means、在线聚类、原型分配、最优传输
  • 典型信号来源:模型自举