表征学习 · 基础知识
基础知识
表征学习的数学模型和研究目的
数学模型
可以先把所有模型抽象成:
其中:
- :原始数据,例如图像、文本、语音;
- :编码器;
- :学习到的特征;
- :分类头、生成器、检索器或者决策模块;
- :最终输出。
表征学习真正关心的不是“用了什么网络”,而是:保留了输入中的什么信息,舍弃了什么信息,以及这种信息组织方式能否迁移到新的任务。
研究目的
经典的表征学习综述把这个问题描述为:数据背后存在若干解释性变化因素,而不同表示会以不同程度把这些因素纠缠或者分离。
例如一张猫的照片包含:
猫的图片属性示例
动物类别:猫 姿态:趴着 颜色:橘色 背景:沙发 光照:较暗 拍摄角度:侧面 纹理、像素噪声……
对于猫分类来说,理想表征应该:
- 保留“猫”的语义;
- 对轻微光照变化保持稳定;
- 对背景变化不过度敏感;
- 可能保留姿态,但不一定依赖姿态;
- 丢弃无意义的传感器噪声。
但对于姿态估计任务,姿态又必须被保留。
所以没有脱离任务和环境的“绝对好表征”。更准确的问题是:
对于哪些任务、哪些变化、哪些数据分布,这个表征是好的?
线性表征跟非线性表征的比较
| 比较维度 | 线性 | 非线性 |
|---|---|---|
| 公式 | ||
| 表示空间 | 线性子空间(超平面) | 弯曲流形 |
| 捕获的统计量 | 二阶(协方差) | 高阶、非欧 |
| 训练方式 | 有闭式解(SVD / 矩阵分解) | 需要梯度下降(BP + SGD) |
| 最优解 | 保证全局最优 | 不保证(可能陷入局部最优) |
| 堆叠多层 | 等价于一层(线性闭包) | 产生层次抽象 |
| 代表方法 | PCA、SVD、NMF、ICA、LDA | Deep AE、VAE、SimCLR、ViT |
从形式上看,差距确实就一个激活函数——但这个“差距”打开了一整个新世界。
双轴框架
双轴框架用两个相互独立的问题定位表征学习方法:想学到什么、信号从哪里来。
主轴:学习目标
主轴回答:希望表示保留什么信息,或者在表示空间中形成什么性质?
主轴不是互斥分类。一个方法可以同时承担多个目标。
重建—生成
保留恢复输入、生成样本或建模数据分布所需的信息。
- 典型方法:AE、VAE、Diffusion
- 常见目标:像素重建、似然建模、去噪、隐变量生成
- 主要风险:模型可能保留大量局部细节,却未必形成便于迁移的语义表示
预测—上下文
保留预测缺失部分、未来状态、相邻区域或上下文所需的信息。
- 典型方法:BERT、MAE、CPC
- 常见目标:掩码预测、下一步预测、未来潜变量预测
- 主要价值:迫使模型利用跨位置、跨时间或跨模态的上下文关系
对齐—关系
规定不同样本、视图或模态在表示空间中的几何关系。
- 典型方法:SimCLR、BYOL、CLIP、度量学习
- 常见目标:正样本靠近、负样本分离、不同维度去相关、聚类结构稳定
- 主要价值:直接塑造表示空间,使表示适合分类、检索与迁移
副轴:监督信号来源
副轴回答:训练时用于约束模型的目标、配对或反馈从哪里产生?
副轴记录一个主要来源;当方法同时依赖其他来源时,再增加辅助标签,不强制互斥。
人工标注
人专门为训练任务创建的类别、属性、边界框、分割掩码或偏好标签。
天然配对
数据产生过程中自然形成的共现关系,例如图像与网页文本、视频画面与声音、相邻视频帧。CLIP 的图文配对属于这一类,而不是人为逐样本制作的类别标签。
数据自指
由数据本身构造目标,例如裁剪与增强、掩码、加噪、旋转或把输入的一部分作为另一部分的预测目标。
模型自举
目标由模型或历史模型产生,例如动量教师、伪标签、在线聚类和教师—学生预测。
环境反馈
模型与环境交互后获得的奖励、成败结果、状态转移或行为后果。
方法坐标示例
下表使用统一字段描述典型方法。主轴可以多选,信号来源区分主要与辅助。
| 方法 | 表征约束 | 主要信号来源 | 辅助来源 |
|---|---|---|---|
| 监督分类 | 对齐—关系 | 人工标注 | — |
| AE | 重建—生成 | 数据自指 | — |
| VAE | 重建—生成 | 数据自指 | 随机隐变量 |
| Diffusion | 重建—生成 | 数据自指 | 人工噪声过程 |
| BERT | 预测—上下文 | 数据自指 | 语料上下文 |
| MAE | 重建—生成+预测—上下文 | 数据自指 | 原始输入目标 |
| SimCLR | 对齐—关系 | 数据自指 | 批内样本关系 |
| MoCo | 对齐—关系 | 数据自指 | 模型自举 |
| BYOL | 对齐—关系 | 数据自指 | 模型自举 |
| DINO | 对齐—关系 | 模型自举 | 数据自指 |
| Barlow Twins | 对齐—关系 | 数据自指 | — |
| VICReg | 对齐—关系 | 数据自指 | — |
| CLIP | 对齐—关系 | 天然配对 | 数据筛选 |
| CPC | 预测—上下文+对齐—关系 | 天然上下文 | 数据内负样本 |
| DeepCluster | 对齐—关系 | 模型自举 | 数据自指 |
| 度量学习 | 对齐—关系 | 人工标注或天然配对 | 样本挖掘 |
常见的几类自监督方法
实现机制回答:模型通过什么损失、结构和训练过程获得目标表示?
深度度量与对比学习
通过样本之间的相似度、距离或排序关系塑造表示空间。
- 代表方法:SimCLR、MoCo、CPC、CLIP
- 常见组件:正负样本、InfoNCE、温度系数、投影头、负样本队列
- 可以服务的目标:对齐—关系,也可以同时承担上下文预测
自蒸馏
学生网络预测教师网络产生的目标表示,教师通常由学生的历史参数或停止梯度分支得到。
- 代表方法:BYOL、SimSiam、DINO
- 常见组件:动量教师、predictor、停止梯度、中心化、锐化
- 典型信号来源:模型自举+数据自指
典型相关与冗余消除
在对齐不同视图的同时,约束表示各维度保持方差并减少冗余。
- 代表方法:Barlow Twins、VICReg、W-MSE
- 常见组件:互相关矩阵、方差约束、协方差惩罚
- 主要目标:对齐—关系
掩码建模
遮挡输入的一部分,让模型根据可见上下文恢复缺失内容或目标表示。
- 代表方法:BERT、MAE、BEiT
- 常见组件:掩码策略、编码器、轻量解码器、离散或连续目标
- 可以服务的目标:预测—上下文,也可能同时属于重建—生成
生成建模
学习数据分布或从隐变量、噪声中生成样本。
- 代表方法:VAE、GAN、Diffusion
- 常见组件:似然目标、变分下界、对抗损失、去噪过程
- 主要目标:重建—生成
聚类、原型与伪标签
模型先产生类别、原型或软目标,再用这些目标更新表示。
- 代表方法:DeepCluster、SwAV
- 常见组件:K-means、在线聚类、原型分配、最优传输
- 典型信号来源:模型自举