一、核心定义

表征学习是机器学习的一个分支,目标:自动把原始高维、无结构的原始数据,转化成低维、有语义、适合下游任务的向量表征(representation)

原始数据(像素、语音波形、文本字符、传感器信号)是底层raw signal,机器无法直接理解;表征学习负责从中提取有用特征,把信息压缩到稠密向量里,让模型能区分相似/不同样本。

通俗一句话:教会机器怎么看懂数据、提炼数据里的关键信息

二、为什么需要表征学习?

  1. 原始数据维度爆炸
    • 图片:256×256=65536维像素,直接训练效率极低、泛化差;
    • 文本:百万词独热编码极度稀疏。
  2. 手工特征有局限 传统机器学习(SVM、随机森林)依赖人工设计特征:
    • CV:SIFT、HOG;NLP:TF-IDF、词袋;语音:MFCC 缺点:费时、依赖领域专家、无法捕捉复杂隐式关联、泛化弱。
  3. 表征学习自动提取特征 不用人工设计,模型从数据里自主学到通用、可迁移特征。

三、两类表征学习范式

1. 监督表征学习

用标签引导学习表征,表征服务于分类/回归任务。 流程:原始数据 → 编码器提取表征 → 全连接层预测标签,反向传播同时优化表征。 例子:

  • CNN图像分类:卷积层输出就是图像表征;
  • BERT微调分类:CLS向量作为文本表征。

缺陷:学到的表征高度贴合当前任务,迁移性差

2. 自监督表征学习(现在主流)

无人工标签,用数据自身构造监督信号预训练表征,得到通用表征,可迁移到各类下游任务。 核心逻辑:把数据拆分、遮挡、扰动,让模型还原原始数据,迫使表征捕获全局语义。 三大领域经典代表:

  1. 计算机视觉
    • MAE:遮挡图片patch,让模型重建原图;
    • SimCLR、MoCo:对比学习,同一图片增强样本表征拉近,不同图片推远。
  2. 自然语言处理
    • BERT:掩码语言建模MLM,随机盖住单词预测;
    • GPT:自回归预测下一个token。
  3. 语音
    • Wav2Vec2:屏蔽部分音频波形,预测原始声学特征。

优势:海量无标注数据可用,表征通用、可迁移,少量微调就能适配分类、检测、检索等任务。

补充:无监督表征学习(传统)

不含自监督,纯基于数据分布,无人工构造预训练任务:PCA、K-means、自动编码器AE。

四、好表征(good representation)具备的性质

  1. 平滑性:相近原始数据,表征向量距离近;
  2. 分离性:语义不同的数据,表征向量距离远;
  3. 解耦性(disentangled):表征不同维度对应独立语义属性(比如人脸表征一维对应年龄、一维对应肤色);
  4. 低冗余、低维度:压缩冗余噪声,保留关键信息;
  5. 可迁移:在A数据集学到的表征,能复用在B任务。

五、经典模型框架分类

  1. 自编码器 Autoencoder(AE) 编码器:(表征z);解码器:,损失最小化重建误差。变体:VAE变分自编码器(概率表征)。
  2. 对比学习 Contrastive Learning 核心:正负样本配对,优化相似度损失,是如今视觉表征学习主流。
  3. 掩码建模 Masked Modeling 遮蔽局部数据重建,BERT/MAE/GPT均属于这类。
  4. 生成式表征模型 GAN、扩散模型,通过生成任务学习数据底层表征。

六、应用场景

  1. 检索系统:图文检索、商品搜索——用表征向量做相似度匹配;
  2. 迁移学习:大模型预训练表征,小样本下游任务微调;
  3. 异常检测:正常样本表征聚类,偏离聚类中心即为异常;
  4. 多模态融合:CLIP统一图像、文本表征,实现跨模态匹配;
  5. 推荐系统:用户、物品表征向量计算相似度推荐。

七、和普通特征工程的区别

维度手工特征工程表征学习
特征来源人工专家设计模型自动从数据学习
复杂度只能捕捉浅层简单规律捕捉高层抽象语义
迁移能力差,场景更换需重设计强,预训练表征通用
数据需求少量数据即可海量数据效果最优

极简总结

表征学习 = 自动特征提取技术,核心是把杂乱原始数据映射为蕴含语义的稠密向量;当前工业界主流是自监督表征学习,是大语言模型、多模态模型、视觉基础模型的底层核心技术。