自监督学习(Self-Supervised Learning,SSL)是一种学习范式,模型通过解决从输入数据自动生成的任务(预任务)来学习表示,而无需依赖人工标注的标签。
形式上,学习一个函数 f: X → Z,对于输入数据分布 p(x),生成表示 z = f(x),通过最小化损失函数 L(f(x), g(x)),其中 g(x) 是从 x 自动推导出的目标信息。
典型的预任务包括预测上下文信息(例如邻近像素、缺失词语)、解决图像拼图游戏或定义正负样本对的对比学习目标。
SSL 架起了监督学习与无监督学习之间的桥梁,实现了对大量无标签数据的高效利用。
现代模型如 SimCLR、MoCo 或 BERT 基于自监督学习,在许多人工智能领域显著提升了性能。
定义:
“自监督学习是一种学习范式,模型通过解决从输入数据自动生成的任务来学习有用的表示,而无需依赖人工标注的数据。”
来源:
Jing, L. & Tian, Y. (2020). Self-Supervised Visual Feature Learning with Deep Neural Networks: A Survey. IEEE Transactions on Pattern Analysis and Machine Intelligence.