自监督学习(Self-Supervised Learning,SSL)是一种学习范式,模型通过解决无监督数据上的预测或重建任务进行训练,无需显式标签。
典型方法包括对比学习、掩码模型预测(例如掩码语言模型如BERT)和上下文预测。
SSL旨在学习有意义且可泛化的表示,这些表示可以针对后续任务进行微调。
该方法解决了标签稀缺的问题,并提高了在大型异构数据集上的学习效率。
定义:
“自监督学习是一种范式,系统通过解决生成监督信号的预任务,从无标签数据中学习表示。”
来源:
Jing, L., & Tian, Y. (2020). Self-supervised visual feature learning with deep neural networks: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence, 43(11), 4037-4058.