面向高级用户的自监督学习解释


自监督学习是一种学习范式,其中模型利用从数据本身生成的任务来学习有用的表示。

在此过程中,定义了所谓的预文本任务,这些任务要求预测或重建输入的部分内容,例如填补缺失的图像区域或预测文本中的下一个单词。

这种方法使得无需显式标签即可进行预训练,随后可以针对特定任务进行微调。

自监督学习的优点在于它能够有效利用大量未标注的数据,并提升泛化能力。

知名的方法包括对比预测编码、像BERT这样的掩码语言模型或图像变换预测。