面向专家的掩码自监督学习解释


掩码自监督学习是一种训练范式,其中模型 f_θ 被训练以根据未掩码的上下文 x_{context} 预测输入数据中被掩码的部分 x_{mask}。

形式上,这可以描述为最小化重构损失:

\[ \mathcal{L}(\theta) = \mathbb{E}_{x \sim D} \left[ \ell (f_\theta(x_{context}), x_{mask}) \right] \]

其中 \( \ell \) 是合适的损失函数,例如离散标记的交叉熵或连续数据的均方误差(MSE)。

在自然语言处理领域,著名模型如 BERT(Devlin 等,2019)利用掩码语言模型进行上下文表示学习。

在计算机视觉领域,该概念通过掩码自编码器(MAE)得到了扩展,这些模型掩码大面积图像区域并由模型进行重构。

这些方法有效地学习自监督表示,可在下游任务中通过少量额外训练使用。


定义:
“掩码自监督学习是一种学习范式,模型被训练以根据未掩码的上下文有针对性地重构输入数据中被掩码的部分,从而学习鲁棒且具泛化能力的表示。”


来源:
Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.