面向专家解释对比学习方法


对比学习方法是一种自监督学习方法,训练一个嵌入函数 f: X → R^d,使得对于一个锚点样本 x_i,其表示 f(x_i) 更接近正样本 x_j^+ 的表示,而远离负样本 x_k^- 的表示。

这通常通过对比损失函数来实现,如 NT-Xent 损失(归一化温度缩放交叉熵损失),该损失在一个批次的样本中最大化正样本之间的相似度,同时最小化负样本之间的相似度。

该方法基于假设:相似的数据点(例如同一图像的不同增强版本)应具有语义相关的表示,而不相似的样本则应被区分开来。

现代方法如 SimCLR(Chen 等,2020)使用强数据增强和大批量大小,而方法如 MoCo(He 等,2020)则利用负样本队列。


定义:
“对比学习方法是一种自监督学习方法,通过最大化正样本对之间的相似度和最小化与负样本的相似度,学习数据的有意义表示。”


来源:
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. 载于第37届国际机器学习大会(ICML)论文集。