对比自监督是一种自监督学习范式,其中模型通过对比学习原则学习表示,最大化正样本对的相似度,最小化负样本对的相似度。
通常形式上使用 InfoNCE 损失:
\[ \mathcal{L}_{i} = -\log \frac{\exp(\mathrm{sim}(\mathbf{z}_i, \mathbf{z}_i^+)/\tau)}{\sum_{k=1}^{N} \exp(\mathrm{sim}(\mathbf{z}_i, \mathbf{z}_k)/\tau)} \]
其中 \( \mathbf{z}_i \) 和 \( \mathbf{z}_i^+ \) 是正样本对的表示,\( \mathbf{z}_k \) 是批次中所有样本的表示,\( \mathrm{sim} \) 是相似度函数(例如余弦相似度),\( \tau \) 是温度参数。
通过这种对比,模型学习到一个结构化的表示空间,反映语义关系,而无需依赖人工标注。
定义:
“对比自监督是一种自监督学习方法,通过最大化同一数据点不同表示之间的相似度,最小化与其他数据点的相似度,从而学习鲁棒且有意义的表示。”
来源:
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. 载于第37届国际机器学习大会(ICML)论文集。