图自监督学习是一种范式,其中图神经网络(GNN)通过利用图的内在结构和属性,在没有外部标签的情况下进行训练。
形式上,这可以通过最小化基于预任务的自定义损失函数 \( \mathcal{L}_{ssl} \) 来实现,例如:
\[ \min_ heta \mathcal{L}_{ssl} = \mathbb{E}_{(v,u) \sim D}[\ell(f_ heta(v), f_ heta(u))] \]
其中 \( f_ heta \) 是由参数 \( heta\) 参数化的表示函数,\( \ell \) 是节点 \(v\) 和 \(u\) 表示之间的距离或相似度函数。
对比方法如 Deep Graph Infomax (DGI) 最大化全局与局部表示之间的互信息,以生成有意义的嵌入。
其他方法利用掩码策略(例如图掩码自编码器)或预测图内的上下文信息。
这些方法使得能够利用大量无标签图数据,并通过更鲁棒且具泛化能力的特征表示提升下游任务的性能。
定义:
“图自监督学习是一种学习范式,通过内在的预任务训练图神经网络,从无标签图数据中提取有意义的表示。”
来源:
Velickovic, P., 等. (2019). Deep Graph Infomax. 国际学习表征会议(ICLR)。