Самоконтролируемое обучение с увеличением данных, объяснённое для экспертов


Самоконтролируемое обучение с увеличением данных обозначает класс методов обучения, при которых модель учится формировать устойчивые и обобщаемые представления за счёт искусственно созданных вариаций входных данных.

Формально входной пример \( x \) преобразуется стохастической функцией аугментации \( t \sim \mathcal{T} \), так что получается \( ilde{x} = t(x) \).

Цель состоит в обучении функции вложения \( f_ heta \), которая для двух аугментаций одного и того же оригинала создаёт похожие представления, то есть \( f_ heta( ilde{x}_i) \approx f_ heta( ilde{x}_j) \), при этом представления разных данных различаются.

Это часто реализуется с помощью контрастных потерь (например, InfoNCE) или других метрик расстояния.

Увеличение данных играет ключевую роль, так как оно моделирует вариативность данных и заставляет модель фокусироваться на релевантных признаках.


Определение:
«Самоконтролируемое обучение с увеличением данных — это парадигма обучения, при которой модель учится устойчивым представлениям через искусственно созданные вариации входных данных, создавая похожие представления для разных аугментаций одного и того же оригинала.»


Источник:
Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. Proceedings of the 37th International Conference on Machine Learning (ICML).