Самоконтролируемое обучение с маскированием — это парадигма обучения, при которой модель f_θ обучается предсказывать замаскированные части входных данных x_{mask} на основе немаскированного контекста x_{context}.
Формально это можно описать как минимизацию функции потерь реконструкции:
\[ \mathcal{L}(\theta) = \mathbb{E}_{x \sim D} \left[ \ell (f_\theta(x_{context}), x_{mask}) \right] \]
где \( \ell \) — подходящая функция потерь, например, кросс-энтропия для дискретных токенов или MSE для непрерывных данных.
Известные модели в области обработки естественного языка — например, BERT (Devlin et al., 2019), который использует маскированное языковое моделирование для представления контекста.
В области компьютерного зрения концепция была расширена с помощью Masked Autoencoders (MAE), которые маскируют большие области изображения и позволяют модели восстанавливать их.
Эти подходы эффективны для обучения самоконтролируемых представлений, которые могут использоваться в последующих задачах с минимальным дополнительным обучением.
Определение:
«Самоконтролируемое обучение с маскированием — это парадигма обучения, при которой модель обучается целенаправленно восстанавливать замаскированные части входных данных на основе немаскированного контекста, чтобы научиться устойчивым и обобщаемым представлениям.»
Источник:
Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.