Aprendizaje auto-supervisado con enmascaramiento explicado para expertos


El aprendizaje auto-supervisado con enmascaramiento se refiere a un paradigma de entrenamiento en el que un modelo f_θ se entrena para predecir partes enmascaradas de los datos de entrada x_{mask} basándose en el contexto no enmascarado x_{context}.

Formalmente, esto se puede describir como la minimización de una pérdida de reconstrucción:

\[ \mathcal{L}(\theta) = \mathbb{E}_{x \sim D} \left[ \ell (f_\theta(x_{context}), x_{mask}) \right] \]

donde \( \ell \) es una función de pérdida adecuada, por ejemplo, entropía cruzada para tokens discretos o MSE para datos continuos.

Modelos conocidos en PLN son, por ejemplo, BERT (Devlin et al., 2019), que utiliza el modelado de lenguaje enmascarado para representaciones contextuales.

En el ámbito de la visión por computadora, el concepto fue ampliado mediante Autoencoders Enmascarados (MAE), que enmascaran grandes áreas de la imagen y permiten que el modelo las reconstruya.

Estos enfoques son efectivos para aprender representaciones auto-supervisadas que pueden ser utilizadas en tareas posteriores con poco entrenamiento adicional.


Definición:
«El aprendizaje auto-supervisado con enmascaramiento es un paradigma de aprendizaje en el que un modelo se entrena para reconstruir partes específicamente enmascaradas de los datos de entrada basándose en el contexto no enmascarado, con el fin de aprender representaciones robustas y generalizables.»


Fuente:
Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.