Transferencia de estilo neuronal explicada para expertos


La transferencia de estilo neuronal es un procedimiento para sintetizar una imagen \( \hat{I} \) que combina el contenido de una imagen fuente \( I_c \) y el estilo de una imagen objetivo \( I_s \), basado en redes neuronales convolucionales profundas (CNNs).

Formalmente, la optimización se realiza minimizando la función de pérdida total

\[ \mathcal{L}_{total}(\hat{I}) = \alpha \mathcal{L}_{content}(\hat{I}, I_c) + eta \mathcal{L}_{style}(\hat{I}, I_s) \]

donde \( \alpha \) y \( eta \) son factores de ponderación.

La pérdida de contenido se define a menudo como el error cuadrático de los mapas de características de una capa específica de la CNN:

\[ \mathcal{L}_{content}(\hat{I}, I_c) = rac{1}{2} \sum_{i,j} (F_{ij}^l(\hat{I}) - F_{ij}^l(I_c))^2 \]

donde \( F^l \) son las activaciones en la capa \( l \).

La pérdida de estilo se basa en la diferencia de las matrices de Gram de los mapas de características a través de varias capas, que capturan información de textura y estilo:

\[ \mathcal{L}_{style}(\hat{I}, I_s) = \sum_{l} w_l \| G^l(\hat{I}) - G^l(I_s) \|_F^2 \]

con la matriz de Gram \( G^l \) y los pesos \( w_l \).

La optimización se realiza generalmente mediante métodos de gradiente para generar una imagen que combine contenido y estilo.


Definición:
«La transferencia de estilo neuronal es un procedimiento que, mediante redes neuronales profundas, combina el contenido de una imagen con el estilo de otra imagen, extrayendo representaciones separadas para contenido y estilo en las capas de la red y fusionándolas mediante optimización.»


Fuente:
Gatys, L. A., Ecker, A. S., & Bethge, M. (2016). Image Style Transfer Using Convolutional Neural Networks. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR).