La transferencia de estilo neuronal es un procedimiento para sintetizar una imagen \( \hat{I} \) que combina el contenido de una imagen fuente \( I_c \) y el estilo de una imagen objetivo \( I_s \), basado en redes neuronales convolucionales profundas (CNNs).
Formalmente, la optimización se realiza minimizando la función de pérdida total
\[ \mathcal{L}_{total}(\hat{I}) = \alpha \mathcal{L}_{content}(\hat{I}, I_c) + eta \mathcal{L}_{style}(\hat{I}, I_s) \]
donde \( \alpha \) y \( eta \) son factores de ponderación.
La pérdida de contenido se define a menudo como el error cuadrático de los mapas de características de una capa específica de la CNN:
\[ \mathcal{L}_{content}(\hat{I}, I_c) = rac{1}{2} \sum_{i,j} (F_{ij}^l(\hat{I}) - F_{ij}^l(I_c))^2 \]
donde \( F^l \) son las activaciones en la capa \( l \).
La pérdida de estilo se basa en la diferencia de las matrices de Gram de los mapas de características a través de varias capas, que capturan información de textura y estilo:
\[ \mathcal{L}_{style}(\hat{I}, I_s) = \sum_{l} w_l \| G^l(\hat{I}) - G^l(I_s) \|_F^2 \]
con la matriz de Gram \( G^l \) y los pesos \( w_l \).
La optimización se realiza generalmente mediante métodos de gradiente para generar una imagen que combine contenido y estilo.
Definición:
«La transferencia de estilo neuronal es un procedimiento que, mediante redes neuronales profundas, combina el contenido de una imagen con el estilo de otra imagen, extrayendo representaciones separadas para contenido y estilo en las capas de la red y fusionándolas mediante optimización.»
Fuente:
Gatys, L. A., Ecker, A. S., & Bethge, M. (2016). Image Style Transfer Using Convolutional Neural Networks. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR).