Le transfert de style neuronal est une méthode de synthèse d'une image \( \hat{I} \) qui combine le contenu d'une image source \( I_c \) et le style d'une image cible \( I_s \), basée sur des réseaux de neurones convolutifs profonds (CNN).
Formellement, l'optimisation est réalisée en minimisant la fonction de perte totale
\[ \mathcal{L}_{total}(\hat{I}) = \alpha \mathcal{L}_{content}(\hat{I}, I_c) + eta \mathcal{L}_{style}(\hat{I}, I_s) \]
où \( \alpha \) et \( eta \) sont des facteurs de pondération.
La perte de contenu est souvent définie comme l'erreur quadratique des cartes de caractéristiques d'une couche CNN spécifique :
\[ \mathcal{L}_{content}(\hat{I}, I_c) = rac{1}{2} \sum_{i,j} (F_{ij}^l(\hat{I}) - F_{ij}^l(I_c))^2 \]
où \( F^l \) représente les activations à la couche \( l \).
La perte de style est basée sur la différence des matrices de Gram des cartes de caractéristiques sur plusieurs couches, capturant les informations de texture et de style :
\[ \mathcal{L}_{style}(\hat{I}, I_s) = \sum_{l} w_l \| G^l(\hat{I}) - G^l(I_s) \|_F^2 \]
avec la matrice de Gram \( G^l \) et les poids \( w_l \).
L'optimisation est généralement effectuée par des méthodes de gradient pour générer une image qui combine contenu et style.
Définition :
« Le transfert de style neuronal est une méthode qui, à l'aide de réseaux neuronaux profonds, combine le contenu d'une image avec le style d'une autre image en extrayant des représentations séparées pour le contenu et le style dans les couches du réseau et en les fusionnant par optimisation. »
Source :
Gatys, L. A., Ecker, A. S., & Bethge, M. (2016). Image Style Transfer Using Convolutional Neural Networks. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR).