L'algorithme qui ne comprenait que les mots connus
Une équipe de développeurs crée une IA destinée à résumer automatiquement des textes.
L'IA est entraînée avec de grands corpus de textes, mais contient principalement des mots fréquemment utilisés et standardisés.
En utilisation, on remarque que l'IA a des difficultés à interpréter ou résumer correctement des textes contenant des termes nouveaux, rares ou spécifiques à un domaine.
Elle ignore ou remplace souvent les mots inconnus par des termes plus généraux, ce qui rend le résumé imprécis ou trompeur.
L'équipe se demande : pourquoi l'IA, bien qu'elle connaisse beaucoup de textes, ne peut-elle pas traiter correctement des mots nouveaux ou inhabituels ?
Question : Pourquoi les modèles d'IA, entraînés principalement avec des mots fréquents, ont-ils du mal à comprendre correctement et à intégrer dans les textes des termes nouveaux ou rares ?
La solution sera donnée demain.
Solution
Les modèles d'IA apprennent les mots et leurs relations en fonction de la fréquence et de la diversité des données d'entraînement.
Si les données d'entraînement contiennent surtout des mots fréquents et connus, le modèle apprend principalement à bien les représenter.
Les mots rares ou nouveaux apparaissent peu ou pas du tout lors de l'entraînement, de sorte que le modèle ne développe pas de représentations fiables pour ces termes.
Cela conduit l'IA à remplacer ou ignorer souvent les mots inconnus par des mots similaires mais plus généraux ou fréquents, afin de permettre une interprétation.
Par conséquent, des informations importantes sont perdues ou déformées, ce qui dégrade la qualité du résumé.
Résultat : Une IA entraînée avec un vocabulaire fortement ciblé ou limité ne peut pas traiter précisément des termes nouveaux ou rares. Pour de meilleurs modèles linguistiques, les données d'entraînement doivent être variées et abondantes afin de capturer et comprendre également les mots rares et nouveaux.