Depuis leur conception initiale dans l’article fondateur de recherche en IA Attention Is All You Need, les architectures basées sur les transformers ont complètement redéfini le domaine du traitement automatique du langage (TAL) et établi l’état de l’art pour de nombreux benchmarks et tâches d’IA.
Que sont les modèles Transformer ? Il s’agit de modèles avancés d’intelligence artificielle qui ont bénéficié d’une « éducation » comparable à celle que quelques dizaines d’êtres humains pourraient acquérir au cours d’une vie.
Les architectures Transformer sont généralement entraînées de manière semi-supervisée sur une quantité massive de textes — par exemple Wikipédia en anglais, des milliers de livres, voire Internet tout entier. En assimilant ces vastes corpus de textes, les architectures basées sur les transformers deviennent de puissants modèles de langage (LM), capables de comprendre avec précision les textes et d’effectuer des analyses prédictives à partir de leur analyse.
En substance, ce niveau d’entraînement exhaustif permet aux modèles Transformer d’approcher à un niveau remarquable la cognition humaine appliquée au texte — la lecture. Autrement dit, il ne s’agit pas d’une simple compréhension, mais aussi, au mieux, d’établir des connexions de niveau supérieur à partir du texte.
Il a récemment été démontré que ces impressionnants modèles d’apprentissage peuvent également être rapidement ajustés pour des tâches de niveau supérieur telles que l’analyse des sentiments, la détection des questions en double et d’autres tâches cognitives fondées sur le texte. Un entraînement supplémentaire du modèle sur un jeu de données ou une tâche distincte de ceux pour lesquels il a été initialement entraîné permet de modifier légèrement les paramètres du réseau pour la nouvelle tâche.
Le plus souvent, cela se traduit par de meilleures performances et un entraînement plus rapide que si le même modèle avait été entraîné à partir de zéro sur le même jeu de données et la même tâche.
Voir aussi : Top 10 Text Analysis Solutions
Avantages des modèles Transformer
1) Excellents avec les données séquentielles
Les modèles Transformer excellent dans la gestion des difficultés liées aux données séquentielles. Pour cette raison, ils constituent un framework encodeur-décodeur, dans lequel l’encodeur projette les données dans un espace représentationnel. avant de les projeter vers la sortie au moyen du décodeur. Cela leur permet de bien s’adapter aux architectures matérielles de traitement parallèle telles que les GPU — des processeurs surpuissants conçus pour faire progresser les logiciels d’IA.
2) Des transformers préentraînés
Les transformers préentraînés peuvent être développés pour exécuter rapidement des tâches connexes. Cela tient au fait que les transformers possèdent déjà une compréhension approfondie du langage, ce qui permet de concentrer l’entraînement sur l’apprentissage de l’objectif souhaité. Il peut s’agir, par exemple, de la reconnaissance d’entités nommées, de la génération de langage ou de l’identification de concepts. Leur préentraînement les rend particulièrement polyvalents et performants.
3) Bénéficier de fonctionnalités immédiatement opérationnelles
En ajustant finement vos transformers préentraînés, vous pouvez obtenir d’emblée de hautes performances, sans investissement colossal. En comparaison, un entraînement à partir de zéro prendrait plus de temps et nécessiterait beaucoup plus de puissance de calcul et d’énergie — de plusieurs ordres de grandeur — pour atteindre les mêmes indicateurs de performance.
4) Optimiser l’analyse des sentiments
Les modèles Transformer vous permettent de prendre un modèle de langage (LM) à grande échelle, entraîné sur une quantité massive de textes — l’œuvre complète de Shakespeare, par exemple — puis de l’adapter à une tâche conceptuelle spécifique, bien au-delà de la simple « lecture », comme l’analyse des sentiments, voire l’analyse prédictive.
Cela tend à produire de bien meilleures performances, car le modèle préentraîné comprend déjà très bien le langage : il lui suffit donc d’apprendre la tâche spécifique, au lieu d’essayer d’apprendre à la fois le langage et la tâche.
Perspectives : redéfinir le domaine du TAL
Depuis leur apparition, les transformers sont devenus la norme de facto pour des tâches telles que la réponse aux questions, la génération de langage et la génération d’entités nommées. Même s’il est difficile de prédire l’avenir de l’IA, il est raisonnable de penser que les modèles Transformer méritent une attention particulière en tant que technologie émergente de nouvelle génération.
Le plus important, sans doute, est leur capacité à permettre aux modèles d’apprentissage automatique non seulement d’approcher les nuances et la compréhension de la lecture humaine, mais aussi de dépasser largement la cognition humaine à de nombreux niveaux — bien au-delà des simples gains de quantité et de vitesse.
À propos de l’auteur :
Dylan Fox est le CEO d’AssemblyAI


