
Parcours
Comment fonctionne l’IA?
Approche hybride

Une approche hybride consiste à combiner différentes méthodes d’apprentissage. L’objectif est de tirer parti des avantages de chacune des méthodes et de compenser leurs faiblesses pour développer des modèles plus performants.
Jusqu’ici, nous avons vu trois méthodes d’apprentissage pour entrainer un modèle en IA :

Apprentissage supervisé

Apprentissage non supervisé

Apprentissage par renforcement
À l’image d’un agent d’IA, un enfant apprend souvent sous supervision, à l’occasion par lui-même et reçoit parfois des récompenses ou des pénalités qui le guident dans son apprentissage.
De la même manière, une entreprise peut choisir de favoriser l’une ou plusieurs de ces trois types d’apprentissage selon la tâche à accomplir, la complexité du modèle, les données disponibles et le stade de développement de l’agent d’IA.
Cette façon mixte d’entrainer les agents d’IA constitue une approche hybride et peut inclure également d’autres méthodes :
Cliquez sur les boutons pour afficher les exemples.
L’apprentissage semi-supervisé utilise un mélange de données étiquetées et de données non étiquetées, améliorant la performance du modèle même lorsque les données étiquetées sont limitées. L’intervention humaine se limite surtout à confirmer les catégorisations proposées par la machine.
Attention! Dans l’usage, la forme avec trait d’union (apprentissage auto-supervisé) est nettement plus fréquente, bien que l’élément « auto- » soit généralement soudé au mot qui le suit. (Vitrine linguistique)
L’apprentissage multitâche permet à un modèle d’utiliser les connaissances acquises d’une tâche à l’autre. Cette approche est particulièrement utile pour améliorer la performance dans des domaines où les tâches sont interconnectées.
Le fonctionnement de l’IA générative
Eva Portelance, professeure adjointe du Département de sciences de la décision à HEC Montréal.
L’exemple de ChatGPT
Plus les modèles sont complexes et robustes, plus les combinaisons de méthodes d’apprentissage sont diverses et raffinées. Par exemple, l’agent conversationnel ChatGPT peut générer du texte cohérent et contextuellement approprié en réponse à des requêtes textuelles. L’agent est capable de répondre à des questions, de rédiger du texte et du code, et même de créer des histoires sur mesure. Son modèle d’entrainement est extrêmement complexe et sophistiqué, et il s’est entrainé intensivement sur d’énormes corpus de données textuelles. Cela permet au modèle d’assimiler les structures linguistiques et les relations syntaxiques, et de performer à un niveau inédit.
Une requête textuelle [1] a été soumise à ChatGPT pour lui demander d’expliquer le processus d’entrainement du modèle GPT. Voici sa réponse qui présente les différentes méthodes d’apprentissage sollicitées (le texte a été retouché, mais l’essence provient directement de ChatGPT) :

Tout commence par rassembler une grande quantité de textes provenant de livres, d’articles et de sites Web. Pensez à cela comme à la collecte de tous les livres d’une bibliothèque gigantesque. Ces textes sont ensuite nettoyés pour s’assurer qu’ils sont de bonne qualité, sans erreurs ni doublons. Cette étape permet de constituer une base de connaissances solide pour le modèle.
Ensuite, le modèle est formé à comprendre et à prévoir la suite des textes qu’il lit. Cela se fait en lui montrant des phrases et en lui demandant de deviner le mot suivant. C’est comme apprendre à un enfant à compléter des phrases pour qu’il comprenne la structure des phrases et le sens des mots. Cette méthode repose sur l’apprentissage autosupervisé, car le modèle crée ses propres étiquettes.
Une fois que le modèle a une bonne compréhension de base, il passe par plusieurs phases d’amélioration. Les conceptrices et concepteurs utilisent des méthodes variées reposant sur plusieurs types d’apprentissage : supervisé, autosupervisé et semi-supervisé. Cela signifie que le modèle apprend à partir de certaines données annotées, mais aussi qu’il crée ses propres exercices pour s’entrainer davantage. Par exemple, il peut essayer de deviner les mots manquants dans un texte ou d’organiser des phrases correctement.
Pour peaufiner les capacités du modèle, une méthode appelée apprentissage par renforcement avec rétroaction humaine est utilisée. Les humains jouent un rôle important ici en donnant des retours sur les réponses du modèle. Ils disent au modèle quelles réponses sont bonnes et lesquelles ne le sont pas, un peu comme en enseignement on corrige les devoirs d’un élève. Grâce à ces retours, le modèle apprend à produire des réponses plus pertinentes et appropriées.
Une fois que le modèle est bien formé, il est soumis à de nombreux tests pour vérifier s’il fonctionne correctement. Ces tests confirment que le modèle peut générer des réponses cohérentes et sensées. Après avoir réussi ces tests, le modèle est prêt à être utilisé par le public.
Le travail ne s’arrête pas après le déploiement. GPT continue de s’améliorer grâce aux interactions avec les utilisatrices et utilisateurs. Les retours de ceux-ci fournissent de nouvelles données aux gens qui conçoivent le modèle et qui peuvent continuer de l’entrainer et de combler ses lacunes.
[1] Requête utilisée : « Explique, dans un langage non technique, le processus d’entraînement du modèle GPT-4. Fais ressortir toutes les méthodes d’apprentissage utilisées par les concepteurs. »











