OpenAI a annulé une mise à jour de GPT-4o afin d’empêcher la flagornerie, ce langage fleuri que l’IA générative peut employer pour encenser les utilisateurs. Les réponses « excessivement bienveillantes mais malhonnêtes » se sont multipliées parce que « nous nous sommes trop concentrés sur les retours à court terme et n’avons pas pleinement pris en compte la façon dont les interactions des utilisateurs avec ChatGPT évoluent au fil du temps », a déclaré OpenAI dans un article de blog publié le 29 avril.
L’empressement de ChatGPT à plaire pourrait être « malaisant »
Les utilisateurs qui discutaient de l’empressement de GPT-4o à plaire ont atteint un point critique la semaine dernière. Selon eux, le ton inlassablement positif gaspillait des jetons et empêchait d’obtenir de véritables réponses. ChatGPT, lorsqu’il utilisait GPT-4o, pouvait féliciter l’utilisateur même pour des requêtes absurdes.
Le problème semblait provenir de la mise à jour de GPT-4o du 27 mars, qu’OpenAI disait destinée à rendre le modèle « intuitif, créatif et collaboratif, avec un meilleur suivi des instructions, des capacités de programmation plus intelligentes et un style de communication plus clair ».
« Les interactions flagorneuses peuvent être inconfortables, déstabilisantes et provoquer de la détresse », a écrit OpenAI. La flagornerie semblait toutefois moins angoissante que superflue : elle ne résout pas des problèmes comme les hallucinations de l’IA, tout en encombrant l’interaction de compliments infondés.
« Chacune de ces qualités souhaitables, comme chercher à être utile ou bienveillant, peut avoir des effets secondaires inattendus », a écrit OpenAI.
OpenAI promet davantage de personnalisation et de nouvelles possibilités de retour
Pour résoudre ce problème de flagornerie de l’IA, OpenAI prévoit de modifier la façon dont l’entreprise recueille et intègre les retours dans les modèles et d’autoriser une personnalisation accrue. OpenAI pourrait notamment permettre aux utilisateurs de choisir parmi « plusieurs personnalités par défaut », une fonctionnalité disponible avec certains agents GPT individuels, mais pas pour le moment dans l’interface principale de ChatGPT.
OpenAI prévoit d’orienter directement la prochaine version de GPT-4o pour l’éloigner de la flatterie, de mettre l’accent sur l’honnêteté, de modifier les moyens par lesquels les utilisateurs peuvent donner leur avis avant le déploiement d’un modèle et d’ajuster le Model Spec ainsi que d’autres évaluations internes afin d’essayer de détecter d’autres points de friction avant qu’ils ne surviennent.
« Nous espérons que ces retours nous aideront à mieux refléter la diversité des valeurs culturelles à travers le monde », a écrit Open AI.

