Étude SWE-Lancer d’OpenAI : « Les modèles de pointe sont encore incapables de résoudre la majorité des tâches »

Multi ethnic web developers writing script while talking.

Image: DC_Studio/Envato Elements

Written By
Megan Crouse
Megan Crouse
Feb 19, 2025
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Selon une étude d’OpenAI publiée le 18 févr. sous le titre « SWE-Lancer : les LLM de pointe peuvent-ils gagner 1 million de dollars grâce à des missions de développement logiciel freelance dans le monde réel ? », les grands modèles de langage, ou LLM, sont plus doués pour corriger des bugs que pour comprendre le problème fondamental qui les provoque.

Mettre les LLM au travail sur la correction de bugs et d’autres missions de développement logiciel

Pour évaluer la capacité des LLM à gérer des tâches de développement logiciel dans le monde réel, OpenAI a créé un benchmark baptisé SWE-Lancer et l’a testé sur Upwork, une plateforme populaire de missions freelance.

SWE-Lancer a évalué combien d’argent trois LLMs — Claude 3.5 Sonnet, GPT-4o d’OpenAI et o1 d’OpenAI — pourraient générer en réalisant des missions de développement logiciel proposées sur Upwork. Cependant, les chercheurs d’OpenAI ont constaté que « … les modèles de pointe sont encore incapables de résoudre la majorité des tâches. »

Tester des solutions générées par l’IA dans des conditions réelles

Contrairement aux évaluations traditionnelles de l’IA, qui comparent les modèles aux capacités cognitives humaines, SWE-Lancer s’est concentré sur la mesure de l’impact économique en simulant des missions freelance dans le monde réel.

Pour créer ce benchmark, les chercheurs d’OpenAI ont sélectionné 764 tâches sur Upwork et les ont converties en un jeu de données structuré au moyen de conteneurs Docker. Les tâches étaient de complexité variable, allant de corrections de bugs à 50 dollars à des implémentations de fonctionnalités à 32 000 dollars. Comme les LLM ne pouvaient toujours pas accéder directement aux annonces Upwork extraites, les chercheurs ont dû créer des prompts à partir de celles-ci, accompagnés d’un échantillon du code source de chaque projet.

Les réponses des modèles ont été évaluées à l’aide de Playwright, une bibliothèque open source de test de navigateurs, afin de déterminer si la solution fonctionnait réellement.

Advertisement

Malgré ses solides performances, Claude 3.5 Sonnet n’a correctement résolu que 26,2 % des tâches, selon les ingénieurs logiciels humains expérimentés qui supervisaient l’expérience. Si les LLM peuvent analyser rapidement les données, ils échouent souvent à identifier la cause sous-jacente d’un problème, ce qui conduit à des solutions incorrectes.

Graph showing Claude 3.5 Sonnet performed best in OpenAI’s SWE-Lancer research.
Claude 3.5 Sonnet performed best in OpenAI’s SWE-Lancer research. Image: OpenAI

Claude 3.5 Sonnet a obtenu les meilleurs résultats dans l’étude SWE-Lancer d’OpenAI. Image : OpenAI

« Le travail freelance dans le monde réel… reste difficile pour l’IA »

« Les résultats indiquent que le travail freelance dans le monde réel de notre benchmark reste difficile pour les modèles de langage de pointe », ont écrit les chercheurs d’OpenAI Samuel Miserendino, Michele Wang, Tejal Patwardhan et Johannes Heidecke. 

Les chercheurs ont écrit que les études précédentes consacrées aux applications possibles de l’IA générative au développement logiciel portaient sur des tâches spécifiques dans des environnements autonomes.

« Dans le monde réel, cependant, les ingénieurs logiciels travaillent sur l’ensemble de la pile technologique et doivent raisonner sur des interactions et des compromis complexes entre les bases de code », ont-ils déclaré. 

Le jeu de données de SWE-Lancer est disponible sur GitHub. Il fournit aux chercheurs des éclairages sur le rôle en constante évolution de l’IA dans le développement logiciel.

Megan Crouse

Megan Crouse has a decade of experience in business-to-business news and feature writing, including as first a writer and then the editor of Manufacturing.net. Her news and feature stories have appeared in Military & Aerospace Electronics, Fierce Wireless, TechRepublic, and eWeek. She copyedited cybersecurity news and features at Security Intelligence. She holds a degree in English Literature and minored in Creative Writing at Fairleigh Dickinson University.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.