OpenAI-SWE-Lancer-Forschung: „Frontier-Modelle sind weiterhin nicht in der Lage, die Mehrheit der Aufgaben zu lösen“

Multi ethnic web developers writing script while talking.

Image: DC_Studio/Envato Elements

Verfasst von
Megan Crouse
Megan Crouse
Feb 19, 2025
2 minute read
eWeek Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Large Language Models oder LLMs sind laut einer am 18. Feb. veröffentlichten OpenAI-Studie mit dem Titel „SWE-Lancer: Können Frontier-LLMs mit Softwareentwicklung als freiberuflicher Tätigkeit in der realen Welt 1 Million US-Dollar verdienen?“ besser darin, Fehler zu beheben, als das grundlegende Problem zu verstehen, das sie verursacht.

LLMs für Fehlerbehebungen und andere Softwareentwicklungsaufgaben einsetzen

Um zu bewerten, wie gut LLMs reale Softwareentwicklungsaufgaben bewältigen, entwickelte OpenAI einen Benchmark namens SWE-Lancer und testete ihn auf Upwork, einer beliebten Plattform für Auftragsarbeit.

SWE-Lancer bewertete, wie viel Geld drei LLMs — Claude 3.5 Sonnet, OpenAIs GPT-4o und OpenAI o1 — durch die Erledigung von auf Upwork angebotenen Softwareentwicklungsaufträgen erwirtschaften könnten. Die OpenAI-Forscher stellten jedoch fest, dass „… Frontier-Modelle weiterhin nicht in der Lage sind, die Mehrheit der Aufgaben zu lösen.“

KI-generierte Lösungen unter realen Bedingungen testen

Im Gegensatz zu herkömmlichen KI-Bewertungen, bei denen Modelle mit den kognitiven Fähigkeiten von Menschen verglichen werden, konzentrierte sich SWE-Lancer auf die Messung wirtschaftlicher Auswirkungen, indem reale Auftragsarbeit simuliert wurde.

Für die Erstellung des Benchmarks stellten die OpenAI-Forscher 764 Aufgaben von Upwork zusammen und wandelten sie mithilfe von Docker-Containern in einen strukturierten Datensatz um. Die Aufgaben unterschieden sich in ihrer Komplexität und reichten von Fehlerbehebungen für 50 US-Dollar bis zu Implementierungen von Funktionen für 32.000 US-Dollar. Da die LLMs weiterhin nicht direkt auf die extrahierten Upwork-Anzeigen zugreifen konnten, mussten die Forscher darauf basierende Prompts erstellen, die jeweils einen Ausschnitt aus der Codebasis des Projekts enthielten.

Die Antworten der Modelle wurden mithilfe von Playwright, einer quelloffenen Bibliothek zum Testen von Browsern, ausgewertet, um festzustellen, ob die Lösung tatsächlich funktionierte.

Advertisement

Trotz seiner starken Leistung löste Claude 3.5 Sonnet laut den erfahrenen menschlichen Softwareentwicklern, die das Experiment überwachten, nur 26,2 % der Aufgaben korrekt. LLMs können Daten zwar schnell analysieren, scheitern aber häufig daran, die zugrunde liegende Ursache eines Problems zu erkennen, was zu falschen Lösungen führt.

Graph showing Claude 3.5 Sonnet performed best in OpenAI’s SWE-Lancer research.
Claude 3.5 Sonnet performed best in OpenAI’s SWE-Lancer research. Image: OpenAI

Claude 3.5 Sonnet schnitt in OpenAIs SWE-Lancer-Forschung am besten ab. Bild: OpenAI

„Freiberufliche Arbeit in der realen Welt … bleibt für KI eine Herausforderung“

„Die Ergebnisse zeigen, dass die freiberufliche Arbeit in der realen Welt in unserem Benchmark für Frontier-Sprachmodelle weiterhin eine Herausforderung darstellt“, schrieben die OpenAI-Forscher Samuel Miserendino, Michele Wang, Tejal Patwardhan und Johannes Heidecke. 

Frühere Studien darüber, wie generative KI in der Softwareentwicklung eingesetzt werden könnte, untersuchten laut den Forschern spezifische Aufgaben in abgeschotteten Umgebungen.

„In der realen Welt arbeiten Softwareentwickler jedoch über den gesamten Technologie-Stack hinweg und müssen komplexe Interaktionen und Abwägungen zwischen Codebasen beurteilen“, sagten sie. 

Der Datensatz für SWE-Lancer ist auf GitHub verfügbar. Er bietet Forschern Einblicke in die sich wandelnde Rolle von KI in der Softwareentwicklung.

Megan Crouse

Megan Crouse has a decade of experience in business-to-business news and feature writing, including as first a writer and then the editor of Manufacturing.net. Her news and feature stories have appeared in Military & Aerospace Electronics, Fierce Wireless, TechRepublic, and eWeek. She copyedited cybersecurity news and features at Security Intelligence. She holds a degree in English Literature and minored in Creative Writing at Fairleigh Dickinson University.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.