Führendes KI-Modell löst im Argo-Bench-Test nur 35 % der Unternehmensaufgaben vollständig

Verfasst von
eWEEK Staff
eWEEK Staff
Oct 4, 2026
3 minute read
Enterprise AI agents concept showing an AI decision dashboard processing complex enterprise data with a warning signal

Argo-Bench shows that enterprise AI agents can produce convincing outputs while still missing the correct business outcome. Image: Generated via ChatGPT/OpenAI

eWeek Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Ein KI-Agent kann eine plausible Analyse erstellen und dennoch die falsche Geschäftsentscheidung treffen. In Argo-Bench, einem neuen Benchmark für Unternehmensdaten, erzielte das leistungsstärkste Modell bei nur 34,8 % von 210 Aufgaben mindestens 95 von 100 Punkten.

Laut TextQL Labs führt Claude Opus 5.5 die aktuelle v1.1-Rangliste mit einer durchschnittlichen Punktzahl von 59,5 an. Das Ergebnis zeigt eine Lücke zwischen Agenten, die Unternehmensdaten analysieren können, und solchen, die auf dieser Grundlage zuverlässig handeln können.

Die aktuelle Argo-Bench-Rangliste führt 13 Modelle auf, während der Vorabdruck vom 1. Oktober Ergebnisse von 14 Spitzen- und Open-Weight-Modellen berichtet. Der Benchmark simuliert ein New Yorker Unternehmen für Essenslieferungen mit 81 Millionen Bestellungen im Jahr 2024 und exportiert dessen Daten in ein Data Warehouse mit 235 Tabellen und 7,49 Milliarden Zeilen, das der Oracle E-Business Suite nachempfunden ist.

So testet Argo-Bench Unternehmens-KI-Agenten

Unter der Benchmark-Methodik können Agenten das Data Warehouse abfragen, Python-basierte Statistik- und Machine-Learning-Tools verwenden sowie Ergebnisse wie Sperrungen von Betrugskonten, Prognosen, Budgets, ausgewiesene Kennzahlen und Datenquellen für Dashboards einreichen. Der Aufbau geht über Text-to-SQL-Tests hinaus, bei denen hauptsächlich gemessen wird, ob Modelle natürlichsprachliche Anfragen in Datenbankabfragen übersetzen können.

Von den 210 Aufgaben erfordern 178 mehr als eine numerische Antwort. Bei einer Aufgabe zur Kostensenkung ermittelte GPT-6 Astra, wo sich Fahrerboni offenbar am wenigsten auszahlten, übersah jedoch ihren Zusammenhang mit den teureren Spitzenzuschlägen. Sein Plan verursachte in der Simulation einen Verlust von 86.281 US-Dollar, während Claude Opus 5.5 diesen Zielkonflikt berücksichtigte und netto rund 3,09 Millionen US-Dollar einsparte.

Andere Fehler zeigten, wie plausible Ausgaben schlechte zugrunde liegende Ergebnisse verschleiern können. Bei 2.894 Prognosereihen enthielten nominale 80-%-Vorhersageintervalle nur in 41,8 % der Fälle das tatsächlich eingetretene Ergebnis. Argo-Bench stellte außerdem fest, dass 72,8 % der Dashboard-Datenquellen, die das erforderliche Strukturformat erfüllten, bei ihren zugrunde liegenden Werten null Punkte erzielten.

Advertisement

Erkenntnis von eWeek: Eine Aufgabe abzuschließen beweist nicht, dass sie richtig erledigt wurde

Da Unternehmen sich von KI-Copiloten hin zu autonomen Workflows bewegen, lässt sich mit Argo-Bench nicht feststellen, wie häufig Agenten in der Produktion versagen würden. Sein simuliertes Data Warehouse ist keine reale Unternehmensumgebung, doch die Ergebnisse zeigen, dass Benchmarks zu Programmierung, SQL und Aufgabenerledigung allein nicht belegen können, ob ein Agent bei komplexen Unternehmensdaten zuverlässige Geschäftsentscheidungen treffen wird.

Zwei weitere aktuelle Benchmarks stellten in anderen Szenarien ähnliche Lücken fest. Die ERPBench-Studie ergab, dass einige ausschließlich auf Screenshots basierende Agenten den richtigen ERP-Datensatz aufrufen und speichern konnten, dabei aber weiterhin den falschen Wert hinterlegten. World of Workflows, das auf einer ServiceNow-basierten Umgebung mit mehr als 4.000 Geschäftsregeln und 55 Workflows aufbaut, zeigte, dass verborgene Systemeffekte dazu führen können, dass Agenten gegen im Interface nicht sichtbare Einschränkungen verstoßen.

Das schafft ein operatives Problem, wenn Unternehmen ihre plattformübergreifende Transparenz über KI-Agenten ausweiten und autonomen Systemen breiteren Zugriff auf Unternehmenssoftware gewähren. CIOs, Chief Data Officers und Enterprise-Architekten benötigen Prüfungen anhand maßgeblicher Daten und Geschäftsregeln, bevor Agenten Entscheidungen zu Budgets, Betrug, Prognosen oder Unternehmensdatensätzen endgültig festlegen.

Dasselbe Prinzip zeigt sich bei den Bemühungen, Sicherheitskontrollen für autonome Agenten aufzubauen: Die Fähigkeit eines Agenten, eine Aufgabe auszuführen, belegt nicht, dass seine Handlung korrekt oder zulässig ist. Diese kontrollierten Benchmarks beweisen nicht, dass Verifizierungskontrollen Fehler vollständig beseitigen werden. Sie zeigen jedoch, warum ein Abschluss signal nicht als Beleg dafür gelten sollte, dass das zugrunde liegende Ergebnis richtig ist.

Möchten Sie mehr KI-Tipps, Tricks und Prompting-Techniken lernen? eWeek-Leser erhalten 7-tägigen kostenlosen Zugang zur The Neuron Academy, unserer praxisorientierten Lernplattform, die Fachleuten helfen soll, KI bei der Arbeit souveräner einzusetzen.

Wir zeigen Ihnen Wie man mit KI spricht kostenlos! Absolvieren Sie unseren sechsminütigen Kurs an der The Neuron Academy und lernen Sie einige einfache Methoden kennen, bessere Prompts zu schreiben und nützlichere Ergebnisse von KI zu erhalten, oder stöbern Sie sieben Tage lang kostenlos in unserem anderen KI-Kurs. Hier finden Sie alle Lektionen →

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.