Ein KI-Agent kann eine plausible Analyse erstellen und dennoch die falsche Geschäftsentscheidung treffen. In Argo-Bench, einem neuen Benchmark für Unternehmensdaten, erzielte das leistungsstärkste Modell bei nur 34,8 % von 210 Aufgaben mindestens 95 von 100 Punkten.
Laut TextQL Labs führt Claude Opus 5.5 die aktuelle v1.1-Rangliste mit einer durchschnittlichen Punktzahl von 59,5 an. Das Ergebnis zeigt eine Lücke zwischen Agenten, die Unternehmensdaten analysieren können, und solchen, die auf dieser Grundlage zuverlässig handeln können.
Die aktuelle Argo-Bench-Rangliste führt 13 Modelle auf, während der Vorabdruck vom 1. Oktober Ergebnisse von 14 Spitzen- und Open-Weight-Modellen berichtet. Der Benchmark simuliert ein New Yorker Unternehmen für Essenslieferungen mit 81 Millionen Bestellungen im Jahr 2024 und exportiert dessen Daten in ein Data Warehouse mit 235 Tabellen und 7,49 Milliarden Zeilen, das der Oracle E-Business Suite nachempfunden ist.
So testet Argo-Bench Unternehmens-KI-Agenten
Unter der Benchmark-Methodik können Agenten das Data Warehouse abfragen, Python-basierte Statistik- und Machine-Learning-Tools verwenden sowie Ergebnisse wie Sperrungen von Betrugskonten, Prognosen, Budgets, ausgewiesene Kennzahlen und Datenquellen für Dashboards einreichen. Der Aufbau geht über Text-to-SQL-Tests hinaus, bei denen hauptsächlich gemessen wird, ob Modelle natürlichsprachliche Anfragen in Datenbankabfragen übersetzen können.
Von den 210 Aufgaben erfordern 178 mehr als eine numerische Antwort. Bei einer Aufgabe zur Kostensenkung ermittelte GPT-6 Astra, wo sich Fahrerboni offenbar am wenigsten auszahlten, übersah jedoch ihren Zusammenhang mit den teureren Spitzenzuschlägen. Sein Plan verursachte in der Simulation einen Verlust von 86.281 US-Dollar, während Claude Opus 5.5 diesen Zielkonflikt berücksichtigte und netto rund 3,09 Millionen US-Dollar einsparte.
Andere Fehler zeigten, wie plausible Ausgaben schlechte zugrunde liegende Ergebnisse verschleiern können. Bei 2.894 Prognosereihen enthielten nominale 80-%-Vorhersageintervalle nur in 41,8 % der Fälle das tatsächlich eingetretene Ergebnis. Argo-Bench stellte außerdem fest, dass 72,8 % der Dashboard-Datenquellen, die das erforderliche Strukturformat erfüllten, bei ihren zugrunde liegenden Werten null Punkte erzielten.
Erkenntnis von eWeek: Eine Aufgabe abzuschließen beweist nicht, dass sie richtig erledigt wurde
Da Unternehmen sich von KI-Copiloten hin zu autonomen Workflows bewegen, lässt sich mit Argo-Bench nicht feststellen, wie häufig Agenten in der Produktion versagen würden. Sein simuliertes Data Warehouse ist keine reale Unternehmensumgebung, doch die Ergebnisse zeigen, dass Benchmarks zu Programmierung, SQL und Aufgabenerledigung allein nicht belegen können, ob ein Agent bei komplexen Unternehmensdaten zuverlässige Geschäftsentscheidungen treffen wird.
Zwei weitere aktuelle Benchmarks stellten in anderen Szenarien ähnliche Lücken fest. Die ERPBench-Studie ergab, dass einige ausschließlich auf Screenshots basierende Agenten den richtigen ERP-Datensatz aufrufen und speichern konnten, dabei aber weiterhin den falschen Wert hinterlegten. World of Workflows, das auf einer ServiceNow-basierten Umgebung mit mehr als 4.000 Geschäftsregeln und 55 Workflows aufbaut, zeigte, dass verborgene Systemeffekte dazu führen können, dass Agenten gegen im Interface nicht sichtbare Einschränkungen verstoßen.
Das schafft ein operatives Problem, wenn Unternehmen ihre plattformübergreifende Transparenz über KI-Agenten ausweiten und autonomen Systemen breiteren Zugriff auf Unternehmenssoftware gewähren. CIOs, Chief Data Officers und Enterprise-Architekten benötigen Prüfungen anhand maßgeblicher Daten und Geschäftsregeln, bevor Agenten Entscheidungen zu Budgets, Betrug, Prognosen oder Unternehmensdatensätzen endgültig festlegen.
Dasselbe Prinzip zeigt sich bei den Bemühungen, Sicherheitskontrollen für autonome Agenten aufzubauen: Die Fähigkeit eines Agenten, eine Aufgabe auszuführen, belegt nicht, dass seine Handlung korrekt oder zulässig ist. Diese kontrollierten Benchmarks beweisen nicht, dass Verifizierungskontrollen Fehler vollständig beseitigen werden. Sie zeigen jedoch, warum ein Abschluss signal nicht als Beleg dafür gelten sollte, dass das zugrunde liegende Ergebnis richtig ist.
Möchten Sie mehr KI-Tipps, Tricks und Prompting-Techniken lernen? eWeek-Leser erhalten 7-tägigen kostenlosen Zugang zur The Neuron Academy, unserer praxisorientierten Lernplattform, die Fachleuten helfen soll, KI bei der Arbeit souveräner einzusetzen.
Wir zeigen Ihnen Wie man mit KI spricht kostenlos! Absolvieren Sie unseren sechsminütigen Kurs an der The Neuron Academy und lernen Sie einige einfache Methoden kennen, bessere Prompts zu schreiben und nützlichere Ergebnisse von KI zu erhalten, oder stöbern Sie sieben Tage lang kostenlos in unserem anderen KI-Kurs. Hier finden Sie alle Lektionen →


