Erinnern Sie sich noch daran, als alle dachten, KI würde zuerst Autoren und Programmierer ersetzen? Offenbar sagte ein Risikokapitalgeber kürzlich zu OpenAIs Noam Brown dass KI diese Dinge zwar durchaus erledigen könne – aber „präzise, gut kalibrierte Vorhersagen über die Zukunft“? Das sei einzigartig menschlich.
Nun hat die University of Chicago gerade Prophet Arena veröffentlicht, um diese Theorie zu testen, und die Ergebnisse sind … ernüchternd.
Darum geht es
Prophet Arena schickt KI-Modelle in Live-Prognosemärkte – denken Sie an Wetten im Stil von Kalshi auf alles Mögliche, von Wahlen über Sport bis hin zu Kryptopreisen. Der Clou? Es handelt sich um reale, noch nicht entschiedene Ereignisse. Die Nachrichten von morgen kann man nicht auswendig lernen (es sei denn, man hat die Zeitreise geknackt). Das bedeutet, dass KI-Modelle nicht schummeln können, indem sie sich Testantworten einprägen, wie sie es bei anderen Benchmarks tun.
Die Modelle erhalten Nachrichtenartikel und Marktdaten und platzieren anschließend Wahrscheinlichkeitswetten. Sobald Ereignisse entschieden sind – etwa wenn Toronto FC überraschend gewinnt –, sehen wir, wer die Welt tatsächlich verstanden hat und wer nur Muster abgeglichen hat.
Die ersten Ergebnisse sind faszinierend
- OpenAIs o3-mini liegt bei den Erträgen weit vorn und macht aus 1 US-Dollar bei einer einzigen MLS-Wette 9 US-Dollar, indem es einen vom Markt übersehenen Wert erkennt.
- Die Modelle haben unterschiedliche „Persönlichkeiten“ – Qwen 3 ist aggressiv (75 % Wahrscheinlichkeit für eine KI-Regulierung), während Llama 4 Maverick vorsichtig agiert (35 % beim selben Ereignis).
- GPT-5 führt bei der Genauigkeit, aber o3-mini verdient mehr Geld – offenbar sind richtig zu liegen und profitabel zu sein nicht dasselbe.
- DeepSeek-R1 lief aus dem Ruder und wettete manchmal auf alles mit 0 %, was bei überraschenden Ergebnissen irgendwie trotzdem Geld einbrachte.

Sehen Sie sich die Rangliste selbst an.
Hier wird es interessant
Beim Spiel von Toronto FC, gab der Markt dem Team eine Gewinnchance von 11 %, während o3-mini 30 % erkannte. Es setzte kräftig auf den Außenseiter und erzielte 9-fache Erträge, als Toronto gewann.
Die Modelle raten nicht einfach zufällig. Sie verfassen detaillierte Begründungen, gewichten Quellen unterschiedlich und zeigen echte Unterschiede beim Schlussfolgern – ein bisschen wie ein Raum voller Analysten, die sich nicht einigen können.
Das Genialste daran ist, wie Prophet Arena das größte Testproblem der KI löst: die Kontamination von Benchmarks. Die meisten Tests werden nutzlos, sobald Modelle mit den Antworten trainiert wurden. Aber die Spielergebnisse von morgen kann man nicht durchsickern lassen.
Achten Sie auf Folgendes
Die Modelle von Anthropic fehlen mysteriöserweise in der Rangliste. Meta’s Llama 4 Maverick war das einzige Modell, das den politischen Überraschungssieg von Zohran korrekt vorhersagte. Und die Modelle scheinen bestimmte Präsidentschaftskandidaten für 2028 deutlich optimistischer einzuschätzen, als es die aktuellen Umfragen nahelegen. Weiß jemand etwas, das wir nicht wissen?
Anmerkung der Redaktion: Dieser Beitrag erschien ursprünglich in einem kürzlich veröffentlichten Newsletter unserer Schwesterpublikation The Neuron. Weitere Beiträge von The Neuron können Sie lesen, indem Sie sich hier für den Newsletter anmelden.

