Entwickler suchen nach neuen Methoden für das KI-Training, da neuere Modelle zunehmend geringere Erträge liefern. Jüngsten Berichten zufolge verzeichnen Modelle, die in führenden KI-Laboren entwickelt wurden, langsamere Verbesserungsraten als früher. Das veranlasst Entwickler, die Gültigkeit der KI-Skalierungsgesetze für das Modelltraining infrage zu stellen. Eine Verbesserung des Modelltrainings bedeutet, die grundlegenden Strategien rund um unser Verständnis von künstlicher Intelligenz und der Verbesserung von Modellen neu zu überdenken.
In den vergangenen fünf Jahren gingen Entwickler davon aus, dass das Vortraining von Modellen mit mehr Rechenleistung und Daten leistungsfähigere KI-Fähigkeiten hervorbringen würde. Jüngste Berichte deuten jedoch auf langsamere Verbesserungsraten bei KI-Modellen hin – selbst bei führenden KI-Laboren. Googles KI-Modell Gemini konnte keine Leistungssteigerungen erzielen, und Anthropic hatte mit Entwicklungsproblemen zu kämpfen, die zu einer Verzögerung der Veröffentlichung seines KI-Modells Claude 3.5 Opus führten. Auch das Orion-Modell von OpenAI erfüllt die Leistungserwartungen im Hinblick auf Verbesserungen beim Programmieren nicht und verzeichnete im Vergleich zu früheren Modellen nur minimale neue Verbesserungen.
Da Modelle sinkende Verbesserungsraten und geringere Erträge zeigen, könnten KI-Entwickler gezwungen sein, eine neue Ära von Methoden für das Modelltraining einzuläuten.
Das Problem mit den KI-Skalierungsgesetzen
Die jüngsten Entwicklungen bei KI-Modellen zeigen, dass sich KI-Labore nicht allein darauf verlassen können, mehr Daten und Rechenleistung einzusetzen, um leistungsfähigere Modelle zu erzeugen. Das stellt Labore vor eine Herausforderung, die traditionelle KI-Skalierungsgesetze als maßgeblichen Faktor für ihre Modellentwicklung genutzt haben. Während sich die ersten von Entwicklern wie OpenAI, Meta, Anthropic und Google entwickelten KI-Modelle durch den Einsatz von mehr GPUs und größeren Datenmengen verbesserten, können diese Methoden allein kein exponentielles Wachstum aufrechterhalten.
KI-Skalierungsgesetze hatten zuvor auch zu Erwartungen an das scheinbar grenzenlose Verbesserungspotenzial der Technologie beigetragen. Führende KI-Unternehmen haben erhebliche Investitionen in die Modellentwicklung getätigt und optimistische Aussagen über die Zukunft der KI gemacht, die die von diesen Technologien erwarteten Erträge widerspiegeln. Als Reaktion darauf setzen Entwickler neue Trainingsstrategien ein, um wettbewerbsfähig zu bleiben, während wir in die nächste Ära der KI-Skalierungsgesetze eintreten.
Neue Trainingsstrategien, um das Tempo zu erhöhen
KI-Labore arbeiten zügig daran, Modelle durch neue Skalierungsmethoden zu verbessern. Zu den jüngst favorisierten Strategien gehört „Test-Time-Compute“, eine Trainingstechnik, bei der Modelle mehr Zeit für Berechnungen erhalten, um Antworten auf sorgfältig zu prüfende Fragen zu erzeugen. Eine kürzlich von MIT-Forschern veröffentlichte Studie zeigt, dass Test-Time-Compute die Modellleistung bei Aufgaben zum schrittweisen logischen Denken deutlich verbessert.
Entwickler werden wahrscheinlich weiterhin traditionelle Methoden nutzen, etwa den Einsatz relevanterer Datensätze und Rechencluster. Die Nachfrage nach schnellen KI-Inferenzchips könnte jedoch steigen, wenn sich Test-Time-Compute als nächste führende Trainingsmethode etabliert. Wie auch immer die Zukunft der KI-Entwicklung aussehen mag: Der allgemeine Enthusiasmus für ihr Potenzial bleibt positiv, während KI-Labore darum konkurrieren, das nächste große Modell im KI-Bereich hervorzubringen.

