Metas V-JEPA-2-Weltmodell bringt KI dem Denken vor dem Handeln näher

Screenshot of a demo of Meta’s V-JEPA 2 world model.

Screenshot of a demo of Meta’s V-JEPA 2 world model. Image: Meta

Written By
J.R. Johnivan
J.R. Johnivan
Jun 16, 2025
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Metas neuestes KI-Modell V-JEPA 2 (Video Joint Embedding Predictive Architecture) wird aufgrund seiner Fähigkeit, physikalische Wechselwirkungen zu simulieren und Schlussfolgerungen darüber zu ziehen, als „Weltmodell“ bezeichnet. V-JEPA 2 identifiziert nicht nur Objekte – es kann auch physikalische Eigenschaften wie die Schwerkraft ableiten, das Verhalten beweglicher Objekte vorhersehen, Hindernissen ausweichen und neue Aufgaben erlernen, indem es analysiert, was es sieht.  

Die Pressemitteilung von Meta vom 11. Juni heißt auszugsweise: „Heute freuen wir uns, V-JEPA 2 vorzustellen, unser hochmodernes, mit Videos trainiertes Weltmodell, das Robotern und anderen KI-Agenten ermöglicht, die physische Welt zu verstehen und vorherzusagen, wie sie auf ihre Handlungen reagieren wird. Diese Fähigkeiten sind entscheidend für die Entwicklung von KI-Agenten, die vor ihrem Handeln denken können, und V-JEPA 2 stellt einen bedeutenden Fortschritt auf dem Weg zu unserem übergeordneten Ziel dar, eine fortgeschrittene maschinelle Intelligenz (AMI) zu entwickeln.“

Was ist ein Weltmodell?

Im Gegensatz zu den meisten herkömmlichen Arten von KI-Modellen , die sich beim Erledigen von Aufgaben auf statistische Muster stützen, erstellen Weltmodelle interne Repräsentationen ihrer Umgebung – so können sie simulieren, wie die Umwelt funktioniert. Dieser Ansatz ermöglicht es dem Modell, seine Umgebung umfassend zu verstehen, mehrstufige Pläne zu erstellen und vorherzusagen, wie sich seine Handlungen und die Handlungen anderer auf die Realität auswirken werden. 

Damit eine KI als Weltmodell eingestuft werden kann, muss sie in der Lage sein:

  • Verstehen
  • Vorhersagen
  • Planen

V-JEPA 2 wurde mit diesen drei Zielen als Kernprinzipien entwickelt und verbessert seinen Vorgänger durch präzisere Prognosen, bessere Generalisierung und eine stärkere Mustererkennung. 

Wie wurde V-JEPA 2 trainiert?

Zusätzlich zum Training mit mehr als einer Million Stunden Videomaterial wurde V-JEPA 2 mithilfe von 6 Stunden Daten zu realen Roboterinteraktionen feinjustiert. Anschließend wurde es an Roboterarmen in verschiedenen Umgebungen getestet, wo es erfolgreich Aufgaben zur Objektmanipulation wie Greifen und Platzieren ausführte, ohne zuvor mit diesen Objekten in Berührung gekommen zu sein. 

Das Modell zeigte eine starke Generalisierungsfähigkeit und passte sich an unbekannte Szenarien an, ohne dass ein Lernen anhand von Demonstrationen erforderlich war. Leistungsbenchmarks zeigten, dass V-JEPA 2 seine frühere Version in Bereichen wie Motorsteuerung, Vorhersage und physikalischer Schlussfolgerung deutlich übertraf.   

Advertisement

Neue KI-Benchmarks vorgestellt

Das Team von Meta veröffentlichte zusammen mit V-JEPA 2 außerdem drei neue KI-Benchmarks. Diese Benchmarks wurden entwickelt, um anhand von aus Videos gewonnenen Daten zu bewerten, wie effektiv ein Modell die reale Welt versteht.

  • IntPhys2: Der erste Benchmark untersucht, ob ein Modell zwischen plausibler und unplausibler Physik unterscheiden kann.
  • Minimal Video Pairs (MVPBench): Dieser Benchmark testet das KI-Modell anhand verschiedener Multiple-Choice-Fragen darauf, wie gut es die für das Training verwendeten Videos versteht.
  • CausalVQA: Dieser Benchmark bewertet schließlich die Fähigkeit des KI-Modells, grundlegende Ursache-Wirkungs-Szenarien zu verstehen.

Der Weg zu intelligenterer Robotik

Während das ursprüngliche V-JEPA einen wichtigen Schritt auf dem Weg darstellte, Maschinen mit verkörperter Intelligenz auszustatten, bringt V-JEPA 2 das Feld deutlich voran. Das auf derselben Grundlage entwickelte, verbesserte Modell bietet erhebliche Fortschritte bei der Vorhersagegenauigkeit und der Generalisierung auf Aufgaben – und eignet sich damit besonders für den Einsatz in der Robotik der nächsten Generation, Wearables und autonomen Systemen. 

Lesen Sie die Berichterstattung von eWeek über Metas neues Superintelligenzlabor, in dem Mark Zuckerberg seine Vision darlegte, wie sich KI über die heutigen Frontier-Modelle hinaus weiterentwickeln lässt. 

J.R. Johnivan

J.R. Johnivan is a 17-year veteran whose writing is focused on innovation and technology, including IT, computer networking, security, cloud computing, staffing, human resources, real estate, sports, entertainment, and more.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.