Alle 48 Stunden erschien im Juni 2026 ein neues Embodied-AI-Modell

AI robots working multiple tasks with a hologram of a brain in the center.

Image: Generated via ChatGPT

Jul 14, 2026
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Die Embodied-AI-Branche verändert ihre Prioritäten rasant: Softwareintelligenz entwickelt sich zum größten Wettbewerbsvorteil gegenüber Verbesserungen an der Hardware.

Laut einem Bericht von Pandaily stellten Entwickler im Juni 2026 13 neue Embodied-AI-Grundlagenmodelle und Weltmodelle vor – im Durchschnitt erschien alle 48 Stunden ein neues Modell. Dieses Tempo spiegelt den wachsenden Fokus der Branche darauf wider, Roboter dazu zu befähigen, effektiver zu denken, Schlussfolgerungen zu ziehen und sich anzupassen, statt lediglich ihre mechanischen Fähigkeiten zu verbessern.

Dieser Wandel vollzieht sich, da Robotikunternehmen zunehmend KI-Modelle als Schlüsseltechnologie betrachten, die bestimmt, wie gut humanoide Roboter und autonome Maschinen in realen Umgebungen funktionieren.

BAAI konzentriert sich auf das Verständnis der Welt

Statt einem einzigen Ansatz zu folgen, konzentrieren sich große KI-Labore und Robotikunternehmen auf konkrete Schwachstellen, die Roboter weiterhin ausbremsen. Auf der Zhiyuan Conference 2026 stellte die Beijing Academy of Artificial Intelligence (BAAI) zwei Weltmodell-Projekte vor.

Das erste, Wujie Physis-v0.1, soll den nächsten physikalischen Zustand einer Umgebung vorhersagen, indem es verschiedene Arten von Sensordaten – darunter Video, RGB-D-Daten, 3D-Punktwolken und Kraft-Tast-Signale – in einer gemeinsamen latenten Repräsentation zusammenführt.

BAAI stellte außerdem Wujie RoboBrain Orca vor, das als Robotergehirn fungiert, indem es Sprach- und visuelle Informationen mit kausalem Schlussfolgern und multimodalem Decoding kombiniert.

Alibaba setzt auf ein besseres Modelldesign statt auf größere Skalierung

Alibaba schlug mit der Vorstellung seiner Qwen-Robot-Familie am 16. Juni eine andere Richtung ein.

Statt sich primär auf größere Datensätze und mehr Robotertraining zu verlassen, argumentierte das Unternehmen, dass die Vielfalt realer Umgebungen nicht allein durch Skalierung bewältigt werden könne. Stattdessen schlug es auf Modellebene angesiedelte Ausrichtungstechniken vor, die auf unterschiedliche robotische Aufgaben zugeschnitten sind.

Advertisement

Die Suite umfasst:

  • Qwen-RobotNav, das die visuelle Aufmerksamkeit für die Roboternavigation anpasst.
  • Qwen-RobotManip, das Zustands- und Aktionsräume für Manipulationsaufgaben standardisiert.
  • Qwen-RobotWorld, das die Dynamik der Welt mithilfe von Aktionsschnittstellen in natürlicher Sprache vorhersagt.

Neue Modelle zielen auf konkrete Schwachstellen von Robotern

Mehrere andere Organisationen stellten Modelle vor, die einzelne Engpässe beheben sollen, die die Leistungsfähigkeit von Robotern weiterhin einschränken.

CasiaHand stellte Brain-Si 0,5 vor, das als weltweit erstes Modell für menschenähnliche geschickte Manipulation beschrieben wird. Es nutzt eine Architektur mit drei Ebenen, die Planung, Manipulationsfähigkeiten und physikalisch interpretierbare Modelle für Aufgaben wie Greifen, Übergaben, beidhändige Koordination und die Mensch-Roboter-Interaktion kombiniert.

GalaxyBot stellte AstraBrain-WBC 0,5 vor, ein vom Kleinhirn inspiriertes Grundlagenmodell für die Ganzkörpersteuerung humanoider Roboter. Es basiert auf einer kausalen Transformer-Architektur im GPT-Stil, wurde mit rund 2 Milliarden Frames menschlicher Aktionsdaten trainiert und umfasst 80 Millionen Parameter.

Zu den weiteren Veröffentlichungen gehörten die Visics-Architektur von RoboScience, die Weltmodelle mithilfe von Repräsentationen von Objekttrajektorien von Betriebsmodellen trennt; Curl-0 von Current Robotics, das sich der geschickten Ganzkörpermanipulation durch gekoppeltes Training nähert; sowie das MWA-Weltmodell von BoundlessPower zur Modellierung bidirektionaler physikalischer Kausalität über lange Sequenzen.

Der Fokus verschiebt sich von Leistungsfähigkeit zu Zuverlässigkeit

Pandaily stellte fest, dass diese Projekte trotz ihrer unterschiedlichen technischen Ansätze ein gemeinsames Ziel verfolgen. Statt lediglich beeindruckende Roboterdemonstrationen zu präsentieren, versuchen Forscher zunehmend zu verstehen, warum Roboter weiterhin mit vielen alltäglichen Aufgaben Schwierigkeiten haben.

Die Teams nehmen unterschiedliche Engpässe ins Visier, darunter taktile Wahrnehmung, Ganzkörperkoordination, die Übertragung von Fähigkeiten aus der Simulation in die reale Welt und die Planung langer Aktionssequenzen. Der zunehmende Schwerpunkt liegt auf dem Aufbau von KI-Architekturen, die diese Einschränkungen überwinden können, statt sich ausschließlich auf verbesserte Hardware zu verlassen.

Advertisement

Was das für die KI-Branche bedeutet

Die Juni-Welle deutet darauf hin, dass verkörperte KI möglicherweise in eine Phase der Grundlagenmodelle eintritt – ähnlich dem Wandel, der die generative KI.

neu geprägt hat. Wenn sich diese Softwareverbesserungen weiterhin in einer besseren Leistung in der realen Welt niederschlagen, könnten Roboter in Fertigung, Logistik, Gesundheitswesen, Lagerhaltung und Dienstleistungsbranchen anpassungsfähiger werden, ohne dass umfangreiche Neuentwicklungen der Hardware erforderlich wären. Entwickler könnten außerdem leichter neue Anwendungen erstellen, indem sie gemeinsame Roboter-Grundlagenmodelle feinjustieren, statt aufgabenspezifische Systeme von Grund auf neu zu entwickeln.

Gleichzeitig bleibt der Einsatz in der realen Welt schwierig. Roboter müssen weiterhin sicher in unvorhersehbaren Umgebungen agieren, mit Menschen interagieren und Situationen bewältigen, die von ihren Trainingsdaten abweichen. Leistungsfähigere KI-Modelle allein beseitigen diese technischen und sicherheitsbezogenen Herausforderungen nicht.

Lesen Sie auch: Chinas Durchbruch bei optischen Chips könnte KI-Inferenz beschleunigen, indem Daten per Licht zwischen Chips übertragen werden, statt sich ausschließlich auf größere GPU-Cluster zu stützen.

Aminu Abdullahi

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.