RT-X (Robotics Transformer X) ist eine im Oktober 2023 von Google DeepMind und über 20 Partnerinstitutionen vorgestellte Familie von Steuerungsmodellen. Sie wurde auf dem gemeinsamen Datensatz Open X-Embodiment trainiert und zeigte, dass ein einzelnes Modell aus den Bewegungsdaten sehr unterschiedlicher Robotertypen lernen kann.
Zusammenfassung
Robotik-Forschungsgruppen trainierten lange jeweils eigene Modelle für ihren eigenen Robotertyp. Bewegungsdaten verschiedener Bauformen ließen sich kaum in einem gemeinsamen Format zusammenführen.
RT-X war der erste breit angelegte Nachweis, dass sich dieser Engpass umgehen lässt. Das Modell wurde auf einem vereinheitlichten Datensatz aus 22 Robotertypen, 527 demonstrierten Fähigkeiten und rund einer Million Episoden trainiert – beigesteuert von 21 Institutionen.
Dabei zeigten sich positive Transfereffekte zwischen den Plattformen, statt gegenseitiger Störung.
Die Modellfamilie umfasst zwei Varianten unterschiedlicher Größe und Architektur: RT-1-X, ein kompaktes, eigens für Robotersteuerung entworfenes Modell, und RT-2-X, das auf einem vortrainierten Vision-Language-Modell aufbaut.
Beide Varianten zeigten gegenüber Modellen, die nur auf den Daten eines einzelnen Robotertyps trainiert wurden, einen klaren Leistungsgewinn. Das Ergebnis stützte erstmals empirisch die Idee, dass mehr und vielfältigere Trainingsdaten auch in der Robotik zu besserer Verallgemeinerung führen.
Abgrenzung
Open X-Embodiment bezeichnet den Datensatz: die vereinheitlichte Sammlung von Bewegungs- und Sensordaten aus über 20 Robotik-Laboren. RT-X bezeichnet die darauf trainierten Modelle.
Beide Namen entstammen derselben Veröffentlichung und werden in der Praxis oft synonym verwendet. Der Unterschied ist derselbe wie zwischen Trainingsmaterial und dem daraus entstandenen System: Ohne den Datensatz gäbe es kein RT-X-Modell, aber der Datensatz selbst steuert keinen Roboter.
Begriffsgeschichte
Der Name RT-X knüpft an RT-2 an, das Google DeepMind wenige Monate zuvor vorgestellt hatte. RT-2 nutzte erstmals ein vortrainiertes Bild-Sprach-Modell zur Steuerung eines Roboterarms, wurde aber nur auf den Daten eines einzelnen Roboters trainiert.
Die im Oktober 2023 veröffentlichte Arbeit Open X-Embodiment: Robotic Learning Datasets and RT-X Models stellte die Frage, ob sich dasselbe Prinzip auch über verschiedene Roboterbauformen hinweg anwenden lässt. Sie entstand als Gemeinschaftsprojekt von Google DeepMind mit Universitäten wie UC Berkeley, Stanford und der Universität Freiburg sowie insgesamt mehr als 20 weiteren Instituten.
Das X im Namen steht für die variable Robotereinheit – den „Embodiment”-Platzhalter, den das Modell überbrücken sollte.
Die Antwort fiel positiv aus. RT-X wurde damit zu einem viel zitierten Beleg dafür, dass sich der aus der Sprachmodell-Forschung bekannte Skalierungsgedanke auf die Robotik übertragen lässt.
In den folgenden Jahren entstanden auf ähnlicher Grundlage offene Nachbauten wie OpenVLA sowie Nachfolgeprojekte bei Google DeepMind selbst. Gemini Robotics etwa führt die im RT-X-Projekt erprobte Cross-Embodiment-Idee mit den deutlich größeren Gemini-Modellen fort.
Methodische Grundlagen
RT-1-X basiert auf der Architektur von RT-1: einem vergleichsweise kompakten Modell mit rund 35 Millionen Parametern (Open X-Embodiment Collaboration 2023), das ein per FiLM konditioniertes EfficientNet zur Bildverarbeitung mit einem Transformer zur Handlungserzeugung verbindet. Es wurde eigens für Robotersteuerung entworfen, ohne auf ein vortrainiertes Sprach- oder Bild-Sprach-Modell zurückzugreifen.
RT-2-X baut dagegen auf einem Vision-Language-Action-Modell mit etwa 55 Milliarden Parametern (Open X-Embodiment Collaboration 2023) auf, das wie RT-2 Bewegungsbefehle als zusätzliche Tokens in den Wortschatz eines vortrainierten Bild-Sprach-Modells einfügt. Beide Varianten erhalten dieselbe Eingabe – ein Kamerabild und eine Textanweisung – und geben diskretisierte Bewegungsbefehle für den Endeffektor aus.
Der Größenunterschied hat praktische Folgen. Auf dem umfangreichen, heterogenen Trainingsdatensatz unterfittet das kleinere RT-1-X eher und bleibt hinter spezialisierten Einzelmodellen zurück, während RT-2-X seine zusätzliche Kapazität nutzt, um deutlich stärker zu generalisieren.
Bei neuen, im Training ungesehenen Fähigkeiten erzielte RT-2-X in den berichteten Experimenten eine etwa dreifach höhere Erfolgsquote als sein Vorgänger RT-2. RT-1-X wiederum verbesserte sich gegenüber Modellen, die nur mit den eigenen, begrenzten Daten einer Plattform trainiert wurden, in datenarmen Szenarien um etwa 50 Prozent (Open X-Embodiment Collaboration 2023).
Anwendungsfelder
RT-X-Modelle dienen vor allem als Referenzpunkt für die Frage, wie viel Trainingsdaten aus fremden Robotertypen einer bestimmten Zielplattform tatsächlich nützen. Praktisch angewendet wird das Prinzip in Forschungslaboren, die selbst nur begrenzt Daten für ihren eigenen Roboter sammeln können.
Diese Labore setzen stattdessen auf gemeinsam trainierte, plattformübergreifende Modelle als Ausgangspunkt – ein Vorgehen, das inzwischen zum Standardansatz vieler Physical-AI-Projekte geworden ist. Als methodischer Baustein prägte RT-X zudem die Entwicklung heutiger Vision-Language-Action-Modelle, die Cross-Embodiment-Training weitgehend selbstverständlich voraussetzen.
Kontroversen und Kritik
Die berichteten Transfereffekte beruhen überwiegend auf Laborbedingungen mit begrenzter Aufgabenvielfalt. Ob sich die positiven Ergebnisse auf reale, unstrukturierte Einsatzumgebungen übertragen, bleibt eng mit der ungelösten Frage des Sim-to-Real Transfer verknüpft.
Zudem variiert die Datenqualität zwischen den mehr als 20 beitragenden Instituten erheblich. Unterschiedliche Sensorik, Aufnahmebedingungen und Aufgabenverteilungen erschweren eine saubere Zuordnung, ob eine Leistungsverbesserung tatsächlich vom Cross-Embodiment-Training stammt oder von schlicht mehr Daten.
Kritisiert wird außerdem, dass „positiver Transfer” im Paper primär an aggregierten Erfolgsquoten über viele Aufgaben hinweg gezeigt wird. Für einzelne Roboter-Aufgaben-Kombinationen traten durchaus negative Transfereffekte auf.
Wie bei RT-2 blieben zudem weder die vollständigen RT-2-X-Modellgewichte noch alle internen Trainingsdetails öffentlich zugänglich. Das erschwert eine unabhängige Nachprüfung der berichteten Zahlen – ein Problem, das offene Nachbauprojekte wie OpenVLA später zu adressieren versuchten.
Verwandte Begriffe
- Embodied AI – programmatischer Rahmen, in dem RT-X steht
- Google DeepMind – das federführende Forschungslabor
- Transfer Learning – das allgemeinere Prinzip, das RT-X erstmals über Robotertypen hinweg belegte
Quellenangaben
- Open X-Embodiment Collaboration u. a., 2023. Open X-Embodiment: Robotic Learning Datasets and RT-X Models. arXiv: 2310.08864.
- Google DeepMind, 2023. Scaling up learning across many different robot types. deepmind.google/blog.