Von Wahrnehmung zu Aktion — Vision-Language- und Vision-Language-Action-Modelle, auf echten Robotern, mit deterministischer Sicherheitsgrenze.
Hyperion positioniert sich nicht als allgemeines Engineering-Team. Technische Kompetenz dient dazu, bessere Produktentscheidungen zu treffen, Annahmen zu hinterfragen, Evidenz zu definieren und die für das Mandat erforderlichen Spezialisten zu koordinieren.
Wahrnehmung
Policy (VLA)
Steuerung
Sicherheitsmonitor
Von Sensoren zur Bewegung, hinter einem unabhängigen Sicherheitsmonitor.
Eine vierstufige Pipeline: Wahrnehmung, dann die Policy (ein Vision-Language-Action-Modell), dann Steuerung, dann ein unabhängiger Sicherheitsmonitor.
Ein Roboter, der in der Demo läuft, ist keiner, den man ausrollen kann. Die folgenreichen Weichenstellungen — VLM oder VLA, was eine Simulation belegen darf, wo die deterministische Sicherheitsgrenze verläuft — sind Produktentscheidungen, bevor sie technische sind. Hyperion verantwortet sie, benennt die Evidenz, die jede von ihnen schließt, und koordiniert die Spezialisten, die das Ergebnis umsetzen.
Die Sensor-zu-Aktion-Pipeline (Wahrnehmung → Policy → Steuerung), die VLM-vs-VLA-Unterscheidung (ein VLM nimmt wahr und schließt; ein VLA gibt Aktionen aus), eine Trainings- und Evaluationsschleife mit Simulation und Sim-to-Real und eine deterministische Sicherheitsgrenze — die Policy schlägt vor, ein unabhängiger Monitor begrenzt.
ROS 2; Vision-Language-Action-Policies (π-Familie, SmolVLA, NVIDIA Isaac GR00T) und VLMs; LeRobot für Daten, Training und Evaluation; Teleoperation für Demonstrationen; Simulation (Isaac Sim/Lab) und Sim-to-Real; Fine-Tuning (LoRA/QLoRA) und Closed-Loop-Evaluation; Laufzeit-Sicherheitsmonitor, Betriebshülle und Not-Halt.
Von Wahrnehmung zu Aktion, mit einer Grenze, die sicher ausfällt
Gelernte Modelle schlagen vor; eine deterministische Grenze entscheidet. Jeder Motorbefehl passiert einen unabhängigen Sicherheitsmonitor, bevor er die Hardware erreicht.
Eingabe
Deterministisch
Gelernt
Sicherheit
Ausgabe
Fluss von den Sensoren über Wahrnehmung, VLM und VLA, Planer und Regler, zu einem unabhängigen Sicherheitsmonitor, der die Aktoren freigibt, mit Rückführung zu den Sensoren.
GelerntVLMVerankert das Ziel — „Was sehe ich gerade?“
GelerntVLAErzeugt Aktions-Chunks auf der Hardware
DeterministischPlaner & SteuerungTrajektorie und Steuerung mit ~1 kHz
SicherheitSicherheitsmonitorUnabhängige Out-of-Band-Hülle und e-stop
AusgabeAktorenBewegung in der physischen Welt
Deterministische Sicherheitsgrenze
Nur ein ACCEPT des Sicherheitsmonitors lässt einen Befehl die Aktoren erreichen; ein REJECT erzwingt einen sicheren Zustand.
⤿Geschlossene Schleife: Aktor- und Umgebungszustand werden an die Sensoren zurückgeführt.
Illustrative Regelschleifen-Budgets: Reflex/Sicherheit ~1 kHz · Wahrnehmung ~10–40 ms · Policy ~20–100 ms · VLM ~1 Hz.
Das VLM denkt. Das VLA handelt.
Zwei Modellklassen mit unterschiedlichen Aufgaben. Nur die Ausgabe des VLA erreicht die Motoren — also muss nur die Ausgabe des VLA die deterministische Sicherheitsgrenze passieren.
Das VLM verankert das Ziel, das das VLA ausführt. Modellbeispiele veranschaulichen offene Klassen (z. B. VLMs der Pixtral-Klasse; VLAs der π0- / SmolVLA-Klasse).