Ga naar inhoud

Capaciteit · toegepast binnen een opdracht

Robotica, VLM's & VLA's

Van perceptie naar actie — vision-language- en vision-language-action-modellen, op echte robots, met een deterministische veiligheidsgrens.

Hyperion positioneert zich niet als een algemene engineeringafdeling. Technische kennis wordt gebruikt om betere productbeslissingen te nemen, aannames te toetsen, bewijs te definiëren en de specialisten te coördineren die de opdracht vereist.

Pixel-art-scène van een robotarm die een taalinstructie omzet in een concrete pick-and-place-actie.
  1. Perceptie

  2. Policy (VLA)

  3. Besturing

  4. Veiligheidsmonitor

Van sensoren naar beweging, achter een onafhankelijke veiligheidsmonitor.

Een pijplijn van vier fasen: perceptie, dan de policy (een vision-language-action-model), dan besturing, dan een onafhankelijke veiligheidsmonitor.

Een robot die in een demo werkt, is er geen die u kunt uitrollen. De ingrijpende keuzes — VLM of VLA, wat een simulatie mag bewijzen, waar de deterministische veiligheidsgrens ligt — zijn productbeslissingen voordat ze technische beslissingen zijn. Hyperion neemt ze, benoemt het bewijs dat elk ervan sluit, en coördineert de specialisten die het resultaat bouwen.

De sensor-naar-actie-pijplijn (perceptie → policy → besturing), het VLM-vs-VLA-onderscheid (een VLM neemt waar en redeneert; een VLA produceert acties), een trainings- en evaluatielus met simulatie en sim-to-real, en een deterministische veiligheidsgrens — de policy stelt voor, een onafhankelijke monitor begrenst.

ROS 2; vision-language-action-policies (π-familie, SmolVLA, NVIDIA Isaac GR00T) en VLM's; LeRobot voor data, training en evaluatie; teleoperatie voor demonstraties; simulatie (Isaac Sim/Lab) en sim-to-real; fine-tuning (LoRA/QLoRA) en closed-loop-evaluatie; runtime-veiligheidsmonitor, bedrijfsenvelop en noodstop.

Van perceptie naar actie, met een grens die veilig faalt

Geleerde modellen stellen voor; een deterministische grens beslist. Elke motoropdracht passeert een onafhankelijke veiligheidsmonitor voordat hij de hardware bereikt.

  • Invoer
  • Deterministisch
  • Geleerd
  • Veiligheid
  • Uitvoer
Van perceptie naar actie, met een grens die veilig faaltEen pixeltopologie: sensoren voeden de perceptie; geleerde VLM- en VLA-modellen stellen een actie voor; een deterministische besturing en een onafhankelijke veiligheidsmonitor, binnen een veiligheids- en cyberbeveiligingsmembraan, accepteren of blokkeren elk commando voordat het de robot bereikt; resultaten worden teruggekoppeld naar de perceptie.

Stroom van de sensoren door perceptie, VLM en VLA, planner en regelaar, naar een onafhankelijke veiligheidsmonitor die de actuatoren bewaakt, met terugkoppeling naar de sensoren.

  1. InvoerSensorenCamera's, diepte, kracht-koppel, proprioceptie
  2. DeterministischPerceptieFusie, SLAM, 6-DoF-pose
  3. GeleerdVLMVerankert het doel — “Waar kijk ik naar?”
  4. GeleerdVLAGenereert actie-chunks op de hardware
  5. DeterministischPlanner & besturingTrajectorie en besturing op ~1 kHz
  6. VeiligheidVeiligheidsmonitorOnafhankelijke out-of-band-envelop en e-stop
  7. UitvoerActuatorenBeweging in de fysieke wereld

Deterministische veiligheidsgrens

Alleen een ACCEPT van de veiligheidsmonitor laat een opdracht de actuatoren bereiken; een REJECT dwingt een veilige toestand af.

Gesloten lus: de toestand van actuatoren en omgeving wordt teruggekoppeld naar de sensoren.

Illustratieve regellus-budgetten: reflex/veiligheid ~1 kHz · perceptie ~10–40 ms · policy ~20–100 ms · VLM ~1 Hz.

Het VLM redeneert. Het VLA handelt.

Twee modelklassen met verschillende taken. Alleen de uitvoer van het VLA bereikt de motoren — dus alleen de uitvoer van het VLA moet de deterministische veiligheidsgrens passeren.

Het VLM verankert het doel dat het VLA uitvoert. Modelvoorbeelden illustreren open klassen (bijv. VLM's van de Pixtral-klasse; VLA's van de π0- / SmolVLA-klasse).
DimensieVLM — vision-language-modelVLA — vision-language-action
UitvoerTekst / gestructureerde taalRobotacties / actie-chunks
Vraag die het beantwoordt“Waar kijk ik naar?”“Wat moeten de gewrichten nu doen?”
RolPerceptie op hoog niveau, redeneren, verankeringSluit de lus op de hardware
Typische frequentie~1 Hz / op aanvraag~10–50 Hz
Getraind opBeeld-tekstparenTeleoperatie-demo's (+ Open X-Embodiment)
FaalmodusGehallucineerd planOnveilige beweging — vereist een veiligheidsmonitor

Wat we hebben gemeten

  • Gemeten

    68.71 GB

    π0.5 volledige fine-tune — piekgeheugen
  • Gemeten

    1.08 → 0.13 (300 steps)

    Echte fine-tune (LIBERO, taalgeconditioneerd) — verlies
  • Simulatie

    0% → 96%

    Simulatiesucces (LIBERO-Spatial) — basis → fijngetuned
  • Op robot, droogloop

    12 / 12

    Cognitieve benchmark op robot (12 scènes) — waarnemen · begrijpen · interpreteren
  • Gemeten

    2.3× – 14.3×

    bf16-doorvoer vs. FP32 (ACT)

Nog niet gemeten

  • Taaksuccespercentage op robot — de armlus is droogloop (nog geen fysieke beweging).
  • NPU-(XDNA2-)uitvoering — de INT8-toolchain valideert, maar geen DPU-subgraaf gecompileerd; alleen iGPU/CPU-fallback.
  • Convergentie (de fine-tune stopt bij 300 stappen), energie en multitask-generalisatie.

Belichaamde-AI-werk bespreken