De la perception à l'action — modèles vision-langage et vision-langage-action, sur de vrais robots, avec une frontière de sûreté déterministe.
Hyperion ne se positionne pas comme une équipe d'ingénierie généraliste. La maîtrise technique sert à mieux décider sur le produit, à remettre en question les hypothèses, à définir les preuves et à coordonner les spécialistes indispensables à la mission.
Perception
Politique (VLA)
Contrôle
Moniteur de sûreté
Des capteurs au mouvement, derrière un moniteur de sûreté indépendant.
Un pipeline en quatre étapes : perception, puis la politique (un modèle vision-langage-action), puis le contrôle, puis un moniteur de sûreté indépendant.
Un robot qui fonctionne en démo n'est pas un robot que l'on peut déployer. Les choix décisifs — VLM ou VLA, ce qu'une simulation est autorisée à prouver, où se situe la frontière de sûreté déterministe — sont des décisions produit avant d'être des décisions d'ingénierie. Hyperion les assume, nomme les preuves qui closent chacune d'elles et coordonne les spécialistes qui en réalisent le résultat.
Le pipeline capteur-à-action (perception → politique → contrôle), la distinction VLM/VLA (un VLM perçoit et raisonne ; un VLA produit des actions), une boucle d'entraînement et d'évaluation avec simulation et sim-to-real, et une frontière de sûreté déterministe — la politique propose, un moniteur indépendant contraint.
ROS 2 ; politiques vision-langage-action (famille π, SmolVLA, NVIDIA Isaac GR00T) et VLM ; LeRobot pour les données, l'entraînement et l'évaluation ; téléopération pour les démonstrations ; simulation (Isaac Sim/Lab) et sim-to-real ; fine-tuning (LoRA/QLoRA) et évaluation en boucle fermée ; moniteur de sûreté en temps réel, enveloppe de fonctionnement et arrêt d'urgence.
De la perception à l'action, avec une frontière qui défaille en sécurité
Les modèles appris proposent ; une frontière déterministe dispose. Chaque commande moteur passe par un moniteur de sûreté indépendant avant d'atteindre le matériel.
Entrée
Déterministe
Appris
Sûreté
Sortie
Flux des capteurs à travers la perception, le VLM et le VLA, le planificateur et le contrôleur, jusqu'à un moniteur de sûreté indépendant qui contrôle l'accès aux actionneurs, avec un retour vers les capteurs.
ApprisVLMAncre l'objectif — « qu'est-ce que je regarde ? »
ApprisVLAGénère des blocs d'actions sur le matériel
DéterministePlanificateur et contrôleTrajectoire et contrôle à ~1 kHz
SûretéMoniteur de sûretéEnveloppe indépendante hors-bande et e-stop
SortieActionneursMouvement dans le monde physique
Frontière de sûreté déterministe
Seul un ACCEPT du moniteur de sûreté laisse une commande atteindre les actionneurs ; un REJECT force un état sûr.
⤿Boucle fermée : l'état des actionneurs et de l'environnement est renvoyé aux capteurs.
Budgets indicatifs de la boucle de contrôle : réflexe/sûreté ~1 kHz · perception ~10–40 ms · politique ~20–100 ms · VLM ~1 Hz.
Le VLM raisonne. Le VLA agit.
Deux classes de modèles aux rôles distincts. Seule la sortie du VLA atteint les moteurs — donc seule la sortie du VLA doit franchir la frontière de sûreté déterministe.
Le VLM ancre l'objectif que le VLA exécute. Les exemples de modèles illustrent des classes ouvertes (p. ex. VLM de classe Pixtral ; VLA de classe π0 / SmolVLA).
Dimension
VLM — modèle vision-langage
VLA — vision-langage-action
Sortie
Texte / langage structuré
Actions du robot / blocs d'actions
Question à laquelle il répond
« qu'est-ce que je regarde ? »
« que doivent faire les articulations maintenant ? »
Rôle
Perception de haut niveau, raisonnement, ancrage
Ferme la boucle sur le matériel
Fréquence typique
~1 Hz / à la demande
~10–50 Hz
Entraîné sur
Paires image-texte
Démonstrations de téléopération (+ Open X-Embodiment)
Mode de défaillance
Plan halluciné
Mouvement dangereux — impose un moniteur de sûreté
Ce que nous avons mesuré
Mesuré
68.71 GB
Fine-tune complet π0.5 — mémoire de pointe
Mesuré
1.08 → 0.13 (300 steps)
Fine-tune réel (LIBERO, conditionné par le langage) — perte
Simulation
0% → 96%
Succès en simulation (LIBERO-Spatial) — base → affiné