Aller au contenu

Capacité · appliquée au sein d'une mission

Robotique, VLM et VLA

De la perception à l'action — modèles vision-langage et vision-langage-action, sur de vrais robots, avec une frontière de sûreté déterministe.

Hyperion ne se positionne pas comme une équipe d'ingénierie généraliste. La maîtrise technique sert à mieux décider sur le produit, à remettre en question les hypothèses, à définir les preuves et à coordonner les spécialistes indispensables à la mission.

Scène en pixel art d'un bras robotique transformant une instruction en langage naturel en une action de préhension et de dépose concrète.
  1. Perception

  2. Politique (VLA)

  3. Contrôle

  4. Moniteur de sûreté

Des capteurs au mouvement, derrière un moniteur de sûreté indépendant.

Un pipeline en quatre étapes : perception, puis la politique (un modèle vision-langage-action), puis le contrôle, puis un moniteur de sûreté indépendant.

Un robot qui fonctionne en démo n'est pas un robot que l'on peut déployer. Les choix décisifs — VLM ou VLA, ce qu'une simulation est autorisée à prouver, où se situe la frontière de sûreté déterministe — sont des décisions produit avant d'être des décisions d'ingénierie. Hyperion les assume, nomme les preuves qui closent chacune d'elles et coordonne les spécialistes qui en réalisent le résultat.

Le pipeline capteur-à-action (perception → politique → contrôle), la distinction VLM/VLA (un VLM perçoit et raisonne ; un VLA produit des actions), une boucle d'entraînement et d'évaluation avec simulation et sim-to-real, et une frontière de sûreté déterministe — la politique propose, un moniteur indépendant contraint.

ROS 2 ; politiques vision-langage-action (famille π, SmolVLA, NVIDIA Isaac GR00T) et VLM ; LeRobot pour les données, l'entraînement et l'évaluation ; téléopération pour les démonstrations ; simulation (Isaac Sim/Lab) et sim-to-real ; fine-tuning (LoRA/QLoRA) et évaluation en boucle fermée ; moniteur de sûreté en temps réel, enveloppe de fonctionnement et arrêt d'urgence.

De la perception à l'action, avec une frontière qui défaille en sécurité

Les modèles appris proposent ; une frontière déterministe dispose. Chaque commande moteur passe par un moniteur de sûreté indépendant avant d'atteindre le matériel.

  • Entrée
  • Déterministe
  • Appris
  • Sûreté
  • Sortie
De la perception à l'action, avec une frontière qui défaille en sécuritéUne topologie en pixels : les capteurs alimentent la perception ; les modèles appris VLM et VLA proposent une action ; un contrôleur déterministe et un moniteur de sûreté indépendant, à l'intérieur d'une membrane de sûreté et de cybersécurité, acceptent ou bloquent chaque commande avant qu'elle n'atteigne le robot ; les résultats sont renvoyés à la perception.

Flux des capteurs à travers la perception, le VLM et le VLA, le planificateur et le contrôleur, jusqu'à un moniteur de sûreté indépendant qui contrôle l'accès aux actionneurs, avec un retour vers les capteurs.

  1. EntréeCapteursCaméras, profondeur, effort-couple, proprioception
  2. DéterministePerceptionFusion, SLAM, pose 6-DoF
  3. ApprisVLMAncre l'objectif — « qu'est-ce que je regarde ? »
  4. ApprisVLAGénère des blocs d'actions sur le matériel
  5. DéterministePlanificateur et contrôleTrajectoire et contrôle à ~1 kHz
  6. SûretéMoniteur de sûretéEnveloppe indépendante hors-bande et e-stop
  7. SortieActionneursMouvement dans le monde physique

Frontière de sûreté déterministe

Seul un ACCEPT du moniteur de sûreté laisse une commande atteindre les actionneurs ; un REJECT force un état sûr.

Boucle fermée : l'état des actionneurs et de l'environnement est renvoyé aux capteurs.

Budgets indicatifs de la boucle de contrôle : réflexe/sûreté ~1 kHz · perception ~10–40 ms · politique ~20–100 ms · VLM ~1 Hz.

Le VLM raisonne. Le VLA agit.

Deux classes de modèles aux rôles distincts. Seule la sortie du VLA atteint les moteurs — donc seule la sortie du VLA doit franchir la frontière de sûreté déterministe.

Le VLM ancre l'objectif que le VLA exécute. Les exemples de modèles illustrent des classes ouvertes (p. ex. VLM de classe Pixtral ; VLA de classe π0 / SmolVLA).
DimensionVLM — modèle vision-langageVLA — vision-langage-action
SortieTexte / langage structuréActions du robot / blocs d'actions
Question à laquelle il répond« qu'est-ce que je regarde ? »« que doivent faire les articulations maintenant ? »
RôlePerception de haut niveau, raisonnement, ancrageFerme la boucle sur le matériel
Fréquence typique~1 Hz / à la demande~10–50 Hz
Entraîné surPaires image-texteDémonstrations de téléopération (+ Open X-Embodiment)
Mode de défaillancePlan hallucinéMouvement dangereux — impose un moniteur de sûreté

Ce que nous avons mesuré

  • Mesuré

    68.71 GB

    Fine-tune complet π0.5 — mémoire de pointe
  • Mesuré

    1.08 → 0.13 (300 steps)

    Fine-tune réel (LIBERO, conditionné par le langage) — perte
  • Simulation

    0% → 96%

    Succès en simulation (LIBERO-Spatial) — base → affiné
  • Sur robot, à blanc

    12 / 12

    Benchmark cognitif sur robot (12 scènes) — percevoir · comprendre · interpréter
  • Mesuré

    2.3× – 14.3×

    Débit bf16 vs FP32 (ACT)

Pas encore mesuré

  • Taux de succès des tâches sur robot — la boucle du bras est à blanc (pas encore de mouvement physique).
  • Exécution NPU (XDNA2) — la chaîne INT8 se valide, mais aucun sous-graphe DPU compilé ; repli iGPU/CPU uniquement.
  • Convergence (le fine-tune s'arrête à 300 étapes), énergie et généralisation multitâche.

Discuter de travaux en IA incarnée