Μετάβαση στο περιεχόμενο

Ικανότητα · εφαρμοσμένη εντός ανάθεσης

Ρομποτική, VLM & VLA

Από την αντίληψη στη δράση — μοντέλα όρασης-γλώσσας και όρασης-γλώσσας-δράσης, σε πραγματικά ρομπότ, με ντετερμινιστικό όριο ασφάλειας.

Η Hyperion δεν τοποθετείται ως γενική ομάδα μηχανικής. Η τεχνική επάρκεια χρησιμοποιείται για καλύτερες αποφάσεις προϊόντος, αμφισβήτηση παραδοχών, ορισμό τεκμηρίων και συντονισμό των ειδικών που απαιτεί η ανάθεση.

Σκηνή pixel-art ενός ρομποτικού βραχίονα που μετατρέπει μια γλωσσική εντολή σε μια συγκεκριμένη ενέργεια λήψης και τοποθέτησης.
  1. Αντίληψη

  2. Πολιτική (VLA)

  3. Έλεγχος

  4. Επόπτης ασφάλειας

Από τους αισθητήρες στην κίνηση, πίσω από ανεξάρτητο επόπτη ασφάλειας.

Ένα pipeline τεσσάρων σταδίων: αντίληψη, μετά η πολιτική (ένα μοντέλο όρασης-γλώσσας-δράσης), μετά έλεγχος, μετά ανεξάρτητος επόπτης ασφάλειας.

Ένα ρομπότ που δουλεύει σε επίδειξη δεν είναι ρομπότ που μπορείτε να αναπτύξετε. Οι ουσιώδεις επιλογές — VLM ή VLA, τι επιτρέπεται να αποδείξει μια προσομοίωση, πού βρίσκεται το ντετερμινιστικό όριο ασφάλειας — είναι αποφάσεις προϊόντος πριν γίνουν αποφάσεις μηχανικής. Η Hyperion τις αναλαμβάνει, ονομάζει τα τεκμήρια που κλείνουν την καθεμία και συντονίζει τους ειδικούς που υλοποιούν το αποτέλεσμα.

Το pipeline αισθητήρα-σε-δράση (αντίληψη → πολιτική → έλεγχος), η διάκριση VLM/VLA (ένα VLM αντιλαμβάνεται και συλλογίζεται· ένα VLA παράγει δράσεις), ένας βρόχος εκπαίδευσης και αξιολόγησης με προσομοίωση και sim-to-real, και ένα ντετερμινιστικό όριο ασφάλειας — η πολιτική προτείνει, ένας ανεξάρτητος επόπτης περιορίζει.

ROS 2· πολιτικές όρασης-γλώσσας-δράσης (οικογένεια π, SmolVLA, NVIDIA Isaac GR00T) και VLM· LeRobot για δεδομένα, εκπαίδευση και αξιολόγηση· τηλεχειρισμός για επιδείξεις· προσομοίωση (Isaac Sim/Lab) και sim-to-real· fine-tuning (LoRA/QLoRA) και αξιολόγηση κλειστού βρόχου· επόπτης ασφάλειας πραγματικού χρόνου, φάκελος λειτουργίας και διακοπή έκτακτης ανάγκης.

Από την αντίληψη στη δράση, με όριο που αστοχεί με ασφάλεια

Τα εκπαιδευμένα μοντέλα προτείνουν· ένα ντετερμινιστικό όριο αποφασίζει. Κάθε εντολή κινητήρα περνά από ανεξάρτητο επόπτη ασφάλειας πριν φτάσει στο υλικό.

  • Είσοδος
  • Ντετερμινιστικό
  • Εκπαιδευμένο
  • Ασφάλεια
  • Έξοδος
Από την αντίληψη στη δράση, με όριο που αστοχεί με ασφάλειαΜια τοπολογία από pixel: οι αισθητήρες τροφοδοτούν την αντίληψη· τα εκπαιδευμένα μοντέλα VLM και VLA προτείνουν μια ενέργεια· ένας ντετερμινιστικός ελεγκτής και ένας ανεξάρτητος επόπτης ασφάλειας, μέσα σε μια μεμβράνη ασφάλειας και κυβερνοασφάλειας, αποδέχονται ή μπλοκάρουν κάθε εντολή πριν φτάσει στο ρομπότ· τα αποτελέσματα επιστρέφουν στην αντίληψη.

Ροή από τους αισθητήρες μέσω της αντίληψης, του VLM και του VLA, του σχεδιαστή και του ελεγκτή, προς έναν ανεξάρτητο επόπτη ασφάλειας που ελέγχει την πρόσβαση στους επενεργητές, με ανατροφοδότηση προς τους αισθητήρες.

  1. ΕίσοδοςΑισθητήρεςΚάμερες, βάθος, δύναμη-ροπή, ιδιοδεκτικότητα
  2. ΝτετερμινιστικόΑντίληψηΣύντηξη, SLAM, στάση 6-DoF
  3. ΕκπαιδευμένοVLMΑγκυρώνει τον στόχο — «Τι κοιτάζω;»
  4. ΕκπαιδευμένοVLAΠαράγει τμήματα δράσεων στο υλικό
  5. ΝτετερμινιστικόΣχεδιαστής & έλεγχοςΤροχιά και έλεγχος στα ~1 kHz
  6. ΑσφάλειαΕπόπτης ασφάλειαςΑνεξάρτητος φάκελος εκτός ζώνης και e-stop
  7. ΈξοδοςΕπενεργητέςΚίνηση στον φυσικό κόσμο

Ντετερμινιστικό όριο ασφάλειας

Μόνο το ACCEPT του επόπτη ασφάλειας αφήνει μια εντολή να φτάσει στους επενεργητές· το REJECT επιβάλλει ασφαλή κατάσταση.

Κλειστός βρόχος: η κατάσταση των επενεργητών και του περιβάλλοντος ανατροφοδοτείται στους αισθητήρες.

Ενδεικτικά χρονικά περιθώρια βρόχου ελέγχου: αντανακλαστικό/ασφάλεια ~1 kHz · αντίληψη ~10–40 ms · πολιτική ~20–100 ms · VLM ~1 Hz.

Το VLM συλλογίζεται. Το VLA δρα.

Δύο κλάσεις μοντέλων με διαφορετικές δουλειές. Μόνο η έξοδος του VLA φτάνει στους κινητήρες — άρα μόνο η έξοδος του VLA πρέπει να περάσει το ντετερμινιστικό όριο ασφάλειας.

Το VLM αγκυρώνει τον στόχο που εκτελεί το VLA. Τα παραδείγματα μοντέλων είναι ενδεικτικά ανοιχτών κλάσεων (π.χ. VLM κλάσης Pixtral· VLA κλάσης π0 / SmolVLA).
ΔιάστασηVLM — μοντέλο όρασης-γλώσσαςVLA — όρασης-γλώσσας-δράσης
ΈξοδοςΚείμενο / δομημένη γλώσσαΔράσεις ρομπότ / τμήματα δράσεων
Ερώτηση που απαντά«Τι κοιτάζω;»«Τι πρέπει να κάνουν τώρα οι αρθρώσεις;»
ΡόλοςΑντίληψη υψηλού επιπέδου, συλλογισμός, αγκύρωσηΚλείνει τον βρόχο στο υλικό
Τυπικός ρυθμός~1 Hz / κατ' απαίτηση~10–50 Hz
Εκπαιδεύεται σεΖεύγη εικόνας-κειμένουΕπιδείξεις τηλεχειρισμού (+ Open X-Embodiment)
Τρόπος αστοχίαςΠαραισθησιακό σχέδιοΕπικίνδυνη κίνηση — επιβάλλει επόπτη ασφάλειας

Τι μετρήσαμε

  • Μετρημένο

    68.71 GB

    Πλήρες fine-tune π0.5 — μέγιστη μνήμη
  • Μετρημένο

    1.08 → 0.13 (300 steps)

    Πραγματικό fine-tune (LIBERO, γλωσσικά εξαρτημένο) — απώλεια
  • Προσομοίωση

    0% → 96%

    Επιτυχία προσομοίωσης (LIBERO-Spatial) — βάση → προσαρμοσμένο
  • Σε ρομπότ, ξηρή εκτέλεση

    12 / 12

    Γνωστικό benchmark σε ρομπότ (12 σκηνές) — αντίληψη · κατανόηση · ερμηνεία
  • Μετρημένο

    2.3× – 14.3×

    Απόδοση bf16 vs FP32 (ACT)

Δεν έχει μετρηθεί ακόμη

  • Ποσοστό επιτυχίας εργασιών σε ρομπότ — ο βρόχος του βραχίονα είναι ξηρή εκτέλεση (καμία φυσική κίνηση ακόμη).
  • Εκτέλεση NPU (XDNA2) — η αλυσίδα INT8 επικυρώνεται, αλλά δεν μεταγλωττίστηκε υπογράφος DPU· μόνο iGPU/CPU.
  • Σύγκλιση (το fine-tune σταματά στα 300 βήματα), ενέργεια και γενίκευση πολλαπλών εργασιών.

Συζητήστε εργασία ενσώματης ΤΝ