انتقل إلى المحتوى

قدرة · تُطبَّق داخل تكليف

الروبوتات وVLM وVLA

من الإدراك إلى الفعل — نماذج الرؤية-اللغة والرؤية-اللغة-الفعل، على روبوتات حقيقية، بحد سلامة حتمي.

لا تقدّم Hyperion نفسها كفريق هندسي عام. تُستخدم الكفاءة التقنية لاتخاذ قرارات منتج أفضل، ومساءلة الافتراضات، وتحديد الأدلة، وتنسيق المتخصصين الضروريين للتكليف.

مشهد بكسل-آرت لذراع روبوتية تُحوّل تعليمة لغوية إلى فعل التقاط ووضع ملموس.
  1. الإدراك

  2. السياسة (VLA)

  3. التحكّم

  4. مراقب السلامة

من المستشعرات إلى الحركة، خلف مراقب سلامة مستقل.

خط بأربع مراحل: الإدراك، ثم السياسة (نموذج رؤية-لغة-فعل)، ثم التحكّم، ثم مراقب سلامة مستقل.

الروبوت الذي يعمل في عرض توضيحي ليس روبوتًا يمكنكم نشره. والخيارات الجوهرية — VLM أم VLA، وما الذي يُسمح للمحاكاة بإثباته، وأين يقع حد السلامة الحتمي — هي قرارات منتج قبل أن تكون قرارات هندسية. تتولاها Hyperion، وتسمّي الأدلة التي تُغلق كلًا منها، وتنسّق عمل المختصين الذين ينفذون النتيجة.

مسار الاستشعار-إلى-الفعل (الإدراك ← السياسة ← التحكم)، والتمييز بين VLM وVLA (الـ VLM يدرك ويستدل؛ والـ VLA يُخرج أفعالًا)، وحلقة تدريب وتقييم مع المحاكاة وsim-to-real، وحد سلامة حتمي — السياسة تقترح، ومراقب مستقل يقيّد.

ROS 2؛ سياسات الرؤية-اللغة-الفعل (عائلة π، SmolVLA، NVIDIA Isaac GR00T) وVLM؛ LeRobot للبيانات والتدريب والتقييم؛ التشغيل عن بُعد للعروض؛ المحاكاة (Isaac Sim/Lab) وsim-to-real؛ الضبط الدقيق (LoRA/QLoRA) والتقييم في حلقة مغلقة؛ مراقب سلامة آني ونطاق تشغيل وإيقاف طارئ.

من الإدراك إلى الفعل، بحدٍّ يُخفِق بأمان

النماذج المتعلِّمة تقترح؛ وحدٌّ حتمي يحسم. يمرّ كل أمر محرّك عبر مراقب سلامة مستقل قبل أن يصل إلى العتاد.

  • إدخال
  • حتمي
  • متعلِّم
  • سلامة
  • إخراج
من الإدراك إلى الفعل، بحدٍّ يُخفِق بأمانطوبولوجيا بكسلية: المستشعرات تغذّي الإدراك؛ نماذج VLM وVLA المُتعلِّمة تقترح إجراءً؛ مُتحكِّم حتمي ومراقب سلامة مستقل، داخل غشاء للسلامة والأمن السيبراني، يقبلان أو يحجبان كل أمر قبل وصوله إلى الروبوت؛ والنتائج تُغذّى عائدةً إلى الإدراك.

تدفّق من المستشعرات عبر الإدراك، وVLM وVLA، والمُخطِّط والمتحكّم، إلى مراقب سلامة مستقل يتحكّم في وصول الأوامر إلى المُشغِّلات، مع تغذية راجعة إلى المستشعرات.

  1. إدخالالمستشعراتكاميرات، عمق، قوة-عزم، استقبال ذاتي
  2. حتميالإدراكدمج، SLAM، وضعية 6-DoF
  3. متعلِّمVLMيُرسي الهدف — «ما الذي أنظر إليه؟»
  4. متعلِّمVLAيولّد حِزَم أفعال على العتاد
  5. حتميالمُخطِّط والتحكّمالمسار والتحكّم بمعدل ~1 kHz
  6. سلامةمراقب السلامةغلاف مستقل خارج النطاق وe-stop
  7. إخراجالمُشغِّلاتحركة في العالم الفيزيائي

حد سلامة حتمي

وحده ACCEPT من مراقب السلامة يسمح للأمر بالوصول إلى المُشغِّلات؛ أما REJECT فيفرض حالة آمنة.

حلقة مغلقة: حالة المُشغِّلات والبيئة تُغذّى راجعةً إلى المستشعرات.

موازنات زمنية توضيحية لحلقة التحكّم: المنعكس/السلامة ~1 kHz · الإدراك ~10–40 ms · السياسة ~20–100 ms · VLM ~1 Hz.

VLM يستدل، وVLA يفعل.

فئتان من النماذج بمهام مختلفة. وحدها مخرجات VLA تصل إلى المحرّكات — لذا وحدها مخرجات VLA يجب أن تجتاز حد السلامة الحتمي.

يُرسي VLM الهدف الذي ينفّذه VLA. أمثلة النماذج توضيحية لفئات مفتوحة (مثل VLM من فئة Pixtral؛ وVLA من فئة π0 / SmolVLA).
البُعدVLM — نموذج الرؤية-اللغةVLA — الرؤية-اللغة-الفعل
المخرجاتنص / لغة مهيكلةأفعال الروبوت / حِزَم أفعال
السؤال الذي يجيب عنه«ما الذي أنظر إليه؟»«ماذا ينبغي أن تفعل المفاصل الآن؟»
الدورإدراك رفيع المستوى، استدلال، إرساءيُغلق الحلقة على العتاد
المعدّل النموذجي~1 Hz / عند الطلب~10–50 Hz
مُدرَّب علىأزواج صورة-نصعروض تشغيل عن بُعد (+ Open X-Embodiment)
نمط الإخفاقخطة مهلوسةحركة غير آمنة — تستلزم مراقب سلامة

ما الذي قِسناه

  • مقيس

    68.71 GB

    الضبط الكامل لـ π0.5 — ذروة الذاكرة
  • مقيس

    1.08 → 0.13 (300 steps)

    ضبط حقيقي (LIBERO، مشروط باللغة) — الخسارة
  • محاكاة

    0% → 96%

    نجاح المحاكاة (LIBERO-Spatial) — الأساس ← المضبوط
  • على الروبوت، تشغيل تجريبي

    12 / 12

    اختبار معرفي على الروبوت (12 مشهدًا) — الإدراك · الفهم · التفسير
  • مقيس

    2.3× – 14.3×

    إنتاجية bf16 مقابل FP32 (ACT)

لم يُقَس بعد

  • معدل نجاح المهام على الروبوت — حلقة الذراع تشغيل تجريبي (لا حركة فيزيائية بعد).
  • تنفيذ NPU‏ (XDNA2) — سلسلة INT8 تتحقق، لكن لم يُترجم أي رسم فرعي DPU؛ احتياطي iGPU/CPU فقط.
  • التقارب (يتوقف الضبط عند 300 خطوة) والطاقة والتعميم متعدد المهام.

ناقش عملًا في الذكاء الاصطناعي المُجسَّد