跳至正文

能力 · 在委托内适用

机器人、VLM 与 VLA

从感知到动作——在真实机器人上运行视觉-语言与视觉-语言-动作模型,并具备确定性安全边界。

Hyperion 并不将自己定位为通用工程团队。技术素养用于做出更好的产品决策、质疑假设、定义证据,并协调该委任所需的关键专家。

像素艺术场景:一只机械臂将一条语言指令转化为具体的抓取放置动作。
  1. 感知

  2. 策略(VLA)

  3. 控制

  4. 安全监视器

从传感器到动作,处于独立安全监视器之内。

四阶段流水线:感知,然后是策略(视觉-语言-动作模型),然后是控制,然后是独立的安全监视器。

能在演示里运行的机器人,并不是可以部署的机器人。那些重大的取舍——用 VLM 还是 VLA、允许仿真证明什么、确定性安全边界设在哪里——在成为工程问题之前,首先是产品决策。Hyperion 承担这些决策,指明能够为每一项定论的证据,并协调实施结果的专家。

从传感器到动作的流水线(感知 → 策略 → 控制)、VLM 与 VLA 的区别(VLM 负责感知与推理,VLA 输出动作)、带仿真与 sim-to-real 的训练与评估闭环,以及确定性安全边界——策略负责提议,独立监视器负责约束。

ROS 2;视觉-语言-动作策略(π 系列、SmolVLA、NVIDIA Isaac GR00T)与 VLM;用于数据、训练与评估的 LeRobot;用于示教的遥操作;仿真(Isaac Sim/Lab)与 sim-to-real;微调(LoRA/QLoRA)与闭环评估;运行时安全监视器、运行包线与紧急停止。

从感知到动作,配备安全失效的边界

习得模型负责提议,确定性边界负责裁定。每条电机指令在到达硬件之前都要经过独立的安全监视器。

  • 输入
  • 确定性
  • 习得
  • 安全
  • 输出
从感知到动作,配备安全失效的边界像素拓扑:传感器输入到感知;学习型 VLM 与 VLA 模型提出动作;在安全与网络安全隔离层内,确定性控制器和独立的安全监视器在每条指令到达机器人之前予以接受或阻断;结果反馈回感知。

数据流从传感器经过感知、VLM 与 VLA、规划器与控制器,到达把关执行器的独立安全监视器,并反馈回传感器。

  1. 输入传感器摄像头、深度、力-力矩、本体感觉
  2. 确定性感知融合、SLAM、6-DoF 位姿
  3. 习得VLM锚定目标——“我在看什么?”
  4. 习得VLA在硬件上生成动作块
  5. 确定性规划器与控制轨迹与 ~1 kHz 控制
  6. 安全安全监视器独立的带外运行包线与 e-stop
  7. 输出执行器在物理世界中的运动

确定性安全边界

只有安全监视器的 ACCEPT 才允许指令到达执行器;REJECT 则强制进入安全状态。

闭环:执行器与环境的状态反馈回传感器。

控制环路的示意时间预算:反射/安全 ~1 kHz · 感知 ~10–40 ms · 策略 ~20–100 ms · VLM ~1 Hz。

VLM 推理,VLA 行动。

两类承担不同任务的模型。只有 VLA 的输出会到达电机——因此只有 VLA 的输出必须通过确定性安全边界。

VLM 锚定 VLA 所执行的目标。模型示例用以说明开放的类别(例如 Pixtral 类的 VLM;π0 / SmolVLA 类的 VLA)。
维度VLM——视觉-语言模型VLA——视觉-语言-动作
输出文本 / 结构化语言机器人动作 / 动作块
它回答的问题“我在看什么?”“关节现在该做什么?”
角色高层感知、推理、锚定在硬件上闭合回路
典型频率~1 Hz / 按需~10–50 Hz
训练数据图文对遥操作演示(+ Open X-Embodiment)
失效模式幻觉式计划不安全的运动——必须配备安全监视器

我们测量了什么

  • 实测

    68.71 GB

    π0.5 全量微调——峰值显存
  • 实测

    1.08 → 0.13 (300 steps)

    真实微调(LIBERO,语言条件)——损失
  • 仿真

    0% → 96%

    仿真成功率(LIBERO-Spatial)——基线 → 微调后
  • 机器人上·空跑

    12 / 12

    机器人上的认知基准(12 个场景)——感知 · 理解 · 解释
  • 实测

    2.3× – 14.3×

    bf16 吞吐 vs FP32(ACT)

尚未测量

  • 机器人上的任务成功率——机械臂回路为空跑(尚无物理动作)。
  • NPU(XDNA2)执行——INT8 工具链可验证,但未编译出 DPU 子图,仅 iGPU/CPU 回退。
  • 收敛(微调止于 300 步)、能耗与多任务泛化。

洽谈具身 AI 工作