能力 · 在委托内适用
机器人、VLM 与 VLA
从感知到动作——在真实机器人上运行视觉-语言与视觉-语言-动作模型,并具备确定性安全边界。
Hyperion 并不将自己定位为通用工程团队。技术素养用于做出更好的产品决策、质疑假设、定义证据,并协调该委任所需的关键专家。
感知
策略(VLA)
控制
安全监视器
四阶段流水线:感知,然后是策略(视觉-语言-动作模型),然后是控制,然后是独立的安全监视器。
能在演示里运行的机器人,并不是可以部署的机器人。那些重大的取舍——用 VLM 还是 VLA、允许仿真证明什么、确定性安全边界设在哪里——在成为工程问题之前,首先是产品决策。Hyperion 承担这些决策,指明能够为每一项定论的证据,并协调实施结果的专家。
从传感器到动作的流水线(感知 → 策略 → 控制)、VLM 与 VLA 的区别(VLM 负责感知与推理,VLA 输出动作)、带仿真与 sim-to-real 的训练与评估闭环,以及确定性安全边界——策略负责提议,独立监视器负责约束。
ROS 2;视觉-语言-动作策略(π 系列、SmolVLA、NVIDIA Isaac GR00T)与 VLM;用于数据、训练与评估的 LeRobot;用于示教的遥操作;仿真(Isaac Sim/Lab)与 sim-to-real;微调(LoRA/QLoRA)与闭环评估;运行时安全监视器、运行包线与紧急停止。
从感知到动作,配备安全失效的边界
习得模型负责提议,确定性边界负责裁定。每条电机指令在到达硬件之前都要经过独立的安全监视器。
- 输入
- 确定性
- 习得
- 安全
- 输出
数据流从传感器经过感知、VLM 与 VLA、规划器与控制器,到达把关执行器的独立安全监视器,并反馈回传感器。
- 输入传感器摄像头、深度、力-力矩、本体感觉
- 确定性感知融合、SLAM、6-DoF 位姿
- 习得VLM锚定目标——“我在看什么?”
- 习得VLA在硬件上生成动作块
- 确定性规划器与控制轨迹与 ~1 kHz 控制
- 安全安全监视器独立的带外运行包线与 e-stop
- 输出执行器在物理世界中的运动
确定性安全边界
只有安全监视器的 ACCEPT 才允许指令到达执行器;REJECT 则强制进入安全状态。
闭环:执行器与环境的状态反馈回传感器。
VLM 推理,VLA 行动。
两类承担不同任务的模型。只有 VLA 的输出会到达电机——因此只有 VLA 的输出必须通过确定性安全边界。
| 维度 | VLM——视觉-语言模型 | VLA——视觉-语言-动作 |
|---|---|---|
| 输出 | 文本 / 结构化语言 | 机器人动作 / 动作块 |
| 它回答的问题 | “我在看什么?” | “关节现在该做什么?” |
| 角色 | 高层感知、推理、锚定 | 在硬件上闭合回路 |
| 典型频率 | ~1 Hz / 按需 | ~10–50 Hz |
| 训练数据 | 图文对 | 遥操作演示(+ Open X-Embodiment) |
| 失效模式 | 幻觉式计划 | 不安全的运动——必须配备安全监视器 |
我们测量了什么
实测 68.71 GB
π0.5 全量微调——峰值显存 实测 1.08 → 0.13 (300 steps)
真实微调(LIBERO,语言条件)——损失 仿真 0% → 96%
仿真成功率(LIBERO-Spatial)——基线 → 微调后 机器人上·空跑 12 / 12
机器人上的认知基准(12 个场景)——感知 · 理解 · 解释 实测 2.3× – 14.3×
bf16 吞吐 vs FP32(ACT)
尚未测量
- 机器人上的任务成功率——机械臂回路为空跑(尚无物理动作)。
- NPU(XDNA2)执行——INT8 工具链可验证,但未编译出 DPU 子图,仅 iGPU/CPU 回退。
- 收敛(微调止于 300 步)、能耗与多任务泛化。