コンテンツへスキップ

ケイパビリティ · エンゲージメント内での適用

ロボティクス・VLM・VLA

知覚から動作まで — 視覚言語モデルと視覚言語行動モデルを、実機ロボット上で、決定論的な安全境界とともに。

Hyperion は汎用のエンジニアリング体制として位置づけていません。技術的な理解は、より良いプロダクト判断、前提の検証、エビデンスの定義、そして案件に必要な専門家の調整のために用います。

言語による指示を具体的なピック・アンド・プレース動作に変換するロボットアームのピクセルアート シーン。
  1. 知覚

  2. ポリシー(VLA)

  3. 制御

  4. 安全モニター

センサーから動作まで、独立した安全モニターの内側で。

4 段階のパイプライン:知覚、次にポリシー(視覚言語行動モデル)、次に制御、次に独立した安全モニター。

デモで動くロボットは、配備できるロボットではありません。重要な選択——VLM か VLA か、シミュレーションに何を証明させてよいか、決定論的な安全境界をどこに置くか——は、エンジニアリングの判断である前にプロダクトの判断です。Hyperion はそれらを引き受け、各判断を確定させる証拠を明示し、結果を実装する専門家を調整します。

センサーから動作までのパイプライン(知覚 → ポリシー → 制御)、VLM と VLA の違い(VLM は知覚・推論し、VLA は動作を出力)、シミュレーションと sim-to-real を伴う学習・評価ループ、そして決定論的な安全境界 — ポリシーが提案し、独立したモニターが制約します。

ROS 2;視覚言語行動ポリシー(π ファミリー、SmolVLA、NVIDIA Isaac GR00T)と VLM;データ・学習・評価のための LeRobot;実演のためのテレオペレーション;シミュレーション(Isaac Sim/Lab)と sim-to-real;微調整(LoRA/QLoRA)と閉ループ評価;ランタイム安全モニター、動作範囲、非常停止。

知覚から動作まで、フェイルセーフな境界とともに

学習モデルが提案し、決定論的な境界が判定します。すべてのモーター指令は、ハードウェアに到達する前に独立した安全モニターを通過します。

  • 入力
  • 決定論的
  • 学習
  • 安全
  • 出力
知覚から動作まで、フェイルセーフな境界とともにピクセルのトポロジー:センサーが知覚に入力し、学習済みのVLMとVLAモデルが行動を提案します。決定論的なコントローラーと独立した安全モニターが、安全・サイバーセキュリティの膜の内側で、すべての指令をロボットに届く前に承認または遮断し、結果は知覚へフィードバックされます。

センサーから、知覚、VLM と VLA、プランナーと制御器を経て、アクチュエータへのアクセスを制御する独立した安全モニターへと流れ、センサーへフィードバックします。

  1. 入力センサーカメラ、深度、力・トルク、自己受容感覚
  2. 決定論的知覚フュージョン、SLAM、6-DoF 姿勢
  3. 学習VLM目標を接地する — 「何を見ているのか?」
  4. 学習VLAハードウェア上でアクションチャンクを生成
  5. 決定論的プランナーと制御軌道と ~1 kHz の制御
  6. 安全安全モニター独立した帯域外の動作範囲と e-stop
  7. 出力アクチュエータ物理世界での動き

決定論的な安全境界

安全モニターの ACCEPT のみが指令をアクチュエータに到達させ、REJECT は安全な状態へ強制移行します。

閉ループ:アクチュエータと環境の状態がセンサーへフィードバックされます。

制御ループの目安となる時間配分:反射/安全 ~1 kHz · 知覚 ~10–40 ms · ポリシー ~20–100 ms · VLM ~1 Hz。

VLM が推論し、VLA が動く。

役割の異なる 2 つのモデルクラス。モーターに届くのは VLA の出力だけ — だから決定論的な安全境界を通過しなければならないのも VLA の出力だけです。

VLM が目標を接地し、VLA がそれを実行します。モデル例はオープンなクラスを示すものです(例:Pixtral クラスの VLM、π0 / SmolVLA クラスの VLA)。
観点VLM — 視覚言語モデルVLA — 視覚言語行動
出力テキスト / 構造化言語ロボットの動作 / アクションチャンク
答える問い「何を見ているのか?」「関節は今どう動くべきか?」
役割高レベルの知覚・推論・接地ハードウェア上でループを閉じる
標準的なレート~1 Hz / オンデマンド~10–50 Hz
学習データ画像とテキストのペアテレオペレーションのデモ(+ Open X-Embodiment)
失敗モード幻覚による計画危険な動き — 安全モニターを必須とする

測定した内容

  • 実測

    68.71 GB

    π0.5 フル微調整 — ピークメモリ
  • 実測

    1.08 → 0.13 (300 steps)

    実データ微調整(LIBERO、言語条件付き)— 損失
  • シミュレーション

    0% → 96%

    シミュレーション成功(LIBERO-Spatial)— ベース → 微調整後
  • ロボット上・ドライラン

    12 / 12

    ロボット上の認知ベンチマーク(12シーン)— 知覚・理解・解釈
  • 実測

    2.3× – 14.3×

    bf16 スループット対 FP32(ACT)

未測定の項目

  • ロボット上のタスク成功率 — アームのループはドライラン(物理的な動作はまだ)。
  • NPU(XDNA2)実行 — INT8 ツールチェーンは検証できるが DPU サブグラフは未コンパイル、iGPU/CPU フォールバックのみ。
  • 収束(微調整は300ステップで停止)、エネルギー、マルチタスク汎化。

身体化 AI の取り組みを相談する