論文の概要: Decoupling Vision, Language, and Action for Efficient Multi-Task Robot Policies
- arxiv url: http://arxiv.org/abs/2609.18374v2
- Date: Thu, 17 Sep 2026 04:59:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.736141
- Title: Decoupling Vision, Language, and Action for Efficient Multi-Task Robot Policies
- Title(参考訳): 効率的なマルチタスクロボット政策のための視覚・言語・行動の分離
- Abstract要約: Vision-Language-Action (VLA) ポリシーは一般的に、Vision-Language Model (VLM) バックボーンを動作させ、すべてのポリシー推論において数十億のパラメータを持つ。
我々は、視覚と言語エンコーダを分離し、表現がコンパクトなアクションヘッドを条件とする、マルチタスク操作のための分離された代替案を再検討する。
Decoupled Embodiment Model (DEM)は、細調整されたDINOv3ビジョンエンコーダ、冷凍されたNeoBERT言語エンコーダ、および1つのフォワードパスでアクションチャンクを生成するMeanFlowヘッドを組み合わせる。
- 参考スコア(独自算出の注目度): 23.521987521697056
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) policies commonly run Vision-Language Model (VLM) backbones with billions of parameters at every policy inference, which costs latency and energy. We revisit a decoupled alternative for multi-task manipulation: separate vision and language encoders whose representations condition a compact action head. We run a standardized comparison that varies the vision encoder, the language encoder, and the action head while holding the demonstrations, the training-step budget, the tasks, the evaluation protocol, and the measurement platform fixed, against seven VLA baselines. The resulting Decoupled Embodiment Model (DEM) combines a fine-tuned DINOv3 vision encoder, a frozen NeoBERT language encoder, and a MeanFlow head that generates an action chunk in one forward pass. On 18 RoboCasa tasks evaluated with held-out instruction paraphrases and randomized scenes, DEM reaches 55.6\% mean success against 56.9\% for GR00T N1.7 and 54.6\% for $π_{0.5}$, and on three real-robot tasks it reaches 66.0\% against 68.0\% for GR00T N1.7. On the same workstation, DEM needs 6.1\,ms per policy forward pass, a maximum throughput of 162.7 policy calls per second, and draws an estimated 2.07\,J of GPU energy per call, eight to seventeen times the throughput and six to fifteen times less energy than these VLM-backbone policies. Within this trained-task regime, DEM sits on the observed success--latency--energy frontier and provides a strong, efficient baseline for language-conditioned robot skills.
- Abstract(参考訳): Vision-Language-Action(VLA)ポリシーは一般的にVision-Language Model(VLM)バックボーンを動作させる。
我々は、視覚と言語エンコーダを分離し、表現がコンパクトなアクションヘッドを条件とする、マルチタスク操作のための分離された代替案を再検討する。
視覚エンコーダ,言語エンコーダ,アクションヘッドを,デモ,トレーニングステップ予算,タスク,評価プロトコル,測定プラットフォームを7つのVLAベースラインに対して変更して比較する。
その結果、DEM(Decoupled Embodiment Model)は、微調整されたDINOv3ビジョンエンコーダ、冷凍されたNeoBERT言語エンコーダ、および1つのフォワードパスでアクションチャンクを生成するMeanFlowヘッドを組み合わせる。
ホールドアウト命令パラフレーズとランダム化シーンで評価された18のRoboCasaタスクでは、GR00T N1.7の56.9\%、$π_{0.5}$の54.6\%に対してDEMは56.0\%、GR00T N1.7の68.0\%に対して66.0\%に達する。
同じワークステーション上では、ポリシーフォワードパスあたり6.1\,ms、最大スループットは毎秒162.7で、1コールあたりのGPUエネルギーの2.07\,J、スループットの8~17倍、VLMバックボーンの6~15倍のエネルギーを描画する。
この訓練されたタスク体制の中では、DEMは観測された成功-遅延-エネルギーフロンティアにあり、言語条件のロボットスキルの強力な効率的なベースラインを提供する。
関連論文リスト
- PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models [60.567497085815724]
PhysBrain 1.5は、物理的な環境を理解し、アクションを生成し、将来の状態を予測するための統一モデルである。
事前トレーニングは、人間のインタラクションビデオから完全に具体化された監督を引き出す。
一般的なマルチモーダル機能を維持しながら、14のベンチマークで最高のオープンソース結果を達成する。
論文 参考訳(メタデータ) (2026-09-14T03:25:46Z) - SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies [61.941546372624686]
既存のプロトコルはタスクのセマンティクスを廃止し、手作りの報酬と制御が検証したものから逸脱する振る舞いを残している。
本稿では,SUN (Semantically UNified Programs) を導入し,幾何関係と接触関係が一度定義され,整列したモデル予測制御にコンパイルされる型付き実行プログラムについて述べる。
我々のシステムであるKuafuは、言語やシーンのセマンティクスからSUNプログラムを自動で合成し、MPCによる画面表示を実現し、ステージ条件付きポリシーのトレーニング中にセマンティクスを保持する。
論文 参考訳(メタデータ) (2026-08-31T17:59:16Z) - Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models [15.173629384871013]
VLA(Vision-Language-Action)モデルは、マルチモーダルコンテキストをロボットアクションに変換することができるが、そのアクションデコーダは行動クローニングによって主に訓練されている。
Intention Distillation (INDI) を提案する。
論文 参考訳(メタデータ) (2026-08-24T16:42:49Z) - G0.5: One Autoregressive Stream for Robot Reasoning and Action [43.43377463558725]
本稿では,1つの変圧器デコーダが1つの目的の下で推論とアクショントークンを出力する,事前訓練された自己回帰VLAであるG0.5を紹介する。
推論とアクションは1組の重みを共有しているため、事前訓練されたVLMの能力は物理的な振る舞いへと引き継がれる。
G0.5は7つの独立した体制で最先端のモデルを上回っている。
論文 参考訳(メタデータ) (2026-08-12T07:26:47Z) - CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model [7.106499413931612]
CoTinyVLAはQwen3.5-0.8Bのバックボーン上のアクションモデルであり、モデルを大きくすることなく、監督を構造化することで堅牢性を得る。
LIBERO-Plusでは、7つの摂動次元で10,030の摂動タスクをこなし、CoTinyVLAは空間で90.8%、オブジェクトで87.3%、ゴールで86.6%、ロングで80.7%に達した。
論文 参考訳(メタデータ) (2026-07-28T09:24:17Z) - Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation [60.07205156194741]
身体的なナビゲーションでは、エージェントが言語や視覚的な観察を、実際に見たことのない環境を通して実際のロボットを駆動する空間的な行動の流れにマッピングする必要がある。
統合エージェントアーキテクチャであるUni-LaViRAを4つのタスクファミリと4つの異種実ロボットに拡張する。
論文 参考訳(メタデータ) (2026-05-26T18:52:04Z) - FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies [26.96931937675281]
FineVLAは、アクションアライメントされたきめ細かいVLA監視のためのオープンフレームワークである。
オープンソースの10のロボットデータセットから85Kタスクにまたがる992,247のトラジェクトリを統一する。
500本のビデオ、10,816件の原子性事実と1,030件のVQA質問のベンチマークがある。
論文 参考訳(メタデータ) (2026-05-26T17:01:10Z) - Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data [55.65426108082807]
Uni-MoE-2.0-Omniをスクラッチから3つのコアコントリビューションで構築しています。
雑用的な理解や、画像、テキスト、音声を生成することができる。
論文 参考訳(メタデータ) (2025-11-16T14:10:55Z) - Language-Conditioned Representations and Mixture-of-Experts Policy for Robust Multi-Task Robotic Manipulation [1.731102560795011]
LMoE-DP(Language-Conditioned Visual Representation)モジュールとLanguage- Conditioned Mixture-of-Experts Density Policy(LMoE-DP)を組み合わせたフレームワークを提案する。
実ロボットのベンチマークでは、LCVRはAction Chunking with Transformers (ACT) と Diffusion Policy (DP) の成功率をそれぞれ33.75%、25%向上させた。
セマンティックグラウンドと専門家の専門化を組み合わせることで、堅牢で効率的なマルチタスク操作が可能になることを示す。
論文 参考訳(メタデータ) (2025-10-28T04:27:03Z) - LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction [51.25719786666156]
ヒューマノイド全体制御のための視覚言語・クローズドループベンチマーク(WBC)について紹介する。
そこで我々は,人間型視覚言語WBCのための階層型遅延命令追従フレームワークであるLeVERB: Latent Vision-Language-Encoded Robot Behaviorを提案する。
私たちのベンチマークでは、単純なビジュアルナビゲーションタスクでゼロショットが80%の成功率、全体的な58.5%の成功率が、階層的な階層的なVLA実装よりも7.8倍高い。
論文 参考訳(メタデータ) (2025-06-16T17:56:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。