論文の概要: LM-X: Explainable Action Modeling with Progress, Event, and Uncertainty Prediction for Generalist Robot Manipulation
- arxiv url: http://arxiv.org/abs/2608.25757v2
- Date: Thu, 27 Aug 2026 12:24:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.880236
- Title: LM-X: Explainable Action Modeling with Progress, Event, and Uncertainty Prediction for Generalist Robot Manipulation
- Title(参考訳): LM-X:汎用ロボットマニピュレーションのための進捗・事象・不確実性予測を用いた説明可能な動作モデリング
- Abstract要約: 一般視覚-言語行動(VLA)政策は、主に短期水平行動予測を通じて長期水平行動を学ぶ。
我々は,解剖学的対応を主張することなく,タスク,イベント,運動の規模にわたって予測を整理するLM-Xを紹介する。
- 参考スコア(独自算出の注目度): 28.431160101245837
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generalist vision--language--action (VLA) policies learn long-horizon behavior mainly through short-horizon action prediction and reveal little beyond sampled commands. This creates two coupled bottlenecks: a single action target must implicitly absorb task progress, intermediate intent, and local reliability, while these control states remain hidden during execution. Inspired by functional principles of biological sensorimotor control, we introduce LM-X , which organizes prediction across task, event, and motor scales without claiming anatomical correspondence. Three explicitly supervised signals are emitted online and directly condition action generation: return-to-go (RTG) measures visible task progress, event-to-go (ETG) identifies the next semantic transition, and heteroscedastic action flow estimates local reliability through propagated variance. Explanation is therefore intrinsic to control rather than generated post hoc. Before a costly 20-day pretraining run on 64 NVIDIA B200 GPUs, a controlled five-task pretraining gate verifies the design: the complete model improves success by 16.0 points over the action-only backbone and by 10.8 points over the strongest single-head variant. We then train LM-X on more than 20,000 hours of real-robot trajectories, including over 1,000 hours of failed policy rollouts. LM-X achieves 74.1\% across 50 randomized-hard RoboTwin2.0 tasks versus 55.4\% for GR00T N1.7, and 68.6\% versus 50.7\% across seven real-robot tasks. RTG tracks semantic progress and visible regression, while variance rises during hesitation and oscillatory control. These results show that explicit multi-timescale predictive state can strengthen control while exposing interpretable internal estimates.
- Abstract(参考訳): 汎用的視覚-言語行動(VLA)政策は、主に短期水平行動予測を通じて長期水平行動を学び、サンプル化されたコマンド以外はほとんど明らかにしない。
単一のアクションターゲットがタスクの進捗、中間的な意図、ローカルな信頼性を暗黙的に吸収しなければならない一方で、これらの制御状態は実行中に隠蔽される。
生体感覚運動制御の関数的原理に着想を得て,解剖学的対応を主張することなく,課題,事象,運動の規模をまたいだ予測を組織化するLM-Xを導入する。
RTG(Return-to-go)は目に見えるタスクの進捗を計測し、ETG(Event-to-go)は次のセマンティックな遷移を識別し、ヘテロセダスティックなアクションフローは伝播分散によって局所的な信頼性を推定する。
したがって、説明はポストホックの生成よりも制御に固有のものである。
64 NVIDIA B200 GPU上で20日間の事前トレーニングを行う前に、制御された5タスク事前トレーニングゲートが設計を検証した。
その後、1000時間以上のポリシーのロールアウトを含む2万時間以上の実際のロボット軌道上でLM-Xをトレーニングします。
LM-Xは、50のランダム化されたハードなRoboTwin2.0タスクで74.1\%、GR00T N1.7では55.4\%、実際の7つのロボットタスクで68.6\%、50.7\%を達成する。
RTGは意味的進行と可視的回帰を追跡し、発散と発振制御の間に分散が増加する。
これらの結果は、解釈可能な内部推定を公開しながら、明示的なマルチタイムスケールの予測状態が制御を強化することを示している。
関連論文リスト
- GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation [63.853929983870955]
本稿では,ジェニー・エンスペクタ法 2.0 (GE-Act 2.0) について紹介する。
制御指向オートエンコーダ(CoAE)、ワンステップビジュアルプランナー(SVP)、逆ダイナミクスモデル(IDM)を組み合わせている。
それらのコンポーネントは、知識に整合した選択最適化(KASO)で共同で訓練され、記録された行動に適合していると判断された予測された未来のみを選択することで、ミスマッチした監視を減らす。
論文 参考訳(メタデータ) (2026-09-04T17:16:48Z) - Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models [120.24139942108405]
ロボットデータのスケーリングは、一般のVision-Language-Action(VLA)モデルを構築する上で重要である。
固定されたロボットデータ予算の下では、継続した事前訓練は限られた軌道を伝達可能な視覚行動知識に変換する必要がある。
本稿では,VLA指向のVLMバックボーンであるVLActを提案する。
論文 参考訳(メタデータ) (2026-08-27T17:59:40Z) - G0.5: One Autoregressive Stream for Robot Reasoning and Action [43.43377463558725]
本稿では,1つの変圧器デコーダが1つの目的の下で推論とアクショントークンを出力する,事前訓練された自己回帰VLAであるG0.5を紹介する。
推論とアクションは1組の重みを共有しているため、事前訓練されたVLMの能力は物理的な振る舞いへと引き継がれる。
G0.5は7つの独立した体制で最先端のモデルを上回っている。
論文 参考訳(メタデータ) (2026-08-12T07:26:47Z) - RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance [84.26294415726723]
汎用報酬モデルが、ロボット学習のスケーリングのボトルネックになりつつある。
ロボット操作のためのオープンソースのバリューファンデーションモデルであるRynnValueを紹介した。
RynnValueは7000時間以上、好みやプログレッシブアノテーションなしで約3Mの命令条件付きクリップにスケールする。
論文 参考訳(メタデータ) (2026-08-10T17:09:37Z) - Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision [26.793499191581315]
視覚言語アクション(VLA)モデルにおける異体間移動は依然として困難である。
ZR-0は260億のパラメーター-エンドツーエンドのVLAモデルであり、密なエンボディード・チェーン・オブ・レーソン(ECoT)の監督を用いて、クロスボディーメント表現を整列させる。
論文 参考訳(メタデータ) (2026-06-29T16:48:48Z) - ActProbe: Action-Space Probe for Early Failure Detection of Generative Robot Policies [21.31011797815255]
本稿では、生成ロボットポリシーのための純粋なアクションスペース検出器であるActProbeを紹介する。
TCE(Temporal Consistency Error)は、連続したアクションチャンクと、現在のチャンクのアクションチャンクマグニチュード(ACM)の2つのコンパクト信号を使用する。
タスク条件付きLSTM-MLPアーキテクチャを用いて、これらの信号をステップ毎の障害確率にマッピングする。
論文 参考訳(メタデータ) (2026-06-07T08:18:11Z) - Wall-OSS-0.5 Technical Report [13.983843529533113]
本稿では,アクションジェネレーションコンポーネントを付加した3B VLMバックボーン上に構築した,オープンソースの4B VLAであるWall-OSS-0.5を紹介する。
このモデルは20以上のエボディメントで事前訓練され、1エポックあたり100万以上のロボット軌道を処理する。
非自明なゼロショットのリアルタイムロボット動作を実現し、17タスクスイート上の高いタスク進捗において、ホールドアウトの変形可能な操作タスクを含むいくつかのタスクを完了させる。
論文 参考訳(メタデータ) (2026-05-29T06:04:03Z) - RLDX-1 Technical Report [74.70437517338186]
マルチストリーム動作変換器(Multi-Stream Action Transformer:MSAT)上に構築したデクスタス操作のための汎用ロボットポリシーRTDX-1を紹介する。
経験的評価により、RLDX-1は最新のフロンティア・ビジョン・ランゲージ・アクションモデルよりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-05-05T01:40:15Z) - ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation [57.07494675832939]
ロボット操作のための既存の視覚言語アクション(VLA)モデルは、進歩意識を欠いている。
本研究では,textbf vla という新しいモデルを提案し,タスク進捗の推定と統合について検討する。
CALVINとLIBEROベンチマークの実験は、実世界のロボットの展開とともに、成功率の大幅な改善を一貫して示している。
論文 参考訳(メタデータ) (2026-03-29T12:38:11Z) - From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation [32.41847293364159]
PRIMO R1はビデオMLLMをアクティブな「批判」に変換する7Bフレームワーク
我々は、結果に基づく強化学習を活用して、進捗推定のための明示的な連鎖生成をインセンティブ化する。
67.0%の精度でRoboFailベンチマークの最先端のパフォーマンスを確立し、OpenAI o1のようなクローズドソースモデルを6.2%上回った。
論文 参考訳(メタデータ) (2026-03-16T17:53:28Z) - See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation [59.07792608884117]
本稿では,See, Plan, Rewind (SPR)について紹介する。
SPRは、現在の状態と今後のマイルストーンを見て、次の2Dウェイポイントに向けて軌道を計画し、障害時に回復可能な状態に戻すという、継続的なコアサイクルを通じて運用される。
SPRは、OpenVLA-OFTとUniVLAを上回る最小のパフォーマンス低下で最先端のロバスト性を達成する。
論文 参考訳(メタデータ) (2026-03-10T07:22:51Z) - Self-Correcting VLA: Online Action Refinement via Sparse World Imagination [55.982504915794514]
本稿では, 自己補正VLA (SC-VLA) を提案する。
SC-VLAは最先端のパフォーマンスを達成し、最高タスクスループットを16%削減し、最高パフォーマンスのベースラインよりも9%高い成功率を得る。
論文 参考訳(メタデータ) (2026-02-25T06:58:06Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。