論文の概要: RoboIRS: Inference-Time Internal Representation Steering for Generalist Robot Policies
- arxiv url: http://arxiv.org/abs/2610.04681v1
- Date: Sat, 03 Oct 2026 17:50:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.380722
- Title: RoboIRS: Inference-Time Internal Representation Steering for Generalist Robot Policies
- Title(参考訳): RoboIRS:ジェネラリストロボットのための推論時内部表現ステアリング
- Abstract要約: RoboIRSは視覚言語モデル(VLA)と世界行動モデル(WAM)のための推論時内部表現ステアリング手法である
0.5ドルというフリーズされた15のシミュレーションタスクでは、RoboIRSは平均成功率を44.4%から66.2%に改善した。
さらに、同じ0.5ドルのポリシーを用いて、実ロボット操作に関するRoboIRSを検証するとともに、世界行動モデルコスモスポリシーの適用性を実証する。
- 参考スコア(独自算出の注目度): 20.29823172229124
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language-action (VLA) and world-action models (WAMs) often degrade under out-of-distribution task variations despite retaining partial task capability. To recover such capability, we propose RoboIRS, an inference-time internal representation steering method that uses successful and failed rollouts to train linear classifiers, select outcome-relevant intervention locations, and derive task-specific steering directions without updating policy parameters. On 15 simulation tasks with a frozen $π0.5$ policy, RoboIRS improves the average success rate from 44.4% to 66.2%, outperforming alternative inference-time intervention baselines while adding little inference time. We further validate RoboIRS on real-robot manipulation using the same $π0.5$ policy and demonstrate its applicability to a world-action model Cosmos Policy, where the average success rate improves from 35.4% to 55.4%. These results show that directly steering internal robot-policy representations can improve the performance of robot policies at inference time. Project website is available at https://rollingoat.github.io/roboirs/.
- Abstract(参考訳): 視覚言語アクション (VLA) と世界行動モデル (WAM) は、部分的なタスク能力を維持しながらも、アウト・オブ・ディストリビューションタスクのバリエーションの下で劣化することが多い。
この能力を回復するために,線形分類器の訓練,結果関連介入場所の選択,タスク固有の操舵方向の導出に成功・失敗したロールアウトを利用した推論時内部表現ステアリング手法であるRoboIRSを提案する。
凍結した$π0.5$のポリシーを持つ15のシミュレーションタスクでは、RoboIRSは平均成功率を44.4%から66.2%に改善し、推論時間をほとんど加えることなく、代替の推論時間介入ベースラインを上回っている。
さらに、同じ$π0.5$ポリシーを用いて、RoboIRSを実ロボット操作で検証し、平均成功率が35.4%から55.4%に向上する世界行動モデルコスモス政策への適用性を実証する。
これらの結果から,内部のロボット政策表現を直接操作することで,推論時のロボットポリシーの性能が向上することが示唆された。
プロジェクトのWebサイトはhttps://rollingoat.github.io/roboirs/.comで公開されている。
関連論文リスト
- EmbodiRSI: Recursive Self-Improvement for Data-Efficient Robot Adaptation [54.5481724465918]
EmbodiRSIは、リアルからシミュレート・トゥ・リアル・セッティングにおける反復的な政策改善のためのシステムである。
タスク固有のシミュレーションは、ターゲットのデプロイメントシナリオから構築され、低コストな環境として使用される。
400の適応的なシミュレートされた軌道と、サブタスクごとに10の現実世界の軌道しか持たないため、EmbodiRSIは83.1%のシーンバランスの自律的実世界の成功を達成している。
論文 参考訳(メタデータ) (2026-09-30T03:54:53Z) - RoboFFT: Finetuning generative robot policy via online reinforcement learning with forward process [22.898652220603026]
生成ロボットポリシーを微調整するための前処理強化学習フレームワークであるRoboFFTを提案する。
本研究では,代表シミュレーションベンチマークを用いて,RoboFFTを一般的な生成ロボットポリシーで評価する。
さらに,RoboFFTを実世界のRLフレームワークに統合し,実世界のタスクにおいて有効性を示す。
論文 参考訳(メタデータ) (2026-09-26T04:52:58Z) - Stable and Efficient Real-World Online VLA Post-Training via Asynchronous Replay-Anchored Policy Improvement [60.83624556700821]
本稿では,リプレイ動作における批評家とアクターの更新の両方を基盤として,ロールアウトと学習を同時に行うフレームワークを提案する。
RAPolicyを4つのシングルタスク設定と1つのジョイント5タスク設定で実世界で評価し,オンライントレーニングの予算は1~2時間に過ぎなかった。
論文 参考訳(メタデータ) (2026-09-19T08:45:18Z) - REVOLVE: An Automated Closed-Loop Framework for Evolving Robot Manipulation with Minimal Human Intervention [17.399763167916195]
人間の介入を最小限に抑えてロボット操作を進化させるための自動クローズドループフレームワークであるREVOLVEを提案する。
統一されたソフトウェアプラットフォーム上に構築されたREVOLVEは、データ収集、ポリシトレーニングとデプロイメント、障害回復、継続的な学習を単一のクローズドループワークフローに統合する。
論文 参考訳(メタデータ) (2026-09-13T16:08:03Z) - PIVOT-R: Primitive-Driven Waypoint-Aware World Model for Robotic Manipulation [68.17081518640934]
ロボット操作のためのPrIrmitive-driVen waypOinT-aware world model(PIVOT-R)を提案する。
PIVOT-RはWAWM(Waypoint-aware World Model)と軽量アクション予測モジュールで構成される。
私たちのPIVOT-RはSeaWaveベンチマークで最先端のオープンソースモデルより優れており、4段階の命令タスクで平均19.45%の相対的な改善を実現しています。
論文 参考訳(メタデータ) (2024-10-14T11:30:18Z) - Robust Visual Sim-to-Real Transfer for Robotic Manipulation [79.66851068682779]
シミュレーションにおけるビジュモータポリシーの学習は、現実世界よりも安全で安価である。
しかし、シミュレーションデータと実データとの相違により、シミュレータ訓練されたポリシーは実際のロボットに転送されると失敗することが多い。
視覚的なsim-to-real領域ギャップを埋める一般的なアプローチは、ドメインランダム化(DR)である。
論文 参考訳(メタデータ) (2023-07-28T05:47:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。