論文の概要: In-Context World Modeling for Robotic Control
- arxiv url: http://arxiv.org/abs/2606.26025v2
- Date: Thu, 25 Jun 2026 01:51:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 15:44:16.382721
- Title: In-Context World Modeling for Robotic Control
- Title(参考訳): ロボット制御のための文脈内世界モデリング
- Abstract要約: In-Context World Modeling (ICWM) は,システム識別を文脈内適応問題として扱うフレームワークである。
ICWMは、自己生成されたタスク非依存的相互作用の短い歴史から、ロボットポリシーが重要なシステム変数を自律的に推論することを可能にする。
- 参考スコア(独自算出の注目度): 43.30975804392366
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Modern Vision-Language-Action (VLA) models often fail to generalize to novel setups, such as altered camera viewpoints or robot morphologies, because they are typically conditioned only on current observations and language instructions. By ignoring the underlying system configuration as a variable, these models implicitly assume a fixed execution context encountered during training, necessitating data-intensive fine-tuning for any new environment. In this work, we introduce In-Context World Modeling (ICWM), a framework that treats system identification as an in-context adaptation problem. ICWM enables robot policies to autonomously infer essential system variables from a short history of self-generated, task-agnostic interactions. Unlike traditional In-Context Learning that uses demonstrations to specify what task to perform, ICWM leverages the context window to understand how the system operates. By processing these interactions before task execution, the model implicitly captures the world dynamics of the current system, enabling adaptation to novel configurations without parameter updates. Extensive experiments in simulation and on real-world robot platforms demonstrate that ICWM significantly outperforms standard VLA baselines on novel camera viewpoints.
- Abstract(参考訳): 現代のビジョン・ランゲージ・アクション(VLA)モデルは、現在の観察と言語指示にのみ条件付けされているため、カメラ視点の変更やロボット形態などの新しい設定に一般化できないことが多い。
基礎となるシステム構成を変数として無視することで、これらのモデルはトレーニング中に発生する固定された実行コンテキストを暗黙的に仮定し、新しい環境にデータ集約的な微調整を必要とする。
本研究では,システム識別を文脈内適応問題として扱うフレームワークであるIn-Context World Modeling (ICWM)を紹介する。
ICWMは、自己生成されたタスク非依存的相互作用の短い歴史から、ロボットポリシーが重要なシステム変数を自律的に推論することを可能にする。
デモを使って実行すべきタスクを指定する従来のIn-Context Learningとは異なり、ICWMはコンテキストウィンドウを活用してシステムの動作を理解する。
タスク実行前にこれらのインタラクションを処理することで、モデルは現在のシステムのワールドダイナミクスを暗黙的にキャプチャし、パラメータを更新せずに新しい設定への適応を可能にする。
シミュレーションおよび実世界のロボットプラットフォームにおける大規模な実験により、ICWMは、新しいカメラ視点で標準VLAベースラインを著しく上回ることを示した。
関連論文リスト
- Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation [17.382238044141783]
本稿では,ロボットのデモンストレーションからスキルを学ぶためのフレームワークを提案する。
メタラーニングを統合して共有スキルスペースを構築することで、DAMIは新しいタスクに迅速に適応するためのエージェントを提供する。
我々の手法は、目に見えるタスクの直接推論と目に見えないタスクへの適応に関して、最先端のベースラインより優れています。
論文 参考訳(メタデータ) (2026-07-17T11:50:03Z) - In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics [109.99871326497333]
In-Context Model Predictive Generation (ICMPG)は、言語モデル計画と推論時の物理的フィードバックを統合するフレームワークである。
ICMPGは2つのモジュールでモデル予測制御(MPC)のようなプロセスとして運動合成を再構成する。
論文 参考訳(メタデータ) (2026-06-25T12:50:33Z) - Decoupling the Declarative from the Procedural in Vision-Language-Action Models [65.22639791239932]
オブジェクト固有のデモから振る舞いをクローンするように訓練されたポリシーは、そのオブジェクトを超えて一般化されなければならない。
情報フローを再構成した新しいビジョン・ランゲージ・アクションモデルであるw$2$VLAを提案する。
最先端のVLAとは異なり、我々のモジュラーアプローチは知識表現の分離に成功している。
論文 参考訳(メタデータ) (2026-06-19T14:43:58Z) - Learning Context-Aware Neural ODE Dynamics for Adaptive Robotic Control [55.01272784312405]
本稿では,ニューラル常微分方程式に基づく文脈認識力学モデルを提案する。
Sphero BOLTロボットとFanucマニピュレータを実世界の実験で使用した。
論文 参考訳(メタデータ) (2026-06-13T20:55:46Z) - Dynamic Context-Aware Scene Reasoning Using Vision-Language Alignment in Zero-Shot Real-World Scenarios [0.0]
この作業では、ゼロショットの現実シナリオに対処するDynamic Context-Aware Scene Reasoningフレームワークを導入している。
提案手法は、学習済みの視覚変換器と大規模言語モデルを統合し、視覚意味論と自然言語記述を整合させる。
実験では、複雑で見えない環境でのベースラインモデルよりも、シーン理解の精度が最大で18%向上した。
論文 参考訳(メタデータ) (2025-10-30T15:07:55Z) - Mechanistic interpretability for steering vision-language-action models [0.23371356738437823]
VLA(Vision-Language-Action)モデルは、一般のエンボディエージェントを実現するための有望な道である。
本稿では,VLAを内部表現で解釈し,操作するための最初のフレームワークを紹介する。
我々は、微調整、報酬信号、環境相互作用を伴わずに、リアルタイムに行動を調整する汎用的なアクティベーションステアリング手法を提案する。
論文 参考訳(メタデータ) (2025-08-30T03:01:57Z) - Flex: End-to-End Text-Instructed Visual Navigation from Foundation Model Features [59.892436892964376]
本稿では,視覚に基づく制御ポリシを用いて,ロバストな閉ループ性能を実現するために必要な最小限のデータ要件とアーキテクチャ適応について検討する。
この知見はFlex (Fly lexically) で合成され, 凍結パッチワイド特徴抽出器として, 事前学習された視覚言語モデル (VLM) を用いたフレームワークである。
本研究では,本手法の有効性を,行動クローンによる訓練を実世界のシーンに応用した,四重項フライ・トゥ・ターゲットタスクに適用した。
論文 参考訳(メタデータ) (2024-10-16T19:59:31Z) - In-Context Imitation Learning via Next-Token Prediction [25.63412917032012]
In-Context Robot Transformer (ICRT) は、言語データや報酬関数に頼ることなく、感覚運動の軌道上で自己回帰予測を行う。
ICRTは、プロンプトとトレーニングデータの両方とは異なる環境設定であっても、プロンプトによって指定された新しいタスクに適応することができる。
論文 参考訳(メタデータ) (2024-08-28T17:50:19Z) - Transferring Foundation Models for Generalizable Robotic Manipulation [82.12754319808197]
インターネット規模の基盤モデルによって生成された言語推論セグメンテーションマスクを効果的に活用する新しいパラダイムを提案する。
提案手法は,オブジェクトのポーズを効果的かつ堅牢に知覚し,サンプル効率のよい一般化学習を可能にする。
デモは提出されたビデオで見ることができ、より包括的なデモはlink1またはlink2で見ることができます。
論文 参考訳(メタデータ) (2023-06-09T07:22:12Z) - Generalizing to New Physical Systems via Context-Informed Dynamics Model [0.0]
文脈インフォームド・ダイナミックス適応(CoDA)のための新しいフレームワークを提案する。
CoDAは、各環境固有のコンテキストパラメータに動的モデルを適用することを学ぶ。
様々なアプリケーション領域を表す非線形ダイナミクスの集合に対して、最先端の一般化結果を示す。
論文 参考訳(メタデータ) (2022-02-01T07:41:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。