論文の概要: Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models
- arxiv url: http://arxiv.org/abs/2607.10655v1
- Date: Sun, 12 Jul 2026 08:42:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.49898
- Title: Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models
- Title(参考訳): ロボット基礎モデルにおけるショートカット学習の回避のための人工的定型認識
- Authors: Xiatao Sun, Yuan Zhuang, Mateo Sanchez Lopez Negrete, Matei-Victor Coldea, Chen Liang, Haoyang Zhang, Che Liu, Ziyao Zeng, Shawn Li, Qian Wang, Fei Miao, Daniel Rakita,
- Abstract要約: 本稿では,ロボット基礎モデルのための軽量かつポリシーに依存しないモジュールであるArtificial Foveated Perception (AFP)を提案する。
AFPは、関連するオブジェクト、ロボット、その他の行動クリティカル領域に対してタスク条件付きマスクを予測する。
AFPは微調整時間を短縮し、オーバーフィッティングを抑制し、環境摂動下での一般化を改善する。
- 参考スコア(独自算出の注目度): 28.23835152537988
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robotic foundation models have recently made substantial progress in multi-task capability, cross-embodiment transfer, and language-conditioned control. Yet robust deployment across diverse real-world settings remains difficult, in part because policies often fail to distinguish causally relevant visual structure from spurious scene-level correlations. We identify this failure mode as shortcut learning: the tendency to exploit predictive but non-causal correlations in the training distribution rather than the task-relevant visual evidence that determines successful action. Although shortcut learning has been extensively studied in computer vision and broader machine learning, its role in robotic foundation models remains comparatively underexplored. We propose Artificial Foveated Perception (AFP), a lightweight, policy-agnostic module that takes the same vision and language inputs as Vision-Language-Action and World Action Model pipelines and predicts task-conditioned masks over relevant objects, the robot, and other action-critical regions. We use these masks primarily as an auxiliary grounding signal during fine-tuning, aligning policy attention with task-relevant regions while leaving the core architecture unchanged. After fine-tuning, the policy executes on the original observation stream without requiring AFP in the control loop. We evaluate AFP across state-of-the-art robotic foundation models and show that foveated perception reduces fine-tuning time, suppresses overfitting, and improves generalization under environmental perturbations. Ablations over mask quality and grounding-loss design further show that these gains arise from directing policy learning toward task-relevant visual evidence. These results suggest that task-conditioned foveated perception is a practical mechanism for making robotic foundation models more robust, data-efficient, and scalable.
- Abstract(参考訳): ロボット基礎モデルは近年,マルチタスク能力,クロス・エボディメント・トランスファー,言語条件制御などにおいて大きな進歩を遂げている。
しかし、様々な現実世界の環境にまたがるロバストな配置は依然として困難であり、その理由の一つとして、ポリシーが因果関係の視覚構造とスプリアス的なシーンレベルの相関を区別できないことがあげられる。
我々は,この障害モードをショートカット学習とみなす: 達成行動を決定するタスク関連視覚的証拠よりも,トレーニング分布における予測的かつ非因果的相関を利用する傾向である。
ショートカット学習はコンピュータビジョンやより広範な機械学習において広く研究されてきたが、ロボット基礎モデルにおけるその役割はいまだに未熟である。
我々は,視覚・言語・行動モデルと同一の視覚と言語入力を取り入れ,関連する対象,ロボット,その他の行動クリティカル領域に対してタスク条件付きマスクを予測する軽量でポリシーに依存しないモジュールであるArtificial Foveated Perception (AFP)を提案する。
我々はこれらのマスクを、主に微調整中の補助接地信号として使用し、中核構造をそのまま残しながら、ポリシーの注意をタスク関連領域と整合させる。
微調整後、ポリシーは制御ループにAFPを必要とせずに、元の観測ストリーム上で実行される。
現状のロボット基礎モデルにまたがるAFPを評価し, ファベレーテッド認知が微調整時間を短縮し, 過度な適合を抑制し, 環境摂動下での一般化を改善することを示す。
マスクの品質とグラウンディング・ロスデザインに対する非難は、これらの利益が、政策学習をタスク関連視覚的証拠に向けることによってもたらされることを示している。
これらの結果は,ロボット基礎モデルをより堅牢で,データ効率が高く,スケーラブルにするための実践的なメカニズムであることを示唆している。
関連論文リスト
- AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding [55.535374902204296]
AffordanceVLAは、タスク指向の中間表現として構造化された価格予測を導入する統一フレームワークである。
AffordanceVLAは様々な操作シナリオで高いパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2026-06-04T13:28:51Z) - PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations [66.94988600664574]
我々は,目標達成型強化学習を通じて事前学習を再構築するVLA基盤モデルであるtextbfPRTS(textbfPrimitive textbfReasoning and textbfTasking textbfSystem)を提案する。
論文 参考訳(メタデータ) (2026-04-30T06:14:02Z) - Gaze-Regularized Vision-Language-Action Models for Robotic Manipulation [7.281396624646809]
本稿では、VLAモデルの内部の注意を人間の視覚パターンと一致させる、視線規則化されたトレーニングフレームワークを提案する。
既存のVLAアーキテクチャに組み込むと、ベンチマークによって4-12%の改善が得られます。
論文 参考訳(メタデータ) (2026-03-24T13:50:28Z) - Closed-Loop Verbal Reinforcement Learning for Task-Level Robotic Planning [1.6641413441634143]
本稿では,モバイルロボットシステムにおけるタスクレベル計画の解釈のための新しい言語強化学習フレームワークを提案する。
このフレームワークはクローズドループアーキテクチャに従い、物理的環境との相互作用を通じて反復的なポリシー改善を可能にする。
提案手法は,実行不確実性下で複数段操作およびナビゲーションタスクを行う実移動ロボット上で検証される。
論文 参考訳(メタデータ) (2026-03-23T16:28:36Z) - ICLR: In-Context Imitation Learning with Visual Reasoning [7.622880558476133]
インコンテキストの模倣学習により、ロボットは追加の訓練をすることなく、少数のデモから新しいタスクに適応できる。
In-Context Imitation Learning with Visual Reasoning (ICLR) は、視覚的推論トレースを構造化したデモプロンプトを強化する新しいフレームワークである。
論文 参考訳(メタデータ) (2026-03-08T08:40:05Z) - Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models [7.802379200026965]
認識状態の複雑さに基づいてVLA実行を動的にルーティングする適応型フレームワークを提案する。
我々のアプローチは、VLAの視覚言語バックボーンを、パラメトリックおよび非パラメトリック推定器のアンサンブルに潜伏埋め込みを投影することにより、アクティブな検出ツールに変換する。
論文 参考訳(メタデータ) (2026-03-05T13:14:41Z) - I-Perceive: A Foundation Model for Active Perception with Language Instructions [41.67607728608853]
I-Perceiveは,自然言語命令に基づく能動的知覚の基礎モデルである。
I-Perceiveは、画像ベースのシーンコンテキストに基づいて、オープンな言語命令に従うカメラビューを予測する。
実験により、I-Perceiveは、生成したカメラビューの予測精度とインストラクションの両方において、最先端のVLMを大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-28T11:38:56Z) - Exploring Conditions for Diffusion models in Robotic Control [70.27711404291573]
我々は,ロボット制御のためのタスク適応型視覚表現を得るために,事前学習したテキスト・画像拡散モデルを活用することを検討する。
テキスト条件をナビゲート的に適用すると、制御タスクにおいて最小あるいは負の利得が得られることがわかった。
本稿では,制御環境に適応する学習可能なタスクプロンプトと,細粒度でフレーム固有の細部をキャプチャする視覚プロンプトを提案する。
論文 参考訳(メタデータ) (2025-10-17T10:24:14Z) - Executable Analytic Concepts as the Missing Link Between VLM Insight and Precise Manipulation [70.8381970762877]
VLM(Vision-Language Models)は、セマンティック推論とタスク計画において顕著な能力を示す。
本稿では,VLMに基づく推論を実行可能な解析概念を通じて基礎づける新しいフレームワークであるGRACEを紹介する。
G GRACEは高レベル命令理解と低レベルロボット制御の統一的で解釈可能なインターフェースを提供する。
論文 参考訳(メタデータ) (2025-10-09T09:08:33Z) - Transferring Foundation Models for Generalizable Robotic Manipulation [82.12754319808197]
インターネット規模の基盤モデルによって生成された言語推論セグメンテーションマスクを効果的に活用する新しいパラダイムを提案する。
提案手法は,オブジェクトのポーズを効果的かつ堅牢に知覚し,サンプル効率のよい一般化学習を可能にする。
デモは提出されたビデオで見ることができ、より包括的なデモはlink1またはlink2で見ることができます。
論文 参考訳(メタデータ) (2023-06-09T07:22:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。