論文の概要: Spatial Attention: Adapting Execution Horizons for Diffusion Policies via Observation Sensitivity
- arxiv url: http://arxiv.org/abs/2607.04739v1
- Date: Mon, 06 Jul 2026 07:22:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.069803
- Title: Spatial Attention: Adapting Execution Horizons for Diffusion Policies via Observation Sensitivity
- Title(参考訳): 空間的注意:観察感度による拡散反応に対する実行ホライズン適応
- Abstract要約: サンプル化された動作チャンクの実行地平線を適応的に調整し、応答性と計算効率のバランスをとる。
チャンクサンプリングの固定予算の下では,乱れによる累積可能性低下を最小化する実行地平線が空間的注意の増大とともに減少することを示す。
- 参考スコア(独自算出の注目度): 26.591374083905336
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sampling action chunks via generative models has become a widely adopted methodology for robotic learning from demonstration. However, existing methods often struggle to balance responsiveness and computational cost because they execute each action chunk for a fixed execution horizon. In this paper, we adaptively adjust the execution horizon of sampled action chunks, balancing responsiveness and computational efficiency. We introduce Spatial Attention -- defined as the expected squared norm of the gradient of the action log-likelihood with respect to the observation -- which indicates the sensitivity of the policy's action distribution to variations in the observation. We show that, under a fixed budget of chunk samplings, the execution horizon that minimizes the cumulative likelihood drop induced by disturbances decreases as Spatial Attention increases. By forecasting future Spatial Attention values alongside the action chunk, our framework dynamically assigns shorter execution horizons to phases with high Spatial Attention, and longer horizons to phases with low Spatial Attention. Experiments on standard and perturbed tasks, in both simulation and on a real robot, show that our method significantly improves success rates over fixed-horizon baselines while maintaining the average execution horizon.
- Abstract(参考訳): 生成モデルによるアクションチャンクのサンプリングは、デモからロボット学習の方法論として広く採用されている。
しかしながら、既存の手法は、各アクションチャンクを固定された実行地平線で実行するため、応答性と計算コストのバランスをとるのに苦労することが多い。
本稿では,サンプルアクションチャンクの実行地平線を適応的に調整し,応答性と計算効率のバランスをとる。
本稿では,アクションログの勾配の2乗ノルムとして定義されている空間的注意(Spatial Attention)を導入する。
チャンクサンプリングの固定予算の下では,乱れによる累積可能性低下を最小化する実行地平線が空間的注意の増大とともに減少することを示す。
動作チャンクと共に将来の空間的注意値を予測することにより、我々のフレームワークは、より短い実行地平線を高い空間的意識の位相に動的に割り当て、より長い空間的意識の位相に割り当てる。
シミュレーションと実ロボットの両方において、標準タスクと摂動タスクの実験により、平均実行地平線を維持しながら、固定水平ベースラインにおける成功率を大幅に向上することを示す。
関連論文リスト
- Knowing When to Stop: Adaptive Action Chunking via Internal Cross-Attention Dynamics in VLAs [4.792917095787488]
アクションチャンキングは、現代のVision-Language-Action(VLA)フレームワークにおける標準的な実行戦略である。
短いチャンクは頻繁な推論を必要とするが、長いチャンクは新しく観測された状態と不一致となることがある。
我々は,この制限を,アクションエキスパートの内部的クロスアテンションダイナミクスに基づく適応的アクションチャンキングアプローチで解決する。
論文 参考訳(メタデータ) (2026-09-01T08:38:16Z) - SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation [65.81476183180527]
両パラダイムの長所を統合するクローズドループビズモータポリシであるSegDiffを紹介する。
SegDiffはデモをキーセグメンテーション間で動作セグメントに分解し、現在の状態から次のキーセグメンテーションまでの連続的な軌跡を予測することを学習する。
SegDiffは、さまざまなシミュレートされた実世界のシナリオにおいて、既存のアプローチよりも大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-07-13T02:48:03Z) - Dynamic Execution Horizon Prediction for Chunk-based Robot Policies [29.482987292744568]
アクションチャンキングは、ポリシーが一連のアクションを予測し、一度にひとつのステップを実行するのではなく、一定数のアクションを実行する、現代のロボットポリシーの標準設計となっている。
実際には、実行の地平線は通常経験的なチューニングによって選ばれ、タスク依存度が高い。
オンライン強化学習を用いて,軽量な実行-水平予測分岐を訓練する有効な手法である動的実行-水平予測(DEHP)を提案する。
論文 参考訳(メタデータ) (2026-06-09T19:58:31Z) - SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation [71.91583446135651]
SAFE-Prunerはプラグアンドプレイのプルーニングフレームワークで、将来のレイヤーの注意手順をプルーニング決定に組み込む。
本手法は成功率を1.7%以下に抑えながら最大1.89倍の高速化を実現し,最先端の手法を最大1.9%向上させることを示した。
論文 参考訳(メタデータ) (2026-05-28T09:23:08Z) - MSACT: Multistage Spatial Alignment for Stable Low-Latency Fine Manipulation [4.439585594082787]
実世界の微視的操作、特に双方向操作では、低レイテンシ制御と安定した視覚的位置決めが必要となる。
ACTのようなアクションチャンキングポリシーは、低レイテンシの実行とデータ効率を可能にするが、空間的一貫性を明示することなく、密集した視覚的特徴に依存している。
安定な2次元アテンションポイントを抽出し,時間的アライメントロスを伴う将来のアテンションシーケンスを共同で予測する多段階空間アテンションモジュールを提案する。
論文 参考訳(メタデータ) (2026-05-01T07:35:15Z) - ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation [57.07494675832939]
ロボット操作のための既存の視覚言語アクション(VLA)モデルは、進歩意識を欠いている。
本研究では,textbf vla という新しいモデルを提案し,タスク進捗の推定と統合について検討する。
CALVINとLIBEROベンチマークの実験は、実世界のロボットの展開とともに、成功率の大幅な改善を一貫して示している。
論文 参考訳(メタデータ) (2026-03-29T12:38:11Z) - SutureAgent: Learning Surgical Trajectories via Goal-conditioned Offline RL in Pixel Space [22.300952176139948]
内視鏡的ビデオからの針の軌跡の予測はロボットによる縫合に不可欠である。
画像に基づく針軌道予測を逐次決定問題として定式化する。
SutureAgentは、観測エンコーダを使用して可変長クリップを符号化し、局所的な空間的キューと長距離時間ダイナミクスの両方をキャプチャする。
論文 参考訳(メタデータ) (2026-03-19T01:36:07Z) - VLA Knows Its Limits [27.43938890325202]
実行地平線の変化は、大幅なパフォーマンスの逸脱につながることを示す。
本稿では,予測された各アクションチャンクの実行地平線を動的に推定する最初のテスト時間手法であるAutoHorizonを提案する。
論文 参考訳(メタデータ) (2026-02-24T23:48:48Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - Continual Low-Rank Scaled Dot-product Attention [67.11704350478475]
我々は,連続的推論に適したNystr"om近似に基づくスケールド・プロダクツ・アテンションの新しい定式化を導入する。
オンライン音声分類およびオンライン行動検出タスクの実験において、提案した連続的スケールド・プロダクト・アテンションは、最大3桁の操作数を削減できる。
論文 参考訳(メタデータ) (2024-12-04T11:05:01Z) - Dynamic Obstacle Avoidance through Uncertainty-Based Adaptive Planning with Diffusion [40.76697924496143]
本稿では,行動予測の不確実性に基づいた適応的生成計画手法を提案する。
本手法は, 衝突回避性能を維持しつつ, 頻繁で計算コストが高く, 冗長な再計画の必要性を最小限に抑える。
論文 参考訳(メタデータ) (2024-09-25T14:03:58Z) - Layout Sequence Prediction From Noisy Mobile Modality [53.49649231056857]
軌道予測は、自律運転やロボット工学などの応用における歩行者運動を理解する上で重要な役割を担っている。
現在の軌道予測モデルは、視覚的モダリティからの長い、完全な、正確に観察されたシーケンスに依存する。
本稿では,物体の障害物や視界外を,完全に視認できる軌跡を持つものと同等に扱う新しいアプローチであるLTrajDiffを提案する。
論文 参考訳(メタデータ) (2023-10-09T20:32:49Z) - Adaptive Perturbation for Adversarial Attack [50.77612889697216]
そこで本研究では,新たな逆例に対する勾配に基づく攻撃手法を提案する。
逆方向の摂動を発生させるために,スケーリング係数を用いた正確な勾配方向を用いる。
本手法は, 高い伝達性を示し, 最先端の手法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2021-11-27T07:57:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。