論文の概要: Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models
- arxiv url: http://arxiv.org/abs/2608.02197v1
- Date: Mon, 03 Aug 2026 13:18:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.576662
- Title: Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models
- Title(参考訳): 視覚・言語・行動モデルにおける適応的視覚再構成
- Abstract要約: 視覚エンコーダは、以前に汎用的な視覚変換器で記録された注目成果物を示す。
本稿では,学習可能なレジスタトークンをビジュアルエンコーダに挿入するフレームワークであるAtVLAを紹介する。
- 参考スコア(独自算出の注目度): 9.514456645829966
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual representations of VLA models remain unreliable for spatially precise robotic manipulation. We uncover that vision encoders in VLAs also exhibit attention artifacts previously documented in generic Vision Transformers, and further show that, in embodied policies, these artifacts are closely associated with spatial perception capabilities acquired during post-training. As the encoder learns task-relevant information such as object location, depth ordering, and local geometry, limited global-token capacity causes part of this information to spill into low-information patch tokens. We introduce AtVLA, a framework that inserts learnable register tokens into the visual encoder. Trained end-to-end using only embodied data and the original action objective, these registers emerge as dedicated carriers of embodied spatial information, while the remaining patch tokens recover clean and spatially faithful attention distributions crucial for precise target localization and fine-grained contact. Clean attention restores reliable localization, but cannot recover geometric details lost in low-resolution observations. AtVLA therefore couples attention rectification with uncertainty-gated local refinement. The action expert samples multiple action chunks and estimates uncertainty from their disagreement; only for uncertain predictions, action-conditioned attention rollout identifies the task-relevant region, which is cropped, re-encoded at high resolution, and appended to the cached prefix for refined action generation. Across LIBERO, SimplerEnv, and a challenging single-view real-world benchmark, AtVLA improves the average LIBERO success rate from 94.2% to 98.4% and real-world success from 46.5% to 69.0%. The cropping is triggered on approximately 30% of replanning steps, resulting in only 1.4-1.6x the total computation of the base model under the representative deployment setting.
- Abstract(参考訳): VLAモデルの視覚表現は、空間的に正確なロボット操作には信頼できないままである。
VLAの視覚エンコーダは、以前に汎用的な視覚変換器で記録された注意要素も示しており、さらに、具体的ポリシーでは、これらのアーティファクトがポストトレーニング中に取得した空間知覚能力と密接に関連していることを示す。
エンコーダは、オブジェクト位置、深度順序、局所幾何学などのタスク関連情報を学ぶため、この情報の一部が低情報パッチトークンに流出する。
本稿では,学習可能なレジスタトークンをビジュアルエンコーダに挿入するフレームワークであるAtVLAを紹介する。
エンボディドデータと元のアクション目標のみを用いて訓練されたエンド・ツー・エンドにおいて、これらのレジスタはエンボディド空間情報の専用キャリアとして出現し、残りのパッチトークンは、正確なターゲット位置決めときめ細かい接触に不可欠な、クリーンで空間的に忠実な注意分布を回復する。
クリーンアテンションは信頼性の高いローカライゼーションを復元するが、低解像度の観測で失われた幾何学的詳細を回復することはできない。
したがって、AtVLAは、不確実な局所的な改善と注意の是正を両立させる。
アクションエキスパートは、複数のアクションチャンクをサンプリングし、不一致から不確かさを推定する。不確実な予測のためのみ、アクション条件付きアテンションロールアウトは、クロップされ、高解像度で再エンコードされ、キャッシュされたプレフィックスに付加されたタスク関連領域を特定する。
LIBERO(英語版)、SimplerEnv(英語版)、および挑戦的なシングルビュー実世界のベンチマークにおいて、AtVLAは平均LIBERO成功率を94.2%から98.4%に改善し、実世界の成功率は46.5%から69.0%に改善した。
トリッピングは、約30%の計画手順でトリミングされ、結果として、典型的な配置設定の下でのベースモデルの総計算の1.4-1.6倍にしかならない。
関連論文リスト
- From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs [50.185593677108436]
マルチモーダル大言語モデル(MLLM)は、ピクセルレベルの視覚タスクにますます適用されているが、空間的理解の本質的な能力は理解されていない。
本稿では,MLLMパイプライン全体(ビジョンエンコーダ,アダプタ,LSM)の階層的線形探索によるセグメント化能力について検討する。
論文 参考訳(メタデータ) (2026-03-18T00:22:15Z) - Informative Object-centric Next Best View for Object-aware 3D Gaussian Splatting in Cluttered Scenes [7.75982375074512]
我々は、オブジェクトの特徴を活用して未探索領域を優先する、インスタンス対応Next Best View(NBV)ポリシーを導入する。
具体的には、オブジェクト認識3DGSは、信頼度重み付け情報ゲインを計算するために使用される1ホットオブジェクトベクターにインスタンスレベル情報を蒸留する。
実験により、NBVポリシーは、合成データセットで77.14%、現実世界のGraspNetデータセットで34.10%まで深さ誤差を減少させることが示された。
論文 参考訳(メタデータ) (2026-02-09T04:50:36Z) - Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning [82.39668822222386]
ビジョントークンプルーニングは、効率的なビジョン言語モデル(VLM)のための効果的なアクセラレーション手法であることが証明された。
空間的整合性を維持しつつ,効率的な特徴集約を実現するための2段階のトークンプルーニングフレームワークである$textNwa$を提案する。
実験によると、textNwa$は複数のVQAベンチマーク(94%から95%)でSOTAのパフォーマンスを達成し、視覚的グラウンドタスク(7%から47%)を大幅に改善している。
論文 参考訳(メタデータ) (2026-02-03T00:51:03Z) - VVLoc: Prior-free 3-DoF Vehicle Visual Localization [6.151313455860856]
マルチカメラシステムを用いたトポロジカルおよび計量車両のローカライゼーションを同時に達成するために,単一ニューラルネットワークを用いた統一パイプラインを提案する。
VVLocはまず、視覚的観察間の地理的近さを評価し、マッチング戦略を用いて相対的な距離ポーズを推定すると同時に、信頼度も提供する。
VVLocの評価は、公開されているデータセットだけでなく、より困難な自己コンパイルデータセット上でも行います。
論文 参考訳(メタデータ) (2026-01-31T16:37:30Z) - Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection [50.343419243749054]
異常検出は、医学診断や工業的欠陥検出などの分野において重要である。
CLIPの粗粒化画像テキストアライメントは、微粒化異常に対する局所化と検出性能を制限する。
クレーンは最先端のZSADを2%から28%に改善し、画像レベルとピクセルレベルの両方で、推論速度では競争力を維持している。
論文 参考訳(メタデータ) (2025-04-15T10:42:25Z) - Recognize Any Regions [55.76437190434433]
RegionSpotは、ローカライゼーション基盤モデルから位置認識ローカライゼーション知識と、ViLモデルからのセマンティック情報を統合する。
オープンワールドオブジェクト認識の実験では、私たちのRereaSpotは、以前の代替よりも大きなパフォーマンス向上を実現しています。
論文 参考訳(メタデータ) (2023-11-02T16:31:49Z) - Spatial-Aware Token for Weakly Supervised Object Localization [137.0570026552845]
タスク固有の空間認識トークンを,弱教師付き方式で条件定位に提案する。
実験の結果、SATはCUB-200とImageNetの両方で、98.45%と73.13%のGT-known Locで最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2023-03-18T15:38:17Z) - Conditioning Covert Geo-Location (CGL) Detection on Semantic Class
Information [5.660207256468971]
サハらによってCCGL(Covert Geo-Location)検出と呼ばれる潜在的な隠蔽物を特定するタスクが提案された。
セマンティッククラス情報を利用する試みは行われなかった。
本稿では,2つの目標を達成するためのマルチタスク学習に基づくアプローチを提案する。i) 意味クラス情報を持つ特徴の抽出;i) 共通エンコーダの堅牢なトレーニング。
論文 参考訳(メタデータ) (2022-11-27T07:21:59Z) - GliTr: Glimpse Transformers with Spatiotemporal Consistency for Online
Action Prediction [26.184988507662535]
多くのオンライン行動予測モデルは、完全なフレームを観察し、スニースと呼ばれるフレーム内の情報的サブリージョンを特定し、参加する。
本稿では,Glimpse Transformers (GliTr) を開発した。
論文 参考訳(メタデータ) (2022-10-24T21:10:34Z) - Adaptive Local-Component-aware Graph Convolutional Network for One-shot
Skeleton-based Action Recognition [54.23513799338309]
骨格に基づく行動認識のための適応的局所成分認識グラフ畳み込みネットワークを提案する。
我々の手法はグローバルな埋め込みよりも強力な表現を提供し、我々のモデルが最先端に到達するのに役立ちます。
論文 参考訳(メタデータ) (2022-09-21T02:33:07Z) - Rethinking Query-Key Pairwise Interactions in Vision Transformers [5.141895475956681]
本稿では,問合せキーの対の相互作用を排除し,注意重みを求めるために計算効率の高い相性ゲートを用いるキーオンリーの注意を提案する。
我々は、ImageNet分類ベンチマークのパラメータ限定設定において、最先端の精度に達する新しい自己注意モデルファミリーLinGlosを開発した。
論文 参考訳(メタデータ) (2022-07-01T03:36:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。