論文の概要: Memory for Attention: Language-Conditioned Re-Perception with a Vision--Language--Motion Map
- arxiv url: http://arxiv.org/abs/2607.23797v1
- Date: Sun, 26 Jul 2026 18:49:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.22892
- Title: Memory for Attention: Language-Conditioned Re-Perception with a Vision--Language--Motion Map
- Title(参考訳): 注意のための記憶:ビジョン付き言語記述型再認識-言語-移動マップ
- Abstract要約: 永続的で行動アノテートされたマップを持つロボットは、2つの計画的な疑問に直面し、その記憶は1つの問題にしか答えない。
永続的なマップのメモリは、メモリレスVLMが貧弱であるのに対して、オラクルにマッチする最適なスケジュール(保留)が得られることを示す。
地図は、ロボットに部屋を歩き回る方法を教えるのではなく、何に注意を払うべきかを伝えることで、注意を引く。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A robot carrying a persistent, behavior-annotated map faces two planning questions, and its memory answers only one well. The \emph{spatial-navigation} question -- how to walk around a room -- we address first and report a negative: building on Vision--Language--Motion Maps (VLMM), a behavior-aware planner cost cuts a planning-time objective by $\sim$35\% over 28 AI2-THOR scenes, but under closed-loop execution the real benefit nearly vanishes ($\sim$4\%) and an on-demand vision--language model (VLM) does as well. The \emph{resource-allocation} question differs: under a limited perception budget, what should the robot re-observe now to keep its map fresh? Framing re-perception as this attention decision, we show a persistent map's memory (change-history, or even just recency of last sighting) yields the best schedule (held-out), matching an oracle, while the memoryless VLM prior is poor. Because the schedule reallocates budget toward what matters, memory's benefit concentrates on the important objects ($\sim$1.6$\times$ the mean), and a downstream fetch task confirms fewer wasted trips; the gain grows with per-instance heterogeneity exactly as a Cauchy--Schwarz bound predicts -- it equals $\mathrm{Var}(\sqrtλ)$, the variance of root-volatility. With a real CLIP prior on rendered objects the advantage is $+21$--$26\%$. The map's distinctive value appears when the task is \emph{language-conditioned}: told what to track, VLMM grounds the relevant objects (open-vocabulary) and tracks their change (memory), beating even a strong relevance-weighted recency baseline ($+2.5\%$) -- so its motion channel adds value beyond a last-seen timestamp -- and an on-demand VLM ($+8.9\%$); neither language nor dynamics alone suffices. The map earns its keep not by telling the robot how to walk around a room, but by telling it what to pay attention to.
- Abstract(参考訳): 永続的で行動アノテートされたマップを持つロボットは、2つの計画的な疑問に直面し、その記憶は1つの問題にしか答えない。
Vision-Language--Motion Maps(VLMM)を構築 行動認識プランナーのコストは、28のAI2-THORシーンで$\sim$35\%削減するが、クローズドループ実行では、実際のメリットはほぼ消滅する($\sim$4\%)し、オンデマンドのビジョン言語モデル(VLM)もそうである。
限られた認識予算の下で、ロボットはマップを新しく保つために、今何を再観測すべきなのか?
この注意決定として再認識を断ち切ることで、永続的なマップのメモリ(変更履歴、あるいは最後の目撃のリレー)が最適なスケジュール(保留)となり、オラクルと一致し、メモリレスVLM前のVLMは貧弱であることを示す。
スケジュールが重要なものに向かって予算を割り当てるため、メモリの利点は重要なオブジェクト(\sim$1.6$\times$ the mean)に集中し、ダウンストリームフェッチタスクは無駄なトリップを減らす。
実際のCLIPがレンダリングされたオブジェクトに先立つ場合、利点は$+21$--$26\%$である。
VLMMは関連するオブジェクト(オープンボキャブラリ)を接地し、それらの変更(メモリ)を追跡し、強い関連性を持つリレーレンシベースライン(+2.5\%$)を打破するので、そのモーションチャネルは、最終表示のタイムスタンプを越えて、オンデマンドのVLM(+8.9\%$)を付加する。
地図は、ロボットに部屋を歩き回る方法を教えるのではなく、何に注意を払わせるべきかを伝えることで、注意を喚起する。
関連論文リスト
- Linguistic Trajectory Encoding for Efficient Long-Horizon Spatial Memory in Embodied Agents [24.05637675858576]
長期タスクを実行するエージェントは、動的オブジェクトの状態遷移が自然言語でクエリ可能なままであるメモリ表現を必要とする。
主な貢献は textbfLinguistic Trajectory Linguistic Trajectory (LTE) である。
LTEは、自然言語の記述、スパース空間アンカー、視覚アンカーを組み合わせたハイブリッド表現を通じて、動的オブジェクトの動き履歴を圧縮する。
LTEはトラジェクトリ圧縮を8.7タイムから26.1タイムで達成し、24,hビデオで秒以下のクエリレイテンシを実現する。
論文 参考訳(メタデータ) (2026-09-04T07:00:48Z) - GaussMemory: Task-Driven 3D Gaussian Scene Memory for Long-Horizon Robotic Manipulation [10.233658861023612]
長距離ロボット操作は永続的な空間記憶に依存している。
既存の3Dメモリシステムは、固定された手作りのルールを使用して観測を記憶する。
本稿では、パッシブストレージからアクティブなタスク駆動空間記憶へのパラダイムシフトを提案する。
論文 参考訳(メタデータ) (2026-08-15T02:28:59Z) - Maglev: Sliding Recurrent Memory [8.788753986099902]
我々のアーキテクチャは、スライディングウインドウの注意を一般化する固定サイズのメモリを備えたリカレントトランスフォーマーアーキテクチャである。
私たちは、$m_t$と$m'_t$を一致させるメモリ一貫性の損失でトレーニングします。
論文 参考訳(メタデータ) (2026-08-03T20:40:49Z) - Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos [62.42252327381627]
言語誘導型空中認識は、複雑な無人航空機(UAV)のシーンにおいて、ユーザ特定された小さなターゲットを理解することを目的としている。
実際のUAV配備では、UAVは飛行中に応答しなければならないため、そのような認識はオンラインストリーミング形式で実行され、フレームが順次到着し、モデルが将来のフレームにアクセスせずに相互に応答する。
データとメソッドの両方の観点から、小さなオブジェクトとストリーミングの課題に対処します。
論文 参考訳(メタデータ) (2026-07-22T07:45:50Z) - Towards a Dynamic and Fixed-budget Memory Bank for Efficient Streaming Video Understanding [56.17043150838547]
CausalMemは動的ビジュアルメモリ更新機構の構築に特化している。
視覚トークンの冗長性を推定し、オンラインセマンティックベースでメモリバンクを更新する。
textbf20$times$ visual token compression ratioを達成し、textbf82 MBストレージのみを占有する。
論文 参考訳(メタデータ) (2026-06-24T10:11:08Z) - EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies [68.812675280427]
EventVLAは、疎視的エビデンスメモリの概念に基づいて開発されたエンドツーエンドフレームワークである。
KEMは、VLAの潜伏した埋め込みから将来の確率を直接予測し、スパースでタスククリティカルな視覚イベントを自律的にキャプチャして保存する。
対話型視覚的エビデンスで非マルコフ操作タスクを評価するための診断ベンチマークであるRoboTwin-MeMを提案する。
論文 参考訳(メタデータ) (2026-06-18T11:11:37Z) - EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation [81.54723508469617]
EvoMemNavは、ゼロショットエンボディナビゲーションのための効率的で自己進化的できめ細かいメモリフレームワークである。
VSMGraphは、セマンティックキューとトポロジ的関係を持つビューをルームビューオブジェクト階層に整理する。
GOAT-BenchとHM3Dのオブジェクト、テキスト記述、画像ゴールのモダリティによる実験は、SR/SPLにおいて一貫した利得を示している。
論文 参考訳(メタデータ) (2026-06-02T11:27:44Z) - A Survey of Spatial Memory Representations for Efficient Robot Navigation [4.560386676154887]
52のシステムにまたがる88の参照の空間記憶効率の問題を調査した。
M_textpeak / M_textmap$は、ピーク時メモリ(操作中に消費される全RAMまたはGPUメモリ)と保存されたマップサイズとの比率である。
論文 参考訳(メタデータ) (2026-04-13T02:12:17Z) - Memory Over Maps: 3D Object Localization Without Reconstruction [44.29345996003297]
ターゲットローカライゼーションは、ナビゲーションや操作といった具体的タスクの前提条件である。
視覚言語モデルの最近の進歩は、リッチなセマンティック推論を2次元観察で直接実行できることを示唆している。
シーンのグローバルな3次元表現を構築することなく,RGB-Dのみを軽量なヴィジュアルメモリとして格納するマップフリーパイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-20T21:57:51Z) - Vision-Language Memory for Spatial Reasoning [4.486751990718678]
VLM$2$は空間推論のための永続記憶を持つ視覚言語モデルである。
VLM$2$は、ビデオのみのモデル間で最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-11-25T18:59:02Z) - LoCUS: Learning Multiscale 3D-consistent Features from Posed Images [18.648772607057175]
我々は、監督なしに多目的な神経表現を訓練する。
検索セットを慎重に構築することで、検索と再利用のバランスをとることができる。
スパース,マルチスケール,セマンティック空間マップの作成結果を示す。
論文 参考訳(メタデータ) (2023-10-02T11:11:23Z) - Episodic Memory Question Answering [55.83870351196461]
我々は、人間がAIエージェントと対話し、質問することで拡張現実デバイスを駆動するシナリオを思い描いている。
成功するためには、エゴAIアシスタントはセマンティックにリッチで効率的なシーン記憶を構築する必要がある。
EMQA(Episodic Memory Question Answering)という新しいタスクを紹介します。
私たちが選択したエピソードシーンメモリは、非常に競争力のあるベースラインのホストであると同時に、そのタスクに対して、単純でオフザセンシティブなソリューションよりも優れています。
論文 参考訳(メタデータ) (2022-05-03T17:28:43Z) - ABC: Attention with Bounded-memory Control [67.40631793251997]
我々は,有界メモリ制御 (ABC) を1つの抽象概念,すなわち有界メモリ制御 (ABC) に仮定できることを示した。
ABCが新たな可能性を明らかにしました。まずは、他の方法では見分けがつかないような、効率的なアテンションのバリエーションを接続します。
最後に,既存のABCアプローチからインスピレーションを得たABCの新しい事例を紹介する。
論文 参考訳(メタデータ) (2021-10-06T03:53:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。