論文の概要: MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation
- arxiv url: http://arxiv.org/abs/2607.23504v1
- Date: Sun, 26 Jul 2026 07:08:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.133993
- Title: MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation
- Title(参考訳): MemVLN:視覚・言語ナビゲーションのための韻律的・手続き的記憶
- Abstract要約: リアルタイム推論効率(14 FPS)で最先端性能を実現する新しいVLNフレームワークを提案する。
MemVLNは、視覚エンコーダを使用して連続観察を処理し、LLM(Large Language Model)を使用して命令を解釈し、アクションを生成する。
VLN-CEの実験では、MemVLN-4BはベースラインのQwen3-VL-4Bアーキテクチャを5.8%のSRでR2R、9.7%のSRで上回り、推論遅延の7$times$スピードアップを達成した。
- 参考スコア(独自算出の注目度): 68.89913903899101
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Vision-and-Language Navigation in Continuous Environments (VLN-CE) requires agents to maintain long-horizon visual history for trajectory consistency while executing actions with low latency. Existing video-based VLN approaches typically struggle to satisfy both demands simultaneously. To address these challenges, we propose MemVLN, a novel VLN framework that achieves state-of-the-art performance with real-time inference efficiency (14 FPS). MemVLN utilizes a visual encoder to process continuous observations and a Large Language Model (LLM) to interpret instructions and generate actions. Central to our approach is an Episodic Memory management that applies pyramidal resolutions. This mechanism concentrates computation on immediate percepts while retaining compressed long-term history. Complementing to this design, we introduce Procedural Memory for fast action with a compact vocabulary of atomic mid-level actions to bypass auto-regressive decoding latency. Experiments on VLN-CE show that MemVLN-4B surpasses the baseline Qwen3-VL-4B architecture by 5.8\% SR in R2R and 9.7\% SR in RxR, while achieving a 7$\times$ speedup in inference latency.
- Abstract(参考訳): VLN-CE(Vision-and-Language Navigation in Continuous Environments)は、エージェントが低レイテンシでアクションを実行しながら、軌道の整合性のために長い水平視履歴を維持する必要がある。
既存のビデオベースのVLNアプローチは、通常、両方の要求を同時に満たすのに苦労する。
これらの課題に対処するために,リアルタイム推論効率(14 FPS)で最先端性能を実現する新しいVLNフレームワークであるMemVLNを提案する。
MemVLNは、視覚エンコーダを使用して連続観察を処理し、LLM(Large Language Model)を使用して命令を解釈し、アクションを生成する。
私たちのアプローチの中心は、ピラミッド分解能を適用したエピソードメモリ管理です。
このメカニズムは、圧縮された長期履歴を保持しながら、即時パーセプションに計算を集中させる。
この設計を補完し、自動回帰復号遅延を回避するために、アトミックな中間レベルアクションの語彙のコンパクトな高速動作のためのプロシージャメモリを導入する。
VLN-CEの実験では、MemVLN-4BはベースラインのQwen3-VL-4BアーキテクチャをR2Rで5.8\% SR、RxRで9.7\% SR、推論遅延で7$\times$スピードアップを達成した。
関連論文リスト
- EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies [68.812675280427]
EventVLAは、疎視的エビデンスメモリの概念に基づいて開発されたエンドツーエンドフレームワークである。
KEMは、VLAの潜伏した埋め込みから将来の確率を直接予測し、スパースでタスククリティカルな視覚イベントを自律的にキャプチャして保存する。
対話型視覚的エビデンスで非マルコフ操作タスクを評価するための診断ベンチマークであるRoboTwin-MeMを提案する。
論文 参考訳(メタデータ) (2026-06-18T11:11:37Z) - Fast SAM2 with Text-Driven Token Pruning [52.8350457627401]
Segment Anything Model 2 (SAM2) では、視覚計算モデルがプロンプト駆動のビデオオブジェクトセグメンテーションにおいて大幅に進歩している。
SAM2パイプラインは、イメージエンコーダが生成するすべての視覚トークンを、ターゲットオブジェクトとの関係にかかわらず、下流の時間的推論モジュールを通じて伝達する。
本稿では,時間的伝播に先立ってトークン密度を選択的に低減し,推論効率を向上させるためのテキスト誘導型トークンプルーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-24T18:59:05Z) - InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models [49.08289742711585]
我々は、Gated DeltaNetとSWA(Slide window attention)を相乗化する線形複雑VLMアーキテクチャであるInfiniteVLを提案する。
InfiniteVLは、一定のレイテンシとメモリフットプリントを維持しながら、3.6時間以上の推論高速化を実現する。
ストリーミングビデオ理解のシナリオでは、長期メモリキャッシュを保持しながら、24FPSのリアルタイムプリフィル速度を安定的に維持する。
論文 参考訳(メタデータ) (2025-12-09T17:18:32Z) - SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference [49.84148668264725]
SparseVILAは効率的なVLM推論のための新しいパラダイムであり、前処理と復号の段階で視覚空間を疎結合する。
AWQ最適化推論パイプライン上に構築されたSparseVILAは、プリフィルの最大4.0倍、デコーディングの2.5倍、長文ビデオタスクの2.6倍のエンドツーエンド高速化を実現している。
論文 参考訳(メタデータ) (2025-10-20T17:35:47Z) - StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling [27.468345201477504]
実世界の環境におけるVLN(Vision-and-Language Navigation)では、エージェントが連続的なビジュアルストリームを処理し、言語命令に基礎を置く低レイテンシでアクションを生成する必要がある。
本稿では,ストリームVLNフレームワークについて紹介する。ストリームVLNは,マルチモーダル推論をサポートするために,低速コンテキストモデリングをハイブリッドで実現する。
VLN-CEベンチマークの実験では、最先端のパフォーマンスが安定した低レイテンシで、現実のデプロイメントにおける堅牢性と効率が保証されている。
論文 参考訳(メタデータ) (2025-07-07T17:49:41Z) - Mem4Nav: Boosting Vision-and-Language Navigation in Urban Environments with a Hierarchical Spatial-Cognition Long-Short Memory System [9.687946545604492]
大規模都市環境における視覚・言語ナビゲーション (VLN) は、複雑な場面で言語指導を行うための具体的エージェントを必要とする。
階層型空間認識長短メモリシステムである textbfMem4Nav を導入し,任意のVLNバックボーンを拡張できる。
論文 参考訳(メタデータ) (2025-06-24T09:00:43Z) - Multimodal Transformer with Variable-length Memory for
Vision-and-Language Navigation [79.1669476932147]
VLN(Vision-and-Language Navigation)は、エージェントが目標位置に向かうために言語命令に従う必要があるタスクである。
近年のTransformer-based VLN法は,視覚的観察と言語指導の直接的な結びつきから大きな進歩を遂げている。
視覚的な自然言語ナビゲーションのための可変長メモリ(MTVM)を備えたマルチモーダルトランス (Multimodal Transformer) を提案する。
論文 参考訳(メタデータ) (2021-11-10T16:04:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。