論文の概要: Drive by Hindsight and Foresight: Tool-Grounded Synergistic Reasoning over Hierarchical Memory for Autonomous Driving
- arxiv url: http://arxiv.org/abs/2609.08217v1
- Date: Tue, 08 Sep 2026 03:59:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 17:04:25.98848
- Title: Drive by Hindsight and Foresight: Tool-Grounded Synergistic Reasoning over Hierarchical Memory for Autonomous Driving
- Title(参考訳): Hindsight と Foresight によるドライブ: 自律運転のための階層記憶を用いたツール周囲のシナジスティック推論
- Abstract要約: VLMは自動運転を約束するが、それでも弱い時間的認識と限定的な一般化に悩まされている。
最近の手法は、CoTの説明、検索強化生成、ツール出力の静的注入による推論と意思決定を改善する。
クローズドループでのプロアクティブツール呼び出しと階層的メモリを密結合する最初のシナジスティックフレームワークである、私たちの知識を提示する。
- 参考スコア(独自算出の注目度): 0.8419406375517101
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: VLMs have shown promise for autonomous driving, yet still suffer from hallucination, weak spatio-temporal perception, and limited generalization. Recent methods improve reasoning and decision-making through CoT explanations, retrieval-augmented generation or the static injection of tool outputs. Although these mechanisms enrich the context, the model neither proactively perceives scene information nor accumulates experience after answering. To overcome these limitations, we present, to our knowledge, the first synergistic framework that tightly couples hierarchical memory with proactive tool invocation in a closed reasoning loop. Our contributions are threefold. (i) Hierarchical Driving Memory: a scene-level short-term memory maintains the dynamic scene state, and an evolving long-term memory retrieves reusable experience and tool strategies. (ii) Memory-Tool Synergistic Reasoning Framework: guided by the scene state and retrieved experience, the model adaptively invokes tools to refine its reasoning at inference time and consolidates reusable experience into a long-term memory pool offline. (iii) Data Generation and Two-stage Training Pipeline: verified memory-tool trajectories built by multi-step teacher rollout are used to train with SFT and GRPO. Our 7B model reaches an overall reasoning score of 80.03 and MCQ accuracy of 79.09% on DriveLMM-o1, surpassing the strongest baseline by 7.74 MCQ points and generalizes strongly across benchmarks. Notably, ablation and analysis studies validate the effectiveness of each component and further reveal the complementary roles of hierarchical memory. Short-term memory strengthens spatio-temporal understanding, improving STSBench accuracy by 24.2 points, while offline long-term memory consolidation yields an additional 3.57-point MCQ gain with all parameters frozen, demonstrating continual self-evolution through accumulated driving experience.
- Abstract(参考訳): VLMは自律運転を約束しているが、幻覚、時空間知覚の弱さ、限定的な一般化に悩まされている。
最近の手法は、CoTの説明、検索強化生成、ツール出力の静的注入による推論と意思決定を改善する。
これらのメカニズムはコンテキストを豊かにするが、このモデルはシーン情報を積極的に知覚したり、回答後に経験を蓄積したりしない。
これらの制限を克服するため、我々は、クローズドな推論ループにおいて、階層的メモリと積極的にツールの実行を密結合する最初のシナジスティックフレームワークである、私たちの知識に提示する。
私たちの貢献は3倍です。
(i)階層駆動メモリ(hierarchical Driving Memory):シーンレベルの短期記憶は動的なシーン状態を維持し、進化する長期記憶は再利用可能なエクスペリエンスとツール戦略を取得する。
(ii)Memory-Tool Synergistic Reasoning Framework:シーンの状態と取得したエクスペリエンスによってガイドされ、モデルは推論時に推論を洗練し、再利用可能なエクスペリエンスを長期記憶プールにオフラインに統合するツールを適応的に呼び出す。
(3)データ生成・二段階訓練パイプライン:SFT・GRPOによる学習に多段階教師ロールアウトで構築したメモリツールトラジェクトリの検証を行う。
我々の7Bモデルは、総合的推論スコア80.03に達し、MCQ精度79.09%をDriveLMM-o1で達成し、最強のベースラインを7.74 MCQポイント超え、ベンチマーク全体で強く一般化した。
特に、アブレーションと分析研究は、各成分の有効性を検証し、階層記憶の相補的な役割を明らかにする。
短期記憶は時空間的理解を強化し、STSBenchの精度を24.2ポイント向上させる一方、オフラインの長期記憶の統合により、全てのパラメータが凍結された3.57ポイントのMCQゲインが得られ、蓄積された運転経験を通じて連続的な自己進化を示す。
関連論文リスト
- Dual-Latent Memory Routing for Vision-Language Reasoning [39.90357280328134]
MLLM(Multimodal large language model)は近年,視覚言語推論において大きな進歩を遂げているが,世代が長くなるにつれてその性能は低下することが多い。
複雑なタスクを解く際に、人間が何を見たか、何を推測したかを個別に思い出す方法に着想を得て、DLMRを提案する。
画像証拠を圧縮するビジュアルメモリと、中間的な結論と制約を追跡する推論メモリである。
論文 参考訳(メタデータ) (2026-09-02T10:45:25Z) - Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents [97.19033877543522]
本稿では,メモリ拡張剤のメモリ基板の制御ハーネス評価について述べる。
統一されたハーネスの下で26のパフォーマンスと効率のメトリクスを計測する。
これらの知見は、アダプティブエージェントメモリシステムに必要なコンポーネントとして、基質ルーティングを動機付けている。
論文 参考訳(メタデータ) (2026-08-15T03:29:48Z) - S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval [38.608941713774186]
S-EMBER(Streaming Egocentric Memory Benchmark for Episodic Retrieval)は,Ray-Ban Metaスマートグラスを用いて388時間の有機活性を計測した3,141本のビデオからなる大規模ベンチマークである。
S-EMBERは、グローバルオフライン検索から、連続ストリームにおける視覚イベントによって引き起こされる因果的アクティブリコールへのパラダイムシフトである、グラウンドドストリーミングエピソード検索を形式化する。
論文 参考訳(メタデータ) (2026-07-02T18:29:20Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - LightThinker++: From Reasoning Compression to Memory Management [61.2260619973687]
大きな言語モデル(LLM)は複雑な推論において優れているが、その効率は長い思考トレースの認知的オーバーヘッドの増加によって制限される。
LLMが動的に中間的思考をコンパクトな意味表現に圧縮できる方法であるLightThinkerを提案する。
私たちはフレームワークをLightThinker++に進化させ、Explicit Adaptive Memory Managementを導入しました。
論文 参考訳(メタデータ) (2026-04-04T10:46:09Z) - MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios [33.8882826707344]
MemGroundは、リッチでゲーミフィケーションされたインタラクティブシナリオを基盤とした、厳格な長期メモリベンチマークである。
メモリ利用と行動軌跡の両方を包括的に定量化するために,多次元計量スイートを提案する。
論文 参考訳(メタデータ) (2026-03-23T02:57:39Z) - From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents [78.30630000529133]
本稿ではファジィトレース理論に基づくピラミッド型マルチモーダルメモリアーキテクチャMM-Memを提案する。
MM-Memメモリは階層的に感覚バッファ、エピソードストリーム、シンボリックに構造する。
実験により、MM-Memがオフラインタスクとストリーミングタスクの両方で有効であることが確認された。
論文 参考訳(メタデータ) (2026-03-02T05:12:45Z) - Dream to Recall: Imagination-Guided Experience Retrieval for Memory-Persistent Vision-and-Language Navigation [8.14424628742372]
VLN(Vision-and-Language Navigation)は、エージェントが環境を通じて自然言語の指示に従う必要がある。
既存のメモリ永続化VLNのアプローチには、限界がある。
本稿では,暗黙記憶に基づく検索機構として想像力を利用するMemoirを提案する。
論文 参考訳(メタデータ) (2025-10-09T17:58:01Z) - MoSFormer: Augmenting Temporal Context with Memory of Surgery for Surgical Phase Recognition [6.913838841605972]
メモリ・オブ・サーチ (Memory of Surgery, MOS) は、意味論的解釈可能な長期手術の歴史と短期的印象の両方を取り入れることで、時間的モデリングを強化する枠組みである。
MoSFormerは、複数のベンチマークで最先端のパフォーマンスをデモする。
論文 参考訳(メタデータ) (2025-03-02T02:26:21Z) - Stable Hadamard Memory: Revitalizing Memory-Augmented Agents for Reinforcement Learning [64.93848182403116]
現在のディープラーニングメモリモデルは、部分的に観察可能で長期にわたる強化学習環境で苦労している。
本稿では,強化学習エージェントのための新しい記憶モデルであるStable Hadamard Memoryを紹介する。
我々の手法は、部分的に観測可能なベンチマークに挑戦する上で、最先端のメモリベースの手法よりも大幅に優れています。
論文 参考訳(メタデータ) (2024-10-14T03:50:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。