論文の概要: Task-Focused Memorization for Multimodal Agents
- arxiv url: http://arxiv.org/abs/2605.31075v1
- Date: Fri, 29 May 2026 09:43:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.520145
- Title: Task-Focused Memorization for Multimodal Agents
- Title(参考訳): タスクフォーカスによるマルチモーダルエージェントの記憶
- Abstract要約: マルチモーダルエージェントがコヒーレントな体験を構築し、世界知識を蓄積し、継続的な学習を実現するためには、長期記憶が不可欠である。
本研究では,環境の中で遭遇する実際のタスクの要求にポリシーが焦点を合わせることを可能にする,強化学習ベースのフレームワークであるTaskMemを紹介する。
- 参考スコア(独自算出の注目度): 9.026427508263641
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Long-term memory is essential for multimodal agents to build coherent experience, accumulate world knowledge, and achieve continual learning. However, constructing effective memory goes beyond memory module design and basic requirements such as accuracy and fidelity; the key challenge lies in determining what to memorize. Multimodal agents, such as embodied agents, continuously perceive, reason, and act in real or virtual environments, receiving an unbounded stream of multimodal observations. From this combinatorial explosion of information, an agent must selectively retain content that is relevant to its role in the environment and valuable for future tasks. To bridge this gap, we frame memory generation as a learnable memorization policy and introduce TaskMem (Task-focused Memorization Policy Learning), a reinforcement-learning-based framework that enables the policy to dynamically adjust its focus to the demands of real tasks encountered in the environment. TaskMem adopts a two-phase training paradigm: Phase One learns how to memorize by optimizing memory quality under fundamental fidelity requirements; Phase Two occurs after deployment, where the agent learns what to memorize by tuning an adapter on its base MLLM, using recent environment tasks to define a reward model that guides the memorization policy toward task-relevant content. To evaluate our approach, we reformulate VideoMME, EgoLife, and EgoTempo into streaming benchmarks that simulate a realistic setting in which an agent processes streaming observations and handles tasks arriving online. To isolate memory assessment, the questions must be answered using only the agent's memory, without access to raw video. Built on Qwen3-VL-30B-A3B, TaskMem improves VQA accuracy by 6.3%, 7.0%, and 5.3% on these benchmarks, respectively.
- Abstract(参考訳): マルチモーダルエージェントがコヒーレントな体験を構築し、世界知識を蓄積し、継続的な学習を実現するためには、長期記憶が不可欠である。
しかし、効果的なメモリの構築は、メモリモジュールの設計や、正確性や忠実性といった基本的な要件を超越している。
エンボディエージェントのようなマルチモーダルエージェントは、実または仮想環境において継続的に知覚、理性、行動し、非有界なマルチモーダル観測を受信する。
この複合的な情報爆発から、エージェントは、環境におけるその役割に関連するコンテンツを選択的に保持し、将来のタスクに有用でなければならない。
このギャップを埋めるために、我々は記憶生成を学習可能な記憶ポリシーとして捉え、環境の中で遭遇する実際のタスクの要求に対して、その焦点を動的に調整できる強化学習ベースのフレームワークであるTaskMem(Task- Focus Memorization Policy Learning)を導入する。
TaskMemは2段階のトレーニングパラダイムを採用している: フェーズ1はメモリ品質を基本的な忠実性要件の下で最適化することで記憶する方法を学ぶ; フェーズ2はデプロイ後に発生し、エージェントは、最近の環境タスクを使用して、タスク関連コンテンツに対する記憶ポリシーを導く報酬モデルを定義する。
提案手法を評価するため,TVMME,EgoLife,EgoTempoをストリーミングベンチマークに再構成し,エージェントがストリーミング観測を処理し,オンラインに到着するタスクを処理する現実的な設定をシミュレートする。
メモリアセスメントを分離するには、生のビデオにアクセスすることなく、エージェントのメモリのみを使用して質問に答えなければならない。
Qwen3-VL-30B-A3Bをベースとして、TaskMemはVQAの精度をそれぞれ6.3%、7.0%、そして5.3%改善した。
関連論文リスト
- Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents [72.3752981234916]
大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
メモリ操作をマルコフ決定プロセスとしてモデル化するフレームワークである制御プロセス(MemCon)としてメモリを提示する。
MemConは、複数のメモリベースラインのタスク成功率を最大15.2ポイント上回り、トークン消費量を5-20%削減している。
論文 参考訳(メタデータ) (2026-07-15T08:32:40Z) - AdMem: Advanced Memory for Task-solving Agents [13.611633561917513]
大規模言語モデル(LLM)はツール使用エージェントとしての約束を示すが、知識の記憶、整理、再利用を必要とする長期的タスクには制限がある。
本稿では,短期記憶と長期記憶を組み合わせた2段階設計において,セマンティック,エピソード,手続き記憶を統合した統合的・自動記憶フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-05T00:11:57Z) - MemTrain: Self-Supervised Context Memory Training [40.64801276577851]
既存のメモリエージェントアプローチは通常、下流タスクで強化学習を施したエンドツーエンドで訓練される。
MemTrainは、LLMエージェントのコンテキストメモリ能力を高めるための自己教師型トレーニングフレームワークである。
MemTrainは、異なるモデル間のダウンストリームメモリ集約推論性能を一貫して改善する。
論文 参考訳(メタデータ) (2026-06-02T05:56:24Z) - LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues [80.29362825271768]
LongMemEval-V2は、メモリシステムが、カスタマイズされた環境で知識のある同僚になるために必要な経験を得るのに役立つかどうかを評価するためのベンチマークである。
LME-V2には、Webエージェントの5つのコアメモリ能力をカバーする451の質問が含まれている。
AgentRunbook-Rは生の状態観察,イベント,戦略ノートのための知識プールを備えた,効率的なRAGベースのメモリであり,AgentRunbook-Cはトラジェクトリをファイルとして格納し,コードエージェントを起動して,拡張サンドボックスに証拠を収集する。
論文 参考訳(メタデータ) (2026-05-12T17:59:34Z) - Memory-Augmented LLM-based Multi-Agent System for Automated Feature Generation on Tabular Data [52.80567461420316]
メモリ拡張LPMに基づくマルチエージェントシステム(textbfMALMAS)を提案する。
MALMASは生成プロセスを独立した責任を持つエージェントに分解し、ルータエージェントはイテレーション毎にエージェントの適切なサブセットを起動する。
さらに、手続きメモリ、フィードバックメモリ、概念記憶を含むメモリモジュールを統合し、その後の特徴生成を適応的に導く反復的改善を可能にする。
論文 参考訳(メタデータ) (2026-04-22T07:09:30Z) - The AI Hippocampus: How Far are We From Human Memory? [77.04745635827278]
インプリシットメモリは、事前訓練されたトランスフォーマーの内部パラメータに埋め込まれた知識を指す。
明示メモリは、動的でクエリ可能な知識表現でモデル出力を増大させるように設計された外部ストレージと検索コンポーネントを含んでいる。
エージェントメモリは、自律エージェント内に永続的、時間的に拡張されたメモリ構造を導入する。
論文 参考訳(メタデータ) (2026-01-14T03:24:08Z) - Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory [89.65731902036669]
Evo-Memoryは、大規模言語モデル(LLM)エージェントで自己進化型メモリを評価するための、ストリーミングベンチマークとフレームワークである。
10以上の代表的なメモリモジュールを評価し、10種類の多ターンゴール指向およびシングルターン推論およびQAデータセットで評価した。
論文 参考訳(メタデータ) (2025-11-25T21:08:07Z) - Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions [22.190297901876278]
メモリエージェントに不可欠な4つのコア能力、すなわち、正確な検索、テスト時間学習、長距離理解、選択的忘れの4つを特定した。
既存のベンチマークは、限られたコンテキスト長に依存するか、書籍ベースのQAのような静的で長いコンテキスト設定用に調整されている。
メモリエージェント用に特別に設計された新しいベンチマークであるMemoryAgentBenchを紹介する。
論文 参考訳(メタデータ) (2025-07-07T17:59:54Z) - MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents [84.62985963113245]
我々は,長時間のマルチターンタスクに対して,エージェントが一定のメモリで動作可能な,エンドツーエンドの強化学習フレームワークMEM1を紹介する。
各ターンでMEM1は、メモリ統合と推論を共同でサポートするコンパクトな共有内部状態を更新する。
その結果,MEM1-7Bは16目的のマルチホップQAタスクにおいて,Qwen2.5-14B-Instructと比較してメモリ使用量を3.7倍削減し,3.5倍の性能向上を示す。
論文 参考訳(メタデータ) (2025-06-18T19:44:46Z) - Memory, Benchmark & Robots: A Benchmark for Solving Complex Tasks with Reinforcement Learning [41.94295877935867]
メモリは、エージェントが時間的および空間的依存関係を持つ複雑なタスクに対処できるようにするために不可欠である。
多くの強化学習アルゴリズムにはメモリが組み込まれているが、エージェントのメモリ能力を評価するための普遍的なベンチマークがない。
メモリRLの総合ベンチマークであるMIKASAを紹介する。
論文 参考訳(メタデータ) (2025-02-14T20:46:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。