論文の概要: Long-Horizon Embodied Decision-Making via Multimodal Memory Compression
- arxiv url: http://arxiv.org/abs/2608.01456v1
- Date: Sun, 02 Aug 2026 19:29:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.245877
- Title: Long-Horizon Embodied Decision-Making via Multimodal Memory Compression
- Title(参考訳): マルチモーダルメモリ圧縮による長軸エンボディード決定法
- Abstract要約: DunphyBenchは、長期的な人間中心の意思決定のエージェントを評価するための新しいベンチマークだ。
MeMentoは、ユーザの好みに基づいて決定関連情報を選択的に圧縮する、優先条件付きマルチモーダルメモリ圧縮機である。
MeMentoはVLM駆動エージェントの精度を7.18%向上させ、メモリ使用率を最強のベースラインに比べて85.38%削減する。
- 参考スコア(独自算出の注目度): 71.16335993005139
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agents are increasingly expected to act not only as task executors, but also as decision-makers on behalf of human users. This shift requires agents to accumulate evidence over long horizons, interpret implicit user preferences, and compare multiple candidates under partial observations. In this work, we propose DunphyBench, a new benchmark for evaluating agents on long-horizon human-centered embodied decision-making, where the agent must navigate through multiple embodied housing environments and make decisions that align with multi-dimensional human preferences. Unlike standard embodied reasoning tasks that often focus on procedural planning or immediate goal completion, our setting requires agents to integrate multimodal, multi-source input into coherent knowledge that supports complex reasoning across long horizon. The evaluation results reveal that there is a substantial gap between current agents and human performance. Furthermore, our diagnosis of state-of-the-art VLM-driven agents reveals that memory management is one of the bottlenecks, where raw multimodal history introduces noise that hinders decision quality. Motivated by this finding, we design MeMento, a preference-conditioned multimodal memory compressor that selectively compresses decision-relevant information from long-horizon history based on user preferences with a fixed set of memory tokens. Experiments show that MeMento helps VLM-driven agents improve accuracy by 7.18%, while reducing memory usage by 85.38% compared to the strongest baseline.
- Abstract(参考訳): エージェントは、タスク実行者としてだけでなく、人間のユーザーのために意思決定者としても機能することがますます期待されている。
このシフトでは、エージェントは長い地平線上で証拠を蓄積し、暗黙のユーザー嗜好を解釈し、部分的な観察の下で複数の候補を比較する必要がある。
本研究では,長期的人間中心型意思決定におけるエージェント評価のための新しいベンチマークであるDunphyBenchを提案する。
プロシージャ計画や即時ゴール完了に重点を置く標準的な具体的推論タスクとは異なり、我々の設定では、エージェントがマルチモーダルでマルチソースなインプットを、長い地平線を越えた複雑な推論をサポートする一貫性のある知識に統合する必要がある。
評価の結果,現在のエージェントと人的パフォーマンスとの間には大きなギャップがあることが判明した。
さらに、最先端のVLM駆動型エージェントの診断により、メモリ管理がボトルネックの1つであり、生のマルチモーダル・ヒストリーがノイズを発生させ、意思決定の質を損なうことが判明した。
この発見に触発されて、我々は、メモリトークンの固定セットによるユーザの嗜好に基づいて、長い水平履歴から決定関連情報を選択的に圧縮する、嗜好条件付きマルチモーダルメモリ圧縮機であるMeMentoを設計した。
実験の結果、MeMentoはVLMを駆動するエージェントの精度を7.18%向上させ、メモリ使用量を最強のベースラインに比べて85.38%削減した。
関連論文リスト
- FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents [9.305912044747368]
FinPerMAは、凍結した縦方向の投資家軌跡に対してパーソナライズされたメモリを評価する、イベントグラウンドのベンチマークである。
完全コンテキスト構成は、全体的な精度が約0.47以上、複数選択の質問では約39%を超えない。
属性分析により、要約ベースのメモリは、パーソナライズに必要な選好信号を失いながら、事実の詳細を保存していることが示された。
論文 参考訳(メタデータ) (2026-08-04T18:00:04Z) - VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions [63.13827503828231]
我々は、長期ユーザーインタラクションにおけるパーソナライズされたプロアクティブなエージェント動作を評価するためのベンチマークであるVitaBench 2.0を紹介する。
結果は、最先端のモデルでさえ、現実世界のパーソナライゼーションは非常に困難であることを示している。
論文 参考訳(メタデータ) (2026-05-26T15:07:38Z) - MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems [69.06764269022925]
本研究では,現在の記憶増強剤が現実的,干渉重大,長期的設定において果たす役割について検討する。
MINTEvalは、頻繁に更新される情報を備えた、長く高度に相互接続されたコンテキストを特徴とするベンチマークである。
MINTEvalは128.8kのトークンを平均で1インスタンスあたり1.8Mのトークンに拡張し、15.6kの質問応答ペアを持つ。
論文 参考訳(メタデータ) (2026-05-18T15:43:35Z) - HabitatAgent: An End-to-End Multi-Agent System for Housing Consultation [8.894547553174196]
エンド・ツー・エンド・エンド・ハウジングのためのLLMを利用した初のマルチエージェントアーキテクチャであるHabitatAgentを紹介する。
HabitatAgentには、メモリ、検索、生成、検証の4つの特別なエージェントの役割がある。
エンド・ツー・エンドの正当性プロトコルを用いて、HabitatAgentを100の実際のユーザコンサルテーションシナリオで評価する。
論文 参考訳(メタデータ) (2026-04-01T06:59:50Z) - Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration [52.35887679314727]
長期記憶身体探索は、エージェントの探索的認知と意思決定行動を統合することを目的としている。
エージェントのメモリリコールとプロアクティブな探索能力を高めるため,我々はMemoryExplorerを提案する。
論文 参考訳(メタデータ) (2026-01-11T16:23:22Z) - Hello Again! LLM-powered Personalized Agent for Long-term Dialogue [63.65128176360345]
モデルに依存しない長期対話エージェント(LD-Agent)を導入する。
イベント認識、ペルソナ抽出、応答生成のための3つの独立した調整可能なモジュールが組み込まれている。
LD-Agentの有効性, 汎用性, クロスドメイン性について実験的に検証した。
論文 参考訳(メタデータ) (2024-06-09T21:58:32Z) - Sequential Recommender via Time-aware Attentive Memory Network [67.26862011527986]
本稿では,注意機構と繰り返し単位を改善するための時間ゲーティング手法を提案する。
また,長期と短期の嗜好を統合するマルチホップ・タイムアウェア・アテンテーティブ・メモリ・ネットワークを提案する。
提案手法は,候補探索タスクに対してスケーラブルであり,ドット積に基づくTop-Kレコメンデーションのための潜在因数分解の非線形一般化とみなすことができる。
論文 参考訳(メタデータ) (2020-05-18T11:29:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。