論文の概要: Momento: Evaluating Persistent Memory and Reasoning with Multi-Session Agentic Conversations
- arxiv url: http://arxiv.org/abs/2606.00832v1
- Date: Sat, 30 May 2026 18:08:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.873134
- Title: Momento: Evaluating Persistent Memory and Reasoning with Multi-Session Agentic Conversations
- Title(参考訳): Momento:マルチセッションエージェント会話による永続記憶と推論の評価
- Authors: Adril Putra Merin, David Anugraha, Ayu Purwarianti, Genta Indra Winata,
- Abstract要約: マルチセッションサービス環境における永続的エージェントタスク補完のためのベンチマークであるMomentoを紹介する。
実験結果から,現在のエージェントはユーザ状態の誤推定によってフェールすることが明らかとなった。
- 参考スコア(独自算出の注目度): 14.480725554900777
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in agentic AI have enabled agents to complete complex tasks through tool use, reasoning, and multi-step planning. Yet existing benchmarks evaluate agents within a single session, ignoring past actions, stated preferences, and prior decisions that agents must integrate to fulfill personalized user goals. We introduce Momento, a benchmark for persistent agentic task completion in multi-session service environments, requiring agents to take consequential, tool-mediated actions while resolving temporal dependencies and evolving user goals across sessions. Experimental results reveal that current agents fail primarily through misestimation of user state, treating prior session history as a reliable proxy for current context rather than stale information requiring re-validation, highlighting a substantial gap between current agent capabilities and realistic long-horizon human-agent interaction.
- Abstract(参考訳): エージェントAIの最近の進歩により、エージェントはツールの使用、推論、多段階計画を通じて複雑なタスクを完了できるようになった。
しかし、既存のベンチマークでは、エージェントを単一のセッション内で評価し、過去のアクションを無視し、優先事項を述べ、エージェントがパーソナライズされたユーザ目標を達成するために統合する必要があるという事前決定を無視する。
マルチセッションサービス環境での永続的なエージェントタスク補完のためのベンチマークであるMomentoを紹介した。
実験結果から,現在のエージェントはユーザ状態の誤推定によって主に失敗し,事前セッション履歴は再検証を必要とする古い情報ではなく,現在のコンテキストの信頼性の高いプロキシとして扱われ,現在のエージェント能力と現実的な長期的な人間とエージェントの相互作用との間に大きなギャップが浮かび上がっていることが明らかとなった。
関連論文リスト
- VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions [63.13827503828231]
我々は、長期ユーザーインタラクションにおけるパーソナライズされたプロアクティブなエージェント動作を評価するためのベンチマークであるVitaBench 2.0を紹介する。
結果は、最先端のモデルでさえ、現実世界のパーソナライゼーションは非常に困難であることを示している。
論文 参考訳(メタデータ) (2026-05-26T15:07:38Z) - Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization [61.641777037967366]
プロアクティブな大規模言語モデル(LLM)エージェントは、複数のターンで積極的に計画し、クエリし、相互作用することを目的としている。
エージェント強化学習(RL)は、マルチターン環境でエージェントを訓練するための有望なソリューションとして登場した。
本稿では,行動強化と情報収集能力の強化を両立させたエージェントRLフレームワークであるBAOを提案する。
論文 参考訳(メタデータ) (2026-02-11T20:40:43Z) - AgentIF-OneDay: A Task-level Instruction-Following Benchmark for General AI Agents in Daily Scenarios [49.90735676070039]
持続時間と複雑さが増大するタスクを効果的に処理するAIエージェントの能力は、成長を続けている。
エージェントタスクの多様性に十分対処することなく,タスクの難易度の向上を優先している。
本稿では,自然言語命令とAIエージェントを多種多様な日常タスクに活用できるかどうかを判定するエージェントIF-OneDayを提案する。
論文 参考訳(メタデータ) (2026-01-28T13:49:18Z) - Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments [8.937298475124484]
現在の大規模言語モデルエージェントはリアクティブパラダイムの下で動作し、短期セッション内の即時ユーザクエリにのみ応答する。
本稿では,比較的静的なユーザニーズと動的環境とのギャップを埋めることのできる,アクティブなタスク指向エージェントのための新しいインタラクションパラダイムを提案する。
動的環境下で複雑なマルチターンダイアログデータを構築するための高品質なデータ合成パイプラインを提案する。
論文 参考訳(メタデータ) (2026-01-14T11:15:40Z) - ReInAgent: A Context-Aware GUI Agent Enabling Human-in-the-Loop Mobile Task Navigation [26.254354188188177]
ReInAgentは、ヒューマン・イン・ザ・ループのモバイルタスクナビゲーションを可能にする、コンテキスト対応のマルチエージェントフレームワークである。
これは、明確で静的なタスク仮定に依存する既存のアプローチの制限を克服する。
真のユーザの好みとより緊密に一致した結果を生み出すのです。
論文 参考訳(メタデータ) (2025-10-09T09:22:05Z) - PIPA: A Unified Evaluation Protocol for Diagnosing Interactive Planning Agents [12.052972947563424]
既存のベンチマークでは、タスク完了に基づくエージェントのパフォーマンスを、全体的な効果のプロキシとして評価している。
対話型タスク計画エージェントの行動過程を概念化する統合評価プロトコルPIPAを提案する。
分析の結果,エージェントは異なる行動段階において優れており,ユーザ満足度は結果と中間行動の両方によって形成されていることがわかった。
論文 参考訳(メタデータ) (2025-05-02T21:27:10Z) - A Desideratum for Conversational Agents: Capabilities, Challenges, and Future Directions [51.96890647837277]
大規模言語モデル(LLM)は、従来の対話システムから、自律的な行動、文脈認識、ユーザとのマルチターンインタラクションが可能な高度なエージェントへと、会話AIを推進してきた。
本調査では,人間レベルの知性にアプローチするよりスケーラブルなシステムにおいて,何が達成されたのか,どのような課題が持続するのか,何を行う必要があるのか,といった,次世代の会話エージェントのデシラトゥムを提示する。
論文 参考訳(メタデータ) (2025-04-07T21:01:25Z) - Tell Me More! Towards Implicit User Intention Understanding of Language
Model Driven Agents [110.25679611755962]
現在の言語モデル駆動エージェントは、しばしば効果的なユーザ参加のメカニズムを欠いている。
Intention-in-Interaction (IN3) は明示的なクエリを通してユーザの暗黙の意図を検査するための新しいベンチマークである。
私たちは、タスクの曖昧さを積極的に評価し、ユーザの意図を問う強力なモデルであるMistral-Interactを経験的に訓練し、それらを実行可能な目標へと洗練させます。
論文 参考訳(メタデータ) (2024-02-14T14:36:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。