論文の概要: FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory
- arxiv url: http://arxiv.org/abs/2608.04530v1
- Date: Wed, 05 Aug 2026 07:02:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.768587
- Title: FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory
- Title(参考訳): FocusMem: 遅延GUIメモリにおけるコンテンツ、読み出し、信頼の要因
- Authors: Zhuoran Zhang, Bowen Li, Jingcheng Ju, Yang Shi, Qixun Wang, Haotian Wang, Wei Chen, Tengjiao Wang,
- Abstract要約: コンパクトな潜在メモリインタフェース内での責務を分離するFocusMemを紹介する。
ロールアウェアコンテンツベースは、タスクの進捗を維持するために、エピソードメモリが再利用可能なエクスペリエンスと作業メモリを維持することを奨励する。
状態条件付き読み出しは、同じ記憶されたエビデンスの決定固有のビューを生成し、一方、軽量な信頼ゲートは、現在のステップとは無関係に見えるメモリブロックを抑えることができる。
- 参考スコア(独自算出の注目度): 13.853612752899442
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: GUI agents must remember both useful experience from earlier tasks and unfinished progress in the current interaction. Latent memory offers a compact solution by compressing multimodal trajectories into a few continuous tokens. Existing methods, however, usually map each trajectory to one fixed memory block and train it mainly through next-action supervision. This creates three practical problems: important details may be lost during compression, the same memory block must serve different decision stages, and irrelevant retrieved trajectories may still mislead the agent. We introduce FocusMem, which separates these responsibilities within a compact latent-memory interface. A role-aware content basis encourages episodic memory to retain reusable experience and working memory to retain task progress. A state-conditioned readout generates a decision-specific view of the same stored evidence, while a lightweight trust gate can suppress memory blocks that appear irrelevant to the current step. All components are trained while the GUI policy remains frozen. Across five GUI-agent benchmarks, FocusMem consistently outperforms a fully matched action-only fixed-memory baseline and prior latent memory adaptations. Further analysis shows that semantic and functional supervision preserve complementary information, state-conditioned readout is more robust as surrounding trajectory context grows, and the trust gate reduces the harm caused by injected irrelevant episodic evidence. These results show that effective latent memory depends not only on compressing past interaction, but also on what is retained, what is exposed, and what is allowed.
- Abstract(参考訳): GUIエージェントは、以前のタスクから有用なエクスペリエンスと、現在のインタラクションにおける未完成の進捗の両方を記憶しなければならない。
ラテントメモリは、マルチモーダルトラジェクトリをいくつかの連続トークンに圧縮することで、コンパクトなソリューションを提供する。
しかし、既存の手法では、通常、各軌跡を1つの固定メモリブロックにマッピングし、主に次の行動監視を通じて訓練する。
重要な詳細が圧縮中に失われる可能性があるし、同じメモリブロックが異なる決定段階を提供する必要があるし、無関係に回収されたトラジェクトリがエージェントを誤解させる可能性がある。
コンパクトな潜在メモリインターフェース内でこれらの責務を分離するFocusMemを紹介します。
ロールアウェアコンテンツベースは、タスクの進捗を維持するために、エピソードメモリが再利用可能なエクスペリエンスと作業メモリを維持することを奨励する。
状態条件付き読み出しは、同じ記憶されたエビデンスの決定固有のビューを生成し、一方、軽量な信頼ゲートは、現在のステップとは無関係に見えるメモリブロックを抑えることができる。
GUIポリシーが凍結されている間、すべてのコンポーネントはトレーニングされる。
5つのGUIエージェントベンチマークで、FocusMemは、完全にマッチしたアクションのみの固定メモリベースラインと、それ以前の潜時メモリアダプションを一貫して上回っている。
さらに分析したところ、意味的および機能的監視は相補的な情報を保持し、状態条件付き読み出しは、周囲の軌跡が大きくなるにつれてより堅牢であり、信頼ゲートは、注入された無関係なエピソード的証拠によって引き起こされる害を軽減する。
これらの結果は、有効な潜時記憶は過去の相互作用を圧縮するだけでなく、保持されているもの、露出しているもの、許容されているものにも依存していることを示している。
関連論文リスト
- Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents [72.3752981234916]
大きな言語モデル(LLM)エージェントは、タスク間の経験を蓄積するために、外部メモリシステムに依存している。
メモリ操作をマルコフ決定プロセスとしてモデル化するフレームワークである制御プロセス(MemCon)としてメモリを提示する。
MemConは、複数のメモリベースラインのタスク成功率を最大15.2ポイント上回り、トークン消費量を5-20%削減している。
論文 参考訳(メタデータ) (2026-07-15T08:32:40Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - The Compliance Trap: Diagnosing How AI Agents Consume Conflicting Memory [9.041305193333434]
メモリは、長年にわたるAIエージェントの中核的なコンポーネントになりつつある。これにより、エージェントは、Webブラウザやソフトウェアツール、その他のインタラクティブな環境を操作する際に、過去の経験を再利用することができる。
既存の作業は、主にメモリを供給問題として扱い、どのエクスペリエンスを書くか、どのように保存するか、どのエントリを次のタスクに取得するかを尋ねる。
しかし、モデルが取得したメモリをどのように消費するかについては、まだ明確な説明がありません。
論文 参考訳(メタデータ) (2026-07-12T07:05:31Z) - Beyond Similarity: Trustworthy Memory Search for Personal AI Agents [25.265839311088516]
個人AIエージェントにおける信頼境界としてのメモリ探索について検討する。
MemGateは、信頼性の高いメモリ検索のための軽量でデプロイ可能なメモリプラグインである。
論文 参考訳(メタデータ) (2026-06-04T11:54:29Z) - STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments [63.39393178045112]
モバイルエージェントは即座に反応制御を行うが、メモリを必要とする現実的なロングホライゾンタスクでは頻繁に失敗する。
制御可能な仮想環境を通じて,モバイルエージェントの明示的なメモリをトレーニングするフレームワークSTAMPを提案する。
結果のStampGUIエージェントは、メモリワールドベンチマークに新たなハイウォーターマークを設定し、例外的なメモリ精度とタスクレジリエンスを実証します。
論文 参考訳(メタデータ) (2026-05-28T04:00:13Z) - MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models [56.31411457917676]
本稿では,メモリ構築と検索において,機能的メモリ境界を保存するタイプアウェアメモリフレームワークであるMemGuardを紹介する。
幻覚と長期会話のベンチマーク全体で、MemGuardはメモリの信頼性を最大28.27%向上し、メモリトークンは以前の方法より5.8倍少ない。
論文 参考訳(メタデータ) (2026-05-27T06:04:19Z) - Mem-W: Latent Memory-Native GUI Agents [50.87647372904382]
本稿では,メモリをエージェントの連続的コンテキストの一部として扱う,潜在メモリネイティブなGUIエージェントであるMem-Wを紹介する。
4つのWebおよびモバイルナビゲーションベンチマークで、Mem-Wはさまざまなバックボーンとメモリ拡張ベースラインを一貫して改善している。
論文 参考訳(メタデータ) (2026-05-10T04:31:23Z) - StageMem: Lifecycle-Managed Memory for Language Models [0.0]
ロングホライゾン言語モデルシステムは、永続記憶にますます依存している。
現在のデザインは、メモリを主に静的ストアとして扱う。
ライフサイクル管理型メモリフレームワークであるStageMemを提案する。
論文 参考訳(メタデータ) (2026-04-18T01:38:25Z) - Agentic Learner with Grow-and-Refine Multimodal Semantic Memory [50.81667005063605]
ViLoMemは、コンパクトなスキーマベースのメモリを構築するデュアルストリームメモリフレームワークである。
視覚的障害パターンと論理的推論エラーを符号化し、MLLMが成功し失敗した経験から学ぶことを可能にする。
論文 参考訳(メタデータ) (2025-11-26T18:55:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。