論文の概要: CausalCache: Conditional High-Fidelity Restoration for Long-Horizon GUI Agents
- arxiv url: http://arxiv.org/abs/2608.22577v2
- Date: Tue, 25 Aug 2026 04:24:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.105515
- Title: CausalCache: Conditional High-Fidelity Restoration for Long-Horizon GUI Agents
- Title(参考訳): CausalCache:Long-Horizon GUIエージェントの条件付き高忠実性復元
- Abstract要約: ロングホライゾンGUIエージェントは、完全なアクション履歴をコンパクトテキストとして保持できるが、アクティブコンテキストに適合する歴史的なスクリーンショットはわずかである。
すべてのイベントは要約され続け、固定予算のB$は、どのイベントがアーカイブされたスクリーンショットを復元するかを決定する。
CaulCacheは、予測されたユーティリティが最近のイベントの履歴を超える場合にのみ、古いイベントの完全な履歴をスコアし、スワップする。
- 参考スコア(独自算出の注目度): 3.349143493623842
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon GUI agents can retain complete action histories as compact text, but only a few historical screenshots fit in active context. We formulate this as budgeted fidelity restoration: every event remains summarized, while a fixed budget $B$ determines which events regain their archived screenshots. Recent-$B$ assigns all visual slots to the latest events. CausalCache instead scores the complete history and swaps in an older event only when its predicted utility exceeds that of a recent event. A history-gated key/value adapter modifies only restored history-image tokens and is exactly bypassed when no history image is active, preserving current-screen processing. The adapter and selector are trained with matched-budget interventions on desktop trajectories and evaluated zero-shot on mobile. On OSWorld-Verified, activating historical screenshots improves success by about $13$ percentage points over summary-only memory. Under the official $15$-step limit, CausalCache and Recent-$4$ are statistically indistinguishable; in a $30$-step diagnostic, CausalCache achieves $46.7\%$ success versus $42.4\%$ ($+4.3$ points). Zero-shot on $117$ MobileWorld tasks, CausalCache improves over Recent-$4$ from $30.2\%$ to $36.8\%$. The gain is concentrated on a pre-defined cross-app memory-candidate split ($30.6\%$ vs. $19.4\%$, $+11.2$ points), while single-app controls show no detectable difference ($43.6\%$ vs. $42.4\%$). These results show that selecting which past events regain pixels is more effective than spending a fixed visual budget entirely on recency.
- Abstract(参考訳): ロングホライゾンGUIエージェントは、完全なアクション履歴をコンパクトテキストとして保持できるが、アクティブコンテキストに適合する歴史的なスクリーンショットはわずかである。
すべてのイベントは要約され続け、固定予算のB$は、どのイベントがアーカイブされたスクリーンショットを復元するかを決定する。
recent-B$は、すべてのビジュアルスロットを最新のイベントに割り当てる。
代わりにCausalCacheは、予測されたユーティリティが最近のイベントの履歴を超える場合にのみ、古いイベントの完全な履歴をスコアし、スワップする。
ヒストリーゲートキー/値アダプタは、復元されたヒストリーイメージトークンのみを変更し、履歴画像がアクティブでない場合、現在のスクリーン処理を保存するために正確にバイパスされる。
アダプタとセレクタはデスクトップトラジェクトリ上で一致した予算介入で訓練され、モバイル上でゼロショットを評価する。
OSWorld-Verifiedでは、過去のスクリーンショットをアクティベートすることで、サマリのみのメモリよりも13ドル程度の成功率が向上する。
公式の15ドルの制限の下では、CausalCache と recent-4$ は統計的に区別がつかない; 30ドルの診断では、CausalCache は 42.4\% (+4.3$ points) に対して 42.4\% (+4.3$ points) である。
117ドルのMobileWorldタスクのゼロショットで、CausalCacheは最近の$4を$30.2\%から$36.8\%に改善した。
利得は、事前に定義されたクロスアプリメモリ/候補分割($30.6\% vs. $19.4\%$, $+11.2$ポイント)に集中しているが、シングルアプリコントロールは、検出可能な差($43.6\% vs. 4,2.4\%$)を示さない。
以上の結果から,過去の事象が画素を回復する要因を選択することは,画像の補正に全予算を費やすよりも効果的であることが示唆された。
関連論文リスト
- Uniform Herding: Exemplar Replay with Representation Refresh [0.0]
我々は、観測されたクラス間で現在のアクティブセットを割り当てるUniform Herdingを提案し、現在の表現で選択した例をリフレッシュするために境界付き候補プールを使用する。
10種類のクラス増分タスクを持つCIFAR-100では、Uniform Herdingが44.00pm0.51%$最終平均精度と17.22pm0.43%$ forgettingを取得し、iCaRLは42.33pm1.20%$と24.87pm1.11%$である。
論文 参考訳(メタデータ) (2026-08-13T10:25:38Z) - Keep the Future, Drop the Rollout: RIFT for World Action Models [46.70481761959841]
将来のキャッシュ値のマスキングや再割り当てによって実行が変化し、成功が減少することを示す。
本稿では,学習した予測トークンを用いて,完全な将来K/Vキャッシュを1つのバックボーンパスで構築するRIFTを提案する。
論文 参考訳(メタデータ) (2026-08-12T00:17:30Z) - Caching for the Future: Scrub Jay Episodic Memory Principles for Agent Memory Systems [5.321970297768025]
既存の記憶アーキテクチャは、全ての記憶を、時代遅れの事実と共に、保存されたコンテキストを均等に永続的で体系的に汚染したものとして扱う。
メモリ当たりの時間減衰は,外部LLMエージェントメモリストアにおいて,自動分類係数$_i$として操作可能であることを示す。
本稿では,時間的一般化テスト(TGT)と,保持間隔を保ったベンチマーク,一般化ギャップ(GenGap)メトリクスを紹介する。
論文 参考訳(メタデータ) (2026-08-05T12:12:44Z) - Maglev: Sliding Recurrent Memory [8.788753986099902]
我々のアーキテクチャは、スライディングウインドウの注意を一般化する固定サイズのメモリを備えたリカレントトランスフォーマーアーキテクチャである。
私たちは、$m_t$と$m'_t$を一致させるメモリ一貫性の損失でトレーニングします。
論文 参考訳(メタデータ) (2026-08-03T20:40:49Z) - Recall Before You Rank: Similarity-Guided Top-$K$ Reuse for Efficient Long-Context Attention [4.6833133124119275]
ReTopKは、歴史的検索決定を再利用することで、動的Top-$Kの注意を加速するトレーニングフリーの手法である。
128Kが$K=512$で、ReTopKはExact Top-K$よりも0.50%のパープレキシティアップしか得られず、注意計算は$3.07times$で加速する。
論文 参考訳(メタデータ) (2026-07-30T05:25:23Z) - Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning [51.563653495547335]
マルチモーダル推論は、マルチステップ生成中に視覚的証拠を再考することによって、視覚的接地を改善する。
再生不要な視覚的再考のためのキャッシュレベルフレームワークであるPlace Rebinding Cache Reuse (PRCR)を提案する。
PRCRはリプレイレベルまたはパフォーマンスの向上を実現し、平均精度を5%向上し、視覚的再考を最大数万倍削減する。
論文 参考訳(メタデータ) (2026-06-25T05:47:52Z) - FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion [59.207505503284715]
FadeMemは、歴史的なKVブロックを固定キャッシュ予算の下で時間階層に整理する。
新しい歴史はきめ細かいエントリとして挿入され、古い隣のエントリは徐々にマージされる。
実験では、既存の有界キャッシュ戦略よりも、被験者の一貫性、背景安定性、時間的コヒーレンスが改善された。
論文 参考訳(メタデータ) (2026-06-09T10:22:18Z) - Enhancing Software Engineering Through Closed-Loop Memory Optimization [50.418699819003486]
ソフトウェア工学 (SE) エージェントにおけるメモリ拡張のためのクローズドループフレームワークである ours を紹介する。
タスクに依存しない textbf ベンチマークとアノテーションのない textbf 最適化信号としての有用性を確立する。
その結果、SEエージェントは設定によって常に改善され、成功率で$uparrow5.25%、解決効率で$uparrow4.63%という絶対的なゲインが得られることが示された。
論文 参考訳(メタデータ) (2026-06-04T03:17:21Z) - Echo-Forcing: A Scene Memory Framework for Interactive Long Video Generation [48.476317015122625]
Echo-Forcingは、インタラクティブなロングビデオ生成のためのトレーニング不要のシーンメモリフレームワークである。
キャッシュのバウンダリでスムーズなトランジション、ハードカット、長距離シーンリコールをサポートする。
論文 参考訳(メタデータ) (2026-05-15T14:33:09Z) - ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction [46.69118032596015]
ReVisionは、冗長な視覚的パッチを削除するトラジェクトリ上で、マルチモーダル言語モデルをトレーニングするために使用される。
ReVisionはトークン使用率を平均で46%削減し,無ドロップベースラインでの成功率を3%向上することを示した。
このことは、視覚史において一般的に見られる飽和は、過去の情報の有用性の制限によるものではなく、むしろ非効率なトークン表現の結果によるものであることを示唆している。
論文 参考訳(メタデータ) (2026-05-11T20:27:54Z) - Mem-W: Latent Memory-Native GUI Agents [50.87647372904382]
本稿では,メモリをエージェントの連続的コンテキストの一部として扱う,潜在メモリネイティブなGUIエージェントであるMem-Wを紹介する。
4つのWebおよびモバイルナビゲーションベンチマークで、Mem-Wはさまざまなバックボーンとメモリ拡張ベースラインを一貫して改善している。
論文 参考訳(メタデータ) (2026-05-10T04:31:23Z) - Label-Free Cross-Task LoRA Merging with Null-Space Compression [50.63908869296697]
我々は,ラベルフリーで出力に依存しない手法であるNull-Space Compression (NSC) Mergingを紹介した。
NSCは、従来のメソッドがタスクのサブセットに収まるバランスの取れたゲインを持つ20の異種視覚タスクに対して、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-27T11:34:41Z) - Near-optimal Regret Using Policy Optimization in Online MDPs with Aggregate Bandit Feedback [49.84060509296641]
オンライン有限水平マルコフ決定過程を逆向きに変化した損失と総括的帯域幅フィードバック(フルバンド幅)を用いて研究する。
この種のフィードバックの下では、エージェントは、軌跡内の各中間段階における個々の損失よりも、軌跡全体に生じる総損失のみを観察する。
この設定のための最初のポリシー最適化アルゴリズムを紹介します。
論文 参考訳(メタデータ) (2025-02-06T12:03:24Z) - Provably Efficient Reinforcement Learning with Multinomial Logit Function Approximation [67.8414514524356]
本稿では,MNL関数近似を用いたMDPの新たなクラスについて検討し,状態空間上の確率分布の正当性を保証する。
その大きな利点にもかかわらず、非線形関数を組み込むことは、統計的および計算効率の両方において重大な課題を提起する。
我々は,$widetildemathcalO(dH2sqrtK + kappa-1d2H2)$を後悔するアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-05-27T11:31:54Z) - Improved Algorithm for Adversarial Linear Mixture MDPs with Bandit
Feedback and Unknown Transition [71.33787410075577]
線形関数近似,未知遷移,および逆損失を用いた強化学習について検討した。
我々は高い確率で$widetildeO(dsqrtHS3K + sqrtHSAK)$ regretを実現する新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-03-07T15:03:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。