論文の概要: Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs
- arxiv url: http://arxiv.org/abs/2607.27415v1
- Date: Wed, 29 Jul 2026 19:31:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.31585
- Title: Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs
- Title(参考訳): 行動中心グラフを用いたブリッジング推論時間スケーリングとエピソード記憶
- Abstract要約: 我々は、推論スケーリングとエピソードメモリのギャップを埋める新しいフレームワーク、textitGAMER(グラフベースアクション中心メモリとエピソード推論)を提案する。
我々のアプローチは、歴史的推論を動的textitAction-Centric Graph としてモデル化する。
複数のベンチマークの実験では、 textitGAMER はバニラベースラインに比べて成功/進歩率に対して textbf20.81%/6.17% で優れたパフォーマンスを達成している。
- 参考スコア(独自算出の注目度): 48.754678397305355
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advancements in inference-time scaling have significantly unlocked the complex reasoning capabilities of Large Language Models~(LLMs). However, for agents, these approaches suffer from a critical inefficiency, operating in a stateless manner and engaging in redundant search processes. Existing memory mechanisms largely rely on the reasoning capabilities of LLMs, leading to prohibitive computational costs. In this paper, we propose a novel framework, \textit{GAMER}~(Graph-based Action-centric Memory with Episodic Reasoning), that bridges the gap between inference scaling and episodic memory. Our approach models historical reasoning as a dynamic \textit{Action-Centric Graph}. By decoupling the memory mechanism from LLMs, our method can save token/money usage by providing less memory context than memory mechanism baselines. To extract knowledge from the graph effectively, we use a dual-stream Temporal Difference learning mechanism to estimate the positive~(suggestion) and negative~(avoidance) value of action nodes based on past successes and failures. During the inference phase, this learned value function optimizes decision-making bi-directionally, so that positive values provide action suggestions, while negative values indicate high-risk actions. By performing efficient searches on the graph, our method significantly improves the efficiency of inference scaling. Experiments on multiple benchmarks demonstrate that \textit{GAMER} achieves superior performance by \textbf{20.81\%/6.17\%} for success/progress rate compared to vanilla baselines.
- Abstract(参考訳): 推論時間スケーリングの最近の進歩は、Large Language Models~(LLMs)の複雑な推論能力を著しく解き放った。
しかしエージェントにとっては、これらのアプローチは致命的な非効率性に悩まされ、ステートレスなやり方で動作し、冗長な探索プロセスに従事している。
既存のメモリ機構はLLMの推論能力に大きく依存しており、計算コストを抑えている。
本稿では、推論スケーリングとエピソディックメモリのギャップを埋める新しいフレームワークである「textit{GAMER}~(グラフベースアクション中心メモリとエピソディック推論)を提案する。
我々のアプローチは、歴史的推論を動的 \textit{Action-Centric Graph} としてモデル化する。
LLMからメモリメカニズムを分離することにより、メモリメカニズムのベースラインよりも少ないメモリコンテキストを提供することで、トークン/マネー使用率を節約できる。
グラフから効果的に知識を抽出するために、過去の成功と失敗に基づいて、二重ストリームの時間差分学習機構を用いて、アクションノードの正〜正〜負〜回避の値を推定する。
推論フェーズにおいて、この学習された値関数は、二方向の意思決定を最適化し、正の値がアクション提案を提供するのに対して、負の値はリスクの高いアクションを示す。
グラフ上で効率的な探索を行うことで,提案手法は推論スケーリングの効率を大幅に改善する。
複数のベンチマークの実験では、'textit{GAMER} はバニラベースラインと比較して成功率/進歩率に対して \textbf{20.81\%/6.17\%} で優れたパフォーマンスを達成している。
関連論文リスト
- MemSifter: Offloading LLM Memory Retrieval via Outcome-Driven Proxy Reasoning [78.46301394559903]
大きな言語モデル(LLM)は、長期化タスクにますます使われています。
現在の手法はコストと精度のトレードオフに直面している。
MemSifterは、メモリ検索プロセスを小さなプロキシモデルにオフロードする新しいフレームワークである。
論文 参考訳(メタデータ) (2026-03-03T02:57:38Z) - NextMem: Towards Latent Factual Memory for LLM-based Agents [58.35585202907478]
NextMemは、自動回帰型オートエンコーダを使用して、潜時メモリを効率的に構築する、潜時ファクトメモリフレームワークである。
大規模な実験は、NextMemが優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-02-26T14:35:27Z) - Recurrent Preference Memory for Efficient Long-Sequence Generative Recommendation [27.325586037888]
本稿では,長いユーザインタラクション履歴をコンパクトなPreference Memoryトークンに圧縮するフレームワークRec2PMを紹介する。
実験の結果、Rec2PMは推論遅延とメモリフットプリントを著しく低減し、フルシーケンスモデルよりも精度が高いことがわかった。
論文 参考訳(メタデータ) (2026-02-12T05:51:52Z) - Power Law Guided Dynamic Sifting for Efficient Attention [0.8198759882422455]
そこで我々は,最上位のk$ステップをしきい値に基づく計算効率の良い要素ワイドフィルタリング操作に置き換える,新しい近似アテンション手法SiftAttentionを提案する。
評価の結果,SiftAttentionは,ベクタのロード時のメモリ使用量を削減するとともに,既存の近似アテンション手法よりもモデル品質を向上することが示された。
論文 参考訳(メタデータ) (2025-06-05T17:50:32Z) - Quantifying Memory Utilization with Effective State-Size [73.52115209375343]
「我々は、テキスト・メモリ利用の尺度を策定する。」
この計量は、textitinput-invariant および textitinput-variant linear operator を持つシステムの基本的なクラスに適合する。
論文 参考訳(メタデータ) (2025-04-28T08:12:30Z) - Reducing Fine-Tuning Memory Overhead by Approximate and Memory-Sharing Backpropagation [29.139579820699495]
この研究は、活性化関数と層正規化の観点から微調整におけるメモリオーバーヘッドを低減することを目的としている。
提案手法をバックプロパゲーショントレーニングに適用し,GELUおよびSiLU活性化関数のメモリ効率の代替を導出する。
さらに、メモリ共有バックプロパゲーション戦略を導入し、アクティベーションメモリを2つの隣接層で共有できるようにする。
論文 参考訳(メタデータ) (2024-06-24T03:09:15Z) - Constant Memory Attention Block [74.38724530521277]
Constant Memory Attention Block (CMAB) は、新しい汎用アテンションブロックであり、その出力を一定メモリで計算し、一定計算で更新を実行する。
提案手法は,メモリ効率を著しく向上しつつ,最先端技術と競合する結果が得られることを示す。
論文 参考訳(メタデータ) (2023-06-21T22:41:58Z) - Dynamic Context Pruning for Efficient and Interpretable Autoregressive Transformers [29.319666323947708]
本稿では,モデル表現性を保ちながら文脈情報を動的に生成する手法を提案する。
本手法では,文脈からどの非形式的トークンをドロップできるかを学習可能なメカニズムを用いて決定する。
我々の参照実装は、推論スループットの増大とメモリの節約を最大2ドルまで達成します。
論文 参考訳(メタデータ) (2023-05-25T07:39:41Z) - A Model or 603 Exemplars: Towards Memory-Efficient Class-Incremental
Learning [56.450090618578]
CIL(Class-Incremental Learning)は、この要件を満たすために、限られたメモリサイズでモデルをトレーニングすることを目的としている。
モデルサイズを総予算にカウントし,メモリサイズに整合する手法を比較すると,保存モデルは常に機能しないことを示す。
本稿では,メモリ効率のよい拡張可能なMOdelのための MEMO という,シンプルで効果的なベースラインを提案する。
論文 参考訳(メタデータ) (2022-05-26T08:24:01Z) - ABC: Attention with Bounded-memory Control [67.40631793251997]
我々は,有界メモリ制御 (ABC) を1つの抽象概念,すなわち有界メモリ制御 (ABC) に仮定できることを示した。
ABCが新たな可能性を明らかにしました。まずは、他の方法では見分けがつかないような、効率的なアテンションのバリエーションを接続します。
最後に,既存のABCアプローチからインスピレーションを得たABCの新しい事例を紹介する。
論文 参考訳(メタデータ) (2021-10-06T03:53:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。