論文の概要: PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
- arxiv url: http://arxiv.org/abs/2607.20064v1
- Date: Wed, 22 Jul 2026 12:11:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.071869
- Title: PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
- Title(参考訳): PRO-LONG: 長期共振が可能なプログラムメモリ
- Abstract要約: 長期の作業には、持続的な知覚、推論、探索が必要である。
大規模言語モデル(LLM)エージェントのための最小限のコンテキスト管理フレームワークであるProp-LONGを提案する。
PRO-LONGは、完全な構造化されたインタラクションログを保持し、この履歴を効率的に検索するコーディングエージェントの最近の進歩に乗じて、トレードオフに対処する。
- 参考スコア(独自算出の注目度): 20.884233351488987
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon tasks require sustained perception, reasoning, and exploration, and are a persistent challenge for large language model (LLM) agents. This gap is reflected in their limited performance on continual learning benchmarks such as ARC-AGI-3, especially when models are evaluated out of the box. Various agent harnesses have been proposed to close this gap, and each commits to a strategy for handling long sequences of observations, i.e., what information to save from the environment and how to load it into model context, a choice we argue is particularly consequential. Existing methods for context management face a significant tradeoff, as preserving more information makes retrieving relevant details less tractable. We propose PRO-LONG, a minimal context management framework built around programmatic memory for LLM agents in long-horizon, exploratory settings. PRO-LONG addresses the tradeoff by keeping a complete, structured interaction log and capitalizing on recent progress in coding agents to search this history efficiently. On the full ARC-AGI-3 public game set, PRO-LONG improves over a base coding agent by an average of 18.0 percentage points across frontier models, and matches or exceeds state-of-the-art specialized harnesses (up to 76.1% pass@1) while using 4.2-5.8x fewer tokens. With Fable 5, PRO-LONG achieves 97.4% best@2 at a total cost of \$1,750. Relevant code and logs are available at https://github.com/alexisfox7/PRO-LONG.
- Abstract(参考訳): ロングホライゾンタスクは持続的な知覚、推論、探索を必要とし、大きな言語モデル(LLM)エージェントにとって永続的な課題である。
このギャップは、ARC-AGI-3のような連続学習ベンチマークにおいて、特にモデルが最初から評価されている場合の限られた性能に反映される。
このギャップを埋めるために様々なエージェントハーネスが提案され、それぞれが長い一連の観測、すなわち環境から保存する情報、モデルコンテキストにそれをロードする方法を扱う戦略にコミットする。
既存のコンテキスト管理の方法は、より多くの情報を保存することで、関連する詳細を検索しにくくなるため、大きなトレードオフに直面します。
本稿では,LLMエージェントの長期探索環境におけるプログラムメモリを中心に構築された最小限のコンテキスト管理フレームワークProp-LONGを提案する。
PRO-LONGは、完全な構造化されたインタラクションログを保持し、この履歴を効率的に検索するコーディングエージェントの最近の進歩に乗じて、トレードオフに対処する。
ARC-AGI-3の公開ゲームセットでは、PRO-LONGはフロンティアモデル全体の平均18.0ポイントでベースコーディングエージェントを改良し、4.2-5.8倍のトークンを使用しながら最先端の特殊ハーネス(最大76.1%パス@1)にマッチまたは超える。
Fable 5では、Prop-LONGは97.4%のベスト@2を合計1,750ドルで達成している。
関連するコードとログはhttps://github.com/alexisfox7/PRO-LONG.comで公開されている。
関連論文リスト
- RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models [54.53236295237077]
リポジトリレベルのコード推論を評価するベンチマークであるRepoReasonerを紹介します。
出力予測は、ファイル間でのきめ細かいステートフルな実行推論を計測します。
Call Chain Predictionは、ノイズの多いコンテキスト下での高レベルのアーキテクチャ依存性の理解を評価する。
論文 参考訳(メタデータ) (2026-07-28T17:12:41Z) - SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent [51.274445160155864]
ロングホライゾンのエージェント推論は、思考、ツールコール、観察、部分的な結論を含む長い相互作用履歴を通して行動するために大きな言語モデルを必要とする。
既存のアプローチでは、インタラクション履歴の切り抜き、短いサロゲートに圧縮、あるいは再利用のために選択した部分を取得することで、この問題に対処している。
我々は、インテント駆動リコールのための生のトラジェクトリページを保持しながら、継続的なインタラクションをコンパクトなメモリキューに統合するスタンドアロンフレームワークであるState-Adaptive Memoryを提案する。
論文 参考訳(メタデータ) (2026-05-23T08:37:16Z) - Episodic-Semantic Memory Architecture for Long-Horizon Scientific Agents [0.0]
長期統合知識(約3トークン/メッセージ)から即時エピソードニーズ(インスタント10メッセージウィンドウ)を分離するデュアルプロセス記憶アーキテクチャを評価する。
より少ないトークン(45,434対12000以上の制限)で1-2秒のレイテンシで70~85%の精度を維持している。
連続記憶を保ちながら現実的な線形成長(約3トークン/メッセージ)を示す「最小から最小の」ギャップを同定する。
論文 参考訳(メタデータ) (2026-05-17T19:44:24Z) - GenericAgent: A Token-Efficient Self-Evolving LLM Agent via Contextual Information Density Maximization (V1.0) [56.81743709880371]
Long-Horizon Large Language Model (LLM) エージェントは、コンテキストによって根本的に制限される。
長い水平性能は、文脈長ではなく、有限の文脈予算内で意思決定関連情報がどれだけ維持されているかによって決定される。
我々は、情報密度とコンテキストの1つの原理に基づいて構築された汎用的自己進化型LLMエージェントシステムであるGenericAgent(GA)を提案する。
論文 参考訳(メタデータ) (2026-04-18T17:59:15Z) - The Limits of Long-Context Reasoning in Automated Bug Fixing [4.853967615615349]
大規模言語モデル(LLM)は、コンテキスト全体を直接推論することができる。
LLMの最近の進歩は、ソフトウェア工学のベンチマークで強力なパフォーマンスを実現している。
我々は,現在のLLMが長文コードとパッチ生成を確実に実行可能であるかどうかを体系的に評価する。
論文 参考訳(メタデータ) (2026-02-17T22:51:40Z) - Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents [57.38404718635204]
大規模言語モデル (LLM) エージェントは、有限コンテキストウィンドウによる長距離推論において基本的な制限に直面している。
既存のメソッドは通常、長期記憶(LTM)と短期記憶(STM)を独立したコンポーネントとして扱う。
本稿では,エージェントのポリシーに LTM と STM 管理を直接統合する統合フレームワークである Agentic Memory (AgeMem) を提案する。
論文 参考訳(メタデータ) (2026-01-05T08:24:16Z) - GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory [59.869552603264076]
GCAgent(Global-Context-Aware Agent)は,広義の長ビデオ理解を実現する新しいフレームワークである。
これは、イベントとその因果関係と時間的関係を、簡潔で組織化されたコンテキストに構造的にモデル化するものです。
実験により、GCAgentは、強力なMLLMベースライン上でのVideo-MME Long分割において、最大23.5%の精度向上を実現した。
論文 参考訳(メタデータ) (2025-11-15T04:29:00Z) - Beyond Fact Retrieval: Episodic Memory for RAG with Generative Semantic Workspaces [5.110309385104824]
大きな言語モデル(LLM)は、長いコンテキスト推論において根本的な課題に直面します。
現在のソリューションでは、エピソードイベントを通じてエンティティを追跡するのに必要な、時空間で記述された物語表現を構築することができない。
我々は,ニューロインスパイアされた生成記憶フレームワークである textbf Generative Semantic Workspace (GSW) を提案する。
論文 参考訳(メタデータ) (2025-11-10T19:59:34Z) - MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning [73.27233666920618]
本稿では,メモリを反復的に保持し,現在のターンと組み合わせたエージェントワークフローであるMemSearcherを提案する。
それぞれのターンで、MemSearcherはユーザーの質問をメモリに融合させ、推論トレースを生成し、検索アクションを実行し、メモリを更新してタスクの解決に必要な情報のみを保持する。
我々は,MemSearcher Agents の推論,検索戦略,メモリ管理を協調的に最適化する,エンドツーエンドの RL フレームワークである Multi-context GRPO を紹介する。
論文 参考訳(メタデータ) (2025-11-04T18:27:39Z) - Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory [0.5584627289325719]
大規模言語モデル(LLM)は、文脈的に一貫性のある応答を生成する際、顕著な進歩を示した。
しかし、それらの固定されたコンテキストウィンドウは、長時間のマルチセッション対話に対する一貫性を維持するための根本的な課題を生じさせる。
私たちはMem0というスケーラブルなメモリ中心アーキテクチャを導入し、進行中の会話から健全な情報を動的に抽出し、統合し、取得することでこの問題に対処します。
論文 参考訳(メタデータ) (2025-04-28T01:46:35Z) - Hierarchical Context Merging: Better Long Context Understanding for Pre-trained LLMs [61.40047491337793]
本稿では,大規模言語モデルの制約を克服する新しいトレーニングフリースキームである階層型cOntext MERging(HOMER)を提案する。
HomeRは、長いインプットを管理可能なチャンクに分割する、分別/対数アルゴリズムを使用する。
トークン削減技術がマージ毎に先行し、メモリ使用効率が保証される。
論文 参考訳(メタデータ) (2024-04-16T06:34:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。