論文の概要: Adaptive Consistency Graph for Long-Horizon Agents
- arxiv url: http://arxiv.org/abs/2609.32754v2
- Date: Tue, 29 Sep 2026 06:28:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.616168
- Title: Adaptive Consistency Graph for Long-Horizon Agents
- Title(参考訳): 長軸エージェントの適応整合性グラフ
- Abstract要約: 本稿では,長距離実行のための適応一貫性グラフ(ACG)を提案する。
ACGは、実行証拠とその証明を永続的なグラフに段階的に整理し、各決定に対して一時的な要求中心のビューを構築する。
一致した評価では、ACGはGPT-5.6-lunaの平均的な成功率を44.5%から50.2%に改善し、BrowseComp-Plusで最大の上昇となった。
- 参考スコア(独自算出の注目度): 6.052949010696364
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model agents can often make reasonable local decisions on short tasks, yet their performance degrades when success requires long sequences of dependent actions and tool calls. During execution, task requirements, historical evidence, and the current execution state may gradually become disconnected, so later decisions can drift from the original objective. We study this problem by introducing the Adaptive Consistency Graph (ACG) for long-horizon execution. ACG incrementally organizes execution evidence and its provenance in a persistent graph, then constructs a temporary requirement-centered view for each decision under a bounded context budget. Rather than replacing the base agent's planner or tool executor, ACG provides a structured and traceable context view for each decision. In the matched evaluation, ACG improves GPT-5.6-luna's average success from 44.5\% with ReAct to 50.2\%, with the largest gain on BrowseComp-Plus (73.5\% versus 62.4\%). We further analyze trajectory structure and inference cost to characterize this improvement. Our code is available at https://github.com/yunsaijc/Adaptive-Consistency-Graph.
- Abstract(参考訳): 大規模な言語モデルエージェントは、短いタスクで合理的な局所的な決定をすることが多いが、成功のためには、依存するアクションやツール呼び出しの長いシーケンスを必要とする場合、パフォーマンスは低下する。
実行中、タスク要求、履歴証拠、現在の実行状態は徐々に切り離されてしまうため、後の決定は元の目的から逸脱する可能性がある。
本稿では,長距離実行のための適応一貫性グラフ(ACG)を導入することにより,この問題を考察する。
ACGは、実行証拠とその証明を永続的なグラフに段階的に整理し、境界付きコンテキスト予算の下で各決定に対して一時的な要求中心のビューを構築する。
基本エージェントのプランナーやツールエグゼキュータを置き換えるのではなく、ACGは各決定に対して構造化されトレース可能なコンテキストビューを提供する。
一致した評価では、ACG は GPT-5.6-luna の平均的な成功率を ReAct で 44.5\% から 50.2\% に改善し、BrowseComp-Plus で最大の上昇率 (73.5\% 対 62.4\%) である。
さらに、この改善を特徴付けるために、軌道構造と推論コストを解析する。
私たちのコードはhttps://github.com/yunsaijc/Adaptive-Consistency-Graphで利用可能です。
関連論文リスト
- GraphHCA: Closed-Form Hindsight Credit Assignment for Long-Horizon LLM Agents [22.9047313166022]
グループベース強化学習(RL)は、高度な大規模言語モデル(LLM)を持ち、エージェントタスクにまで拡張されている。
Hindsight Credit assignment (HCA) は、後見と行動政治の確率の比率による信用の属性である。
本稿では,HCAのモデルフリーな実現法であるGraphHCAを提案する。
論文 参考訳(メタデータ) (2026-09-28T13:03:13Z) - LocalLSTC: A Long Short-Term Control Architecture for Locally Deployed GUI Agents [13.261859864631063]
トレーニング不要なアーキテクチャであるLocalLSTCを導入し、時間的スコープによる制御を組織化し、永続的なクロスステップ状態を維持する。
長期制御は、アクティブなサブゴール、サブゴールアライメントのエビデンス、および相互作用間の実行時のフィードバックを維持し、短期実行は現在のステップに対する有界なコミットメントを実現している。
Qwen3.6-27Bでは、LocalLSTCはOSWorldで64.7%のSR-100、WindowsAgentArenaで65.3%に達し、両方のベンチマークで最強のローカル結果を上回った。
論文 参考訳(メタデータ) (2026-08-26T13:20:27Z) - TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents [22.01777615106231]
Long-Horizon Large Language Model (LLM) エージェントは通常、スパース終端結果に最適化される。
本稿では、ステップレベルの監督を行動誘発遷移から直接引き出すトランジッションワイド・クレジット・アサインメントを提案する。
ALFWorld、WebShop、および7つの検索拡張された質問回答ベンチマークの実験は、評価されたベースラインよりも一貫した改善を示している。
論文 参考訳(メタデータ) (2026-08-17T06:19:12Z) - Atomic Task Graph: A Unified Framework for Agentic Planning and Execution [13.978062792065215]
Atomic Task Graph (ATG) は、計画と実行のための統一された制御フレームワークである。
ATGは依存関係を公開するための明示的なグラフを維持し、再利用をサポートする。
ATGは、成功率と実行効率の強いベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-02T09:34:20Z) - Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning [85.02566758103008]
Group-Graph Policy Optimization (G2PO) は、マルチターンエージェントタスクに適したグループベースの強化学習アルゴリズムである。
G2POは最先端のプロンプトベースとRLベースラインを大幅に上回り、GRPOよりも最大22.2%の成功率の向上を達成した。
論文 参考訳(メタデータ) (2026-06-22T08:12:47Z) - TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition [62.56752617853322]
アウトカムベースの報酬はスパースフィードバックのみを提供するが、トラジェクトリによる報酬は注釈付き参照ソリューションに依存している。
本稿では,関数スキーマと実行時実行を直接管理する報奨フレームワークであるtrajectory-Invariant Execution Rewardsを提案する。
論文 参考訳(メタデータ) (2026-05-16T03:47:26Z) - LongSeeker: Elastic Context Orchestration for Long-Horizon Search Agents [63.75550089045995]
ロングホライズン検索エージェントは、理由として急速に成長する作業状況を管理し、ツールを呼び、情報を観察しなければならない。
エージェントの軌道の一部は、タスクに対する現在の関連性に応じて、異なるレベルで細部まで維持される。
我々は10kの合成軌道上にQwen3-30B-A3Bを微調整した長距離探索エージェントであるLongSeekerを開発した。
論文 参考訳(メタデータ) (2026-05-06T17:54:16Z) - Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation [86.62036852878354]
大規模言語モデル(LLM)は、信頼性の高い長文理解を必要とする設定でますます運用される。
位置ロバスト性を向上させるトレーニングレギュレータであるRoPE-Perturbed Self-Distillationを提案する。
Llama-3-8BとQwen-3-4Bの長文適応実験は、長文ベンチマークにおいて一貫した利得を示す。
論文 参考訳(メタデータ) (2026-04-15T18:46:35Z) - WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning [82.12501258760814]
大規模言語モデル(LLM)ベースのエージェントは、Web情報検索において強力な能力を示している。
Plan anchorは、長期にわたるWeb推論タスクにおいて、最初の推論ステップが下流の動作に不均等に影響を与えている場所です。
計画と実行を分離する2段階のRLフレームワークであるAnchor-GRPOを提案する。
論文 参考訳(メタデータ) (2026-01-06T16:36:40Z) - DecEx-RAG: Boosting Agentic Retrieval-Augmented Generation with Decision and Execution Optimization via Process Supervision [50.89715397781075]
Agentic Retrieval-Augmented Generation (Agentic RAG)は、複雑なタスクの処理能力を向上する。
我々は,決定と実行を取り入れたマルコフ決定プロセス(MDP)としてRAGをモデル化したDecEx-RAGを提案する。
DecEx-RAGは6つのデータセットに対して平均6.2%の絶対的なパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2025-10-07T08:49:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。