論文の概要: Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift
- arxiv url: http://arxiv.org/abs/2607.09175v1
- Date: Fri, 10 Jul 2026 08:10:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.809048
- Title: Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift
- Title(参考訳): 分散シフト下における信頼性のある長軸エージェントコンテキスト進化のスコープ検証
- Abstract要約: 永続的な命令成分を型付きセマンティックグラフとして維持するためのグラフ正規化エージェントコンテキスト進化(GRACE)を提案する。
制御された分散シフトプロトコルの下で,2ドルベンチから導出される固定通信エージェントのGRACEを評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deployed LLM agents rely on agentic context, the model-external textual control content assembled by an operational harness. In this work, the mutable component of that context is a persistent system-level instruction that is updated from operational experience while the model, tools, and harness remain fixed. Over long evolution horizons, flat-text maintenance makes verification increasingly difficult as accumulated instructions grow and interact. We propose Graph-Regularized Agentic Context Evolution (GRACE), which maintains the persistent instruction component as a typed semantic graph and validates proposed updates within the local typed neighborhoods of modified nodes. Accepted graph updates are reconstructed as incremental edits to the textual instruction checkpoint used at deployment. We evaluate GRACE within a fixed telecom agent harness derived from $τ^2$-bench under a controlled distribution-shift protocol. Across five independent replications, GRACE improves strict reliability, measured by pass^3, from the Gemini 2.5 Flash zero-shot value of 0.091 to 0.673$\pm$0.136 at the final checkpoint. This exceeds a Gemini 3.1 Pro zero-shot reference of 0.242 on the same held-out set, while the flat-text HCE baseline finishes at 0.191$\pm$0.051. These results identify two requirements for reliable long-horizon context evolution, a structural substrate that makes verification local and a consolidation mechanism that keeps accumulated instruction content usable.
- Abstract(参考訳): デプロイされたLLMエージェントは、操作ハーネスによって組み立てられたモデル-外部テキスト制御コンテンツであるエージェントコンテキストに依存している。
この作業では、そのコンテキストの可変なコンポーネントは、モデル、ツール、ハーネスが固定されている間、運用経験から更新される永続的なシステムレベルの命令である。
長い進化の地平線の中で、フラットテキストのメンテナンスは、蓄積された命令が成長し相互作用するにつれて、検証がますます困難になる。
本稿では,永続的命令成分を型付きセマンティックグラフとして保持し,修正ノードの局所型付き地区内での更新提案を検証したグラフ正規化エージェントコンテキスト進化(GRACE)を提案する。
承認されたグラフ更新は、デプロイ時に使用されるテキスト命令チェックポイントへのインクリメンタルな編集として再構築される。
我々は、制御された分散シフトプロトコルの下で、$τ^2$-benchから導出される固定通信エージェントのGRACEを評価する。
5つの独立したレプリケーションで、GRACEはパス^3で測定された厳格な信頼性を、最終チェックポイントでのGemini 2.5 Flashゼロショット値0.091から0.673$\pm$0.136まで向上させる。
これはGemini 3.1 Proの0ショット参照を超え、同じホールトアウトセットで0.242、フラットテキストのHCEベースラインは0.191$\pm$0.051である。
これらの結果は、信頼性のある長期的コンテキスト進化のための2つの要件、検証を局所的に行う構造基板と、蓄積した命令内容を使用可能な統合メカニズムを識別する。
関連論文リスト
- HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution [11.431479238875712]
我々は、信頼できるエージェントの自己進化を実現するために、参照軌道から学習する自己進化フレームワークであるHarnessEvolveを紹介する。
私たちは、さまざまなモデルとエージェントフレームワークを使用して、オープンドメインとエンタープライズシナリオにまたがるいくつかのベンチマークで広範な実験を行います。
結果は、HarnessEvolveがすべてのベンチマークと設定で、最先端のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-09-01T07:31:18Z) - EDGE: Engine for Deterministic Graph Evaluation through Conversation Simulation from Graph Structured DSL Configuration [0.518884791678612]
本稿では,ドメイン固有言語を利用したプランナであるAgentGraphを基盤とした形式的評価手法を提案する。
我々は,対話経路を包括的に列挙するグラフアルゴリズムを活用し,エージェントの完全な行動空間をキャプチャする包括的評価セットを形成する。
信頼性を定量化するために、反応と軌道決定性、構造的付着、意味的整合性を測定する新しい指標を定義する。
論文 参考訳(メタデータ) (2026-08-30T18:56:53Z) - Living-Harness Is an Interactive-Agent Evolver [15.081919387954578]
大規模言語モデル(LLM)エージェントは、エピソード内の障害や再試行後に回復する可能性があるが、同じ実行失敗は後続のタスクで再帰する可能性がある。
我々は,各軌道とその評価器信号を有界なハーネス更新のための後続証拠に変換する自己進化型エージェントハーネスである$textbfLiving-Harnessを提案する。
論文 参考訳(メタデータ) (2026-07-29T08:20:11Z) - VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct [71.22358682581215]
ビジュアルな数学的推論のための強化学習のスケーリングは、難しい質問を生成すること以上のものを必要とします。
これは2つのコンポーネントからなる反復的なフレームワークであるVeriEvolとしてインスタンス化します。
5ベンチマークのビジュアル・マス・スイートでは、10Kから250KサンプルまでのSFTデータのスケーリングが平均精度を35.42から54.73に引き上げている。
論文 参考訳(メタデータ) (2026-06-22T16:17:30Z) - Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning [85.02566758103008]
Group-Graph Policy Optimization (G2PO) は、マルチターンエージェントタスクに適したグループベースの強化学習アルゴリズムである。
G2POは最先端のプロンプトベースとRLベースラインを大幅に上回り、GRPOよりも最大22.2%の成功率の向上を達成した。
論文 参考訳(メタデータ) (2026-06-22T08:12:47Z) - KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing [24.315720861063397]
KGEditは、テキスト・トゥ・ビデオ(T2V)拡散モデルのための構造化セマンティック・コントロール・フレームワークである。
まず、入力プロンプトのアンビグニティ対応知識グラフ(AAKG)を構築し、入力プロンプトのアンビグニティ化とアンビグニティ化を行う。
次に,拡散変換器の鍵層に意味信号を注入する構造的意味注入モジュール(SSIM)を設計する。
論文 参考訳(メタデータ) (2026-05-28T07:31:22Z) - EGL-SCA: Structural Credit Assignment for Co-Evolving Instructions and Tools in Graph Reasoning Agents [35.25814217014108]
グラフ推論エージェントのための検証器中心のデュアルスペースフレームワークであるEGL-SCAを提案する。
EGL-SCAは、最先端の92.0%の平均成功率を達成することを示す。
論文 参考訳(メタデータ) (2026-05-11T11:09:32Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - Semantic Entanglement in Vector-Based Retrieval: A Formal Framework and Context-Conditioned Disentanglement Pipeline for Agentic RAG Systems [0.0]
埋め込み空間における交叉重なりのモデル相対尺度として意味的絡み合いを定式化する。
埋め込みに先立って文書を再構成する4段階の事前処理フレームワークであるセマンティック・ディスタングルメント・パイプライン(SDP)を紹介した。
約25のサブドメインにわたる2,000以上のドキュメントからなる実世界の企業医療知識ベースでSDPを評価した。
論文 参考訳(メタデータ) (2026-04-20T00:24:34Z) - Autogenesis: A Self-Evolving Agent Protocol [60.15939127351914]
本稿では,自己進化プロトコルであるAutogenesis Protocol(AGP)を紹介する。
本稿では,実行中のプロトコル登録リソースを動的にインスタンス化し,検索し,精錬する自己進化型マルチエージェントシステムAGSを提案する。
論文 参考訳(メタデータ) (2026-04-16T14:04:06Z) - IMPACT: A Dataset for Multi-Granularity Human Procedural Action Understanding in Industrial Assembly [79.737814043505]
IMPACTは、デプロイメント指向の産業手続き的理解のための5ビューのRGB-Dデータセットである。
実際の組み立てと、プロ向けのツールを備えた商業用アングルグラインダーの分解を中心に構築されている。
論文 参考訳(メタデータ) (2026-04-12T02:09:19Z) - Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models [59.242742594156546]
CoEvoは、テキストプロキシとビジュアルプロキシの両方を双方向でサンプル条件で適応するテストタイムフレームワークである。
CoEvoは最先端のパフォーマンスを実現し、AUROCを1.33%改善し、ImageNet-1KではFPR95を45.98%削減した。
論文 参考訳(メタデータ) (2026-01-13T12:08:26Z) - Open-Source Agentic Hybrid RAG Framework for Scientific Literature Review [2.092154729589438]
本稿では,ハイブリッドRAGパイプラインを自律エージェント内にカプセル化するエージェントアプローチを提案する。
当社のパイプラインでは,PubMedやarXiv,Google Scholar APIから,バイオロジカルなオープンアクセスデータを収集しています。
Llama-3.3-70B エージェントが GraphRAG (クエリを Cypher for KG に変換する) または VectorRAG (スパースと高密度検索を組み合わせて再ランク付けする) を選択する
論文 参考訳(メタデータ) (2025-07-30T18:54:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。