論文の概要: STAGE: Stateful Translation to Agentic Graph Execution with Policy-Scoped Context and Deterministic Control
- arxiv url: http://arxiv.org/abs/2608.22538v2
- Date: Thu, 27 Aug 2026 22:56:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.069043
- Title: STAGE: Stateful Translation to Agentic Graph Execution with Policy-Scoped Context and Deterministic Control
- Title(参考訳): STAGE:ポリシー付きコンテキストと決定論的制御によるエージェントグラフ実行へのステートフル翻訳
- Abstract要約: 本稿では、決定論的コードに手続き制御を配置しつつ、ポリシースコープノードにモデル判断を限定するフレームワークSTAGEを提案する。
3つの公開ポリシーフォローベンチマークと、プロプライエタリなバンキングベンチマークであるSmart Disputeについて、STAGEを評価した。
- 参考スコア(独自算出の注目度): 0.29360071145551064
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Policy-governed agents must interpret case evidence while reliably following authorized procedures. We present STAGE, an executable-graph framework that confines model judgment to policy-scoped nodes while placing procedural control in deterministic code. We evaluate STAGE on three public policy-following benchmarks and Smart Dispute, a proprietary banking benchmark. Compared with monolithic full-policy execution, STAGE improves task success and repeated-run reliability, with its largest observed gains on the deeper workflows. On $τ^2$-bench Telecom and Smart Dispute, $\mathrm{Pass}^{3}$ improves by up to 55.0 and 65.7 percentage points, respectively. These results demonstrate the value of combining localized policy reasoning with deterministic procedural control for enterprise use.
- Abstract(参考訳): 政策を監督する代理人は、証明された手続きを確実に追及しつつ、事件証拠を解釈しなければならない。
本稿では、決定論的コードに手続き制御を配置しつつ、ポリシースコープノードにモデル判断を限定する実行可能なグラフフレームワークSTAGEを提案する。
3つの公開ポリシーフォローベンチマークと、プロプライエタリなバンキングベンチマークであるSmart Disputeについて、STAGEを評価した。
モノリシックなフルポリシー実行と比較すると、STAGEはタスクの成功と繰り返し実行される信頼性を改善し、より深いワークフローで最大の成果を上げている。
τ^2$-bench Telecom と Smart Dispute では、$\mathrm{Pass}^{3}$はそれぞれ 55.0 と 65.7 に改善されている。
これらの結果は、企業利用における局所的な政策推論と決定論的手続き制御を組み合わせることの価値を実証するものである。
関連論文リスト
- OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks [17.773038952370865]
本稿では,ループポリシーを中心とした自己進化フレームワークであるOpenLoopEvolve(OLE)について述べる。
OLEは、エージェントの観察、計画、記憶、行動、検証、回復、停止、予算管理を、バージョンと系統を持つポータブルなポリシー資産として表現する。
オンラインモードは連続的な操作からのフィードバックに基づいて候補生成をトリガーし、オフラインモードはアーカイブされたトレースと障害証拠から候補ポリシーを検索する。
論文 参考訳(メタデータ) (2026-08-10T09:57:26Z) - Co-Evolving LLM Evaluators and Policies via DynamicRubric [67.2962847914162]
政策によって引き起こされたサンプルに対する評価者フィードバックによるポストトレーニングは、大きな言語モデルを改善するための主要なメカニズムとなる。
反応条件付き評価器であるDynamicRubricを提案する。
8Bバックボーンを用いた実験では、DynamicRubricは評価器のパフォーマンスを改善し、ベースラインよりも強力なポリシー管理を提供する。
論文 参考訳(メタデータ) (2026-07-22T12:35:40Z) - EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments [64.33452656100393]
本稿では,固定的なインタラクション予算の下で,ハーネスモデルエージェントが繰り返し実行可能なポリシシステムを編集する制御された評価設定である自律ポリシー進化を紹介する。
この設定を、コンパクトなインタラクティブRL環境から構築されたベンチマークであるEvoPolicyGymでインスタンス化する。
EvoPolicyGymスイートでは、GPT-5.5が16の環境で最強のランキングスコアとトップ2のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2026-07-02T17:10:13Z) - Beyond Goodhart's Law: A Dynamic Benchmark for Evaluating Compliance in Multi-Agent Systems [45.89982596338141]
本稿では,現実的な圧力下でのマルチエージェントシステムの手続き的アライメントを評価するために設計された,動的で対向的なベンチマークであるMAC-Benchを紹介する。
コンプライアンス・ウェイト・サクセス・レート(CSR)とマキアベリアン・ギャップ(MG)という新しい指標を紹介します。
我々は、成功とコンプライアンスの間の広範にわたるトレードオフを明らかにするために、最先端フロンティアモデルの包括的な評価を行う。
論文 参考訳(メタデータ) (2026-06-05T19:33:58Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - OGPO: Sample Efficient Full-Finetuning of Generative Control Policies [53.42266064673132]
ジェネレーティブコントロールポリシー(GCP)は、ロボット学習に有効なパラメータ化として登場した。
この研究は、GCPを微調整するためのサンプル効率であるOGPO(Off-policy Generative Policy Optimization)を導入している。
OGPOはマルチタスク設定、高精度挿入、デクスタラス制御にまたがる操作タスクにおける最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-05-04T18:36:40Z) - PolicyBank: Evolving Policy Understanding for LLM Agents [51.86716874651299]
PolicyBankは構造化されたツールレベルの政策洞察を維持し、それらを反復的に洗練する。
PolicyBankは、人間の神託に対するギャップの最大82%を閉じている。
論文 参考訳(メタデータ) (2026-04-16T20:29:30Z) - Near-Miss: Latent Policy Failure Detection in Agentic Workflows [9.719140082591956]
エージェントの会話トレースにおける遅延ポリシー障害を検出するための新しい指標を提案する。
その結果,ツールコールの変異を伴う軌道の8~17%に潜伏障害がみられた。
論文 参考訳(メタデータ) (2026-03-31T12:26:35Z) - Runtime Governance for AI Agents: Policies on Paths [4.111929395230638]
我々は、実行パスが効率的なランタイムガバナンスの中心的なオブジェクトであると主張している。
私たちの見解では、実行時評価は一般的なケースであり、パスに依存したポリシーには必要です。
論文 参考訳(メタデータ) (2026-03-17T14:35:52Z) - Verification of Robust Properties for Access Control Policies [51.736723807086385]
既存のアクセス制御ポリシーの検証方法は、検証が進む前に、ポリシーを完全かつ完全に決定する必要がある。
本稿では,政策構造がどのような決定を下すか,どのような決定を下すか,あるいはその後の拡張に拘わらず,その決定を行うかという課題について,ロバストなプロパティ検証を導入する。
可能なすべてのポリシー拡張を普遍的に定量化しているにもかかわらず、判断は二階述語論理プログラミング言語における探索の証明に還元されることを示す。
論文 参考訳(メタデータ) (2026-03-13T17:14:38Z) - Verified Critical Step Optimization for LLM Agents [67.05296684575445]
クリティカルステップ最適化は、検証されたクリティカルステップに優先学習を集中する。
メソッドは、専門家のデモンストレーションではなく、失敗するポリシーの軌道から始まります。
GAIA-Text-103とXBench-DeepSearchの実験では、CSOはSFTベースラインよりも37%、相対的に26%改善している。
論文 参考訳(メタデータ) (2026-02-03T11:41:02Z) - Safe and Compliant Cross-Market Trade Execution via Constrained RL and Zero-Knowledge Audits [0.5586191108738564]
本稿では、厳格なコンプライアンスの実施と実行品質のバランスをとるクロスマーケットアルゴリズムトレーディングシステムを提案する。
アーキテクチャは、高レベルプランナー、強化学習実行エージェント、独立コンプライアンスエージェントを含む。
対t検定による95%信頼度レベルへの影響を報告し,CVaRによる尾部リスクの検討を行った。
論文 参考訳(メタデータ) (2025-10-06T15:52:12Z) - Simulation-Based Optimistic Policy Iteration For Multi-Agent MDPs with Kullback-Leibler Control Cost [3.9052860539161918]
本稿では,マルコフ決定過程(MDP)における定常最適ポリシー学習のためのエージェントベース楽観的ポリシー(OPI)手法を提案する。
提案手法は, 強欲政策改善段階とm段階時間差(TD)政策評価段階から構成される。
我々は,OPIスキームの同期(入出力状態空間の評価)と非同期(一様にサンプリングされたサブステートの集合)の両バージョンが,最適値関数と最適共同ポリシーのロールアウトに収束することを示した。
論文 参考訳(メタデータ) (2024-10-19T17:00:23Z) - Distributed-Training-and-Execution Multi-Agent Reinforcement Learning
for Power Control in HetNet [48.96004919910818]
We propose a multi-agent Deep reinforcement learning (MADRL) based power control scheme for the HetNet。
エージェント間の協調を促進するために,MADRLシステムのためのペナルティベースQラーニング(PQL)アルゴリズムを開発した。
このように、エージェントのポリシーは、他のエージェントによってより容易に学習でき、より効率的なコラボレーションプロセスをもたらす。
論文 参考訳(メタデータ) (2022-12-15T17:01:56Z) - Efficient Policy Iteration for Robust Markov Decision Processes via
Regularization [49.05403412954533]
ロバストな意思決定プロセス(MDP)は、システムのダイナミクスが変化している、あるいは部分的にしか知られていない決定問題をモデル化するためのフレームワークを提供する。
最近の研究は、長方形長方形の$L_p$頑健なMDPと正規化されたMDPの等価性を確立し、標準MDPと同じレベルの効率を享受する規則化されたポリシー反復スキームを導出した。
本研究では、政策改善のステップに焦点をあて、欲求政策と最適なロバストなベルマン作用素のための具体的な形式を導出する。
論文 参考訳(メタデータ) (2022-05-28T04:05:20Z) - OffCon$^3$: What is state of the art anyway? [20.59974596074688]
モデルフリー連続制御タスクに対する2つの一般的なアプローチは、SACとTD3である。
TD3 は DPG から派生したもので、決定論的ポリシーを用いて値関数に沿ってポリシー上昇を行う。
OffCon$3$は、両方のアルゴリズムの最先端バージョンを特徴とするコードベースである。
論文 参考訳(メタデータ) (2021-01-27T11:45:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。