論文の概要: ContractRL: Shielded Group-Relative Policy Optimization for Auditable Tool-Call Repair
- arxiv url: http://arxiv.org/abs/2610.00328v1
- Date: Tue, 29 Sep 2026 08:38:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.611659
- Title: ContractRL: Shielded Group-Relative Policy Optimization for Auditable Tool-Call Repair
- Title(参考訳): ContractRL: 監査ツールコール修復のためのシールド付きグループ相対ポリシー最適化
- Abstract要約: 本稿では,契約制約付き逐次修復プロトコルであるContractRLを紹介し,検証者誘導修復を0.9決定プロセスとしてモデル化する。
我々は,契約制約付きグループ相対的グループ相対的客観的決定を規定し,標準的目標とセマンティックラベルは凍結までオンライン状態外に保持する。
- 参考スコア(独自算出の注目度): 21.792889952064527
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Structured tool calls often fail after only a small number of fields violate a schema or an execution contract. Regenerating the complete object enlarges the action surface and makes repeated repair difficult to audit. We introduce ContractRL, a contract-constrained sequential repair protocol that models verifier-guided JSON repair as a bounded decision process. At each step the policy observes the candidate, typed verifier feedback, JSON Pointer, immutable repair history, and remaining budget; a contract-derived action mask filters malformed or prohibited RFC-6902 operations before a deterministic validator performs the transition. We specify a contract-constrained group-relative objective for patch, retry, and abstention decisions while keeping canonical targets and semantic labels outside the online state until trace freeze. Under identical verifier information, ContractRL attains 0.9362 semantic success with 34.4 generated tokens, compared with 0.9076 and 44.9 tokens for Patch-SFT and 0.9148 and 137.2 tokens for full regeneration over 192 cases per seed and five seeds. Policy optimization improves semantic success from 0.9186 for supervised ContractRL to 0.9375. A separate three-seed paired evaluation against Patch-SFT yields a semantic difference of +0.0396 (95% CI $[+0.0137,+0.0662], p=0.0039$). Feedback, action-mask, budget, and schema-shift analyses connect these gains to localized correction, while adversarial and multi-turn evaluations characterize the remaining failure modes.
- Abstract(参考訳): 構造化ツールコールは、少数のフィールドがスキーマや実行契約に違反した後に失敗することが多い。
完全なオブジェクトを再生すると、動作面が拡大し、繰り返しの修復が困難になる。
本稿では,検証対象のJSON修復を境界決定プロセスとしてモデル化するコントラクト制約付きシーケンシャル修復プロトコルであるContractRLを紹介する。
各ステップでポリシーは、候補、型付き検証者フィードバック、JSONポインタ、不変の修復履歴、残りの予算を観察し、決定論的バリデータを実行する前に、コントラクト由来のアクションマスクフィルタがRFC-6902操作を不正または禁止する。
凍結までオンライン状態の外に標準的ターゲットやセマンティックラベルを置きながら、パッチ、再試行、棄権決定のための契約制約付きグループ相対的目標を規定する。
同一の検証情報の下では、ContractRLは34.4の生成トークンで0.9362のセマンティックな成功を達成し、Patch-SFTでは0.9076、44.9のトークンで0.9148と137.2のトークンで1種当たり192のケースと5つのシードで完全な再生を実現している。
ポリシー最適化は、教師付きContractRLのセマンティック成功を0.9186から0.9375に改善する。
Patch-SFTに対する3つ組のペア評価は、+0.0396(95% CI $[+0.0137,+0.0662], p=0.0039$)のセマンティックな差をもたらす。
フィードバック、アクションマスク、予算、スキーマシフト分析はこれらの利得を局所的な補正に結び付け、対向評価とマルチターン評価は残りの障害モードを特徴づける。
関連論文リスト
- Agent Error Dataset: Scaling 50,000 Error--Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training [45.727227890697556]
我々は,9,961のソースタスクから50,228のエラー診断ペアからなるエージェントエラーデータセット(AED)を紹介した。
5段階のAgenic Error-to-Trainingパイプラインは自然の故障を収集し、診断と修正案を生成し、記録された証拠と照合する。
アクタートレーニングのレシピの比較において、アクションオンリーの修復トレーニングは成功オンリーのトレーニングよりもWebShop-liteの方が6.67ポイント高い。
論文 参考訳(メタデータ) (2026-09-30T16:40:22Z) - DRSR: Learning Set-Level Deletion Risk for Efficient Long-Horizon Agents [55.84813053778976]
ロングホライゾン言語モデルエージェントは、現在の決定と関係が変化する推論の痕跡、ツール交換、観察を蓄積する。
直接セットリスクスコアは、削除セットの選択としてエージェント履歴圧縮リスクを定式化する。
メカニカル・アナリシスとアブリケーションは、決定に制約のある関係、保持されたコンテキスト情報、ペア・インタラクション、および棄権がそれぞれ信頼できるプルーニングに寄与していることを示している。
論文 参考訳(メタデータ) (2026-09-23T03:06:01Z) - Invalidation Contracts for Cross-Episode Agent Memory [0.8673353590830692]
APIエラーからのリカバリ提案をキャッシュするLLMエージェントは、後続のエピソードでリデリベーションをスキップすることができる。
サーバ側のデータドリフトは、キャッシュされた修正をサイレント障害にします。
バージョンスタンプとキャッシュ可能性ヒントをすべてのリカバリ提案にアタッチするプロトコル層である、無効化契約を導入する。
論文 参考訳(メタデータ) (2026-08-31T18:45:07Z) - The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context [45.88028371034407]
コード修復における制御ケーススタディを報告し,新しい現象ではない。
私たちは、同じスタック上の1つのフラグ(1チャンク毎の重複)を切り替えます。
BM25(3.2pp、重要なパラダイム間相互作用)を逆転させる。
厳格な固定予算では、ファイルごとのハードダイドプリケートや、タスクに対するA/Bパッケージングポリシは、メトリックフラグを調整しないことが示されます。
論文 参考訳(メタデータ) (2026-08-14T19:22:50Z) - Metric Aggregation Divergence: A Hidden Validity Threat in Agent-Based Policy Optimization and a Contractual Remedy [7.1976264551575895]
メートル法アグリゲーション分散(英: Metric aggregate divergence、MAD)は、エージェントベースのモデルにおいて、異なるパイプラインステージで発生するサイレント不整合である。
私たちは、ディスパッチ時に実施される単一の呼び出し可能なランタイムであるメトリックコントラクトを、対策として紹介します。
論文 参考訳(メタデータ) (2026-06-27T18:17:33Z) - Software Delegation Contracts: Measuring Reviewability in AI Coding-Agent Work [0.0]
以前の作業では、タスク、権限、返却された作業パッケージ、受け入れコンテキストを、委譲されたコーディング作業の分析単位として記述するソフトウェア委譲契約を提案したが、その効果は測定しなかった。
本稿では,符号化エージェントの明示的デリゲート契約に関する制御されたパイロット研究について報告する。
論文 参考訳(メタデータ) (2026-06-14T05:53:27Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - ContractBench: Can LLM Agents Preserve Observation Contracts? [9.057486468322933]
観察契約の遵守は、緊急かつ回帰的な能力であることを示す。
ContractBenchは、2つの障害モードを探索する33の二重軸タスクのベンチマークである。
i)評価モデルが80%,Claude-Opus-4.6が77.8%, (ii)Qwen 3.5で4B (0%) から9B (56.6%) の急激な家庭内能力崖が397B-A17Bで70.7%, (iii) GPT-5ファミリーでの非単調性スケーリングが消失した。
論文 参考訳(メタデータ) (2026-05-17T06:37:04Z) - Security Is Relative: Training-Free Vulnerability Detection via Multi-Agent Behavioral Contract Synthesis [14.657771106188115]
脆弱性検出のためのトレーニング不要なマルチエージェントフレームワークであるPhoenixを提案する。
Phoenixは、検出をセマンティックスライダ、要求リバースエンジニア、契約審査員の3つのステージに分解する。
PrimeVul Pairedでは、Phoenix は F1 = 0.825 と Pair-Correct = 64.4% を獲得し、RASM-Vul (F1 = 0.668) と VulTrial (F1 = 0.563) を上回る。
論文 参考訳(メタデータ) (2026-04-21T03:02:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。