論文の概要: RCBSF: A Multi-Agent Framework for Automated Contract Revision via Stackelberg Game
- arxiv url: http://arxiv.org/abs/2604.10740v1
- Date: Sun, 12 Apr 2026 17:27:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.196215
- Title: RCBSF: A Multi-Agent Framework for Automated Contract Revision via Stackelberg Game
- Title(参考訳): RCBSF:Stackelberg Gameによる自動契約更新のためのマルチエージェントフレームワーク
- Abstract要約: 本稿では,非協調ゲームとしてリビジョンを定式化するリスク制約付きバイレベルスタックバーグフレームワーク(RCBSF)を提案する。
この二段階の定式化が収束して、誘導されていない構成よりも厳密に優れた効用が得られるという理論的保証を提供する。
- 参考スコア(独自算出の注目度): 5.711356514732554
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Despite the widespread adoption of Large Language Models (LLMs) in Legal AI, their utility for automated contract revision remains impeded by hallucinated safety and a lack of rigorous behavioral constraints. To address these limitations, we propose the Risk-Constrained Bilevel Stackelberg Framework (RCBSF), which formulates revision as a non-cooperative Stackelberg game. RCBSF establishes a hierarchical Leader Follower structure where a Global Prescriptive Agent (GPA) imposes risk budgets upon a follower system constituted by a Constrained Revision Agent (CRA) and a Local Verification Agent (LVA) to iteratively optimize output. We provide theoretical guarantees that this bilevel formulation converges to an equilibrium yielding strictly superior utility over unguided configurations. Empirical validation on a unified benchmark demonstrates that RCBSF achieves state-of-the-art performance, surpassing iterative baselines with an average Risk Resolution Rate (RRR) of 84.21\% while enhancing token efficiency. Our code is available at https://github.com/xjiacs/RCBSF .
- Abstract(参考訳): 法律AIにLarge Language Models(LLM)が広く採用されているにもかかわらず、自動化されたコントラクト修正のためのユーティリティは、幻覚的な安全性と厳格な行動制約の欠如によって妨げられている。
これらの制約に対処するため,リスク制約付きバイレベルスタックルバーグフレームワーク (RCBSF) を提案し,非協調型スタックルバーグゲームとしてリビジョンを定式化する。
RCBSFは、GPA(Global Prescriptive Agent)が、反復的にアウトプットを最適化するために、CRA(Constrained Revision Agent)とLVA(Local Verification Agent)によって構成されるフォロワーシステムにリスク予算を課する階層的リーダフォロワー構造を確立する。
この二段階の定式化が非誘導構成よりも厳密に優れた効用をもたらす平衡に収束するという理論的保証を提供する。
統一されたベンチマークにおける実証的な検証は、RCVFが最先端のパフォーマンスを達成し、トークン効率を高めつつ、平均リスク解決率(RRR)84.21\%の反復的ベースラインを超えていることを示している。
私たちのコードはhttps://github.com/xjiacs/RCBSFで利用可能です。
関連論文リスト
- ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples [65.74946647574696]
強化学習(RL)は,大規模言語モデル(LLM)の推論能力を大幅に向上させた。
本研究では,この不安定性の重要源である過最適化について検討する。
我々は,このパラダイムを受動的ペナルティからアクティブ標本安定化に移行するフレームワークARMORを提案する。
論文 参考訳(メタデータ) (2026-07-11T21:22:46Z) - Mitigating Anchoring Bias in LLM-Based Agents for Energy-Efficient 6G Autonomous Networks [3.2715455153948256]
本稿では,Large Language Model (LLM) エージェントを用いた6Gアーキテクチャにおけるゼロタッチネットワークスライシングを実現するための,自律型エージェントリソースネゴシエーションフレームワークを提案する。
このようなエージェントは本質的にバイアスのアンカーに悩まされ、初期提案に固執し、ネットワークオーバープロビジョンを引き起こしていることを示す。
当社の認知的脱バイアスは、厳格な交渉パターンを分解し、エージェントにSLA境界を安全に乗り越え、システムの省エネを最大25%向上させるアクティブな探索を強制します。
論文 参考訳(メタデータ) (2026-06-05T08:29:03Z) - Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering [54.97384993676565]
複雑な国内R&D規制から派生した運用知識グラフを特徴とする,新たなベンチマークであるRegOps-Benchを用いて,レギュレーションコンプライアンスQAを形式化する。
RefWalkはクロスドキュメントの引用を横切り、マックスベースのアグリゲーションを通じてマルチビュー候補を融合させ、ソースへのクレームを明示的にマッピングするためにルールごとの属性を強制する。
論文 参考訳(メタデータ) (2026-05-28T10:38:38Z) - SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs [55.46289074417954]
検証可能な報酬(RLVR)による強化学習は、推論タスクのpass@1を確実に改善するが、pass@kでは同等の利得を得られないことが多い。
中心的な構造的制約は、トレーニングを安定させるが、本質的には基準分布にポリシーを固定する逆-KL正規化から生じる。
我々は,逆KLアンカー分布自体を再構成することで,制御可能な経験的サポート拡張を可能にする,原則化されたフレームワークであるSAGEを提案する。
論文 参考訳(メタデータ) (2026-05-15T07:42:21Z) - Four-Axis Decision Alignment for Long-Horizon Enterprise AI Agents [0.0]
長期のエンタープライズエージェントは、失われた記憶、多段階の推論、および規制の制約の下で高い評価を下す。
長距離決定行動は、4つの軸に分解され、それぞれ独立に測定可能で、フェール可能となる。
論文 参考訳(メタデータ) (2026-04-21T13:37:19Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - DARC: Disagreement-Aware Alignment via Risk-Constrained Decoding [59.16244104797919]
本稿では,リスク制約付き復号法(DARC)*による分散アライメント(Disagreement-Aware Alignment)を提案する。
DARCは応答選択を、分布的に堅牢で、リスクに敏感な意思決定として捉えている。
アライメントベンチマークの実験では、DARCは競合平均品質を維持しながら、不一致と尾のリスクを低減する。
論文 参考訳(メタデータ) (2026-03-09T09:21:29Z) - Scalable and Reliable State-Aware Inference of High-Impact N-k Contingencies [4.588028371034407]
ACパワーフローやACOPFによる全機能停止組合せの排他的評価は日常的な操作では不可能である。
本稿では,高インパクトな$N!-k$の停止シナリオを直接生成するように設計された,スケーラブルでステートアウェアな並行性推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-10T06:55:59Z) - SGM: A Statistical Godel Machine for Risk-Controlled Recursive Self-Modification [24.250783705030653]
安全編集のための最初の統計アーキテクチャである統計ゴデルマシン(SGM)を紹介する。
SGMは証明に基づく要求を統計的信頼テスト(e-values, Hoeffding bounds)に置き換え、選択された信頼度レベルで優越性が証明された場合にのみ修正を認める。
また,提案するCTHS(Confirm-Triggered Harmonic Spending)も提案する。
論文 参考訳(メタデータ) (2025-10-11T14:09:37Z) - Safe and Compliant Cross-Market Trade Execution via Constrained RL and Zero-Knowledge Audits [0.5586191108738564]
本稿では、厳格なコンプライアンスの実施と実行品質のバランスをとるクロスマーケットアルゴリズムトレーディングシステムを提案する。
アーキテクチャは、高レベルプランナー、強化学習実行エージェント、独立コンプライアンスエージェントを含む。
対t検定による95%信頼度レベルへの影響を報告し,CVaRによる尾部リスクの検討を行った。
論文 参考訳(メタデータ) (2025-10-06T15:52:12Z) - Vulnerable Agent Identification in Large-Scale Multi-Agent Reinforcement Learning [49.31650627835956]
システムがスケールアップすると、部分的なエージェントの障害は避けられないものとなり、全体的なパフォーマンスが著しく低下するエージェントのサブセットを特定することが重要になる。
本稿では,大規模マルチエージェント強化学習(MARL)における脆弱性エージェント識別(VAI)問題について検討する。
実験により, 大規模MARLおよびルールベースシステムにおいて, より脆弱なエージェントを効果的に同定し, システムを悪用し, それぞれのエージェントの脆弱性を明らかにする値関数を学習した。
論文 参考訳(メタデータ) (2025-09-18T16:03:50Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z) - Adaptive Insurance Reserving with CVaR-Constrained Reinforcement Learning under Macroeconomic Regimes [0.0]
本稿では、テールリスク感度、マクロ経済体制モデリング、規制コンプライアンスを統合した保険保留のための強化学習(RL)フレームワークを提案する。
このフレームワークは、固定ショックストレステストとシステマティック・ストラテライズド・アナリティクスに対応しており、不確実性の下での維持に原則的で原則化されたアプローチを提供する。
論文 参考訳(メタデータ) (2025-04-13T01:43:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。