論文の概要: Evaluating Bounded Autonomy in Regulated Agentic AI: A Diagnostic Harness with Constitutional Rewards, Escalation Labels, and Runtime Governance
- arxiv url: http://arxiv.org/abs/2609.37501v1
- Date: Mon, 28 Sep 2026 11:08:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.530305
- Title: Evaluating Bounded Autonomy in Regulated Agentic AI: A Diagnostic Harness with Constitutional Rewards, Escalation Labels, and Runtime Governance
- Title(参考訳): 規制されたエージェントAIにおける境界自律性の評価: 構成的リワード、エスカレーションラベル、実行時ガバナンスによる診断的ハーネス
- Abstract要約: RegLLMは、規制されたエージェントの信頼性における境界自律性のための診断ハーネスである。
引用妥当性、ソースグラウンド、スキーマコンプライアンス、エスカレーションの正確性、コンスティチューションアライメント、アンセーフアクションレートの6つのシグナルを計測する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose RegLLM, a diagnostic harness for bounded autonomy in regulated agentic workflows. It instruments six trustworthiness signals: citation validity, source grounding, schema compliance, escalation correctness, constitutional alignment, and unsafe-action rate. Signals are distinguished by their source of supervision: programmatic verifiers, task-level escalation labels, or AI-judge scores. A deterministic runtime supervisor blocks ungrounded answers and forces escalation, logging interventions. The same domain constitution informs evaluation, training rewards, and serving guardrails. Task-level should-escalate labels make the act-versus-defer decision a measurable training signal. We demonstrate the harness at smoke scale. An offline reference run (n=12) lifts escalation recall from 0 to 0.67 and reduces unsafe-action rate from 0.33 to 0.08 when governance is enabled. Two single-GPU Qwen2.5-3B LoRA/DPO pilots (n=8, same seed and evaluation split) expose substantial variation: nominally identical RL-base configurations yield task success of 0.25 versus 0.12 and escalation recall of 1.0 versus 0.5. An answer-quality adapter changes recall from 1.0 to 0.5 in Run A, but from 0.5 to 1.0 in Run B. An escalation-aware variant produces no measurable change in Run B. These small pilots do not establish reliable adapter effects or production readiness. Their contribution is diagnostic: configuration variance can overwhelm apparent tuning effects on bounded-autonomy metrics, motivating larger evaluation sets and repeated runs.
- Abstract(参考訳): 本稿では、規制されたエージェントワークフローにおける境界自律性のための診断ハーネスであるRegLLMを提案する。
引用の妥当性、ソースの根拠付け、スキーマコンプライアンス、エスカレーションの正確性、コンスティチューションアライメント、安全でないアクションレートの6つの信頼性シグナルを計測する。
信号は、プログラム検証、タスクレベルのエスカレーションラベル、AI-judgeスコアといった、その監督源によって区別される。
決定論的ランタイムスーパーバイザーは、未解決の回答をブロックし、エスカレーション、ロギングの介入を強制します。
同じ藩憲法は、評価、訓練報酬、ガードレールの運用を通知する。
タスクレベルのアズ・エスカレートラベルは、アクト・ヴァース・デファーの決定を測定可能なトレーニング信号にする。
我々は煙のスケールでハーネスを実演する。
オフライン参照実行(n=12)は、エスカレーションリコールを0から0.67に引き上げ、ガバナンスを有効にすると、アンセーフアクションレートを0.33から0.08に下げる。
2つのシングルGPU Qwen2.5-3B LoRA/DPOパイロット(n=8、同じシードと評価スプリット)は、相当なばらつきを呈している: 名目上同じRLベース構成は、タスク成功率0.25対0.12、エスカレーションリコール率1.0対0.5である。
応答品質のアダプタは、Run Aでは1.0から0.5にリコールされるが、Run Bでは0.5から1.0にリコールされる。
それらの貢献は診断である: 構成のばらつきは、境界付き自律性メトリクスに対する明らかなチューニング効果を圧倒し、より大きな評価セットと繰り返し実行を動機付ける。
関連論文リスト
- APEXA: Execution-Integrity Enforcement for Multi-Agent LLM Automation of Synchrotron Data Reduction [0.23332469289621782]
我々は、シンクロトロンデータリダクションのための61のツールをコーディネートするフレームワークAPEXAを提案する。
決定論的実行統合ガードは、実行されていないツール呼び出しの結果を返すのを防ぐ。
また,APEXA-Benchは科学的正当性と身体的影響によって構成された58の施設タスクである。
論文 参考訳(メタデータ) (2026-09-21T06:33:11Z) - Counterfactual Tool Ranking under Utility, Cost, and Privilege Constraints [7.504639516424482]
本研究は、新しいDR推定器、公式BFCLリーダーボードスコア、プロダクションエージェント安全クレームではなく、偽造可能な評価方法であり、独立した公的証拠である。
不一致保存フォールバックは、5つのサポートギャップ実行すべてでこの特性を達成するが、保守的なサンプリング境界はデプロイメントの改善を証明しない。
2つのピン付きローカルQwen2.5モデルは、同じ200の保持タスクで評価され、固定プロンプトの下での強い失敗が露呈する。
論文 参考訳(メタデータ) (2026-09-19T06:40:09Z) - Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling [65.03665015319457]
本稿では,マルチターン障害を2つのモードに分解するアクションクラス指向診断フレームワークを提案する。
複数のマルチターンベンチマークにまたがるツールコールモデルのパネル上で検証を行う。
論文 参考訳(メタデータ) (2026-09-01T09:08:15Z) - WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - CausalNav: Reliability-Certified Causal World Models for Control under Physical-Parameter Shift [4.0604823050005345]
CausalNavは、特定状態座標上の署名付きアクション条件遷移グラフを中心に構築されたコントローラである。
CausalNavはデプロイメント時に、介入シーケンスの小さなライブラリをシミュレートし、客観的エラーをポリシ-ログアドバイスに変換する。
我々はCartPole-v1とPendulum-v1の9つの制御基線について評価した。
論文 参考訳(メタデータ) (2026-08-07T23:16:57Z) - Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Auditable Decision Models with Learned Abstention and Real-Time Steering [6.287457666346811]
生産AIシステムは、不完全、矛盾、あるいは不十分な証拠で運用されることが多い。
我々は,不確実性が明確でなければならないAIシステムの運用上の決定制御について検討する。
本稿では,YES,NO,TBDを予測する境界決定制御モデルであるEvaluatorDPTを提案する。
論文 参考訳(メタデータ) (2026-05-26T23:37:56Z) - Reliable Extraction of Clinical Follow-Up Instructions: A Hybrid Neural-Symbolic Pipeline [43.0484058393522]
我々は,ニューラルシンボリックなハイブリッドパイプラインを直接生成に対して試験する。
本研究は,2000点の合成外用コーパスについて検討した。
論文 参考訳(メタデータ) (2026-05-26T05:14:33Z) - Temporal Attention for Adaptive Control of Euler-Lagrange Systems with Unobservable Memory [1.2891210250935148]
本稿では,自己注意ブロックによって演算トルク制御器の利得が生成されるメタ制御アーキテクチャを提案する。
注意頭数は、記憶状態勾配の代理解析によりポリシートレーニングの前に選択される。
この手法は非線形摩擦と可変ペイロードを持つ2-DOFマニピュレータで試験される。
論文 参考訳(メタデータ) (2026-05-07T19:25:18Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。