論文の概要: Calibrating Conservatism for Scalable Oversight
- arxiv url: http://arxiv.org/abs/2605.28807v1
- Date: Wed, 27 May 2026 17:56:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:56.263505
- Title: Calibrating Conservatism for Scalable Oversight
- Title(参考訳): スケーラブルな監視のための保守性の校正
- Authors: William Overman, Mohsen Bayati,
- Abstract要約: 本稿では,多彩な補助的スコアリング機能を,保守的ベースラインからの逸脱を測定するペナルティに集約するCalibrated Collective Oversight(CCO)を紹介する。
CCOは、Conformal Decision Theoryを使って、この保守主義をオンラインで校正し、望ましくない結果がユーザ指定の目標閾値以下であることを保証する。
SWEベンチの修正版では、より弱い監督者が敵に不整合な強いエージェントを拘束することに成功し、マチャイアヴェリでは、CCOは報酬を保ちながら倫理的違反を著しく軽減する。
- 参考スコア(独自算出の注目度): 9.553819152637493
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agentic AI systems capable of autonomous planning and extended environmental interaction pose a fundamental control problem: how can humans maintain meaningful oversight of systems that may exceed their own capabilities? Existing approaches to scalable oversight rely on complex assumptions, remain largely heuristic, or lack practical methods for sequential settings with statistical guarantees. We introduce Calibrated Collective Oversight (CCO), which aggregates diverse auxiliary scoring functions into a penalty measuring deviation from a conservative baseline. Inspired by Attainable Utility Preservation, CCO enables collective conservatism: actions face a penalty proportional to overseer concern, so high-utility actions are still selected when overseers find them unobjectionable and overridden only when concern accumulates. CCO calibrates this conservatism online using Conformal Decision Theory, ensuring that undesirable outcomes remain below a user-specified target threshold with finite-time bounds and no distributional assumptions. On a modified version of SWE-bench, weaker overseers successfully constrain an adversarially misaligned stronger agent; on MACHIAVELLI, CCO substantially reduces ethical violations while preserving reward. In both settings, empirical violation rates closely match the specified targets, as predicted by the theory.
- Abstract(参考訳): 自律的な計画と拡張された環境相互作用が可能なエージェントAIシステムは、基本的な制御上の問題を引き起こす。
既存のスケーラブルな監視へのアプローチは、複雑な仮定に依存し、主にヒューリスティックであり続けるか、統計的保証を伴うシーケンシャルな設定のための実践的な方法が欠如している。
本稿では,多彩な補助的スコアリング機能を,保守的ベースラインからの逸脱を測定するペナルティに集約するCalibrated Collective Oversight(CCO)を紹介する。
行動は監督官の懸念に比例するペナルティに直面するので、監督官が懸念が蓄積された場合にのみ、監視官が拒否不能と判断し、過度に拘束された場合にのみ、高い効力を有する行動が選択される。
CCOは、Conformal Decision Theoryを用いて、この保守主義をオンラインで校正し、望ましくない結果が、有限時間境界と分布仮定のないユーザ指定の目標しきい値以下であることを保証する。
SWEベンチの修正版では、より弱い監督者が敵に不整合な強いエージェントを拘束することに成功し、マチャイアヴェリでは、CCOは報酬を保ちながら倫理的違反を大幅に減らした。
どちらの設定でも、経験的違反率は、理論によって予測されるように、指定された目標と密接に一致している。
関連論文リスト
- When Outcome Looks Right But Discipline Fails: Trace-Based Evaluation Under Hidden Competitor State [0.39287497907611874]
アウトカムのみの評価は経済的に安全でないエージェントを認定することができる。
隠れた競合状態のホテル料金では、学習者はルールベースの収益管理政策の利率規律を保ちつつ、利用可能な部屋当たりのもっともらしい収入を達成することができる。
トレースに基づく評価パラダイムである規律安定性を導入する。
論文 参考訳(メタデータ) (2026-05-18T15:58:34Z) - Semantic Reward Collapse and the Preservation of Epistemic Integrity in Adaptive AI Systems [0.0]
近年の強化学習の進歩により、大規模言語モデルのユーザビリティ、一貫性、安全性が大幅に向上した。
実行的確実性などの繰り返しの振る舞いは、スカラー化された選好最適化システム内の未解決構造問題を示唆している。
本稿では,SRC(Semantic Reward Collapse)を提案する。
論文 参考訳(メタデータ) (2026-05-12T17:03:26Z) - Mechanical Conscience: A Mathematical Framework for Dependability of Machine Intelligenc [0.0]
本稿では、新しい概念と単純化された数学的枠組みである機械的良心(MC)を紹介する。
MCは、単一エージェントと分散インテリジェントシステムの両方のトラジェクトリレベルの規範的規制を運用している。
中心となる理論的性質は、許容性等価性、最適規制の存在、単調偏差減少である。
論文 参考訳(メタデータ) (2026-05-05T15:14:02Z) - Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration [76.08899010904652]
CapCalは、ランキング決定から位置バイアスを機械的に分離する、トレーニング不要のフレームワークである。
シングルパス効率を保ちながら、トレーニング不要の手法で優れた性能を発揮する。
論文 参考訳(メタデータ) (2026-04-11T10:47:22Z) - CMP: Robust Whole-Body Tracking for Loco-Manipulation via Competence Manifold Projection [64.65196237023754]
Manifold Competence Projectionは、アウト・オブ・ディストリビューションの摂動に対する堅牢性を改善する。
我々は、無限水平安全制約を計算効率の良い単段多様体包含に変換するフレーム-ワイズ安全スキームを用いる。
実験により、CMPは典型的なOODシナリオで最大10倍の生存率向上を達成することが示された。
論文 参考訳(メタデータ) (2026-04-08T18:00:39Z) - Authority-Level Priors: An Under-Specified Constraint in Hierarchical Predictive Processing [0.0]
オーソリティ・レベル優先(英: Authority-Level Priors、ALP)は、アイデンティティレベルの仮説の規制が許容できるサブセットを定義するメタ構造制約である。
ALPは、追加の表現状態や精度よりも高優先度であり、規制制御に許容される仮説を制約している。
計算形式化は、認可された仮説によって生成されるポリシーに対するポリシー最適化を制限する。
論文 参考訳(メタデータ) (2026-03-19T13:27:47Z) - Core Safety Values for Provably Corrigible Agents [2.6451153531057985]
我々は,複数段階の部分的に観察された環境において,検証可能な保証を付与し,適応性のための最初の実装可能なフレームワークを紹介した。
私たちのフレームワークは、単一の報酬を5つの*構造的に分離された*ユーティリティヘッドに置き換えます。
敵がエージェントを修正できるオープンエンド設定では、任意のポストハックエージェントが調整性に反するかどうかを判断することは不可能である。
論文 参考訳(メタデータ) (2025-07-28T16:19:25Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - Criticality and Safety Margins for Reinforcement Learning [53.10194953873209]
我々は,定量化基盤真理とユーザにとっての明確な意義の両面から,批判的枠組みを定めようとしている。
エージェントがn連続的ランダム動作に対するポリシーから逸脱した場合の報酬の減少として真臨界を導入する。
我々はまた、真の臨界と統計的に単調な関係を持つ低オーバーヘッド計量であるプロキシ臨界の概念も導入する。
論文 参考訳(メタデータ) (2024-09-26T21:00:45Z) - Exterior Penalty Policy Optimization with Penalty Metric Network under Constraints [52.37099916582462]
制約強化学習(CRL:Constrained Reinforcement Learning)では、エージェントが制約を満たしながら最適なポリシーを学習するために環境を探索する。
我々は,刑罰科目ネットワーク(PMN)が生み出す適応的な罰則を持つ,理論的に保証された刑罰関数法(Exterior Penalty Policy Optimization (EPO))を提案する。
PMNは様々な制約違反に適切に対応し、効率的な制約満足度と安全な探索を可能にする。
論文 参考訳(メタデータ) (2024-07-22T10:57:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。