論文の概要: Mechanism Design for Alignment and Control
- arxiv url: http://arxiv.org/abs/2609.01595v1
- Date: Tue, 01 Sep 2026 17:57:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.939931
- Title: Mechanism Design for Alignment and Control
- Title(参考訳): 配向制御のための機構設計
- Authors: Dirk Bergemann, Andrew Koh, Stephen Morris,
- Abstract要約: 我々は、アライメントと能力が不明なAIエージェントによるメカニズム設計のためのフレームワークを開発する。
我々は、そのようなエージェントが我々の代理として行動することを望んでおり、メカニズムは誠実さと服従の両方にインセンティブを与えなければならない。
- 参考スコア(独自算出の注目度): 0.6372261626436676
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We develop a framework for mechanism design with AI agents whose alignment (preferences) and capabilities (feasible actions and information) are unknown. We want such agents to act on our behalf so mechanisms must incentivize both honesty and obedience. A one-sided imitation structure---capabilities can be concealed but not counterfeited---yields a revelation principle, a characterization of implementable policies via nested cyclical monotonicity, and conditions under which eliciting higher-order beliefs can discipline multiple agents. We apply our framework to stylized examples of (i) sandbagging in which a more capable agent pretends to be less capable; (ii) an alignment--interpretability trade-off, where the two are substitutes in the instrument but complements in value; (iii) discipline via peer scoring; (iv) coupling rewards to induce competition among multiple agents; and (v) scalable oversight and reward shaping.
- Abstract(参考訳): 我々は、アライメント(前提)と能力(実行可能なアクションと情報)が不明なAIエージェントによるメカニズム設計のためのフレームワークを開発する。
我々は、そのようなエージェントが我々の代理として行動することを望んでおり、メカニズムは誠実さと服従の両方にインセンティブを与えなければならない。
片側模倣構造--能力は隠蔽されるが偽造されない---啓示原理、ネストされた巡回的単調性による実装可能な政策の特徴づけ、高次信念を引き出す条件は複数のエージェントを訓練することができる。
スタイル化された例に私たちのフレームワークを適用します。
一 より有能な代理人が有能でないふりをする砂袋
2 備品の代用品であって、価値を補完するアライメント-解釈可能性トレードオフ
三 ピアスコアによる規律
(四)複数業者間の競争を誘発する結合報酬及び
(v)スケーラブルな監視と報酬形成。
関連論文リスト
- Norm Enforcement for AI Agents: Robustly Shaping Behavior in Multi-Agent Systems [41.0957339989053]
言語モデルエージェントの規範執行機構について検討する。
単純な強制機構は、競争上の優位性のために、ミスアライメントされたエージェントによって悪用される。
本研究は,標準執行機構をエージェントの振る舞いを形作るスケーラブルなレバーとして位置づけるが,それらが支配するシステムの一部となることを期待する設計の場合のみである。
論文 参考訳(メタデータ) (2026-07-07T06:40:14Z) - Provably Secure Agent Guardrail [89.79561918065122]
既存の防衛アーキテクチャは経験的セマンティックガードレールと確率論的大モデル調整器に依存している。
本稿では,論理的推論の基本的制約に基づくエージェントのための新しいセキュリティパラダイムを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:12:41Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - Beyond Arrow's Impossibility: Fairness as an Emergent Property of Multi-Agent Collaboration [3.4539478661465766]
大規模言語モデルがエージェントとなるにつれて、相互作用と交換によって公平性が生まれることを提案する。
本研究は,2人のエージェントが3回の構造化された議論ラウンドで交渉する,管理された病院トリアージの枠組みを用いて研究する。
論文 参考訳(メタデータ) (2026-04-15T10:34:35Z) - Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges [87.04241991512386]
本稿では、報酬ハッキングを理解するための統一フレームワークとして、PCH(Proxy Compression hypothesis)を提案する。
この観点では、報酬のハッキングは、客観的圧縮、最適化増幅、評価器-政治共適応の相互作用から生じる。
この視点は、RLHF、RLAIF、RLVR体制をまたいだ経験的現象を統一し、局所的ショートカット学習がより広範な誤認識へと一般化する方法について説明している。
論文 参考訳(メタデータ) (2026-04-15T08:11:34Z) - Incentive Aware AI Regulations: A Credal Characterisation [14.228416693145649]
高度なMLアプリケーションは厳格な規制を要求するが、戦略的なMLプロバイダは開発コストを下げるためにそれらを回避していることが多い。
モデルから経験的証拠をマーケットシェアのライセンスにマッピングするフレームワークである。
非コンプライアンス分布の集合が不規則な確率測度の集合を形成する場合に限って、その機構が完全な市場結果を持つことを証明する。
論文 参考訳(メタデータ) (2026-03-05T13:42:19Z) - Agentic Uncertainty Quantification [76.94013626702183]
本稿では,言語化された不確実性をアクティブな双方向制御信号に変換する統合されたデュアルプロセスエージェントUQ(AUQ)フレームワークを提案する。
システム1(Uncertainty-Aware Memory, UAM)とシステム2(Uncertainty-Aware Reflection, UAR)は、これらの説明を合理的な手段として利用し、必要な時にのみターゲットの推論時間解決をトリガーする。
論文 参考訳(メタデータ) (2026-01-22T07:16:26Z) - Institutional AI: A Governance Framework for Distributional AGI Safety [1.3763052684269788]
AIモデルのコア特性から生じる3つの構造的問題を同定する。
ソリューションはInstitutional AIであり、AIエージェント集団の効果的なガバナンスの問題としてアライメントを扱うシステムレベルのアプローチである。
論文 参考訳(メタデータ) (2026-01-15T17:08:26Z) - SONA: Learning Conditional, Unconditional, and Mismatching-Aware Discriminator [54.562217603802075]
帰納的バイアスを伴う最終層において,自然性(美容性)とアライメントを別々に投影するSONA(Sum of Naturalness and Alignment)を導入する。
クラス条件生成タスクの実験により、SONAは最先端の手法に比べて優れたサンプル品質と条件アライメントを達成することが示された。
論文 参考訳(メタデータ) (2025-10-06T08:26:06Z) - VCG Mechanism Design with Unknown Agent Values under Stochastic Bandit
Feedback [104.06766271716774]
本研究では,エージェントが自己の価値を知らない場合に,マルチラウンドの福祉最大化機構設計問題について検討する。
まず、福祉に対する後悔の3つの概念、各エージェントの個々のユーティリティ、メカニズムの3つの概念を定義します。
当社のフレームワークは価格体系を柔軟に制御し、エージェントと販売者の後悔のトレードオフを可能にする。
論文 参考訳(メタデータ) (2020-04-19T18:00:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。