論文の概要: Fragility of Value under Imperfect Alignment
- arxiv url: http://arxiv.org/abs/2607.28881v2
- Date: Wed, 05 Aug 2026 03:59:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:42.956542
- Title: Fragility of Value under Imperfect Alignment
- Title(参考訳): 不完全なアライメントにおける価値の脆弱性
- Authors: Winter Cross,
- Abstract要約: AIの安全性の一般的な懸念は、人間の価値が脆弱であることだ。
本稿では,エージェントが理想化されたアライメントトレーニングを行うアライメント問題のモデルを提案する。
我々の結果は、最適化圧力を制限するAI設計の過度な最適化と動機付けの危険性を強調します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As more responsibility is placed upon AI systems, it becomes increasingly important to guarantee that these systems are aligned with humanity. A common fear in AI safety is that human value is fragile -- that is, optimizing too heavily for an imperfect proxy to human values will lead to a catastrophic outcome. In this paper, we present a model of the alignment problem where an agent undergoes idealized alignment training that guarantees its value function satisfies a proxy condition before optimizing the world. Our primary results identify conditions on the human value function and the accuracy of several proxy conditions under which an agent with an $η$-catastrophic value function, one that is guaranteed to take the expectation of human value below $η$ in the limit of optimizing power, would be deployed. Our results highlight the danger of overoptimization and motivate AI designs that limit optimization pressure, such as quantilizers, rather than relying solely on pre-deployment training.
- Abstract(参考訳): より多くの責任がAIシステムに置かれるにつれて、これらのシステムが人間と一致していることを保証することがますます重要になる。
AIの安全性における一般的な懸念は、人間の価値は脆弱である、つまり、人間の価値に対する不完全なプロキシに過度に最適化することは、破滅的な結果をもたらす、ということだ。
本稿では,エージェントが理想化されたアライメントトレーニングを行い,その値関数が世界を最適化する前にプロキシ条件を満たすことを保証するアライメント問題のモデルを提案する。
本研究の主目的は,最大化能力の限界において,$η$-catastrophic値関数を持つエージェントが$η$以下の人的値の期待値を取ることが保証されるような,人的価値関数に関する条件と,数種類のプロキシ条件の精度を明らかにすることである。
我々の結果は、事前デプロイトレーニングにのみ依存するのではなく、量子化器のような最適化圧力を制限するAI設計の過度な最適化と動機付けの危険性を強調します。
関連論文リスト
- The Novelty Bottleneck: A Framework for Understanding Human Effort Scaling in AI-Assisted Work [4.726153739634646]
新規性ボトルネックと呼ばれるメカニズムを分離した人間とAIのコラボレーションモデルを提案する。
モデルはタスクが原子的な決定に分解されると仮定する。
私たちの貢献は、人間の努力が線形にスケールしなければならないという証拠ではありません。
論文 参考訳(メタデータ) (2026-03-28T22:50:13Z) - Moral Anchor System: A Predictive Framework for AI Value Alignment and Drift Prevention [0.0]
重要なリスクはバリュードリフトであり、進化するコンテキストや学習ダイナミクス、意図しない最適化によって、AIシステムが一致した値から逸脱する。
我々は,AIエージェントの値ドリフトを検出し,予測し,緩和する新しいフレームワークであるMoral Anchor System(MAS)を提案する。
論文 参考訳(メタデータ) (2025-10-05T07:24:23Z) - Personalized Constitutionally-Aligned Agentic Superego: Secure AI Behavior Aligned to Diverse Human Values [0.6640968473398455]
スーパーエージェントがユーザー選択型「クリードコンスティチューション」を参考にAIプランニングを主導
リアルタイムコンプライアンス執行機関は、これらの憲法に対する計画を検証する。
システムは最大98.3%の有害スコアの減少とほぼ完全な拒絶率を達成する。
論文 参考訳(メタデータ) (2025-06-08T20:31:26Z) - REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback [61.54791065013767]
報酬関数と人間の嗜好の相違は、現実世界で破滅的な結果をもたらす可能性がある。
近年の手法は、人間の嗜好から報酬関数を学習することで、不適応を緩和することを目的としている。
本稿では,ロボットRLHFフレームワークにおける報酬正規化の新たな概念を提案する。
論文 参考訳(メタデータ) (2023-12-22T04:56:37Z) - ASSERT: Automated Safety Scenario Red Teaming for Evaluating the
Robustness of Large Language Models [65.79770974145983]
ASSERT、Automated Safety Scenario Red Teamingは、セマンティックなアグリゲーション、ターゲットブートストラップ、敵の知識注入という3つの方法で構成されている。
このプロンプトを4つの安全領域に分割し、ドメインがモデルの性能にどのように影響するかを詳細に分析する。
統計的に有意な性能差は, 意味的関連シナリオにおける絶対分類精度が最大11%, ゼロショット逆数設定では最大19%の絶対誤差率であることがわかった。
論文 参考訳(メタデータ) (2023-10-14T17:10:28Z) - Absolutist AI [0.0]
絶対的な制約でAIシステムを訓練することは、多くのAI安全問題にかなりの進歩をもたらす可能性がある。
ミスアライメントの最悪の結果を避けるためのガードレールを提供する。
非常に価値のある結果を得るために、AIが大惨事を引き起こすのを防げるかもしれない。
論文 参考訳(メタデータ) (2023-07-19T03:40:37Z) - Heterogeneous Value Alignment Evaluation for Large Language Models [91.96728871418]
大規模言語モデル(LLM)は、その価値を人間のものと整合させることを重要視している。
本研究では,LLMと不均一値の整合性を評価するため,不均一値アライメント評価(HVAE)システムを提案する。
論文 参考訳(メタデータ) (2023-05-26T02:34:20Z) - ERMAS: Becoming Robust to Reward Function Sim-to-Real Gaps in
Multi-Agent Simulations [110.72725220033983]
Epsilon-Robust Multi-Agent Simulation (ERMAS)は、このようなマルチエージェントのsim-to-realギャップに対して堅牢なAIポリシーを学ぶためのフレームワークである。
ERMASは、エージェントリスク回避の変化に対して堅牢な税政策を学び、複雑な時間シミュレーションで最大15%社会福祉を改善する。
特に、ERMASは、エージェントリスク回避の変化に対して堅牢な税制政策を学び、複雑な時間シミュレーションにおいて、社会福祉を最大15%改善する。
論文 参考訳(メタデータ) (2021-06-10T04:32:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。