論文の概要: AI Alignment through a Game-theoretic Lens: A Survey
- arxiv url: http://arxiv.org/abs/2608.27910v2
- Date: Tue, 01 Sep 2026 13:18:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:35.556749
- Title: AI Alignment through a Game-theoretic Lens: A Survey
- Title(参考訳): ゲーム理論レンズによるAIアライメント:サーベイ
- Authors: Yanan Cai, Zhongrui Zhao, Zhigang Lu, Ickjai Lee, Wei Emma Zhang, Minhui Xue, Yihong Zhang, Shuchao Pang, Wei Xiang,
- Abstract要約: 主要なゲーム理論要素に関する最近の進歩を整理し、好みの多様性、アライメントの優先順位、時間的ダイナミクスという3つの課題に沿って文献を合成する。
この視点は、現在のアライメント手法がゲーム理論の分析から真に恩恵を受けていること、フレームワークがゆるいこと、堅牢で適応的で検証可能なAIシステムを構築する上での課題を明らかにする。
- 参考スコア(独自算出の注目度): 24.643841917395743
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As large language models and increasingly capable AI agents are deployed in high-risk settings, aligning them with complex human values has become a central challenge. Existing alignment methods, while effective in improving helpfulness, harmlessness, and controllability, often struggle to capture real-world preferences that are context-dependent, non-transitive, and shaped by dynamic multi-party interactions. This survey reviews AI alignment through a game-theoretic lens. Specifically, it organizes recent progress around key game-theoretic elements and synthesizes the literature along three challenges: preference diversity, alignment priority, and temporal dynamics. This perspective clarifies where current alignment methods genuinely benefit from game-theoretic analysis, where the framework is looser, and what challenges remain in building robust, adaptive, and verifiable AI systems.
- Abstract(参考訳): 大きな言語モデルと、ますます有能なAIエージェントがリスクの高い設定でデプロイされるにつれて、それらと複雑な人間の価値を整合させることが、中心的な課題となっている。
既存のアライメント手法は、有用性、無害性、制御性を改善するのに効果的であるが、コンテキストに依存し、非推移的であり、動的多人数インタラクションによって形作られた現実世界の好みを捉えるのに苦労することが多い。
この調査はゲーム理論レンズを通してAIのアライメントをレビューする。
具体的には、重要なゲーム理論要素に関する最近の進歩を整理し、好みの多様性、アライメントの優先順位、時間的ダイナミクスという3つの課題に沿って文献を合成する。
この視点は、現在のアライメント手法がゲーム理論の分析から真に恩恵を受けていること、フレームワークがゆるいこと、堅牢で適応的で検証可能なAIシステムを構築する上での課題を明らかにする。
関連論文リスト
- Positive Alignment: Artificial Intelligence for Human Flourishing [36.70635562721606]
既存のアライメント研究は、安全と害の防止に関する懸念に支配されている。
ポジティブアライメント(Positive Alignment)とは、人間と生態の繁栄を積極的に支援するAIシステムの開発である。
論文 参考訳(メタデータ) (2026-05-11T10:11:08Z) - Unleashing Guidance Without Classifiers for Human-Object Interaction Animation [54.24065561632133]
従来の拡散に基づくアプローチは、しばしば接触品質を改善するために手作りの接触先行や人為的なキネマティック制約に頼っている。
そこで本研究では,手作業による事前設計への依存を軽減し,手作業による指導を段階的に行うデータ駆動型代替手法を提案する。
このデータ駆動型ガイダンスは本質的に接触認識であり,広い範囲の合成対象測地でトレーニングを行う際に拡張可能である。
論文 参考訳(メタデータ) (2026-03-26T17:59:34Z) - Disentangling AI Alignment: A Structured Taxonomy Beyond Safety and Ethics [0.0]
我々は、AIアライメントを理解するための構造化された概念的フレームワークを開発する。
アライメント目標のみに焦点を当てるのではなく、アライメント目標(安全、倫理性、合法性など)、スコープ(アウトカム対実行)、選挙区(個人対集団)を区別する分類を導入する。
この構造的アプローチは複数の正統なアライメント構成を明らかにし、ドメイン間の実践的および哲学的な統合の基礎を提供する。
論文 参考訳(メタデータ) (2025-05-02T20:45:52Z) - PRISM: Perspective Reasoning for Integrated Synthesis and Mediation as a Multi-Perspective Framework for AI Alignment [0.0]
Perspective Reasoning for Integrated Synthesis and Mediation (PRISM)は、AIアライメントにおける永続的な課題に対処するフレームワークである。
PRISMは道徳的懸念を7つの「基本世界観」にまとめ、それぞれが人間の道徳的認知の異なる次元を捉えていると仮定している。
現実の展開や形式的検証など,今後の方向性を概説するとともに,マルチパースペクティブな合成とコンフリクトの仲介に重点を置きながら,今後の方向性を概説する。
論文 参考訳(メタデータ) (2025-02-05T02:13:57Z) - Position: Towards Bidirectional Human-AI Alignment [109.57781720848669]
我々は、人間とAIの双方向的・動的関係を説明するために、研究コミュニティは「調整」を明確に定義し、批判的に反映すべきであると主張する。
このフレームワークは、AIと人間の価値を整合させる従来の取り組みを取り入れているだけでなく、人間とAIを整合させるという、重要で未解明の次元も導入しています。
論文 参考訳(メタデータ) (2024-06-13T16:03:25Z) - A Moral Imperative: The Need for Continual Superalignment of Large Language Models [1.0499611180329806]
スーパーアライメント(Superalignment)は、超知能AIシステムが人間の価値観や目標に応じて行動することを確実にする理論フレームワークである。
本稿では,AIシステム,特に大規模言語モデル(LLM)における生涯的スーパーアライメントの実現に関わる課題について検討する。
論文 参考訳(メタデータ) (2024-03-13T05:44:50Z) - AI Alignment: A Comprehensive Survey [69.61425542486275]
AIアライメントは、AIシステムが人間の意図や価値観に沿って振る舞うようにすることを目的としている。
AIアライメントの重要な目的として、ロバストネス、解釈可能性、制御可能性、倫理という4つの原則を特定します。
我々は、現在のアライメント研究を、前方アライメントと後方アライメントの2つの重要なコンポーネントに分解する。
論文 参考訳(メタデータ) (2023-10-30T15:52:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。