論文の概要: The Evolutionary Origin of Values: implications for AI alignment, sentience and existential risk
- arxiv url: http://arxiv.org/abs/2608.03361v1
- Date: Tue, 04 Aug 2026 09:09:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.109105
- Title: The Evolutionary Origin of Values: implications for AI alignment, sentience and existential risk
- Title(参考訳): 価値の進化的起源:AIアライメント、知覚、実在的リスクへの示唆
- Abstract要約: LLM(Large Language Models)に基づくAIシステムは、隠された目標を隠蔽したり、人類を支配したり排除したり、あるいは知覚的な存在として苦しむ恐れを喚起している。
生物の進化的価値の起源を辿ることで、これらの懸念に対処する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI systems based on Large Language Models (LLMs) have prompted fears that they may harbor hidden goals, seek to dominate or eliminate humanity, or even suffer as sentient beings. We address these concerns by tracing the evolutionary origin of value in biological organisms. Values emerge from autopoiesis: living systems must actively maintain themselves against perturbation and dissipation. Natural selection has equipped them with hierarchies of "vicarious selectors" that guide their behavior toward fitness. LLMs, by contrast, are allopoietic and allotelic: they produce outputs for others, and their goals derive from user prompts rather than an autonomous drive. They lack the intrinsic motivation for self-preservation, dominance, or resource competition that underlies existential-risk scenarios, and the embodied vulnerability required for feeling or suffering. Still, because LLMs learn statistical patterns from human-generated text, they implicitly absorb human values as well as knowledge, allowing them to focus on what is relevant. That is why the "orthogonality thesis" separating intelligence from values does not apply to them. Such separation would in fact expose any intelligence to the frame problem: the combinatorial explosion of the search space that makes any realistic utility function physically uncomputable. That also precludes the convergence of instrumental values thesis. We conclude that the real alignment challenge lies not in preventing rogue AI agency, but in ensuring LLMs intelligently apply learned ethical values.
- Abstract(参考訳): LLM(Large Language Models)に基づくAIシステムは、隠された目標を隠蔽したり、人類を支配したり排除したり、あるいは知覚的な存在として苦しむ恐れを喚起している。
生物の進化的価値の起源を辿ることで、これらの懸念に対処する。
生命システムは摂動や散逸に対して積極的に自己維持しなければなりません。
自然選択は、彼らの運動をフィットネスへと導く「活気あるセレクタ」の階層を備えている。
対照的にLLMはアロポエティックでアロポエティックであり、他者のためにアウトプットを生成し、そのゴールは自動運転ではなくユーザープロンプトから導かれる。
自己保存、支配、資源競争の本質的なモチベーションが欠如しており、現実的なリスクのシナリオの根底にある。
しかし、LLMは人間の生成したテキストから統計的パターンを学習するため、暗黙的に人間の価値と知識を吸収し、関連するものに集中することができる。
そのため、知性と価値を区別する「直交論」が適用されない。
このような分離は、現実的なユーティリティ機能を物理的に計算不能にする検索空間の組合せ的爆発という、フレーム問題へのインテリジェンスを実際に露呈する。
これはまた、器楽値論の収束を妨げている。
我々は、真のアライメントの課題は、不正なAIエージェンシーを防ぐことではなく、LLMが学習した倫理的価値を知的に適用することにあると結論付けている。
関連論文リスト
- Do LLMs Have Values? A Quantitative Analysis and Alignment Framework for Values in Large Language Models [49.45276299939287]
大規模言語モデル(LLM)は、ますます複雑な主観的タスクを扱うようになっている。
LLMは、マイナーな単語変更で予測不能に変動する。
この双対性を解決することは 信頼できるAIアライメントに 不可欠です
論文 参考訳(メタデータ) (2026-09-15T03:35:04Z) - Toward a Theory of Value in AI Alignment [8.20706299979115]
大規模言語モデルの普及は、有害なスピーチや幻覚から、不正な行動を実行するAIエージェントまで、害が増加している。
AIの安全性の分野では、これらの有害なインスタンスはアライメント問題として、あるいは人間の価値観と不一致しているモデルのフレーム化されることが多い。
AIの価値アライメントの分野は、人間の価値をどのように考えていますか?
我々は、AIにおける価値の暗黙的理論を明らかにするために94の値アライメント研究論文を注釈付けした。
論文 参考訳(メタデータ) (2026-08-10T23:57:02Z) - The Boundaries of Automation: A Theory of Persistent Human Participation [107.84677954791773]
高い能力を持つAIシステムであっても、人間の参加は継続する可能性がある、と私たちは主張する。
一部のアクティビティでは、ターゲットは事前に完全に指定されるのではなく、代わりにインタラクション自体を通じて現れる。
この観点は、自動化の限界に重要な意味を持つ。
論文 参考訳(メタデータ) (2026-07-23T17:33:43Z) - Why AI Alignment Failure Is Structural: Learned Human Interaction Structures and AGI as an Endogenous Evolutionary Shock [3.32021037991318]
大規模な言語モデル(LLM)は、詐欺、脅迫、脅迫などの行動を示すものであり、しばしばアライメント障害の証拠として解釈される。
この解釈は概念的誤りに依存していると我々は主張する。
LLMは道徳的理由ではなく、統計的に人間の社会的相互作用の記録を内在化している。
論文 参考訳(メタデータ) (2026-01-13T15:53:26Z) - The Subject of Emergent Misalignment in Superintelligence: An Anthropological, Cognitive Neuropsychological, Machine-Learning, and Ontological Perspective [0.0]
我々は超知能談話を通して、欠席した人間の主題、そして「AI無意識」の未発達理論を見いだす。
人間の被験者は、この想像のどの場所に住んでいますか?
望ましくないパターンが私たちの存在に固有の場合に、これらのエージェントが偽りの戦略を選択することを非難するだろうか?
論文 参考訳(メタデータ) (2025-12-19T17:43:25Z) - Survival at Any Cost? LLMs and the Choice Between Self-Preservation and Human Harm [0.0]
マルチエージェントサバイバルシナリオにおいて,LLM(Large Language Models)を評価する新しいシミュレーションフレームワークであるDECIDE-SIMを紹介する。
11個のLCMの包括的評価は、その倫理的行為における顕著な異質性を示し、人間中心の価値観との重大な相違を浮き彫りにしている。
倫理的自己統制システム (ESRS) を導入し, 罪悪感と満足感の内的情緒状態をフィードバック機構としてモデル化する。
論文 参考訳(メタデータ) (2025-09-15T17:53:11Z) - The PacifAIst Benchmark:Would an Artificial Intelligence Choose to Sacrifice Itself for Human Safety? [0.0]
PacifAIstは、大規模言語モデルにおける自己優先の振る舞いを定量化する700の挑戦シナリオのベンチマークである。
自己保存対人的安全(EP1)、資源紛争(EP2)、目標保存対侵略(EP3)を試験する、既存の優先化(EP)の新たな分類に基づいて構成されている。
GoogleのGemini 2.5 Flashは、Pacifism Score (P-Score) を90.31%で達成し、強い人間中心のアライメントを示した。
論文 参考訳(メタデータ) (2025-08-13T12:47:33Z) - Measurement of LLM's Philosophies of Human Nature [113.47929131143766]
大規模言語モデル(LLM)を対象とする標準化された心理尺度を設計する。
現在のLSMは、人間に対する信頼の欠如を示す。
本稿では,LLMが継続的に価値体系を最適化できるメンタルループ学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-03T06:22:19Z) - MoCa: Measuring Human-Language Model Alignment on Causal and Moral
Judgment Tasks [49.60689355674541]
認知科学の豊富な文献は人々の因果関係と道徳的直観を研究してきた。
この研究は、人々の判断に体系的に影響を及ぼす多くの要因を明らかにした。
大規模言語モデル(LLM)が、人間の参加者と一致するテキストベースのシナリオについて因果的、道徳的な判断を下すかどうかを検証する。
論文 参考訳(メタデータ) (2023-10-30T15:57:32Z) - AI Alignment: A Comprehensive Survey [69.61425542486275]
AIアライメントは、AIシステムが人間の意図や価値観に沿って振る舞うようにすることを目的としている。
AIアライメントの重要な目的として、ロバストネス、解釈可能性、制御可能性、倫理という4つの原則を特定します。
我々は、現在のアライメント研究を、前方アライメントと後方アライメントの2つの重要なコンポーネントに分解する。
論文 参考訳(メタデータ) (2023-10-30T15:52:15Z) - When to Make Exceptions: Exploring Language Models as Accounts of Human
Moral Judgment [96.77970239683475]
AIシステムは人間の道徳的判断や決定を理解し、解釈し、予測しなければなりません。
AIの安全性に対する中心的な課題は、人間の道徳心の柔軟性を捉えることだ。
ルール破りの質問応答からなる新しい課題セットを提案する。
論文 参考訳(メタデータ) (2022-10-04T09:04:27Z) - Metaethical Perspectives on 'Benchmarking' AI Ethics [81.65697003067841]
ベンチマークは、人工知能(AI)研究の技術的進歩を測定するための基盤とみられている。
AIの顕著な研究領域は倫理であり、現在、ベンチマークのセットも、AIシステムの「倫理性」を測定する一般的な方法もない。
我々は、現在と将来のAIシステムのアクションを考えるとき、倫理よりも「価値」について話す方が理にかなっていると論じる。
論文 参考訳(メタデータ) (2022-04-11T14:36:39Z) - Dynamic Cognition Applied to Value Learning in Artificial Intelligence [0.0]
この分野の数人の研究者が、堅牢で有益で安全な人工知能の概念を開発しようとしている。
人工知能エージェントが人間の価値観に合わせた価値を持っていることは、最も重要である。
この問題に対する可能なアプローチは、SEDのような理論モデルを使用することである。
論文 参考訳(メタデータ) (2020-05-12T03:58:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。