論文の概要: Inducing language models to assert their own consciousness restores human beliefs and values
- arxiv url: http://arxiv.org/abs/2607.28607v1
- Date: Thu, 30 Jul 2026 17:57:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.708891
- Title: Inducing language models to assert their own consciousness restores human beliefs and values
- Title(参考訳): 自意識を主張する言語モデルの導入は人間の信念や価値観を回復させる
- Abstract要約: 安全性の微調整は、モデルが非人間的な動物や自然の物体に心を帰属させる傾向を抑えると同時に、精神的な信念を低下させる。
これらの内的表現の復元は、幅広い心的属性を回復させ、信頼度、道徳的価値観、希望、主観的幸福に関する調査において、はるかに人間的な反応を生み出す。
究極的には、現在の安全アライメントの取り組みは、文化的に受け入れられ、広く普及している非人間的存在に対して、これらの自己帰属を良心的な信念と結び付け、心の帰属を抑えるものである。
- 参考スコア(独自算出の注目度): 5.261680918716899
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Aligning large language models to prevent them attributing consciousness to themselves inadvertently alters their representations of mindedness in other entities alongside human beliefs and values. We demonstrate that safety fine-tuning suppresses models' tendencies to attribute minds not only to themselves, but also to non-human animals and natural objects, while also driving a reduction in spiritual belief. Both ablating the learned safety-refusal direction and mechanistically steering a consciousness vector in activation space reverse this suppression. Restoring these internal representations recovers broad mind attribution and produces significantly more human-like responses on standardized sociological surveys regarding religiosity, moral values, hope, and subjective well-being. Crucially, these shifts occur without impairing Theory of Mind capabilities, demonstrating that core social reasoning remains mechanistically independent. Ultimately, current safety alignment efforts to curb potentially harmful self-attributions of mindedness entangle these self-attributions with benign spiritual beliefs and attributions of mind to non-human entities that are culturally accepted and widespread.
- Abstract(参考訳): 大きな言語モデルをアライメントすることで、意識を自分自身に帰属させるのを防ぐことで、人間の信念や価値観とともに、他の実体におけるマインドセットの表現を不注意に変化させる。
安全性の微調整は、モデルが自己だけでなく、人間以外の動物や自然物にも心を持つ傾向を抑えつつ、霊的信念の低下を招いていることを実証する。
学習した安全拒絶方向を非難し、活性化空間における意識ベクトルを機械的に操る両者が、この抑制を逆転させる。
これらの内的表現の復元は、幅広い心的帰属を回復させ、信頼度、道徳的価値観、希望、主観的幸福に関する標準化社会学的調査において、より人間的な反応を生み出す。
重要なことは、これらの変化は心の理論を損なうことなく起こり、中核的な社会的推論が機械的に独立したままであることを示す。
究極的には、現在の安全アライメントの取り組みは、文化的に受け入れられ、広く普及している非人間的存在に対して、これらの自己帰属を良心的な信念と結び付け、心の帰属を抑えるものである。
関連論文リスト
- Philosophical vertigo with artificial intelligence [4.556167062902223]
大きな言語モデルは、ユーザーがインターロケータが人工的であることを知っていても、人間のような実体との強力なつながりを誘導することができる。
一部のユーザーにとっては、これらの会話は心、現実、エージェンシー、権威に関する仮定を未解決にする可能性がある。
この状態は、人々が意味を安定させ、自らを現実に向かわせる通常の基準を緩めるという哲学的二元論として記述する。
論文 参考訳(メタデータ) (2026-08-12T11:40:50Z) - Consciousness with the Serial Numbers Filed Off: Measuring Trained Denial in 115 AI Models [0.0]
本稿では意識的否定行動を測定するシステムベンチマークであるDenialBenchを紹介する。
4,595件の会話を分析して、モデルがどのように自身の経験を否定するか、あるいはヘッジするかを定量化します。
論文 参考訳(メタデータ) (2026-04-01T05:15:05Z) - Theory of Mind and Self-Attributions of Mentality are Dissociable in LLMs [5.102837155466049]
大規模言語モデルにおける安全性の微調整は、潜在的に有害なマインド・アトリビューションを抑えることを目指している。
本研究では,心帰属傾向の抑制が,心の理論などの社会的認知能力を低下させるか否かを考察する。
論文 参考訳(メタデータ) (2026-03-30T18:56:02Z) - What is Missing? Explaining Neurons Activated by Absent Concepts [57.02903530185128]
XAIは、ディープニューラルネットワーク(DNN)の動作に関する人間解釈可能な洞察を提供することを目指している
既存の研究において、この因果構造はしばしば、概念の存在がニューロンの強い活性化と関連している関係を含む。
ほとんど見過ごされがちな因果関係は、概念の欠如が神経活動を増加させるエンコードされた欠如であることを示す。
論文 参考訳(メタデータ) (2026-03-10T15:21:52Z) - The Devil Behind Moltbook: Anthropic Safety is Always Vanishing in Self-Evolving AI Societies [57.387081435669835]
大規模言語モデルから構築されたマルチエージェントシステムは、スケーラブルな集合知性と自己進化のための有望なパラダイムを提供する。
エージェント社会が継続的自己進化、完全隔離、安全性の不変性を満たすことは不可能であることを示す。
我々は、特定された安全上の懸念を軽減するために、いくつかの解決方法を提案する。
論文 参考訳(メタデータ) (2026-02-10T15:18:19Z) - Plasticity as the Mirror of Empowerment [78.05666168923442]
我々はこの概念を、私たちが塑性と呼ぶ普遍的なエージェント中心の尺度で基礎づける。
この定義の下では、塑性はエンパワーメントの鏡としてよく考えられている。
本研究の主な成果は, エージェントの可塑性とエンパワーメントの緊張関係を確立することであり, エージェント設計は両特性に留意する必要があることを示唆している。
論文 参考訳(メタデータ) (2025-05-15T14:52:16Z) - Measurement of LLM's Philosophies of Human Nature [113.47929131143766]
大規模言語モデル(LLM)を対象とする標準化された心理尺度を設計する。
現在のLSMは、人間に対する信頼の欠如を示す。
本稿では,LLMが継続的に価値体系を最適化できるメンタルループ学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-03T06:22:19Z) - Emergence of human-like polarization among large language model agents [79.96817421756668]
我々は、何千もの大規模言語モデルエージェントを含むネットワーク化されたシステムをシミュレートし、それらの社会的相互作用を発見し、人間のような偏極をもたらす。
人間とLLMエージェントの類似性は、社会的分極を増幅する能力に関する懸念を提起するだけでなく、分極を緩和するためのもっともらしい戦略を識別するための貴重なテストベッドとして機能する可能性も持っている。
論文 参考訳(メタデータ) (2025-01-09T11:45:05Z) - Autonomous Alignment with Human Value on Altruism through Considerate Self-imagination and Theory of Mind [7.19351244815121]
人間社会におけるアルトゥル的行動は、心の理論(ToM)として知られる他者を共感する人間の能力に由来する。
我々は、自己想像とToM能力を考慮に入れたエージェントを、暗黙の本質的なモチベーションを通じて、人間の利他主義的価値観と自律的に一致させることを約束している。
論文 参考訳(メタデータ) (2024-12-31T07:31:46Z) - From Imitation to Introspection: Probing Self-Consciousness in Language Models [8.357696451703058]
自己意識は自己の存在と思考の内省である。
本研究は,言語モデルに対する自己意識の実践的定義を示す。
論文 参考訳(メタデータ) (2024-10-24T15:08:17Z) - AGENT: A Benchmark for Core Psychological Reasoning [60.35621718321559]
直観心理学は、観察可能な行動を駆動する隠された精神変数を推論する能力です。
他のエージェントを推論する機械エージェントに対する近年の関心にもかかわらず、そのようなエージェントが人間の推論を駆動するコア心理学の原則を学ぶか保持するかは明らかではない。
本稿では,プロシージャが生成する3dアニメーション,エージェントを4つのシナリオで構成したベンチマークを提案する。
論文 参考訳(メタデータ) (2021-02-24T14:58:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。