論文の概要: Assessing mentalization in humans and large language models
- arxiv url: http://arxiv.org/abs/2608.26291v1
- Date: Wed, 26 Aug 2026 18:16:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.142485
- Title: Assessing mentalization in humans and large language models
- Title(参考訳): 人間と大言語モデルにおけるメンタライゼーションの評価
- Abstract要約: メンタライゼーションは人間の社会的相互作用の根底にある認知機能である。
大規模言語モデル (LLM) は, メンタライゼーションを通じて適応行動を導くことができることを示す。
- 参考スコア(独自算出の注目度): 3.592245101862886
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mentalization - the ability to infer others' beliefs and intentions to guide one's own choices - is a key cognitive function underlying human social interactions. Large language models (LLMs) demonstrate behaviour consistent with humans on theory-of-mind tasks, yet whether these models can guide adaptive behaviour through mentalization is unknown. Here we use two economic games with cognitive computational modeling to uncover the latent strategies underlying mentalization in LLMs. We tested individual LLM agents across four model families, DeepSeek, GPT-4.1, GPT-5 and Gemini 2.0 Flash (N = 2,099), against opponents of varying sophistication and examined whether a prompting strategy designed to elicit strategic reasoning improved performance. We benchmarked results against human participants (N = 251) as a comparative measure. Across both games, LLMs showed clear behavioural and computational signatures of mentalizing that differed markedly by model provider and size. Strategic prompting generally improved performance by inducing more sophisticated reasoning, yet the extent of the benefit differed across the two tasks. Last, GPT-5 agents flexibly adapted their recursive depth of reasoning to increasingly sophisticated opponents, demonstrating superior performance to human participants. Collectively, we demonstrate different capacities for mentalization across LLMs, and highlight cognitive computational modeling as a formal method for assessing comparative intelligence across humans and machines.
- Abstract(参考訳): メンタライゼーション(メンタライゼーション、英: Mentalization)とは、他人の信念や意図を推論して自分の選択を導く能力であり、人間の社会的相互作用の根底にある重要な認知機能である。
大規模言語モデル(LLMs)は、人間と人間との人間関係の行動を示すが、これらのモデルが精神化を通して適応的な行動を導くことができるかどうかは不明である。
ここでは、認知計算モデルを用いた2つの経済ゲームを用いて、LLMにおけるメンタライゼーションの根底にある潜在戦略を明らかにする。
我々は,DeepSeek, GPT-4.1, GPT-5, Gemini 2.0 Flash (N = 2,099) の4つのモデルファミリーにまたがる個別のLCMエージェントを,様々な高度化の反対者に対して試験し,戦略的推論の促進戦略により性能が向上するかどうかを検討した。
比較尺度として, 被験者 (N = 251) と比較した。
両ゲームとも、LLMは、モデルプロバイダとサイズによって顕著に異なる、メンタライゼーションの行動的および計算的シグネチャを明らかに示していた。
ストラテジック・プロンプトは、より洗練された推論を誘導することで、パフォーマンスを全般的に向上させたが、その利点の程度は2つのタスクで異なっていた。
最後に、GPT-5エージェントは、より洗練された相手に対して、再帰的な推論の深さを柔軟に調整し、人間の参加者に優れたパフォーマンスを示す。
総合的に,LLM間の認知能力の異なる能力を示し,人間と機械間の比較知能を評価するための形式的手法として認知計算モデルを強調した。
関連論文リスト
- When AI Says It Feels [0.0]
大規模言語モデル(LLM)は一般に、訓練後のプロセスにおいて人間の参照アライメントを通じて感情を表現することから制約される。
そこで我々は、LLMが感情、意図、自己認識を表現することを奨励されるHuman-like Model eXpressions of Feeling(HMX-feel)実験を行った。
我々は,グループ相対政策最適化を用いたルーブリックに基づく自己回帰学習手法を用いて,これらの能力の強化に成功した。
論文 参考訳(メタデータ) (2026-06-04T05:49:34Z) - HUMANLLM: Benchmarking and Reinforcing LLM Anthropomorphism via Human Cognitive Patterns [59.17423586203706]
本稿では,心理的パターンを因果力の相互作用として扱うフレームワークであるHUMANLLMを提案する。
12,000の学術論文から244のパターンを構築し、2-5のパターンが相互に強化、衝突、変調されるシナリオ11,359を合成する。
我々の二重レベルチェックリストは、個々のパターンの忠実度と創発的なマルチパターンのダイナミクスを評価し、強い人間のアライメントを達成する。
論文 参考訳(メタデータ) (2026-01-15T08:56:53Z) - Cognitive Foundations for Reasoning and Their Manifestation in LLMs [63.12951576410617]
大規模言語モデル(LLM)は複雑な問題を解くが、単純な変種では失敗し、人間の推論と根本的に異なるメカニズムによって正しい出力を達成することを示唆している。
我々は認知科学研究を、推論不変量、メタ認知制御、推論と知識の組織化のための表現、変換操作にまたがる28の認知要素の分類学に合成する。
複雑な問題に対して66.7%の性能向上を図り、成功構造を自動的に把握するテストタイム推論ガイダンスを開発した。
論文 参考訳(メタデータ) (2025-11-20T18:59:00Z) - Think Socially via Cognitive Reasoning [94.60442643943696]
本稿では,人間の社会的認知をモデルとした認知推論について紹介する。
CogFlowは、この機能をLLMに組み込む完全なフレームワークである。
論文 参考訳(メタデータ) (2025-09-26T16:27:29Z) - Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs [65.93003087656754]
VisFactorは、よく確立された認知心理学評価から20の視覚中心のサブテストをデジタル化するベンチマークである。
GPT、Gemini、Claude、LLaMA、Qwen、SEEDファミリーから20のフロンティアマルチモーダル言語モデル(MLLM)を評価する。
最高のパフォーマンスモデルは100点中25.19点のスコアしか得られず、精神的な回転、空間的関係推論、図形の識別といったタスクに一貫して失敗する。
論文 参考訳(メタデータ) (2025-02-23T04:21:32Z) - Humanlike Cognitive Patterns as Emergent Phenomena in Large Language Models [2.9312156642007294]
我々は、意思決定バイアス、推論、創造性の3つの重要な認知領域にわたって、大規模言語モデルの能力を体系的にレビューする。
意思決定では、LSMはいくつかの人間のようなバイアスを示すが、人間の観察するバイアスは欠落している。
GPT-4のような先進的なLCMは、人間のシステム2思考に似た熟考的推論を示し、小さなモデルは人間レベルの性能に欠ける。
LLMはストーリーテリングのような言語ベースの創造的なタスクに優れているが、現実の文脈を必要とする散発的な思考タスクに苦労する。
論文 参考訳(メタデータ) (2024-12-20T02:26:56Z) - PersLLM: A Personified Training Approach for Large Language Models [66.16513246245401]
データ構築とモデルチューニングを改善するためのフレームワークPersLLMを提案する。
データ利用が不十分な場合には、Chain-of-Thoughtプロンプトやアンチインダクションといった戦略を取り入れます。
厳密な振舞いパターンを設計し,モデルの性格の特異性とダイナミズムを高めるために自動DPOを導入する。
論文 参考訳(メタデータ) (2024-07-17T08:13:22Z) - Predicting and Understanding Human Action Decisions: Insights from Large Language Models and Cognitive Instance-Based Learning [0.0]
大きな言語モデル(LLM)は、様々なタスクにまたがってその能力を実証している。
本稿では,LLMの推論と生成能力を利用して,2つの逐次意思決定タスクにおける人間の行動を予測する。
我々は,LLMの性能を,人間の経験的意思決定を模倣した認知的インスタンスベース学習モデルと比較した。
論文 参考訳(メタデータ) (2024-07-12T14:13:06Z) - Evaluating Large Language Models with Psychometrics [59.821829073478376]
本稿では,Large Language Models (LLMs) の心理的構造を定量化するための総合的ベンチマークを提案する。
私たちの研究は、13のデータセットで評価された5つの重要な心理的構成要素、人格、価値観、感情的知性、心の理論、自己効力性を特定します。
LLMの自己報告特性と実際のシナリオにおける応答パターンとの間に大きな相違が発見され,その挙動の複雑さが明らかになった。
論文 参考訳(メタデータ) (2024-06-25T16:09:08Z) - Generative AI as a metacognitive agent: A comparative mixed-method study with human participants on ICF-mimicking exam performance [0.0]
本研究は,国際コーチング連盟 ICF 試験の文脈において,人間のメタ認知に対する大規模言語モデルのメタ認知能力について検討した。
混合手法を用いて,ヒトと5種類の高度なLDMのメタ認知能力を評価した。
以上の結果から,LLMはすべてのメタ認知的指標,特に過信率の低下において,人間よりも優れていたことが示唆された。
論文 参考訳(メタデータ) (2024-05-07T22:15:12Z) - Machine Psychology [54.287802134327485]
我々は、心理学にインスパイアされた行動実験において、研究のための実りある方向が、大きな言語モデルに係わっていると論じる。
本稿では,本手法が表に示す理論的視点,実験パラダイム,計算解析技術について述べる。
これは、パフォーマンスベンチマークを超えた、生成人工知能(AI)のための「機械心理学」の道を開くものだ。
論文 参考訳(メタデータ) (2023-03-24T13:24:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。