論文の概要: LLMs struggle to simulate human belief updates in controlled environments
- arxiv url: http://arxiv.org/abs/2607.28347v1
- Date: Thu, 30 Jul 2026 15:19:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.620583
- Title: LLMs struggle to simulate human belief updates in controlled environments
- Title(参考訳): LLMは制御された環境における人間の信念更新をシミュレートするのに苦労している
- Abstract要約: 6つのLDMが個人の信念更新をシミュレートできるかどうかを検証する。
一部のLSMは人間のポストスタンス分布と一致するが、参加者の最初のスタンスでしか一致しない。
すべてのモデルに3つの体系的バイアスが現れる。
- 参考スコア(独自算出の注目度): 13.511441750037376
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: LLMs are increasingly deployed as proxies for human study participants in social science experiments, yet the fidelity of this practice has rarely been tested directly. We test whether six LLMs can simulate individual human belief updates, comparing LLM outputs 1-to-1 against ground truth data from 391 UK participants on Prolific, who updated their stances on three discussion topics after reading Reddit comments. Each participant was simulated by an LLM conditioned on a persona derived from their demographic and personality trait data. We find that some LLMs (Qwen3-32B and GPT-5-Mini) can match the human post-stance distribution, but only when given participants' actual initial stances. All six models fail to simulate initial stances themselves and to produce faithful belief updates from self-generated stances. Three systematic biases emerge across all models: overrepresentation of neutral positions, more frequent but smaller belief shifts than humans, and a failure to rank comments by convincingness. Demographic and personality trait personas had no consistent effect on fidelity. LLM simulations of human belief dynamics are only reliable when grounded in realistic starting conditions, that current multi-round social media simulations rarely provide.
- Abstract(参考訳): LLMは、社会科学実験に参加する人間の研究参加者のプロキシとして徐々に展開されているが、このプラクティスの忠実さは直接的にテストされることはめったにない。
我々は、6つのLDMが個人の信念更新をシミュレートできるかどうかを検証し、1対1のLCM出力と391人のProlific参加者の真理データを比較し、Redditコメントを読んでから3つの議論トピックに関するスタンスを更新した。
各被験者は、人口統計および性格特性データから得られたペルソナに条件付きLDMによりシミュレートされた。
いくつかのLCM (Qwen3-32B, GPT-5-Mini) はヒトの姿勢と一致しうるが, 被験者の実際の姿勢は一致しない。
6つのモデルは全て、最初のスタンス自体をシミュレートし、自己生成的なスタンスから忠実な信念を更新できない。
3つの体系的バイアスは、中立的な位置の過剰表現、人間よりも頻繁だがより小さな信念シフト、説得力によるコメントのランク付けの失敗である。
人物像と人格特性は忠実性に一貫した影響を与えなかった。
人間の信念力学のLLMシミュレーションは、現実的な開始条件下でのみ信頼性があり、現在のマルチラウンドのソーシャルメディアシミュレーションがほとんど提供しない。
関連論文リスト
- Do LLMs Change Their Minds Like Humans? Diagnosing Human--LLM Divergence in Single-Turn Persuasion Judgments [10.717755637740948]
大規模言語モデル (LLMs) は、社会シミュレーションの参加者のためのプロキシとして、ますます多くデプロイされている。
自然発生型オンライン説得コーパスを用いて体系的な比較を行う。
以上の結果から,LSMは人間とわずかに一致していることがわかった。
論文 参考訳(メタデータ) (2026-08-30T14:08:06Z) - Reinforcing Human Behavior Simulation via Verbal Feedback [105.68319269895653]
本稿では,言語フィードバックを強化学習の第一級信号として扱うことによって訓練したモデルであるDITTOを提案する。
また、心の理論、キャラクターロールプレイ、社会的スキル、学習者シミュレーション、ユーザシミュレーション、ペルソナシミュレーションの6つのカテゴリにまたがる10のタスクにまたがる統合ベンチマークとトレーニングデータスイートであるSOULを紹介した。
DitTOはベースモデルに対して平均36%の改善を達成し、10のSOULベンチマークでGPT-5.4を上回った。
論文 参考訳(メタデータ) (2026-05-19T21:23:24Z) - Can LLMs Emulate Human Belief Dynamics? [4.918358353535447]
LLMは初期の人間の信念の分布を捉えることができず、人間よりも全体的な適合性が高い傾向にある。
彼らはまた、ネットワーク内のヒトの同性愛傾向をエミュレートするためのニュアンスなアプローチを取る。
論文 参考訳(メタデータ) (2026-05-05T23:21:11Z) - Evaluating Alignment of Behavioral Dispositions in LLMs [15.282965130762648]
社会的文脈における反応を形作る行動配置に着目する。
LLMによって表現される配位が人間の配位とどのように密接に一致しているかを研究するための枠組みを導入する。
論文 参考訳(メタデータ) (2026-02-11T19:59:12Z) - Consistently Simulating Human Personas with Multi-Turn Reinforcement Learning [52.07170679746533]
大規模言語モデル(LLM)は、セラピー、教育、社会的役割プレイといったインタラクティブな環境において、人間のユーザをシミュレートするためにますます使われています。
LLM生成対話におけるペルソナの一貫性の評価と改善のための統一的なフレームワークを提案する。
我々は3つの自動メトリクス、即行一貫性、行間一貫性、Q&A一貫性を定義し、異なるタイプのペルソナドリフトをキャプチャし、それぞれが人間のアノテーションに対して検証する。
論文 参考訳(メタデータ) (2025-10-31T19:40:41Z) - TwinVoice: A Multi-dimensional Benchmark Towards Digital Twins via LLM Persona Simulation [55.55404595177229]
大型言語モデル(LLM)は、人間のような能力を示す。
TwinVoiceは、さまざまな現実世界のコンテキストにわたるペルソナシミュレーションを評価するためのベンチマークである。
論文 参考訳(メタデータ) (2025-10-29T14:00:42Z) - Social Simulations with Large Language Model Risk Utopian Illusion [61.358959720048354]
社会シミュレーションにおける大規模言語モデルの行動分析のための体系的枠組みを提案する。
本手法は,チャットルーム型会話を通してマルチエージェントインタラクションをシミュレートし,5つの言語的側面にわたって解析する。
以上の結果から,LSMは真の人間の行動を忠実に再現するのではなく,過度に理想化されたバージョンを反映していることが明らかとなった。
論文 参考訳(メタデータ) (2025-10-24T06:08:41Z) - Large Language Models Show Human-like Social Desirability Biases in Survey Responses [12.767606361552684]
人格評価が推定された場合,Large Language Models (LLMs) が特徴次元の望ましい端に向かってスコアを歪めていることを示す。
このバイアスは、GPT-4/3.5、Claude 3、Llama 3、PaLM-2を含む全ての試験モデルに存在する。
すべての質問のリバースコーディングはバイアスレベルを低下させるが、それらを取り除くことはできず、この効果はアクセプションバイアスによるものではないことを示唆している。
論文 参考訳(メタデータ) (2024-05-09T19:02:53Z) - Is this the real life? Is this just fantasy? The Misleading Success of Simulating Social Interactions With LLMs [24.613282867543244]
大規模言語モデル(LLM)はより豊かな社会シミュレーションを可能にし、様々な社会現象の研究を可能にしている。
最近の研究は、これらのシミュレーションについて、人間とAIエージェントが現実世界で関与する不完全で情報非対称な相互作用と、基本的には異なっています。
論文 参考訳(メタデータ) (2024-03-08T03:49:17Z) - Are You Sure? Challenging LLMs Leads to Performance Drops in The
FlipFlop Experiment [82.60594940370919]
大規模言語モデル(LLM)のマルチターン動作を研究するためのFlipFlop実験を提案する。
モデルが平均46%の時間で回答を反転させ、全てのモデルが最初の予測と最終予測の間に精度を低下させ、平均17%の低下(FlipFlop効果)を示す。
我々はオープンソースのLLMで微調整実験を行い、合成されたデータに対する微調整は、性能劣化を60%低減させることができるが、サイコファンティックな振る舞いを完全には解決できないことを発見した。
論文 参考訳(メタデータ) (2023-11-14T23:40:22Z) - Do LLMs exhibit human-like response biases? A case study in survey
design [66.1850490474361]
大規模言語モデル(LLM)が人間の反応バイアスをどの程度反映しているかについて検討する。
アンケート調査では, LLMが人間のような応答バイアスを示すかどうかを評価するためのデータセットとフレームワークを設計した。
9つのモデルに対する総合的な評価は、一般のオープンかつ商用のLCMは、一般的に人間のような振る舞いを反映しないことを示している。
論文 参考訳(メタデータ) (2023-11-07T15:40:43Z) - CoMPosT: Characterizing and Evaluating Caricature in LLM Simulations [61.9212914612875]
本研究では,LLMシミュレーションを4次元(コンテキスト,モデル,ペルソナ,トピック)で特徴付けるフレームワークを提案する。
我々は,この枠組みを用いて,オープンエンドLLMシミュレーションのキャラクチュアへの感受性を測定する。
GPT-4では、特定の人口動態(政治的・疎外化グループ)と話題(一般には非論争的)のシミュレーションは、似顔絵に非常に敏感であることが判明した。
論文 参考訳(メタデータ) (2023-10-17T18:00:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。