論文の概要: Empirical Grounding Improves the Realism of LLM Agents Simulating Human Behavior During Disruptions
- arxiv url: http://arxiv.org/abs/2607.17437v1
- Date: Sun, 19 Jul 2026 23:06:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.466537
- Title: Empirical Grounding Improves the Realism of LLM Agents Simulating Human Behavior During Disruptions
- Title(参考訳): 経験的グラウンドディングは破壊時の人間の行動を模擬するLDMエージェントの現実性を改善する
- Authors: Chen Xia, Zexi Kuang, Yuqing Hu,
- Abstract要約: 大型言語モデル(LLM)エージェントは、直接の歴史的な類似点がほとんどあるいは全くないような条件下での人間の振る舞いをシミュレートするための生成的アプローチを提供する。
本研究は, LLM-エージェントシミュレーションの破壊過程における統計的現実性の向上を実証的に評価する。
- 参考スコア(独自算出の注目度): 4.691907035988758
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents offer a generative approach to simulating human behavior under conditions that may have few or no direct historical analogues, a common challenge in disaster and infrastructure-disruption planning. However, this generative capacity creates a validity problem: individually plausible agent reasoning may fail to reproduce empirical population behavior. We evaluate whether empirical grounding improves the statistical realism of LLM-agent simulations during disruptions. Specifically, we develop an empirically grounded LLM-agent framework that embeds demographic profiles from the American Community Survey, baseline routines from the American Time Use Survey, and urban spatial context into agent initialization, memory, decision prompts, and activity execution. An independent household survey conducted during the July 2024 Philadelphia heatwave is reserved as an external validation benchmark. Compared with an ungrounded LLM-agent baseline, the grounded model improved reconstruction of normal daily routines, increasing mean correlation with empirical activity profiles from 0.528 to 0.912 and reducing mean squared error from 0.066 to 0.008. Under heatwave conditions, the grounded model better reproduced survey-derived activity profiles, increasing mean correlation from 0.349 to 0.836 and reducing mean squared error from 0.098 to 0.012. The grounded model captured 46.4% of observed heatwave response amplitude, compared with 20.6% for the ungrounded baseline. These findings show that empirical grounding can make LLM agents more statistically credible simulators of population behavior while revealing remaining gaps in modeling human adaptation during disruptions.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、直接的な歴史的類似点がほとんどあるいは全くない状況下での人間の行動をシミュレーションするための生成的アプローチを提供する。
しかし、この生成能力は有効性の問題を引き起こし、個々に妥当なエージェント推論は経験的な集団行動の再現に失敗する可能性がある。
本研究は, LLM-エージェントシミュレーションの破壊過程における統計的現実性の向上を実証的に評価する。
具体的には,アメリカン・コミュニティ・サーベイ,アメリカン・タイム・ユース・サーベイのベースライン・ルーチン,都市空間のコンテキストをエージェント初期化,記憶,意思決定のプロンプト,行動実行に組み込む,経験的基盤のLLMエージェント・フレームワークを開発した。
2024年7月のフィラデルフィア・ヒートウェーブで実施された独立世帯調査は、外部の検証基準として保留されている。
その結果,LLM-Adntベースラインと比較すると,通常の日常行動の再構築,0.528から0.912への経験的活動プロファイルの相関性の向上,平均2乗誤差の0.066から0.008への減少が認められた。
熱波条件下では, 地盤モデルでは, 調査による活動分布の再現性が向上し, 平均相関が0.349から0.836に増加し, 平均2乗誤差が0.098から0.012に減少した。
グラウンドドモデルは観測された熱波応答振幅の46.4%を占め、アングラウンドドベースラインは20.6%であった。
これらの結果から, LLMエージェントは, 集団行動の統計的信頼性を高めつつ, 乱れ時のヒト適応をモデル化する際のギャップを生じさせる可能性が示唆された。
関連論文リスト
- The Epi-LLM Framework: probing LLM behavioral priors through epidemiological agent-based models [0.0]
本稿では,エージェントベースのモデリング,実生活のエピガメ,大規模言語モデルの新たな統合であるEpi-LLMフレームワークを紹介する。
4 つの異なるアーキテクチャにまたがる LLM 薬剤はピークの能動感染を減少させることがわかった。
二項一般化線形モデルは、健康の重大さが検疫行動の最も強い予測因子であることを示した。
論文 参考訳(メタデータ) (2026-06-01T20:31:06Z) - The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study [56.649987197786096]
大規模言語モデル(LLM)は人間の行動のシミュレータとしての可能性を示している。
LLMは潜在ユーザ属性の意図しないシフトを誘発し、ユーザのドリフトを引き起こす。
ユーザのドリフトによって生じる不確実性や選択バイアスを形式化する。
論文 参考訳(メタデータ) (2026-05-20T06:09:41Z) - Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces [81.41397370235102]
我々はOmniBehaviorを紹介した。OmniBehaviorは実世界のデータから構築された最初のユーザシミュレーションベンチマークである。
現在のモデルでは,コンテキストウィンドウが拡大しても,複雑な振る舞いを正確にシミュレートすることが困難であることを示す。
この結果、個人差や長い尾の挙動が失われ、将来の高忠実度シミュレーション研究における重要な方向性が浮き彫りになる。
論文 参考訳(メタデータ) (2026-04-09T15:26:21Z) - RealUserSim: Bridging the Reality Gap in Agent Benchmarking via Grounded User Simulation [43.758401022409465]
RealUserSimは、実際の行動データに基づく最初のユーザーシミュレーションフレームワークである。
14,000以上の人間とLLMの会話(WildChat)から、7,275の行動プロファイルを抽出する。
71以上のドメインをまたいだ600の会話に対する信頼度ベンチマーク(PT3)は、基底シミュレーションが一致率を24.2%から45.3%に引き上げていることを示している。
論文 参考訳(メタデータ) (2026-04-07T19:42:36Z) - When simulations look right but causal effects go wrong: Large language models as behavioral simulators [10.754758699423022]
大規模言語モデル (LLM) は、研究者が自然言語で個体群の特徴と介入状況を特定することを可能にする。
62か国59,508人の参加者を対象に,11の気候心理学的介入に関する3つのLCMを評価した。
説明的適合性は因果的忠実度(例えば、介入効果の正確な推定)に確実に変換されなかった
論文 参考訳(メタデータ) (2026-04-02T18:42:29Z) - Position: AI Agents Are Not (Yet) a Panacea for Social Simulation [62.891898598784415]
大規模言語モデル(LLM)の最近の進歩は、社会シミュレーションにLLM統合エージェントを使うことへの関心が高まっている。
このポジションペーパーは、LSMをベースとしたエージェントは社会シミュレーションのパナセアではないと主張している。
論文 参考訳(メタデータ) (2026-02-19T06:35:07Z) - Assessing the Reliability of Persona-Conditioned LLMs as Synthetic Survey Respondents [0.4277616907160855]
我々は、ペルソナ条件のシミュレーションの影響を評価するために、米国のマイクロデータの大規模なデータセットを使用します。
その結果,ペルソナ・プロンプトはサーベイアライメントにおいて明確な総合的改善を得られず,多くの場合,性能が著しく低下することがわかった。
本研究は,現在のペルソナ・シミュレーション・プラクティスの重大な影響を浮き彫りにするものである。
論文 参考訳(メタデータ) (2026-02-06T15:13:59Z) - Overstating Attitudes, Ignoring Networks: LLM Biases in Simulating Misinformation Susceptibility [7.616305266104683]
大規模言語モデル (LLM) は、計算社会科学における人間の判断のためのプロキシとして、ますます使われている。
LLMを模擬した調査の回答者が、誤情報信念と共有の人間のパターンを再現できるかどうかを検証した。
論文 参考訳(メタデータ) (2026-02-04T15:48:05Z) - MF-LLM: Simulating Population Decision Dynamics via a Mean-Field Large Language Model Framework [53.82097200295448]
MF-LLM(Mean-Field LLM)は,まず平均場理論を社会シミュレーションに取り入れる。
MF-LLMは反復過程を通じて個人と人口間の双方向相互作用をモデル化する。
IB-Tuneは、Information Bottleneckの原理にインスパイアされた、新しい微調整手法である。
論文 参考訳(メタデータ) (2025-04-30T12:41:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。