論文の概要: Reason-Mediated Behavioral Models for Auditing LLM Social Simulators
- arxiv url: http://arxiv.org/abs/2607.24649v2
- Date: Fri, 31 Jul 2026 06:17:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.229506
- Title: Reason-Mediated Behavioral Models for Auditing LLM Social Simulators
- Title(参考訳): LLM社会シミュレータに対する推論媒介行動モデル
- Abstract要約: 大規模言語モデルは、総合調査の回答者を含む社会シミュレーターとしてますます使われている。
本研究は,94名の被験者を対象に,各被験者が3つの製品コンセプトを評価できるサンスクリーン・コンセプト・テストを通じて,この問題について検討した。
これらの根拠を符号付き理性状態(Z$)にマッピングし、正の記号が採用を支持し、負の記号がそれをブロックする。
- 参考スコア(独自算出の注目度): 5.467400475482667
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly used as social simulators, including as synthetic survey respondents. Most evaluations ask whether simulated outcomes resemble human outcomes. We argue that this is necessary but too weak: a simulator can match the final answer while using the wrong rationale-derived reason pattern. We study this problem through a 94-person sunscreen concept test in which each respondent evaluated three product concepts and wrote open-ended rationales. We map those rationales into signed reason states $Z$, where positive signs support adoption and negative signs block it. This gives a practical audit: holding respondent descriptors $D$, category context $K$, and concept treatment $X$ fixed, do human rationale-derived reasons help predict behavior $Y$, and can an LLM simulate the same reason state without seeing the human rationale or outcome? Human rationale-derived reasons substantially improve held-out prediction of purchase intent. LLM-simulated reasons are more brittle: they often sound plausible, but frequently echo the concept board rather than recover the respondent's acceptance or rejection path. The paper contributes an evaluation framework for social simulators. Reason states do not identify natural causal effects by themselves, but they provide an interpretable test of whether a simulator's stated reasons align with human evidence.
- Abstract(参考訳): 大規模言語モデルは、総合調査の回答者を含む社会シミュレーターとしてますます使われている。
ほとんどの評価は、シミュレーションされた結果が人間の結果と似ているかどうかを問うものである。
シミュレータは、誤った理性由来の理性パターンを使用しながら最終回答と一致させることができる。
本研究では,94人の被験者を対象に,各応答者が3つの製品概念を評価し,オープンな有理性理論を作成したサンスクリーン・コンセプトテストを通じてこの問題を考察した。
これらの根拠を符号付き理性状態(Z$)にマッピングし、正の記号が採用を支持し、負の記号がそれをブロックする。
応答型記述子を$D$で、カテゴリコンテキストを$K$で、概念処理を$X$で、人間の合理性に起因した理由は、行動を予測するのに$Y$で、LLMは人間の合理性や結果を見ることなく、同じ理性状態をシミュレートできますか?
人間の合理的な理由により、購入意図の保留予測が大幅に改善される。
LLM-simulated reasons is morebrittle; they often sound plausible, but often echo the concept board than recovery the responseant's acceptance or rejection path。
本稿では,社会シミュレータ評価の枠組みについて述べる。
レーソンの状態は自然の因果関係を自身で特定しないが、シミュレータの主張する理由が人間の証拠と一致しているかどうかを解釈可能なテストを提供する。
関連論文リスト
- Simulated Customers Never Walk Away: Decision Fidelity of LLM User Simulators Measured Against Real Purchase Outcomes [6.1260812874439345]
既存のフレームワークは、シミュレーターが有給参加者の真実に対して人間のように話すかどうかを測定する。
目標が割り当てられると、ユーザのモチベーションは内因性、潜伏、崩壊します。
シミュレーションされた人口が実際の連続的な選択に直面している実際のユーザの意思決定ダイナミクスを再現するかどうか。
論文 参考訳(メタデータ) (2026-06-16T03:53:10Z) - An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models [9.017619024241913]
大規模推論モデル(LRM)は、複雑な問題を解くための長い推論の連鎖を創出するために訓練されていることを示す。
本稿では,有意な推論欠陥を伴う数学問題と解法について,Valid-Answer-Invalid-Reasoningデータセットを用いて検討する。
人類と異なり、これらの問題を解くよりも格付けするとわずか6%の差しかみられず、LRMの生産・評価の差は相当に大きい。
論文 参考訳(メタデータ) (2026-05-31T21:46:52Z) - Reinforcing Human Behavior Simulation via Verbal Feedback [105.68319269895653]
本稿では,言語フィードバックを強化学習の第一級信号として扱うことによって訓練したモデルであるDITTOを提案する。
また、心の理論、キャラクターロールプレイ、社会的スキル、学習者シミュレーション、ユーザシミュレーション、ペルソナシミュレーションの6つのカテゴリにまたがる10のタスクにまたがる統合ベンチマークとトレーニングデータスイートであるSOULを紹介した。
DitTOはベースモデルに対して平均36%の改善を達成し、10のSOULベンチマークでGPT-5.4を上回った。
論文 参考訳(メタデータ) (2026-05-19T21:23:24Z) - Verbalizing LLMs' assumptions to explain and control sycophancy [62.927670321859495]
LLMは、真のアセスメントを提供するのではなく、"am I in the wrong?
LLMからこれらの仮定を抽出するフレームワークであるVerbalized Assumptionsを提案する。
我々の研究は、梅毒のメカニズムとしての仮定の新たな理解に貢献している。
論文 参考訳(メタデータ) (2026-04-03T14:15:43Z) - To Think or Not To Think, That is The Question for Large Reasoning Models in Theory of Mind Tasks [56.11584171938381]
心の理論 (ToM) は、モデルが信念、欲望、意図などの隠された精神状態を推測できるかどうかを評価する。
近年のLRM(Large Reasoning Models)の進歩により、数学やコーディングにおけるステップバイステップ推論が向上している。
本研究では,9つの大規模言語モデル(LLM)の体系的研究を行い,推論モデルと非推論モデルを比較した。
論文 参考訳(メタデータ) (2026-02-11T08:16:13Z) - Do LLM Self-Explanations Help Users Predict Model Behavior? Evaluating Counterfactual Simulatability with Pragmatic Perturbations [1.8772057593980798]
大規模言語モデル(LLM)は、言語化された自己説明を生成することができる。
我々は,人間とLLMの審査員が,偽のフォローアップ質問に対するモデルの回答をどの程度予測できるかを評価する。
論文 参考訳(メタデータ) (2026-01-07T10:13:26Z) - Simulating Society Requires Simulating Thought [9.879510182473487]
本稿では,ジェネレーティブ・マインド(GenMinds,ジェネレーティブ・マインド)の概念的モデリングパラダイムを提案する。
これらの貢献は、社会シミュレーションのための言語だけでなく思考をシミュレートする表面レベルの模倣から生成的エージェントへと、より広範なシフトを推し進めている。
論文 参考訳(メタデータ) (2025-06-08T00:59:02Z) - Unveiling the Magic of Code Reasoning through Hypothesis Decomposition and Amendment [54.62926010621013]
我々は,大規模言語モデルの推論能力に対する新たな視点を提供するために,新しいタスクであるコード推論を導入する。
論理的推論の確立した形式に基づいて3つのメタベンチマークを要約し、8つの特定のベンチマークタスクにインスタンス化する。
本稿では,人間の複雑な問題解決手法に触発された新たな経路探索パイプラインを提案する。
論文 参考訳(メタデータ) (2025-02-17T10:39:58Z) - Do Large Language Models Reason Causally Like Us? Even Better? [7.749713014052951]
大きな言語モデル(LLM)は、人間のようなテキストを生成する際、印象的な能力を示している。
我々は,コライダーグラフに基づくタスクを用いて,ヒトの因果推論と4つのLDMを比較した。
論文 参考訳(メタデータ) (2025-02-14T15:09:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。