論文の概要: Stable Behavior, Limited Variation: Persona Validity in LLM Agents for Urban Sentiment Perception
- arxiv url: http://arxiv.org/abs/2604.28048v1
- Date: Thu, 30 Apr 2026 15:59:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:54.185277
- Title: Stable Behavior, Limited Variation: Persona Validity in LLM Agents for Urban Sentiment Perception
- Title(参考訳): 安定行動, 限定変量:都市感知覚のためのLLM剤の個人的妥当性
- Abstract要約: 我々は、ジェンダー、経済的地位、政治的指向、性格にまたがる要因的なペルソナを用いて、都市景観画像の評価を行う。
その結果、ペルソナを共有するエージェント間で強い収束を示し、安定かつ再現可能な行動を示す。
エージェントはまた、人間のアノテーションに共通する中間的な感情カテゴリーを崩壊させる極度のバイアスを示す。
- 参考スコア(独自算出の注目度): 4.732324753420076
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) are increasingly used as proxies for human perception in urban analysis, yet it remains unclear whether persona prompting produces meaningful and reproducible behavioral diversity. We investigate whether distinct personas influence urban sentiment judgments generated by multimodal LLMs. Using a factorial set of personas spanning gender, economic status, political orientation, and personality, we instantiate multiple agents per persona to evaluate urban scene images from the PerceptSent dataset and assess both within-persona consistency and cross-persona variation. Results show strong convergence among agents sharing a persona, indicating stable and reproducible behavior. However, cross-persona differentiation is limited: economic status and personality induce statistically detectable but practically modest variation, while gender shows no measurable effect and political orientation only negligible impact. Agents also exhibit an extremity bias, collapsing intermediate sentiment categories common in human annotations. As a result, performance remains strong on coarse-grained polarity tasks but degrades as sentiment resolution increases, suggesting that simple label-based persona prompting does not capture fine-grained perceptual judgments. To isolate the contribution of persona conditioning, we additionally evaluate the same model without personas. Surprisingly, the no-persona model sometimes matches or exceeds persona-conditioned agreement with human labels across all task variants, suggesting that simple label-based persona prompting may add limited annotation value in this setting.
- Abstract(参考訳): 大規模言語モデル (LLMs) は都市分析における人間の知覚のプロキシとしての利用が増えているが、ペルソナの促進が有意義で再現可能な行動多様性をもたらすかどうかは不明である。
マルチモーダルLLMが生み出す都市感性判断に異なるペルソナが与える影響について検討する。
ジェンダー,経済状況,政治的指向,パーソナリティにまたがる要因的ペルソナを用いて,パーセプションデータセットから複数のエージェントをインスタンス化して都市景観画像の評価を行い,対人一貫性と対人変動の評価を行う。
その結果、ペルソナを共有するエージェント間で強い収束を示し、安定かつ再現可能な行動を示す。
しかし、対人差別は限定的であり、経済的地位と人格は統計的に検出できるが実質的には控えめな変化をもたらすが、ジェンダーは測定可能な効果を示さず、政治的指向は無視できる影響しか示さない。
エージェントはまた、人間のアノテーションに共通する中間的な感情カテゴリーを崩壊させる極度のバイアスを示す。
その結果、粗粒度極性タスクでは高い性能が保たれるが、感情分解能が増大するにつれて低下し、単純なラベルに基づくペルソナプロセッシングが微粒度の知覚的判断を捉えていないことが示唆された。
ペルソナ条件付けの貢献を分離するために,ペルソナなしで同じモデルを評価する。
意外なことに、非ペルソナモデルは、すべてのタスクの変種にまたがる人間のラベルとのペルソナ条件の合意にマッチしたり、超えたりすることがあり、単純なラベルベースのペルソナプロンプトがこの設定に限定的なアノテーション値を加える可能性があることを示唆している。
関連論文リスト
- Rethinking the Evaluation and Optimization of LLM-Based Social Simulation [56.18577997572273]
主観性係数を用いて、主観性が高くなるにつれて、精度に基づく評価とハードラベルトレーニングがいかに失敗するかを分析する。
我々は193のアノテーションと100の主観的質問を含む19,300の文脈のベンチマークであるSUBJSIMを構築した。
SUBJSIMの結果は,本手法の利点を示すものである。
論文 参考訳(メタデータ) (2026-08-20T06:26:03Z) - Do AI Personas Grow? Analyzing and Benchmarking Personality Evolution in LLM Agents After Life Events [34.88005801095875]
パーソナリティ条件付きLLMエージェント(PC-Agents)は、感情的支援、社会シミュレーション、ロールプレイングにますます利用されている。
ビッグファイブの特徴をサイコメトリックアンカーとして用いて,11大生活イベント後の事象誘発人格変化について検討した。
以上の結果から,現在のPC-Agentsは人格動態の平均をシミュレートするが,その形状は似ていないことが示唆された。
論文 参考訳(メタデータ) (2026-08-06T18:25:58Z) - From Self to Other: Evaluating Demographic Perspective-Taking in LLM Hate Speech Annotation [5.762370982168011]
パーソナ条件付き大規模言語モデル(特定の階層的アイデンティティーを採用するよう促されるモデル)は、スケールにおける様々な視点をシミュレートする方法として提案されている。
人間の社会的判断の3つの側面として, (i) 異なる集団のペルソナが人間的な方法(グループ間不一致)に異同するか否か, (ii) コンテンツが自身のアイデンティティ(グループ内での感受性)をターゲットとした場合に, より敏感になるかどうか, (iii) 他集団の反応を正確に予測できるかどうか (viarious prediction) を評価した。
以上の結果から, モデルが3次元全てを連続的に捉えることはなく, 性能はモデル依存であり, 確実に出現しないことが明らかとなった。
論文 参考訳(メタデータ) (2026-06-04T15:09:58Z) - The Chameleon's Limit: Investigating Persona Collapse and Homogenization in Large Language Models [12.654067061944074]
大規模言語モデル(LLM)に基づくアプリケーションでは,エージェント間の個体数の多様性が要求される。
エージェントはそれぞれ異なるプロファイルを割り当てるが、それでも狭い行動モードに収束し、均質なシミュレートされた人口を生み出す。
論文 参考訳(メタデータ) (2026-04-27T17:01:48Z) - Persona Prompting as a Lens on LLM Social Reasoning [5.001433675691563]
ヘイトスピーチ検出のような社会的に敏感なタスクでは、LLM(Large Language Models)による説明の質が不可欠である。
パーソナプロンプト(PP)は、ユーザ固有の生成に向けてモデルを操る手段として、ますます用いられるようになっているが、モデル理性に対する効果はいまだに未解明である。
論文 参考訳(メタデータ) (2026-01-28T16:41:17Z) - The Personality Illusion: Revealing Dissociation Between Self-Reports & Behavior in LLMs [60.15472325639723]
人格特性は、人間の行動の予測因子として長い間研究されてきた。
近年のLarge Language Models (LLM) は, 人工システムに類似したパターンが出現する可能性を示唆している。
論文 参考訳(メタデータ) (2025-09-03T21:27:10Z) - Evaluating the Simulation of Human Personality-Driven Susceptibility to Misinformation with LLMs [0.18416014644193066]
大規模言語モデル(LLM)により、大規模に合成行動データを生成することができる。
我々は,誤情報に対する個人的影響の変動を再現するために,Big-Fiveプロファイルに規定されたLLMエージェントの能力を評価する。
論文 参考訳(メタデータ) (2025-06-30T08:16:07Z) - Spotting Out-of-Character Behavior: Atomic-Level Evaluation of Persona Fidelity in Open-Ended Generation [16.76995815742803]
より微細な粒度でペルソナの忠実度を定量化する原子レベル評価フレームワークを提案する。
私たちの3つの重要な測定基準は、世代間でのペルソナのアライメントと一貫性の度合いを測定します。
多様なタスクやパーソナリティの多様さからペルソナの忠実度を解析することにより,タスク構造とペルソナの嗜好性がモデル適応性にどのように影響するかを明らかにする。
論文 参考訳(メタデータ) (2025-06-24T06:33:10Z) - PAARS: Persona Aligned Agentic Retail Shoppers [2.8737584376365355]
電子商取引では、行動データは意思決定のために収集される。
匿名化された履歴ショッピングデータを自動マイニングすることで、合成ショッピングエージェントを作成するフレームワークを提案する。
本稿では,自動エージェントA/Bテストのためのフレームワークの初期応用について紹介し,その結果と人的結果を比較した。
論文 参考訳(メタデータ) (2025-03-31T15:41:51Z) - Beyond correlation: The Impact of Human Uncertainty in Measuring the Effectiveness of Automatic Evaluation and LLM-as-a-Judge [51.93909886542317]
一つの集計相関スコアを*参照することで、人名と自動評価の基本的な違いが曖昧になることを示す。
本研究では,評価性能のより堅牢な解析を行うために,ラベルの不確実性による階層化データを提案する。
論文 参考訳(メタデータ) (2024-10-03T03:08:29Z) - Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment [84.32768080422349]
人間の好みの調整は、大きな言語モデルが誤解を招くか有害なコンテンツを生成するのを防ぐ。
本研究では, 微調整後のLLMの最終性能と線形相関を示唆し, 即時多様性の新たな定式化を提案する。
論文 参考訳(メタデータ) (2024-03-17T07:08:55Z) - Decoding Susceptibility: Modeling Misbelief to Misinformation Through a Computational Approach [61.04606493712002]
誤報に対する感受性は、観測不可能な不検証の主張に対する信念の度合いを記述している。
既存の感受性研究は、自己報告された信念に大きく依存している。
本稿では,ユーザの潜在感受性レベルをモデル化するための計算手法を提案する。
論文 参考訳(メタデータ) (2023-11-16T07:22:56Z) - On the steerability of large language models toward data-driven personas [98.9138902560793]
大規模言語モデル(LLM)は、特定のグループや集団の意見が不足している偏りのある応答を生成することが知られている。
本稿では, LLM を用いて特定の視点の制御可能な生成を実現するための新しい手法を提案する。
論文 参考訳(メタデータ) (2023-11-08T19:01:13Z) - Sensitivity, Performance, Robustness: Deconstructing the Effect of
Sociodemographic Prompting [64.80538055623842]
社会デマトグラフィープロンプトは、特定の社会デマトグラフィープロファイルを持つ人間が与える答えに向けて、プロンプトベースのモデルの出力を操縦する技術である。
ソシオデマトグラフィー情報はモデル予測に影響を及ぼし、主観的NLPタスクにおけるゼロショット学習を改善するのに有用であることを示す。
論文 参考訳(メタデータ) (2023-09-13T15:42:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。