論文の概要: Large language models simulate intersectional synthetic identities with a budget of one to two dimensions
- arxiv url: http://arxiv.org/abs/2608.23005v1
- Date: Mon, 24 Aug 2026 09:07:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:44.005691
- Title: Large language models simulate intersectional synthetic identities with a budget of one to two dimensions
- Title(参考訳): 大規模言語モデルは1次元から2次元の予算で交叉合成アイデンティティをシミュレートする
- Authors: Virgile Rennard, Christos Xypolopoulos,
- Abstract要約: 我々は、Pew's American Trends Panelの15波にわたるすべての実際の交叉部分群に対して、人口統計学的対人法を検証した。
実際の回答者では、サブグループの意見は、その一意成分の加法和に概ね等しいが、アイデンティティが交差するにつれて2.5倍の差が生じる。
- 参考スコア(独自算出の注目度): 5.10573774891006
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large language models are increasingly used as synthetic survey respondents, promising cheap access to rare intersectional populations. We test standard demographic-persona methods against every real intersectional subgroup across 15 waves of Pew's American Trends Panel -- 21 million simulated response distributions from eight models. In real respondents, subgroup opinion is approximately the additive sum of its single-identity components, yet grows 2.5x more distinctive as identities intersect. Simulated respondents show no such composition: a single feature explains a two-feature persona's responses better than the additive combination in 75-82% of subgroups, and a third feature adds almost nothing. This collapse survives every prompting strategy we test. Additionally, the feature models retain is chosen nearly blindly -- except that they systematically discard race and religion, the strongest real drivers of opinion. Synthetic samples offer intersectional personas but represent one identity at a time.
- Abstract(参考訳): 大規模な言語モデルは、稀に交差する人口への安価なアクセスを約束する合成調査の回答者として、ますます使われている。
我々は、Pew's American Trends Panelの15波にわたるすべての実際の交叉部分群に対して、標準的な人口統計学的パーソナ法をテストする。
実際の回答者では、サブグループの意見は、その一意成分の加法和に概ね等しいが、アイデンティティが交差するにつれて2.5倍の差が生じる。
シミュレーションされた回答者は、そのような構成は示していない: 一つの特徴は、75~82%のサブグループの付加的な組み合わせよりも2つの機能を持つペルソナの反応をうまく説明し、第三の特徴は、ほとんど何も加えない。
この崩壊は、テストするすべての急進的な戦略を乗り越えます。
さらに、機能モデルがほとんど盲目的に選択されるが、それは人種や宗教を体系的に捨てることを除いて、意見の最も強い原動力である。
合成サンプルは、交差点のペルソナを提供するが、一度に1つのアイデンティティを表す。
関連論文リスト
- When Synthetic Users Fail: A Cross-Domain Benchmark of LLM-Simulated Human Survey Responses [4.327699139300454]
大規模言語モデル(LLMs)は、製品、ポリシー、市場決定をシミュレートした人間の回答に対するスタンドインとして、合成ユーザとしてますます使われています。
この置換が有効なのか、いつ失敗したのかを問うとともに、インテリジェントな合成ユーザシステムの評価フレームワークとしてその答えをパッケージ化する。
2つのファミリーにまたがる4つのモデルと8B-to-frontier機能の範囲で実行される単一のプロトコルは、実際のヒューマンレスポンスデータの2つの独立したドメインに適用される。
すべてのモデルは、ホールドアウトされた人間のデータに適合する非LLMベースラインのスイートに対してベンチマークされる。
論文 参考訳(メタデータ) (2026-07-28T23:43:00Z) - The One-Word Census: Answer-Choice Conformity Across 44 Language Models [3.7734715043126488]
我々は31個のシングルターンプロンプトの収束を特徴付け、それぞれに有効な1ワードの回答が多数あるカテゴリを命名する。
平均$-log2$の確率は、他のすべてのモデルのプールされた答えの下で得られる。
ペルソナとコミュニティがデザインしたモデルは最も異なっており、最新のメインラインフラッグシップは最もコンフォーマリストである。
論文 参考訳(メタデータ) (2026-07-14T14:12:05Z) - Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement [66.67463557274358]
バイアス付きデータセットに基づいてトレーニングされた基礎モデルは、しばしばターゲットラベルと非因果属性の間の急激な相関に依存する。
信頼誘導概念マイニング(CBCM:Confidence-guided Concept Mining)を導入し,属性アノテーションを使わずに信頼性の高いスプリアス属性を同定する。
本稿では,目標と突発的な表現を2つのブランチに分離するプロンプトチューニングフレームワークであるDual-branch Cross-projection Debiasing (DCD)を提案する。
論文 参考訳(メタデータ) (2026-06-23T05:28:47Z) - From Self to Other: Evaluating Demographic Perspective-Taking in LLM Hate Speech Annotation [5.762370982168011]
パーソナ条件付き大規模言語モデル(特定の階層的アイデンティティーを採用するよう促されるモデル)は、スケールにおける様々な視点をシミュレートする方法として提案されている。
人間の社会的判断の3つの側面として, (i) 異なる集団のペルソナが人間的な方法(グループ間不一致)に異同するか否か, (ii) コンテンツが自身のアイデンティティ(グループ内での感受性)をターゲットとした場合に, より敏感になるかどうか, (iii) 他集団の反応を正確に予測できるかどうか (viarious prediction) を評価した。
以上の結果から, モデルが3次元全てを連続的に捉えることはなく, 性能はモデル依存であり, 確実に出現しないことが明らかとなった。
論文 参考訳(メタデータ) (2026-06-04T15:09:58Z) - Response Time Enhances Alignment with Heterogeneous Preferences [49.69696266152175]
簡易な二次信号で選好データセットを増大させることで、住民の平均選好の識別性を回復できることを示す。
私たちの結果は、将来的なデータ収集パイプラインに約束と新たな機会をもたらします。
論文 参考訳(メタデータ) (2026-05-07T22:05:23Z) - The Chameleon's Limit: Investigating Persona Collapse and Homogenization in Large Language Models [12.654067061944074]
大規模言語モデル(LLM)に基づくアプリケーションでは,エージェント間の個体数の多様性が要求される。
エージェントはそれぞれ異なるプロファイルを割り当てるが、それでも狭い行動モードに収束し、均質なシミュレートされた人口を生み出す。
論文 参考訳(メタデータ) (2026-04-27T17:01:48Z) - No Single Best Model for Diversity: Learning a Router for Sample Diversity [69.53166985556759]
本稿では,有効な応答の集合を包括的に抽出する手法について検討する。
本稿では,各回答に割り当てられた品質スコアを計測する指標であるtextbfdiversity Cover を紹介する。
各プロンプトには、多様な回答セットを生成する際に、他のすべてのモデルよりも大幅に優れるモデルが存在する。
論文 参考訳(メタデータ) (2026-04-02T17:58:37Z) - Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond) [90.45301024940329]
言語モデル(LM)は、多様で人間らしい創造的コンテンツを生成するのに苦労することが多い。
Infinity-Chatは26万の多様な実世界のオープンエンドユーザクエリからなる大規模データセットである。
本研究では, LMのモード崩壊について大規模に検討し, 人工Hivemind効果が明らかとなった。
論文 参考訳(メタデータ) (2025-10-27T03:16:21Z) - DisCo: Reinforcement with Diversity Constraints for Multi-Human Generation [60.741022906593685]
DisCoは、マルチヒューマン世代におけるアイデンティティの多様性を直接最適化する最初のRLベースのフレームワークである。
グループ相対ポリシー最適化によるDisCo微粒フローマッチングモデル。
DiverseHumans Testsetでは、DisCoは98.6のユニークな顔の精度とほぼ完璧なグローバルアイデンティティスプレッドを実現している。
論文 参考訳(メタデータ) (2025-10-01T19:28:51Z) - Intersectional Bias in Causal Language Models [0.0]
我々は,emphGPT-2およびemphGPT-NEOモデルについて検討した。
我々は、性別、宗教、障害の3つの社会的カテゴリを無条件またはゼロショットのプロンプトに組み合わせて実験を行う。
EmphGPTモデルを含む自己回帰因果モデルを用いて実施した先行試験を確認した。
論文 参考訳(メタデータ) (2021-07-16T03:46:08Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。