論文の概要: Do LLMs Ask the Right Questions? Evaluating GPT-Generated Surveys as Instruments for Measuring Social Attitudes
- arxiv url: http://arxiv.org/abs/2607.19211v1
- Date: Tue, 21 Jul 2026 15:41:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.479881
- Title: Do LLMs Ask the Right Questions? Evaluating GPT-Generated Surveys as Instruments for Measuring Social Attitudes
- Title(参考訳): LLMs Ask the Right Questions? : GPT-Generated Surveys as Instruments for Measurementing Social Attitudes
- Abstract要約: 本稿では,GPTによる調査と3つの社会的領域における調査基準の確立について比較する。
以上の結果から,GPTが生成した調査は,人間設計の機器と同一の縦割りを捉えていることが明らかとなった。
- 参考スコア(独自算出の注目度): 14.002581483623219
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Understanding human beliefs and social attitudes often relies on carefully designed survey instruments. Recent work has suggested that large language models (LLMs) could automate parts of this process by generating surveys at scale, raising questions about the comparability of such instruments to literature-grounded, human-designed surveys. We present a controlled empirical comparison between GPT-generated surveys and established survey baselines across three social domains: climate change, immigration, and diversity, equity, and inclusion (DEI). GPT-generated surveys were produced using a fixed prompting framework enforcing a 3x3 structure over beliefs, perceptions, and behaviors, while human baselines were assembled from validated instruments to match survey length and construct coverage. We collected responses from U.S.-based participants, who completed both survey types, allowing direct within-subject comparison. We analyze differences in response distributions, clustering behavior, and alignment with self-identified stances. Our results show that GPT-generated surveys capture the same dominant attitudinal divisions as human-designed instruments, while exhibiting differences in the resolution of belief structure and group separation. These findings suggest that LLM-generated surveys are suited for exploratory and large-scale analyses, and can be used to complement expert-designed instruments.
- Abstract(参考訳): 人間の信念や社会的態度を理解することは、しばしば慎重に設計された調査機器に依存する。
近年の研究では、大規模な調査を発生させることで、大規模言語モデル(LLM)がこのプロセスの一部を自動化できることが示唆されている。
本稿では,気候変動,移民,多様性,株式,包括性(DEI)という3つの社会領域にまたがって,GPTが生み出した調査と確立された調査基準を比較検討する。
GPTが生成した調査は、信念、知覚、行動に対して3x3構造を強制する固定的なプロンプトフレームワークを用いて作成され、人間のベースラインは、調査の長さと構成範囲に適合する検証済みの機器から組み立てられた。
両調査を完了した米国在住の参加者からの回答を収集し,直接対象内比較を行った。
我々は、応答分布、クラスタリング行動、および自己識別姿勢との整合性の違いを分析する。
以上の結果から,GPTが生成した調査は,人間設計の楽器と同じ存在区分を捉えつつ,信念構造と集団分離の解像度に差異が認められた。
これらの結果から, LLMによる調査は探索的, 大規模分析に適しており, 専門家が設計した機器を補完するのに有用であることが示唆された。
関連論文リスト
- Total Simulated Survey Error: Designing and Diagnosing Survey Responses from Large Language Models [6.18279552770494]
大規模言語モデル(LLM)は、膨大な量の人為的なデータに基づいて訓練されている。
LLMは、さまざまな状況における人々をシミュレートする上で、人間のようなパターンを模倣することを約束している。
そのような文脈の1つは、LLMを「シリコンサンプル」、すなわち、世論、デザインポリシー、あるいは(社会的な)科学的データとして使うために調査質問に答える人々のプロキシとして使うことである。
論文 参考訳(メタデータ) (2026-09-09T14:59:07Z) - SurveyReview: A Reviewer-Aligned Benchmark for Survey Evaluators [50.129606229339146]
SurveyReviewは、調査評価のためのレビューアラインで多次元のベンチマークとデータセットである。
我々は、自由形式のコメントを4次元のスコアに変換することによって、ピアレビューレポートを構築する。
我々は,自動評価器と人間レビュアーのアライメントを測定するための,標準化された列車/テスト分割と評価プロトコルをリリースする。
論文 参考訳(メタデータ) (2026-08-07T16:11:46Z) - On the Credibility of Evaluating LLMs using Survey Questions [0.42061757959666934]
近年,大規模言語モデル(LLM)の価値指向を適応型社会調査を用いて評価している。
本稿では, 正確な設定に依存して, 値配向の類似性を過小評価し, 過度に見積もることの限界を明らかにする。
5か国3ヶ国における世界価値調査(World Value Survey)を用いて、直接対思考の連鎖(direct vs. chain-of-thinkt)と復号戦略(greedy vs. sample)が結果に有意な影響を及ぼすことを示した。
論文 参考訳(メタデータ) (2026-02-03T21:45:43Z) - AI Assisted Economics Measurement From Survey: Evidence from Public Employee Pension Choice [2.2324302196460706]
本研究では,大規模言語モデルを用いて調査機器から直接測定構造を抽出する経済計測の反復的枠組みを開発する。
この枠組みは、大規模な公務員退職計画調査に適用される。
論文 参考訳(メタデータ) (2026-02-02T02:22:36Z) - AlignSurvey: A Comprehensive Benchmark for Human Preferences Alignment in Social Surveys [14.699937408707356]
私たちはAlignSurveyを紹介します。AlignSurveyは、社会調査パイプライン全体を体系的に複製し、評価する最初のベンチマークです。
ソーシャル・ロール・モデリング、半構造化インタビュー・モデリング、態度・モデリング、アンケート・レスポンス・モデリングの4つの主要な調査段階に沿ったタスクを定義している。
また、個別レベルとグループレベルのアライメントの正確性、一貫性、公平性を評価するために、タスク固有の評価指標も提供します。
論文 参考訳(メタデータ) (2025-11-11T06:14:21Z) - Prompts to Proxies: Emulating Human Preferences via a Compact LLM Ensemble [46.82793004650415]
大規模言語モデル(LLM)は、様々なタスクにまたがる人間のような応答をエミュレートする可能性を実証している。
本研究では,LLMをエージェントプロキシとして扱う新しいアライメントフレームワークを提案する。
我々は、構造化されたプロンプトエンジニアリング、エントロピーに基づくサンプリング、回帰に基づく選択を用いて、LLMエージェントを代表的行動パターンに向けて操るシステムであるP2Pを紹介する。
論文 参考訳(メタデータ) (2025-09-14T15:08:45Z) - Specializing Large Language Models to Simulate Survey Response Distributions for Global Populations [49.908708778200115]
我々は,調査応答分布をシミュレートする大規模言語モデル (LLM) を最初に開発した。
テストベッドとして、我々は2つの世界文化調査の国レベルの結果を使用します。
予測された応答分布と実際の応答分布のばらつきを最小限に抑えるために, ファースト・ツーケン確率に基づく微調整法を提案する。
論文 参考訳(メタデータ) (2025-02-10T21:59:27Z) - ChatGPT vs Social Surveys: Probing Objective and Subjective Silicon Population [7.281887764378982]
大規模言語モデル(LLM)は、社会調査における人間の反応をシミュレートし、信頼できる予測を生成する可能性を秘めている。
GPTにより生成したシリコン試料の集団パラメータを同定するサンプリング分布を生成するために,繰り返しサンプリングを用いる。
以上の結果から、GPTの人口分布は、性別と平均年齢の点で、2020年の米国人口と一致していることがわかった。
GPTの立位スコアの点推定は極めて矛盾しており、特定のイデオロギーに対する明確な傾きを示していない。
論文 参考訳(メタデータ) (2024-09-04T10:33:37Z) - Evaluating Large Language Models with Psychometrics [59.821829073478376]
本稿では,Large Language Models (LLMs) の心理的構造を定量化するための総合的ベンチマークを提案する。
私たちの研究は、13のデータセットで評価された5つの重要な心理的構成要素、人格、価値観、感情的知性、心の理論、自己効力性を特定します。
LLMの自己報告特性と実際のシナリオにおける応答パターンとの間に大きな相違が発見され,その挙動の複雑さが明らかになった。
論文 参考訳(メタデータ) (2024-06-25T16:09:08Z) - Iterative Utility Judgment Framework via LLMs Inspired by Relevance in Philosophy [66.95501113584541]
ITEM(Iterative utiliTy judgm fraEntMework)を提案する。
RAGの3つの中核的構成要素は、検索モデル、ユーティリティ判断、回答生成から導かれる関連性ランキングであり、シューツの哲学的関連性体系と一致している。
実効性判定, ランキング, 回答生成におけるITEMの顕著な改善が, 代表ベースラインに基づいて示された。
論文 参考訳(メタデータ) (2024-06-17T07:52:42Z) - An unsupervised learning approach to evaluate questionnaire data -- what
one can learn from violations of measurement invariance [2.4762962548352467]
本稿では,このような研究データに対する教師なし学習に基づくアプローチを提案する。
データ準備、アンケートのクラスタリング、得られたクラスタリングと各グループの特性に基づいて類似度を測定する。
グループ間の自然な比較と、グループの応答パターンの自然な記述を提供する。
論文 参考訳(メタデータ) (2023-12-11T11:31:41Z) - Bias and Fairness in Large Language Models: A Survey [73.87651986156006]
本稿では,大規模言語モデル(LLM)のバイアス評価と緩和手法に関する総合的な調査を行う。
まず、自然言語処理における社会的偏見と公平性の概念を統合し、形式化し、拡張する。
次に,3つの直感的な2つのバイアス評価法と1つの緩和法を提案し,文献を統一する。
論文 参考訳(メタデータ) (2023-09-02T00:32:55Z) - AI-Augmented Surveys: Leveraging Large Language Models and Surveys for Opinion Prediction [0.0]
人間のような反応を生み出す大きな言語モデル(LLM)は、社会科学における研究の実践に革命をもたらし始めている。
横断的な調査を繰り返しながらLLMを微調整する新しい手法の枠組みを開発した。
AIが強化した調査の2つの新しい応用として、レトロディクション(すなわち、年レベルの欠落を予測)と、無意識の意見予測(unasked opinion prediction)を紹介した。
論文 参考訳(メタデータ) (2023-05-16T17:13:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。