論文の概要: Consequential Behaviour and Representational Fairness in the Validation of Synthetic Research
- arxiv url: http://arxiv.org/abs/2609.27690v2
- Date: Thu, 24 Sep 2026 10:09:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.356437
- Title: Consequential Behaviour and Representational Fairness in the Validation of Synthetic Research
- Title(参考訳): 合成研究の検証における連続行動と表現フェアネス
- Abstract要約: 産業とアカデミアの研究者たちは、人間のサンプルの代用として、大きな言語モデルを利用した総合調査の回答者を使用している。
これらの人工個体群は実世界のデータに対する検証を必要とするため、研究者はしばしば人間の調査とアドホックな比較によってそれらに対処する。
行動科学における意図的・行動的ギャップに触発されたこれらの検証は、ほとんどの応用事例で間違ったことをテストしていると論じる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Researchers in industry and academia use synthetic survey respondents powered by large language models as substitutes for human samples. These synthetic populations require validation against real-world data, so researchers often address them using ad hoc comparisons with human surveys. Inspired by the intention-behaviour gap in behavioural science, we argue that these validations test the wrong thing for most applied cases where decision makers commission synthetic research to anticipate consequential behaviour. To address this problem, we propose a validation framework with two requirements. First, every validity claim must state its level of correspondence with human data: does the sample predict what the represented people do, which of four diagnostics (location, dispersion, response process and structure) does the validation address, and does the validation compare against experimental effects? Second, researchers must report validity claims for subgroups, since these groups are often the most affected by consequential decisions and aggregate accuracy hides their misrepresentation. Our validation framework operationalises three justice dimensions (distributional, procedural, and recognition) as measurable quantities and defines within-persona counterfactual experiments as a validation requirement. We then apply the framework to electric vehicle charging tariffs, before closing with a reporting checklist that researchers can use to make convincing validity claims.
- Abstract(参考訳): 産業とアカデミアの研究者たちは、人間のサンプルの代用として、大きな言語モデルを利用した総合調査の回答者を使用している。
これらの人工個体群は実世界のデータに対する検証を必要とするため、研究者はしばしば人間の調査とアドホックな比較によってそれらに対処する。
行動科学における意図的・行動的ギャップに触発されたこれらの検証は、意思決定者が連続的な行動を予測するために合成研究を委託するほとんどの場合において、間違ったことをテストしていると論じる。
この問題に対処するために,2つの要件を持つ検証フレームワークを提案する。
サンプルは、代表者が何をしているか、どの診断(位置、分散、応答プロセス、構造)がバリデーションアドレスをするかを予測し、検証は実験結果と比較しますか?
第二に、研究者はサブグループに対する妥当性の主張を報告しなければならない。
検証フレームワークは,3つの正義次元(分配,手続き,認識)を測定可能な量として運用し,対人実験を検証要件として定義する。
次に、この枠組みを電気自動車の充電関税に適用し、研究者が妥当な正当性主張を行うために使用できるレポートチェックリストを閉じる。
関連論文リスト
- Multi-dimensional Bias in Modeling Multi-dimensional Preferences: Evaluating the Ability of Synthetic Agents to Replace Human Participants in Conjoint Experiments [3.5330809691508924]
本稿では, 合成エージェントが, 多次元の人間の嗜好パターンを再現できるかどうかを考察する。
共役研究を再現し、合成エージェントが生成した結果を3次元の人間のデータと比較する。
論文 参考訳(メタデータ) (2026-08-13T13:44:07Z) - This human study did not involve human subjects: Validating LLM simulations as behavioral evidence [15.56427716190418]
ヒューリスティックなアプローチは、シミュレーションされた観察された人間の行動が交換可能であることを確立する。
統計的キャリブレーションは、観察された反応とシミュレーションされた反応の相違を説明するために、補助的な人間のデータと統計的調整を組み合わせる。
論文 参考訳(メタデータ) (2026-02-17T18:18:38Z) - Stochastic Parrots or Singing in Harmony? Testing Five Leading LLMs for their Ability to Replicate a Human Survey with Synthetic Data [0.0]
本稿では,シリコンバレーのプログラマ420名を対象にした人間対応サーベイと,実際のシークエンサーをシミュレートする合成サーベイデータの比較を行った。
以上の結果から,AIエージェントが予想以上に再現性と調和性を重視した技術的に妥当な結果を生み出したことが判明した。
本研究は, 厳密な調査手法の代わりに, より信頼性の高い前・後調査機器として, 総合的な調査に基づく研究を行なわなければならないと結論付けた。
論文 参考訳(メタデータ) (2026-02-10T09:50:33Z) - A validity-guided workflow for robust large language model research in psychology [0.0]
大規模言語モデル(LLM)は、研究ツール、評価対象、人間のシミュレータ、認知モデルとして、心理学研究に急速に統合されている。
これらの「測定幻覚」は、統計的成果を心理学的現象として生み出すもので、成長する研究機関の妥当性を損なうものである。
精神測定と因果推論を統合した二重正当性フレームワークによって導かれた6段階のワークフローで、妥当性要件を研究野心に拡張する。
論文 参考訳(メタデータ) (2025-07-06T18:06:12Z) - On the Interconnections of Calibration, Quantification, and Classifier Accuracy Prediction under Dataset Shift [58.91436551466064]
本稿では,データセットシフト条件下でのキャリブレーションと定量化の3つの基本問題間の相互接続について検討する。
これらのタスクのいずれか1つに対するオラクルへのアクセスは、他の2つのタスクの解決を可能にすることを示す。
本稿では,他の分野から借用した高度に確立された手法の直接適応に基づく各問題に対する新しい手法を提案する。
論文 参考訳(メタデータ) (2025-05-16T15:42:55Z) - SciClaimHunt: A Large Dataset for Evidence-based Scientific Claim Verification [7.421845364041002]
本稿では,SciClaimHuntとSciClaimHunt_Numの2つの大規模データセットを紹介する。
本稿では,これらのデータセットの有効性を評価するために,科学的クレーム検証に適したベースラインモデルをいくつか提案する。
SciClaimHuntとSciClaimHunt_Numで訓練されたモデルと既存の科学的クレーム検証データセットを比較し,その品質と信頼性を評価する。
論文 参考訳(メタデータ) (2025-02-14T08:34:26Z) - A Double Machine Learning Approach to Combining Experimental and Observational Data [58.05402364136958]
実験と観測を組み合わせた二重機械学習手法を提案する。
本フレームワークは, より軽度な仮定の下で, 外部の妥当性と無知性に対するファルシフィケーションテストを提案する。
論文 参考訳(メタデータ) (2023-07-04T02:53:11Z) - Empirical Estimates on Hand Manipulation are Recoverable: A Step Towards
Individualized and Explainable Robotic Support in Everyday Activities [80.37857025201036]
ロボットシステムの鍵となる課題は、他のエージェントの振る舞いを理解することである。
正しい推論の処理は、(衝突)因子が実験的に制御されない場合、特に困難である。
人に関する観察研究を行うために必要なツールをロボットに装備することを提案する。
論文 参考訳(メタデータ) (2022-01-27T22:15:56Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。