論文の概要: Evaluating LLM-Generated Preference Distributions
- arxiv url: http://arxiv.org/abs/2610.01000v1
- Date: Thu, 01 Oct 2026 03:40:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.88234
- Title: Evaluating LLM-Generated Preference Distributions
- Title(参考訳): LLM生成選好分布の評価
- Abstract要約: 大規模言語モデル(LLM)は、シミュレーション、合成データ生成、実世界のデータが利用できない環境での決定サポートのための確率的ジェネレータとして、ますます使われてきている。
そこで我々は, LLMによる航空旅行, レストラン, 消費者製品への嗜好の分布を系統的に分析した。
以上の結果から, 十分な能力を有するLLMが, 調査対象者のスタンドインとして使用する場合に, 類似した嗜好分布を生み出すという共通仮定に挑戦し, モデル選択により, 結果がより影響されることが示唆された。
- 参考スコア(独自算出の注目度): 3.8078514125892333
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) are increasingly used as probabilistic generators for simulation, synthetic data generation, and decision support in settings where real-world data are unavailable. Yet, the structure and reliability of the distributions they produce remain understudied. Here, we systematically analyze LLM-generated distributions of preferences for air travel, restaurants, and consumer products. Encouragingly, all models considered in our analysis exhibit self-coherence, with the most probable outcomes stabilizing rapidly under repeated sampling. At the same time, we observe substantial discordance across both model families and scales, with little consensus even among their most probable outcomes. These patterns hold across nine open-weight models, three choice domains, and show robustness under temperature changes, greedy decoding, and perturbations of prompt and ordering. Our findings indicate that outcomes are influenced more by the choice of model than by the wording of the prompt, challenging the common assumption that sufficiently capable LLMs produce similar preference distributions when used as stand-ins for survey respondents.
- Abstract(参考訳): 大規模言語モデル(LLM)は、シミュレーション、合成データ生成、実世界のデータが利用できない環境での決定サポートのための確率的ジェネレータとして、ますます使われている。
しかし、それらが生み出す分布の構造と信頼性はまだ検討されていない。
そこで我々は, LLMによる航空旅行, レストラン, 消費者製品への嗜好の分布を系統的に分析した。
分析において考慮された全てのモデルは自己整合性を示し、最も可能性の高い結果は反復サンプリング下で急速に安定化する。
同時に、モデルファミリーとスケールの双方でかなりの不一致が観察され、最も可能性の高い結果においてもほとんど合意が得られない。
これらのパターンは、9つのオープンウェイトモデル、3つの選択ドメインにまたがって保持され、温度変化、強欲な復号化、プロンプトと順序付けの摂動の下で堅牢性を示す。
以上の結果から, 十分な能力を有するLLMが, 調査対象者のスタンドインとして使用する場合に, 類似した嗜好分布を生み出すという共通仮定に挑戦し, モデル選択により, 結果がより影響されることが示唆された。
関連論文リスト
- The Illusion of Stochasticity in LLMs [21.172079837071724]
我々は,信頼性サンプリングが大規模言語モデル (LLM) をエージェントとして動作させるための基本的な要件であることを示した。
強力なフロンティアモデルでは、与えられたランダムな種を対象の分布に変換することができるが、特定の分布から直接サンプリングする能力には根本的な欠陥があることが示されている。
論文 参考訳(メタデータ) (2026-04-08T00:44:14Z) - D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models [91.21455683212224]
大規模言語モデル(LLMs)では、次の情報の関連性確率は、次の製品の関連性確率に関連付けられる。
しかし、きめ細かいサンプリング確率がタスク要求に忠実に適合するかどうかは未解決の問題だ。
P_tokenが大きなステップ・ツー・ステップの変動を示し、P_taskとの整合性が低いDモデルと、P_tokenがより安定してP_taskに整合するEモデルである。
論文 参考訳(メタデータ) (2026-01-25T14:59:09Z) - From Model Choice to Model Belief: Establishing a New Measure for LLM-Based Research [0.0]
大規模言語モデル(LLM)は、人間の振る舞いをシミュレートするためにますます使われている。
LLMの出力を単一のデータポイントとして扱うことは、LLMの確率的性質に固有の情報を過小評価する。
本稿では, LLMのトークンレベルの確率から導かれる「モデル信念」を紹介し, 定式化する。
論文 参考訳(メタデータ) (2025-12-29T03:50:40Z) - Learning to Reason in LLMs by Expectation Maximization [55.721496945401846]
我々は推論を潜在変数モデルとして定式化し、推論を学ぶための期待最大化目標を導出する。
この見解はEMと現代の報酬に基づく最適化を結びつけるものであり、正しい答えを正当化する有理性を生成するサンプリング分布を設計することの主な課題であることを示している。
論文 参考訳(メタデータ) (2025-12-23T08:56:49Z) - Spatial Reasoning with Denoising Models [49.83744014336816]
本稿では,連続変数の集合に対する推論を行うためのフレームワークを提案する。
初めて、その生成順序をデノナイジングネットワーク自体によって予測できる。
これらの結果から,特定の推論タスクの精度を1%から50%に向上させることができる。
論文 参考訳(メタデータ) (2025-02-28T14:08:30Z) - Evaluating Binary Decision Biases in Large Language Models: Implications for Fair Agent-Based Financial Simulations [15.379345372327375]
エージェントベースの金融市場モデルにおいて、人間のような意思決定をシミュレートするために、LLM(Large Language Models)がますます使われている。
我々は,2つのモデルサンプリングアプローチ(ワンショットと少数ショットのAPIクエリ)を用いて,最先端のGPTモデル3つをバイアスとして検証する。
論文 参考訳(メタデータ) (2025-01-20T10:36:51Z) - Quantifying Prediction Consistency Under Fine-Tuning Multiplicity in Tabular LLMs [10.494477811252034]
微調整多重度は分類タスクにおけるタブラル LLM に現れる。
我々の研究は、タブラルLLMにおける微調整多重性というこのユニークな挑戦を定式化する。
本稿では,コストのかかるモデル再訓練を伴わずに,個々の予測の一貫性を定量化する手法を提案する。
論文 参考訳(メタデータ) (2024-07-04T22:22:09Z) - Synthetic location trajectory generation using categorical diffusion
models [50.809683239937584]
拡散モデル(DPM)は急速に進化し、合成データのシミュレーションにおける主要な生成モデルの一つとなっている。
本稿では,個人が訪れた物理的位置を表す変数列である合成個別位置軌跡(ILT)の生成にDPMを用いることを提案する。
論文 参考訳(メタデータ) (2024-02-19T15:57:39Z) - Characterizing Fairness Over the Set of Good Models Under Selective
Labels [69.64662540443162]
同様の性能を実現するモデルセットに対して,予測公正性を特徴付けるフレームワークを開発する。
到達可能なグループレベルの予測格差の範囲を計算するためのトラクタブルアルゴリズムを提供します。
選択ラベル付きデータの実証的な課題に対処するために、我々のフレームワークを拡張します。
論文 参考訳(メタデータ) (2021-01-02T02:11:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。