論文の概要: More Is Not More: What Matters for Diversity in LLM Opinions?
- arxiv url: http://arxiv.org/abs/2607.20429v1
- Date: Sun, 10 May 2026 00:52:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.156766
- Title: More Is Not More: What Matters for Diversity in LLM Opinions?
- Title(参考訳): それ以上ではない - LLMオピニオンにおける多様性とは何か?
- Abstract要約: 我々は、入力条件付けと相互作用アーキテクチャの2つの主要な介入次元を分離する要因実験を設計する。
我々は、7つのモデルにまたがる100人の実ユーザによるオープンエンド質問のすべての条件を評価し、複数の相補的な指標を用いて多様性を測定した。
我々の研究は、多様性は単一の次元に沿ってスケーリングする産物ではなく、構造形式や介入の組み合わせに非常に敏感であることを示した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly used to simulate diverse human opinions in open-ended tasks such as synthetic surveys, focus group modeling, and public opinion prediction. However, LLM outputs exhibit systematic opinion homogenization. Practitioners have explored various interventions to increase diversity, but the landscape remains fragmented: different methods are evaluated in isolation with incomparable metrics, and in practice they are typically deployed and upgraded simultaneously, making it difficult to attribute gains to specific components. To advance a more scientific understanding of LLM output diversity, we design a factorial experiment that separates two primary intervention dimensions: input conditioning (operationalized through persona depth) and interaction architecture. We evaluate all conditions on 100 real-user open-ended questions across 7 models, measuring diversity with multiple complementary metrics. Our findings challenge several common assumptions. First, more persona detail does not monotonically increase diversity. The initial step of persona conditioning already captures the majority of the gain, while further elaboration with demographic detail does not consistently improve and can reduce diversity on some models. Second, rather than seeking a single best interaction architecture, we find that different architectures explore largely non-overlapping opinion regions. Combining multiple architectures yields broader coverage than optimizing any one. Third, commonly attempted low-cost alternatives such as raising sampling temperature and adding diversity instructions produce negligible effects compared to structured interventions. Overall, our work demonstrates that diversity is not a product of scaling along any single dimension, but is highly sensitive to the structural form and combination of interventions.
- Abstract(参考訳): 大規模言語モデルは、総合的な調査、焦点グループモデリング、世論予測などのオープンなタスクにおいて、多様な人間の意見をシミュレートするために、ますます使われている。
しかし、LSMの出力は体系的な意見均質化を示す。
異なるメソッドは非互換性なメトリクスと独立して評価され、実際にはそれらは通常、同時にデプロイされ、アップグレードされるため、特定のコンポーネントに利得を割り当てることは困難である。
LLM出力の多様性をより科学的に理解するために,入力条件付け(ペルソナ深度による操作)と相互作用アーキテクチャの2つの主要な介入次元を分離する因子的実験を設計する。
我々は、7つのモデルにまたがる100人の実ユーザによるオープンエンド質問のすべての条件を評価し、複数の相補的な指標を用いて多様性を測定した。
私たちの発見はいくつかの一般的な仮定に挑戦する。
第一に、より多くのペルソナの詳細は、単調に多様性を増すものではない。
ペルソナ条件付けの最初のステップは、既にゲインの大部分をキャプチャする一方で、人口統計の詳細に関するさらなる検討は、一貫して改善されず、いくつかのモデルにおいて多様性を低下させる可能性がある。
第二に、単一の最高の相互作用アーキテクチャを求めるのではなく、異なるアーキテクチャが主に重複しない意見領域を探索していることに気付きます。
複数のアーキテクチャを組み合わせることで、最適化するよりも幅広いカバレッジが得られる。
第3に、サンプリング温度の上昇や多様性指示の追加といった、一般的に試みられている低コストな代替手段は、構造化された介入と比較して無視できる効果をもたらす。
全体として、我々の研究は、多様性は単一の次元に沿ってスケーリングする産物ではなく、構造形式や介入の組み合わせに非常に敏感であることを示している。
関連論文リスト
- Diversity Collapse in Multi-Agent LLM Systems: Structural Coupling and Collective Failure in Open-Ended Idea Generation [38.13720312846963]
我々は、モデルインテリジェンス、エージェント認知、システムダイナミクスの3つのボトムアップレベルにおいて、MASに基づくアイデアの多様性について研究する。
これらの成果を,構造的結合から生じる集合的失敗として特徴づける。
この崩壊は,本質的なモデル不足というよりも,相互作用構造に起因していると考えられる。
論文 参考訳(メタデータ) (2026-04-20T09:27:49Z) - pMoE: Prompting Diverse Experts Together Wins More in Visual Adaptation [68.3777121585281]
pMoEと呼ばれる新しいMixture-of-Expertsプロンプトチューニング手法を提案する。
提案したpMoEは、幅広いタスクに対するモデルの汎用性と適用性を著しく向上させる。
本研究は,一般領域と医療領域の分類・分節を含む47の適応タスクにまたがる広範囲な実験を行った。
論文 参考訳(メタデータ) (2026-02-26T12:27:06Z) - Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond) [90.45301024940329]
言語モデル(LM)は、多様で人間らしい創造的コンテンツを生成するのに苦労することが多い。
Infinity-Chatは26万の多様な実世界のオープンエンドユーザクエリからなる大規模データセットである。
本研究では, LMのモード崩壊について大規模に検討し, 人工Hivemind効果が明らかとなった。
論文 参考訳(メタデータ) (2025-10-27T03:16:21Z) - Mind the Gap: Conformative Decoding to Improve Output Diversity of Instruction-Tuned Large Language Models [0.0]
本稿では,物語生成作業における「多様性ギャップ」について検討する。
その結果,指導指導による多様性の低下が認められた。
本稿では、より多様なベースモデルを用いてインストラクションモデルを誘導し、出力の多様性を再導入する新しいデコーディング戦略であるコンストラクティブデコーディングを提案する。
論文 参考訳(メタデータ) (2025-07-28T16:04:25Z) - Diverse LLMs or Diverse Question Interpretations? That is the Ensembling Question [5.847084649531299]
大型言語モデル(LLM)を用いた二分問題に対する2つの多様性アプローチの比較を行った。
いずれの場合も、最終的な回答を決定するために、多数決をアンサンブルの合意として適用する。
Boolq、Strategyqa、pubmedqaの実験は、質問解釈の多様性が一貫してより良いアンサンブル精度をもたらすことを示した。
論文 参考訳(メタデータ) (2025-07-25T15:26:18Z) - Evaluating the Diversity and Quality of LLM Generated Content [72.84945252821908]
品質閾値を満たす出力間の効果的な意味的多様性を測定するための枠組みを導入する。
嗜好調整モデルでは語彙的および構文的多様性が低下するが、SFTやベースモデルよりも効果的な意味的多様性が得られる。
これらの発見は、多種多様な高品質な出力を必要とするアプリケーションに重要な意味を持つ。
論文 参考訳(メタデータ) (2025-04-16T23:02:23Z) - Exploring and Controlling Diversity in LLM-Agent Conversation [13.69653913986299]
本稿では,単一パラメータで多様性を制御できる新しい手法であるAdaptive Prompt Pruning (APP)を提案する。
APPは広範な実験を通じて多様性を効果的に調整し、既存の多様性制御手法と互換性がある。
論文 参考訳(メタデータ) (2024-12-30T17:25:58Z) - Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment [84.32768080422349]
人間の好みの調整は、大きな言語モデルが誤解を招くか有害なコンテンツを生成するのを防ぐ。
本研究では, 微調整後のLLMの最終性能と線形相関を示唆し, 即時多様性の新たな定式化を提案する。
論文 参考訳(メタデータ) (2024-03-17T07:08:55Z) - Identifiability Results for Multimodal Contrastive Learning [72.15237484019174]
本研究では,以前研究したマルチビュー設定よりも,より一般的な設定で共有要因を復元可能であることを示す。
本研究は,マルチモーダル表現学習の理論的基盤を提供し,マルチモーダルコントラスト学習を実践的に効果的に設定する方法を説明する。
論文 参考訳(メタデータ) (2023-03-16T09:14:26Z) - Picking on the Same Person: Does Algorithmic Monoculture lead to Outcome
Homogenization? [90.35044668396591]
機械学習における繰り返しのテーマはアルゴリズムによるモノカルチャーである。同じシステム、またはコンポーネントを共有するシステムは、複数の意思決定者によってデプロイされる。
意思決定者がトレーニングデータや特定のモデルなどのコンポーネントを共有すれば、より均一な結果が得られます。
我々はこの仮説をアルゴリズムフェアネスベンチマークで検証し、トレーニングデータの共有がホモジェナイゼーションを確実に悪化させることを示した。
結果の均質化に関する哲学的分析と社会的な課題を、デプロイされた機械学習システムに含めることに着目して結論付ける。
論文 参考訳(メタデータ) (2022-11-25T09:33:11Z) - Feature diversity in self-supervised learning [0.0]
CNNモデルを用いた自己教師型学習の文脈において,これらの要因が全体的な一般化性能に与える影響について検討した。
最後のレイヤがトレーニングを通じて最も多様化していることが分かりました。
モデルのテストエラーはエポックの増加に伴って減少するが、その多様性は低下する。
論文 参考訳(メタデータ) (2022-09-02T21:34:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。