論文の概要: Diverse by Reasoning: Harnessing the Wisdom of LLM Crowds for Future Prediction
- arxiv url: http://arxiv.org/abs/2608.24001v2
- Date: Wed, 26 Aug 2026 03:50:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.124275
- Title: Diverse by Reasoning: Harnessing the Wisdom of LLM Crowds for Future Prediction
- Title(参考訳): 推論によるディバース:未来予測のためのLLM群衆の知恵の調和
- Abstract要約: 大規模言語モデル (LLMs) は将来の予測にますます使われており、複数のモデルの知恵のメカニズムとしての利用を動機付けている。
多様なLLM群集を構築するための行動認識フレームワークを提案する。
- 参考スコア(独自算出の注目度): 7.744713199205176
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly used for future prediction, motivating the use of multiple models as a wisdom-of-the-crowd mechanism. However, simply increasing crowd size does not guarantee effective diversity, as different LLMs may exhibit redundant behaviors. We propose a behavior-aware framework for constructing diverse LLM crowds. The framework characterizes models using their reasoning traces on independent development tasks, clusters models by behavioral similarity, and selects representatives for collective prediction. We evaluate 25 LLMs using seven development benchmarks for behavioral diversity modeling and two future-prediction benchmarks for evaluating diverse crowds' performance. Our results show that crowd composition can matter more than crowd size: a three-model medoid crowd based on K-means++ behavioral clustering outperforms conventional voting over all 25 models on both prediction benchmarks, while reducing model calls by 88% and inference cost by approximately 80%. The results further suggest that representative behavioral diversity, rather than simply maximizing diversity, is important for constructing effective LLM crowds
- Abstract(参考訳): 大規模言語モデル (LLM) は将来の予測にますます使われており、複数のモデルの知恵のメカニズムとしての利用を動機付けている。
しかし、単に群衆の大きさを増やすだけでは、異なるLCMが冗長な振る舞いを示す可能性があるため、効果的な多様性は保証されない。
多様なLLM群集を構築するための行動認識フレームワークを提案する。
このフレームワークは、独立開発タスクの推論トレースを使用したモデルの特徴付け、行動類似性によるクラスタモデル、および集合予測のための代表者を選択する。
行動多様性モデリングのための7つの開発ベンチマークと、多様な観衆のパフォーマンスを評価するための2つの将来の予測ベンチマークを用いて、25個のLLMを評価した。
K-means++の挙動クラスタリングに基づく3モデルメドロイド群は,従来の25モデルすべてに対して,従来の投票結果よりも優れ,モデルコールを88%削減し,推論コストを約80%削減した。
この結果は、単に多様性を最大化するのではなく、代表的行動多様性が効果的なLLM群集の構築に重要であることを示唆している。
関連論文リスト
- Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models [60.9932576020062]
テスト時の計算戦略は、大規模言語モデルにおける推論を強化するための軽量なアプローチとして現れている。
本稿では,予測エントロピーに基づいて最も確実な予測を選択するエントロピーに基づくTTCを提案する。
ETTCは、軽度の仮定で多数決よりも優れており、投票と最高の個人モデルの両方を一貫して上回っていることを実証的に実証している。
論文 参考訳(メタデータ) (2026-05-29T01:06:38Z) - Learning to Trust the Crowd: A Multi-Model Consensus Reasoning Engine for Large Language Models [0.0]
大規模言語モデル(LLM)は平均年齢のパフォーマンスは高いが、インスタンスレベルでは信頼性が低い。
本稿では,LLM出力の集合を教師付きメタラーナへの入力として扱うマルチモデル・コンセンサス・推論エンジンを提案する。
このシステムは、自然言語の応答をセマンティックな埋め込み、ペアの類似性とクラスタリング統計、語彙的および構造的手がかり、推論品質スコア、信頼度推定、モデル固有の事前情報を用いて構造化された特徴にマッピングする。
論文 参考訳(メタデータ) (2026-01-12T06:27:06Z) - Beyond the Leaderboard: Understanding Performance Disparities in Large Language Models via Model Diffing [13.861365773419314]
モデル差分法を用いて, Gemma-2-9b-it と SimPO-enhanced の差分を解析する。
クロスコーダを用いて、2つのモデルを区別する潜在表現を特定し分類する。
論文 参考訳(メタデータ) (2025-09-23T08:35:58Z) - Can Reasoning Help Large Language Models Capture Human Annotator Disagreement? [84.32752330104775]
ヒトのアノテーションの変化(つまり不一致)は、NLPでは一般的である。
異なる推論条件が大言語モデルの不一致モデルに与える影響を評価する。
意外なことに、RLVRスタイルの推論は不一致モデリングにおいて性能を低下させる。
論文 参考訳(メタデータ) (2025-06-24T09:49:26Z) - Prismatic Synthesis: Gradient-based Data Diversification Boosts Generalization in LLM Reasoning [77.120955854093]
我々は,データ多様性が言語モデルにおける一般化の強力な予測因子であることを示す。
モデル誘起勾配のエントロピーを通して多様性を定量化する計量であるG-Vendiを導入する。
多様な合成データを生成するためのフレームワークであるPrismatic Synthesisを提案する。
論文 参考訳(メタデータ) (2025-05-26T16:05:10Z) - Latent Preference Coding: Aligning Large Language Models via Discrete Latent Codes [54.93980123979578]
我々は、暗黙の要因をモデル化する新しいフレームワークであるLatent Preference Coding (LPC)を紹介する。
LPCは様々なオフラインアライメントアルゴリズムとシームレスに統合し、基礎となる要因とデータからその重要性を自動的に推測する。
論文 参考訳(メタデータ) (2025-05-08T06:59:06Z) - One fish, two fish, but not the whole sea: Alignment reduces language models' conceptual diversity [2.5975241792179378]
研究者は大規模言語モデル(LLM)を人間の行動研究の代替として使用することを提案した。
トレーニング後のアライメント(RLHFまたはRLAIF)がモデルの内部多様性に影響を及ぼすかどうかが議論されている。
我々は、シミュレーションされた個体の内部変動と集団レベルの変動を関連づけることで、合成合成LLMの「人口」の概念的多様性を測定する新しい方法を用いる。
論文 参考訳(メタデータ) (2024-11-07T04:38:58Z) - Diversity of Thought Elicits Stronger Reasoning Capabilities in Multi-Agent Debate Frameworks [0.0]
大規模言語モデルの推論と事実的正確性を改善するために, 思考の促進, 自己検証, マルチエージェントの議論が提案されている。
マルチエージェントの議論はどんなモデルスケールでも有効であり、思考の多様性はLLMの議論においてより強力な推論をもたらす。
論文 参考訳(メタデータ) (2024-10-10T21:59:01Z) - Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large
Language Models [56.256069117502385]
Chain of Thought (CoT)アプローチは、複雑な推論タスクにおいて、LLM(Large Language Models)の能力を高めるために使用できる。
しかし、マルチモーダル推論における最適なCoT実例の選択は、まだ検討されていない。
本稿では,この課題に対処する新しい手法として,検索機構を用いて実演例を自動的に選択する手法を提案する。
論文 参考訳(メタデータ) (2023-12-04T08:07:21Z) - Improving Discriminative Multi-Modal Learning with Large-Scale
Pre-Trained Models [51.5543321122664]
本稿では,大規模な事前学習型ユニモーダルモデルを用いて,識別型マルチモーダル学習を向上する方法について検討する。
MMLoRA(Multi-Modal Low-Rank Adaptation Learning)を導入する。
論文 参考訳(メタデータ) (2023-10-08T15:01:54Z) - CAMERO: Consistency Regularized Ensemble of Perturbed Language Models
with Weight Sharing [83.63107444454938]
本稿では,CAMEROと呼ばれる摂動モデルに基づく一貫性規則化アンサンブル学習手法を提案する。
具体的には、すべてのモデルで底層重みを共有し、異なるモデルの隠れ表現に異なる摂動を適用し、モデルの多様性を効果的に促進することができる。
大規模言語モデルを用いた実験により,CAMEROはアンサンブルモデルの一般化性能を大幅に向上することが示された。
論文 参考訳(メタデータ) (2022-04-13T19:54:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。