論文の概要: Are Diversity Metrics Measuring Diversity? A Capability-Controlled Audit of Majority-Vote Gain in LLM Ensembles
- arxiv url: http://arxiv.org/abs/2607.20768v1
- Date: Wed, 22 Jul 2026 22:34:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.228778
- Title: Are Diversity Metrics Measuring Diversity? A Capability-Controlled Audit of Majority-Vote Gain in LLM Ensembles
- Title(参考訳): 多様性メトリクスは多様性を測定するか? : LLMアンサンブルにおける多目的利得の能力制御型監査
- Abstract要約: 5つの多様性対策が、最良メンバーに対する多数票獲得の予測因子として、追跡しているか、あるいは主に再表現能力を示すのかを問う。
オラクルゲインはサブセットの100%で陽性であるが、単純な投票では全標準サイズ3サブセットの9.98%で最強の会員に勝っている。
独立した予測器としての厳密な多様性、不一致、ダブルフォールトは、建設によってランク不足する。
- 参考スコア(独自算出の注目度): 19.651323641444726
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Majority voting over LLMs is widely assumed to benefit from diversity, and diversity measures are used to choose which models to combine. We ask whether five such measures track diversity or mainly re-express capability, auditing them as predictors of majority-vote gain over the best member across 31,900 subsets of 30 LLMs on MMLU-Pro (29 on TruthfulQA) under explicit capability controls. Three findings emerge. First, latent complementarity is ubiquitous: oracle gain is positive in 100% of subsets, yet simple voting beats the strongest member in only 9.98% of all canonical size-3 subsets (18.71% with held-out best selection); the pooled size-2-4 rate is 1.27%, partly reflecting deterministic even-size voting behavior. Second, a joint-correctness proxy (strict diversity) is nearly collinear with one minus mean accuracy (size-3 Spearman rho = +0.991 / +0.988); raw diversity-gain associations are strongly capability-entangled and, with one exception, unstable under control. Third, three linear contingency-table statistics are algebraically non-separable; after capability control, the empirically stable remainder is a modest residual pairwise co-failure association in which more shared error corresponds to lower gain. This direction is robust, but its magnitude is configuration-dependent. Joint rawspace linear regressions treating strict diversity, disagreement, and double-fault as independent predictors are rank-deficient by construction.
- Abstract(参考訳): LLMに対する多数決は多様性の恩恵を受けると広く考えられており、どのモデルを組み合わせるかを選択するために多様性対策が用いられる。
MMLU-Pro(29 on TruthfulQA)上の30 LLMの31,900個のサブセットのうち、最上位メンバに対する多数票獲得の予測因子として、明示的な機能制御の下で、このような5つの指標が多様性を追及しているか、あるいは主に表現能力を再表現するかを問う。
3つの発見がある。
オラクルゲインはサブセットの100%で陽性であるが、単純投票は全標準サイズ3サブセットの9.98%しか勝っていない(18.71%が最良選択)。
第二に、結合正当性プロキシ(厳密な多様性)は1つの平均精度(size-3 Spearman rho = +0.991 / +0.988)とほぼ直線的である。
能率制御の後、経験的に安定な残余は、より多くの共有誤差がより低い利得に対応する、わずかに残余なペアワイズ共失敗結合である。
この方向は堅牢だが、大きさは構成に依存している。
厳密な多様性、不一致、ダブルフォールトを独立予測器として扱う共同生空間線形回帰は、構築によってランク不足である。
関連論文リスト
- CUSP: Decomposable Collective Uncertainty for Multi-Agent Multimodal Reasoning [6.428392127849263]
本稿では,複数のVLM応答を共有意味応答空間にマッピングする訓練不要不確実性フレームワークCUSPを提案する。
本稿では,集合的不確実性,プール化意見の分散,ジェンセン・シャノン発散(JSD)の2つの相補的システムレベル信号について報告する。
静的なマルチVLMアンサンブルでは、集合的不確実性は小モデル状態において最強の信号である。
論文 参考訳(メタデータ) (2026-09-04T20:27:47Z) - Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - Traits Run Deeper: Trait-Specific Asymmetric Fusion for Personality Assessment [53.50824432699408]
Traits Run Deeperは、新しいパーソナリティアセスメントフレームワークである。
MFR(Multimodal Foundation Representation)、TSMF(Trit-Specific Modality Fusion)、DCPR(Distributed-Calibrated Personality Regression)の3つのコンポーネントで構成されている。
論文 参考訳(メタデータ) (2026-06-09T06:38:36Z) - Not All Flips Are Conformity: Decomposing Stance Convergence in Multi-Agent LLM Debate [5.650336594658653]
従来の解答フリップは, 自発的不安定性, 姿勢による適合性, 推論による説得の3つのメカニズムを混同している。
我々の3ソース分解フレームワークは、制御された対策条件によってそれぞれを分離する。
論文 参考訳(メタデータ) (2026-05-30T17:41:11Z) - Socio-Conformal Calibration in Complex Survey Data: Marginal Validity Is Not Enough for Subgroup Reliability [1.089614199781423]
我々は,Pew American Trends Panel上での5段階のAI態度予測の順序性予測について検討した。
標準コンフォメーションは4つのベース予測器全てに対して名目上の限界範囲を達成しているが、重み付けされたサブグループギャップは13ポイントである。
最強の予測者(XGBoost)にとって、モンドリアンは公平性と効率性のトレードオフを悪化させる。
グループしきい値を大域量子化に向けて縮小する正規化コンパレータは、この不安定性を緩和する。
論文 参考訳(メタデータ) (2026-05-07T01:10:48Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - Representational Collapse in Multi-Agent LLM Committees: Measurement and Diversity-Aware Consensus [0.0]
マルチエージェントLDM委員会は、異なるロールプロンプトの下で同じモデルを複製し、多数決によってアウトプットを集約する。
それぞれのエージェントのチェーン・オブ・シークレットの論理を組み込んで、100 GSM8Kの質問に3つのQwen2.5-14Bのエージェントでペアの類似度を測る。
DALCは、埋め込み幾何学から多様性重量を計算するトレーニングフリーコンセンサスプロトコルであり、GSM8Kでは87%、トークンコストでは84%に達する。
論文 参考訳(メタデータ) (2026-04-04T17:30:23Z) - Dependence-Aware Label Aggregation for LLM-as-a-Judge via Ising Models [55.94503936470247]
大規模なAI評価は、審査員を含む、$K$アノテータからのバイナリ判断を集約することにますます依存している。
ほとんどの古典的なメソッドは、アノテータが条件的に独立であると仮定するが、真のラベルは$Yin0,1$であり、この仮定は LLM の審査員によってしばしば違反される。
我々はIsingグラフィカルモデルと潜在因子に基づく依存認識モデルの階層構造を通してラベルアグリゲーションを研究する。
論文 参考訳(メタデータ) (2026-01-29T21:26:50Z) - Is BatchEnsemble a Single Model? On Calibration and Diversity of Efficient Ensembles [2.957223821964636]
BatchEnsembleは、アンサンブルのような不確実性(EU)EUを、はるかに低いパラメータとメモリコストで提供することを目指している。
我々は,BatchEnsembleがDeep Ensemblesを過小評価するだけでなく,単一のモデルベースラインを密接に追跡していることを示す。
論文 参考訳(メタデータ) (2026-01-23T17:50:50Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。