論文の概要: Quantifying Diversity of Thought: A Predictive Law of Weighted LLM Ensemble Lift
- arxiv url: http://arxiv.org/abs/2607.17384v2
- Date: Tue, 21 Jul 2026 07:59:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.402262
- Title: Quantifying Diversity of Thought: A Predictive Law of Weighted LLM Ensemble Lift
- Title(参考訳): 思考の多様性の定量化:LLMアンサンブルリフットの予測法則
- Authors: Junade Ali,
- Abstract要約: 本稿では,大規模言語モデルのアンサンブルにおいて,思考の多様性がもたらす上昇を計算するための実験的に検証された形式法について述べる。
2つの大学院レベルの科学ベンチマークで、10のオープンウェイトモデルから767,520の推論を検証した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper provides an experimentally verified formal law for calculating the uplift that diversity of thought provides in Large Language Model (LLM) ensembles. From first principles, we derive an exact decomposition of LLM ensemble lift into rescue and damage masses, which yields a compact heuristic for calculating uplift. From this we extract the metrics which predict ensemble performance: an accuracy-adjusted correctness correlation, $φ_{\mathrm{adj}}$, together with the accuracy gap and collective accuracy of the pair. We test the law on 767,520 inferences from ten open-weight models over two graduate-level science benchmarks, together with a novel agentic cybersecurity benchmark in which each model conducts digital-forensics investigations by multi-turn tool use in a network-isolated sandbox (23,520 graded trials including abstentions); all votes are released openly. Calibrated once on SuperGPQA at a 40:60 vote split, the heuristic predicts lift on the calibration set with Spearman's $ρ=0.84$ and, with its coefficients frozen, transfers to two datasets never used in calibration ($ρ=0.51$ on GPQA Diamond and $0.84$ on the forensic tasks), whilst the measured swap mass tracks realised lift with $R^2\ge 0.96$ throughout. Raw $φ$ has almost no predictive power ($R^2\le 0.09$ throughout); the accuracy-adjusted $φ_{\mathrm{adj}}$ is markedly superior ($R^2=0.67$ on SuperGPQA), and the heuristic combining these metrics is the most stable pre-pooling predictor across the three datasets.
- Abstract(参考訳): 本稿では,Large Language Model (LLM) アンサンブルにおいて,思考の多様性がもたらす上昇を計算するための実験的に検証された公式な法則を提案する。
第一原理から、LLMアンサンブルリフトの正確な分解を救難質量と損傷質量に導出し、アップリフトを計算するためのコンパクトなヒューリスティックを生み出す。
この結果から,精度調整精度相関,$φ_{\mathrm{adj}}$,精度ギャップ,集合精度などのアンサンブル性能を予測する指標を抽出した。
我々は、2つの大学院レベルの科学ベンチマークに対する10のオープンウェイトモデルからの767,520の推論と、ネットワークアイソレーションされたサンドボックス(23,520のグレードトライアルを含む)で使用するマルチターンツールによるデジタルフォレシック調査を行う新しいエージェントサイバーセキュリティベンチマークを試験する。
40:60 票決でスーパーGPQAに1度キャリブレーションされ、スピアマンの$ρ=0.84$でキャリブレーションセットのリフトを予測し、その係数が凍結され、2つのデータセットへの転送がキャリブレーションで使われない(ρ=0.51$、GPQAダイアモンドで$0.84$、法医学的なタスクで$0.84$)一方、測定されたスワップ質量トラックは、リフトをR^2\ge 0.96$で実現した。
Raw $φ$は予測力(R^2\le 0.09$全体)がほとんどなく、精度調整された$φ_{\mathrm{adj}}$は著しく優れている(R^2=0.67$ on SuperGPQA)。
関連論文リスト
- Saturation Makes Quantization Error Additive: A Coverage Model with a Certificate [0.0]
混合精度量子化は、モデルのどの部分がより高い精度を維持するかを決定する必要がある。
本研究は, 層単位での定量化による損失を, 層ごとの感性や, 対方向の感性から再現可能であることを示す。
本稿では, 測定値の差分プロファイルである$f(S)=cbigl (1-prod_iin S (1-a_i)bigr)$を, その$L$適合ブレークレートから数パーセント以内まで再現する。
論文 参考訳(メタデータ) (2026-07-14T02:08:33Z) - Weight Decay Regimes in Grokking Transformers: Cheap Online Diagnostics [0.0]
モジュラー演算で訓練された変換器は、記憶、一般化、崩壊の急激な遷移を示す。
重み劣化はこれらの状態に対するスカラーな経験的制御パラメータとして機能することを示す。
トレーニングのダイナミクスをトラックするオンライン診断,平均的注意頭コサイン類似性とエントロピー標準偏差を導入する。
論文 参考訳(メタデータ) (2026-05-19T19:48:40Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - High-Probability Convergence in Decentralized Stochastic Optimization with Gradient Tracking [69.90407799170687]
分散最適化における高確率収束保証について検討する。
その結果, 地平線上の条件は, 比較時間と同一であることがわかった。
論文 参考訳(メタデータ) (2026-04-30T22:45:21Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - Singular Bayesian Neural Networks [1.2891210250935148]
ベイズニューラルネットワークはキャリブレーションされた不確かさを約束するが、標準平均体ガウス後方に対する$O(mn)$パラメータを必要とする。
我々は、ルベーグ測度に関して特異な後部を誘導し、ランク-$r$多様体に集中する。
複素項が $sqrtr(m+n)$ ではなく $sqrtm n$ としてスケールするPAC-Bayes 一般化境界を導出し、誤差を最適化とランク誘導バイアスに分解する損失境界を証明する。
論文 参考訳(メタデータ) (2026-01-30T23:06:34Z) - Robust Layerwise Scaling Rules by Proper Weight Decay Tuning [50.11170157029911]
現代のスケール不変アーキテクチャでは、トレーニングは急速に劣化したグラデーション状態に入る。
我々は,AdamWに対して,幅をまたいだサブ層ゲインを保ったウェイトデカイスケーリングルールを導入する。
この結果は,パラメータが設定した定常スケールを明示的に制御することにより,ほぼ入出力体制を超えて$mu$Pを拡大する。
論文 参考訳(メタデータ) (2025-10-17T02:58:35Z) - Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining [59.369484219304866]
我々は100兆のトークンをスクラッチから3,700以上の大規模言語モデル(LLM)に対する前例のない経験的調査訓練を実施している。
ステップ法則(ステップ法)と呼ばれる,LLM事前学習におけるハイパーパラメータ最適化のための普遍的スケーリング法則を確立する。
我々の推定オプティマは, 排他的探索によって得られた世界最高の性能から, テストセットの0.094%しか逸脱しない。
論文 参考訳(メタデータ) (2025-03-06T18:58:29Z) - Contextual Combinatorial Bandits with Probabilistically Triggered Arms [55.9237004478033]
確率的に誘発される腕(C$2$MAB-T)を様々な滑らかさ条件下で検討した。
トリガー変調 (TPM) 条件の下では、C$2$-UC-Tアルゴリズムを考案し、後悔すべき$tildeO(dsqrtT)$を導出する。
論文 参考訳(メタデータ) (2023-03-30T02:51:00Z) - Optimal Robust Linear Regression in Nearly Linear Time [97.11565882347772]
学習者が生成モデル$Y = langle X,w* rangle + epsilon$から$n$のサンプルにアクセスできるような高次元頑健な線形回帰問題について検討する。
i) $X$ is L4-L2 hypercontractive, $mathbbE [XXtop]$ has bounded condition number and $epsilon$ has bounded variance, (ii) $X$ is sub-Gaussian with identity second moment and $epsilon$ is
論文 参考訳(メタデータ) (2020-07-16T06:44:44Z) - Extrapolation Towards Imaginary $0$-Nearest Neighbour and Its Improved
Convergence Rate [13.985534521589257]
そこで我々は,数個の$k ge 1$値から$k=0$まで,未重み付き$k$-NN推定器を外挿する新しいマルチスケール$k$-NN(MS-$k$-NN)を提案する。
提案手法は問合せとその周辺点に適応する最適実数値重みを暗黙的に計算する。
論文 参考訳(メタデータ) (2020-02-08T00:32:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。