論文の概要: Uncertainty-Aware Trust Estimation for Multi-LLM Systems via Structured Expert Judgement
- arxiv url: http://arxiv.org/abs/2607.20529v1
- Date: Fri, 10 Jul 2026 08:47:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.219409
- Title: Uncertainty-Aware Trust Estimation for Multi-LLM Systems via Structured Expert Judgement
- Title(参考訳): 構造化専門家判定によるマルチLLMシステムの不確実性認識信頼推定
- Abstract要約: 我々は不確実性を考慮した信頼推定問題としてマルチLLMアグリゲーションを定式化する。
我々は、不正確な予測を過信するCookスタイルのログ重み付けを採用する。
我々は,同種,異種,汚染された専門家パネルにまたがるMMLUとMMLU-Proのアプローチを評価した。
- 参考スコア(独自算出の注目度): 4.972323953932128
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Model (LLM) ensembles are increasingly used to improve reliability by combining predictions from multiple LLMs. However, existing aggregation methods typically assume that all models are equally trustworthy, overlooking differences in uncertainty quality. This assumption is poorly suited to heterogeneous LLMs, whose reliability and capability vary significantly, making naive aggregation vulnerable to unreliable or adversarial experts. In this work, we formulate multi-LLM aggregation as a problem of uncertainty-aware trust estimation. We adapt structured expert judgment from decision theory, using context-aware calibration questions to estimate expert reliability based on the quality of its probabilistic predictions. Specifically, we employ Cooke-style log weighting, which penalises overconfident incorrect predictions and favours well-calibrated experts. We evaluate our approach on MMLU and MMLU-Pro across homogeneous, heterogeneous, and contaminated expert panels. Results show that while aggregation methods perform similarly in homogeneous settings, Cooke weighting becomes critical under heterogeneity and contamination. It achieves a superior accuracy-reliability balance and remains robust when unreliable experts are introduced. These findings suggest that Multi-LLM aggregation requires not just combining predictions, but calibrating trust under uncertainty.
- Abstract(参考訳): 大規模言語モデル (LLM) アンサンブルは、複数のLLMからの予測を組み合わせることで信頼性を向上させるためにますます利用されている。
しかし、既存のアグリゲーション法は、すべてのモデルが同等に信頼でき、不確実性の品質の違いを見落としていると仮定するのが一般的である。
この仮定は、信頼性と能力が著しく異なる異種LSMにはあまり適さないため、信頼できない、あるいは敵対的な専門家に弱いナイーブアグリゲーションをもたらす。
本研究では,不確実性を考慮した信頼推定問題としてマルチLLMアグリゲーションを定式化する。
我々は、文脈対応キャリブレーション質問を用いて、決定理論から構造化された専門家の判断を適用し、その確率論的予測の品質に基づいて専門家の信頼性を推定する。
具体的には、不確実な予測を過度に考慮し、よく校正された専門家を好むCookスタイルのログ重み付けを採用する。
我々は,同種,異種,汚染された専門家パネルにまたがるMMLUとMMLU-Proのアプローチを評価した。
その結果, 凝集法は均一な条件下でも同様に作用するが, 不均一性や汚染下ではクッキー重み付けが重要となることがわかった。
信頼性と信頼性のバランスが優れており、信頼性の低い専門家が登場すると頑健になる。
これらの結果から,Multi-LLMアグリゲーションは予測を合成するだけでなく,不確実性の下で信頼度を調整する必要があることが示唆された。
関連論文リスト
- Trustworthy Protein-Ligand Binding Affinity Prediction via Reliability-Aware Multi-Engine Fusion [17.232816400275727]
マルチエンジンバインドアフィニティ予測のためのフレームワークであるRELIABLE-BAを紹介する。
PDBBindとBDB 2020+ベンチマークの実験では、不確実性のキャリブレーションを大幅に改善した競合点予測が示されている。
これらの不確実性推定は、タンパク質-リガンドペアの信頼性の高いフィルタリングを可能にし、高信頼ペアのみを保持する場合、予測誤差を最大25%削減する。
論文 参考訳(メタデータ) (2026-07-20T06:42:49Z) - Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models [11.878003218072765]
MLLM(Multimodal Large Language Models)は、様々な知覚や推論タスクにおいて例外的な機能を示す。
二重チャネル信号とチャネル間の整合性を融合して正当性を推定するモノトーン信頼融合フレームワークを提案する。
各種オープンソースおよびクローズドソースMLLMの実験結果から,本手法は信頼性の高い推定値が得られることがわかった。
論文 参考訳(メタデータ) (2026-04-19T06:07:39Z) - On Calibration of Large Language Models: From Response To Capability [66.59139960234326]
大規模言語モデル(LLM)は汎用的な問題解決手段として広くデプロイされている。
本稿では,クエリ上でモデルが期待する精度を目標とするキャリブレーションを提案する。
我々の結果は、キャパシティ校正された信頼度がpass@$k$予測と推論予算割り当てを改善することを示している。
論文 参考訳(メタデータ) (2026-02-14T01:07:45Z) - Beyond Hallucinations: A Composite Score for Measuring Reliability in Open-Source Large Language Models [0.0]
大規模言語モデル(LLM)は、医療、法律、金融といった決定クリティカルな領域でますます使われている。
彼らはしばしば過度に自信過剰なエラーを犯し、入力シフトの下で分解し、明確な不確実性推定を欠いている。
キャリブレーション,ロバスト性,不確実性の定量化をひとつの解釈可能な指標に統合する統合フレームワークであるCRS(Composite Reliability Score)を導入する。
論文 参考訳(メタデータ) (2025-12-30T08:07:28Z) - Towards Reliable LLM-based Robot Planning via Combined Uncertainty Estimation [68.106428321492]
大規模言語モデル (LLM) は高度な推論能力を示し、ロボットが自然言語の命令を理解し、適切な接地で高レベルな計画を生成することができる。
LLMの幻覚は重大な課題であり、しばしば過度に信頼され、不一致または安全でない計画に繋がる。
本研究は, 信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性評価を別々に評価するものである。
論文 参考訳(メタデータ) (2025-10-09T10:26:58Z) - Extracting Uncertainty Estimates from Mixtures of Experts for Semantic Segmentation [9.817102014355617]
アーキテクチャ変更を伴わない専門家(MoE)の混合から、よく校正された予測不確実性推定が抽出可能であることを示す。
以上の結果から,MoEsは条件付き正当性測定値において,アンサンブルよりも信頼性の高い不確実性推定値が得られることがわかった。
Cityscapesデータセットの実験では、専門家の数が増加することで不確実性の校正がさらに高められることが示唆された。
論文 参考訳(メタデータ) (2025-09-05T05:30:53Z) - Simple Yet Effective: An Information-Theoretic Approach to Multi-LLM Uncertainty Quantification [9.397157329808254]
MUSEは、大規模言語モデルのよく校正されたサブセットを特定し、集約するための単純な情報理論手法である。
二分予測タスクの実験では、単一モデルとナイーブアンサンブルベースラインと比較してキャリブレーションと予測性能が改善された。
論文 参考訳(メタデータ) (2025-07-09T19:13:25Z) - Probabilistic Modeling of Disparity Uncertainty for Robust and Efficient Stereo Matching [61.73532883992135]
本稿では,新しい不確実性を考慮したステレオマッチングフレームワークを提案する。
我々はベイズリスクを不確実性の測定として採用し、データを別々に見積もり、不確実性をモデル化する。
論文 参考訳(メタデータ) (2024-12-24T23:28:20Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - Revisiting Confidence Estimation: Towards Reliable Failure Prediction [53.79160907725975]
多くの信頼度推定法は誤分類誤りを検出するのに有害である。
本稿では, 最先端の故障予測性能を示す平坦な最小値を求めることにより, 信頼性ギャップを拡大することを提案する。
論文 参考訳(メタデータ) (2024-03-05T11:44:14Z) - Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling [69.83976050879318]
大規模言語モデル(LLM)では、不確実性の原因を特定することが、信頼性、信頼性、解釈可能性を改善するための重要なステップである。
本稿では,LLMのための不確実性分解フレームワークについて述べる。
提案手法は,入力に対する一連の明確化を生成し,それらをLLMに入力し,対応する予測をアンサンブルする。
論文 参考訳(メタデータ) (2023-11-15T05:58:35Z) - ELFNet: Evidential Local-global Fusion for Stereo Matching [17.675146012208124]
ステレオマッチングのためのtextbfEvidential textbfLocal-global textbfFusion (ELF) フレームワークを提案する。
不確実性推定と信頼に値する頭部との信頼を意識した融合の両方を付与する。
論文 参考訳(メタデータ) (2023-08-01T15:51:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。