論文の概要: Blind to the Pivotal Vote: Aggregate Independence Metrics Miss Where Verification Actually Helps
- arxiv url: http://arxiv.org/abs/2608.06940v1
- Date: Fri, 07 Aug 2026 08:14:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.411203
- Title: Blind to the Pivotal Vote: Aggregate Independence Metrics Miss Where Verification Actually Helps
- Title(参考訳): Pivotalの投票に盲目:アグリゲート・インデペンデンス・メトリックス(動画あり)
- Abstract要約: 多数派の置換規則は、クエリの16.2%でシグナルを呼び出しながら、全体的な精度を82.44%から85.62%に向上させる。
HumanEval+/MBPP+では、16.2%のクエリでシグナルを呼び出しながら、多数派の置換規則が全体の精度を82.44%から85.62%に引き上げている。
- 参考スコア(独自算出の注目度): 9.710464466895521
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM judge panels are a standard evaluation tool, but prior work reports highly correlated panel errors: nine judges provide roughly the effective information of two independent ones, and aggregation closes only a small fraction of the gap. A natural remedy--a signal from a different evidence source, e.g., executing a test suite--produced no distinguishable change in the panel's effective-vote count at scale (-0.04, 95\% CI [-0.10, +0.02]). Aggregate dependence and conditional decision utility are different questions. Elementary majority arithmetic fixes the affected set for single-ballot substitution: only decisions with a one-vote margin can change. The empirical question is whether panel error rates rise and useful substitutions concentrate there. They do: the entire accuracy gain concentrates on these pivotal queries, where it is large (+10.4 to +23.3 percentage points across three headline configurations), and is exactly zero elsewhere. We confirm the pattern across three code benchmarks and four panel sizes (a 9-judge extension and 56 dependent subsampling checks, gain +6.5 to +16.1 percentage points). On HumanEval+/MBPP+, a majority-side replacement rule raises overall accuracy from 82.44\% to 85.62\% while invoking the signal on 16.2\% of queries; signal-only remains stronger at 87.60\%. Thus population-level dependence diagnostics and margin-stratified utility are complementary, and the affected-set characterization yields a call-reduction rule for any specified single-ballot substitution policy.
- Abstract(参考訳): LLM審査員パネルは標準的な評価ツールであるが、以前の作業報告では高い相関性のあるパネルエラーが報告されている。
異なるエビデンスソース(例えばテストスイートの実行)からの信号である自然療法は、パネルの有効投票数(-0.04, 95\% CI [-0.10, +0.02])に区別可能な変化を生じさせない。
集約依存と条件決定ユーティリティは異なる質問である。
過半数の算術は、影響のある集合を単投票置換で修正する: 1票差の判定だけを変えることができる。
経験的問題は、パネルエラー率が上昇し、有用な置換が集中するかどうかである。
完全精度のゲインは、大きな(3つの見出し構成にまたがる+10.4から+23.3のパーセンテージ)これらのピボットクエリに集中し、全く別の場所ではゼロである。
3つのコードベンチマークと4つのパネルサイズ(9-judge拡張と56依存サブサンプリングチェック、+6.5から+16.1ポイント)でパターンを確認します。
HumanEval+/MBPP+では、多数派側の置換規則が全体の精度を82.44\%から85.62\%に引き上げ、クエリの16.2\%でシグナルを呼び出す。
このように、人口レベルの依存診断とマージン階層化ユーティリティは相補的であり、影響されたセットの特徴付けは、任意の特定の単一投票代行ポリシーに対する呼び出し還元ルールをもたらす。
関連論文リスト
- Decomposing Wrong-Consensus Agreement in LLM Self-Consistency: A GPT-4.1 Case Study [1.2716872085463884]
複数のLSMサンプルに対する多数決投票は、回答の正確性を高めるために広く用いられているが、その利得は不規則に異なる。
本稿は、この失敗を定量的に分析する。
論文 参考訳(メタデータ) (2026-08-19T10:50:15Z) - Does Splitting a Triage Decision Across Agents Hide Bias or Help Catch It? A Multi-Agent Simulation Study of LLM-Based Resource Allocation Under Audit Capacity Constraints [0.0]
我々は、同じ決定がロール微分マルチエージェントパイプラインに分散されたとき、バイアスに何が起こるかを研究する。
2つの条件の間に偏りが生じる頻度について、測定可能な違いは見つからない。
バイアスが捕捉されるかどうかに監査能力が大きな、そして重大な影響を与えることが分かっています。
論文 参考訳(メタデータ) (2026-08-07T08:25:53Z) - When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs [42.32694162421078]
CALVERは、パールの因果基準に対して構造化されたトレースをスコアする訓練不要なシンボル検証器である。
CALVERは、複数のグラフ正解を許容するCLEAR検索1価クエリにおいて、報酬モデル、LLM審査員、モデルの信頼性が30%近く残っている42.1%に達する。
論文 参考訳(メタデータ) (2026-08-04T11:45:46Z) - Passing Coarse Marginal Checks Can Be Cheap: Persona Mixtures and Imprecise Treatment-Response Estimates in an LLM Persona Panel [0.0]
戦略ゲームにおける16個の軽量人格条件付きGPT-4.1構成の固定パネルについて検討した。
変化は急激なインデクシングであったが、そのシェアは不確実性の仮定に依存していた。
結果は、1つの固定されたモデル・プロンプトパネルに関係し、人間の置換性を確立しない。
論文 参考訳(メタデータ) (2026-08-02T04:10:11Z) - Share the Judge, Learn the Deferral: Where Specialization Helps LLM Evaluation [0.1269104766024433]
99,952 の公試例について検討した。
正しいルーブリックを供給すると、応答のみの制御よりもロックテストの精度が2.11ポイント向上する。
RewardBench 2では、報酬スコアを変更することなく0.6B-4B-8Bカスケードを通した正当性ヘッドの例を学習した。
論文 参考訳(メタデータ) (2026-07-30T10:29:22Z) - Visual Credit Audit for Multimodal Spatial Reasoning [70.16915309526443]
Visual Credit Auditは、ベンチマーク画像がテキストのみとブランクコントロールよりもモデルの宣言された決定をもっとサポートするかどうか、モデルが関係性固有の視覚的エビデンスに反応するかどうかの2つの評価を分離する。
ラベルを適用すれば依存性認定正当性(D-CC)が得られる
4つのオープンMLLMと2つの空間ベンチマーク、12.73-26.25%の判定は正確であるが、証明されていない。
論文 参考訳(メタデータ) (2026-07-29T15:55:31Z) - State-dependent error correlations shape voting thresholds in committees of AI agents [1.7545090618311434]
Sah-Stiglitzブートストラップスクリーニングとエラー依存性を組み合わせることで、良いケースと悪いケースを区別できる。
4つのバイナリスクリーニングベンチマークで28言語モデルを用いて174,384票から異種拡張を推定した。
設計バランスの分析では、独立下でのコスト感受性の閾値選択により60.25から52.50に縮小された。
論文 参考訳(メタデータ) (2026-07-27T02:06:22Z) - Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels [0.0]
LLM-as-a-judgeパネルは複数のモデルからの投票を集計する。
私たちは、その信頼性が独立投票の理想にどの程度劣るかを定量化します。
論文 参考訳(メタデータ) (2026-05-28T11:48:17Z) - What Are We Actually Decoding? Source Attribution for Non-Invasive Brain-to-Language Retrieval [42.66754319854329]
我々は,刺激同期MEG-to-audio検索を監査フレームワークとして再放送した。
構造的ショートカット、ウィンドウレベルの刺激ロックされたエビデンス、ウィンドウ間のコンテキストアグリゲーションを使用します。
これらの結果は、脳から言語へのパフォーマンスは、単に報告されるのではなく、ソース属性であるべきだことを示唆している。
論文 参考訳(メタデータ) (2026-05-23T11:23:39Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making [38.75183725659772]
大規模言語モデル(LLM)は、複雑な推論を必要とするタスクにますます使われている。
モデル動作の理解と信頼性向上には,内部プロセスの測定が不可欠である,と我々は主張する。
計画,修正,資源制約のある意思決定という3つの中核的な側面に沿ってLCMを評価する枠組みを導入する。
論文 参考訳(メタデータ) (2025-06-13T17:59:10Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。