論文の概要: From Discovery to Decision: Finite-Budget Recoverability in LLM Voting
- arxiv url: http://arxiv.org/abs/2610.01014v1
- Date: Thu, 01 Oct 2026 03:57:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.88674
- Title: From Discovery to Decision: Finite-Budget Recoverability in LLM Voting
- Title(参考訳): 発見から決定へ: LLM投票における有限予算回収可能性
- Abstract要約: 複数のLDM応答に投票することは、テスト時間スケーリングとアンサンブル推論において一般的なプリミティブである。
我々は、実際の投票状態と通話予算の残量を通じて、発見と決定のギャップを特徴づける。
誤審者識別の融合は単一呼び出しの正しさを保ち、複数の精度を向上できないことを示す。
- 参考スコア(独自算出の注目度): 9.351444106520516
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Voting over multiple LLM responses is a common primitive in test-time scaling and ensemble inference. Collecting more responses can expand the candidate pool and increase the chance that a correct answer is discovered. Under a fixed call budget, a discovered answer still needs to accumulate enough support within the remaining calls to become the final plurality winner, creating a discovery-to-decision gap. In this work, we characterize this gap through the realized vote state and remaining call budget. We derive a sharp recoverability threshold and show that, as sampling proceeds, the observed candidate set can only expand while the set of reachable endpoint winners can only contract, inducing a candidate-level conversion window. Under a specified iid response law, the same state yields exact finite-horizon endpoint probabilities. We further show that merging wrong-answer identities preserves single-call correctness and cannot improve plurality accuracy, and that the effect of redistributing wrong-answer probability depends on the realized vote state. Singleton reachability yields a gold-free exact locking certificate. For a known answer universe, its first trigger is the earliest prefix at which all admissible continuations yield the same fixed-budget output. Empirically, most discovered-but-unselected correct answers lose reachability only after discovery. In a controlled Word16 study, input permutation improves raw-plurality accuracy by 21.1 points with essentially unchanged single-call correctness. Exact locking saves 28-30% of calls at a 16-call budget while preserving every fixed-budget output.
- Abstract(参考訳): 複数のLDM応答に投票することは、テスト時間スケーリングとアンサンブル推論において一般的なプリミティブである。
より多くのレスポンスを収集することで、候補プールを拡張し、正しい回答が見つかる可能性を高めることができる。
固定的な呼び出し予算の下では、発見された答えは、最後の複数の勝者になるために、残りの呼び出しに十分なサポートを蓄積する必要がある。
本研究では,このギャップを実際の投票状態と通話予算の維持を通じて特徴づける。
我々は、鋭い回復可能性閾値を導出し、サンプリングが進むにつれて、観測された候補集合は拡張できるのみであり、到達可能なエンドポイントの勝者の集合は収縮し、候補レベルの変換ウィンドウを誘導できることを示す。
特定の iid 応答則の下では、同じ状態は正確に有限水平の終点確率をもたらす。
さらに,誤回答の正しさを保ち,複数の精度を向上させることができず,誤回答の確率を再分配する効果が実現された投票状態に依存することを示す。
シングルトン到達性は、ゴールドフリーの正確なロック証明書をもたらす。
既知の答え宇宙にとって、その最初の引き金は、全ての許容可能継続が同じ固定予算出力をもたらす最初期のプレフィックスである。
経験的に、最も発見されたが未選択の正しい答えは、発見後にのみ到達性を失う。
制御されたWord16研究において、入力置換は、本質的にはシングルコールの正確性に変化しない21.1ポイントの生複数性精度を向上させる。
Exact lockingは16コールの予算で28~30%の呼び出しを節約し、固定予算のアウトプットを保留する。
関連論文リスト
- Overwhelmed by Choice: Studying LLM Decision Making at Scale [70.45144023754595]
候補数の増加に伴い,複数選択および候補選択の評価を体系的に評価した。
タスク間での相当な精度劣化、戦略の推進、モデルスケールが見られます。
階層分割と置換に基づく推論は、HotpotQAとMIMICで約20パーセントの精度をN=160$で向上する。
論文 参考訳(メタデータ) (2026-09-26T17:33:04Z) - Verification Pulses and the Cost of Escaping Wrong Consensus [2.731113456484581]
外的検証は、誤ったコンセンサスの盆地に自衛集団を残しながら、個々のアウトプットを補正することができる。
固定された検証予算のタイミングと対処が非同期バイナリレジスタの回復に与える影響について検討する。
論文 参考訳(メタデータ) (2026-09-24T03:29:27Z) - The Undetected Damage of Quantization on Retrieval and How to Fix It [51.02977749156532]
分類精度を保った量子モデルでは,トップ1検索結果の14ドルから46%の値がまだ変化していることを示す。
この失敗を2つの上位モデルスコア間のギャップに結び付け、そのギャップを使用して、定量化された回答をいつ信頼するかを決めます。
この差が最大の丸め誤差の2倍を超える場合にのみ、トップ1結果が量子化を継続することが保証されていることを示す。
論文 参考訳(メタデータ) (2026-09-21T09:26:35Z) - Correct Now, Insufficient Later: Auditing Update Sufficiency in Context Compression [0.0]
メモリは、後の更新で要求される区別を捨てながら、現在のクエリに正しく答えることができる。
我々はこの失敗を2つの歴史監査で調査する。
パイロットは6つの合成機構の24の履歴ペアを評価する。
論文 参考訳(メタデータ) (2026-09-17T10:51:37Z) - ResiSpec: Enhancing Multi-Candidate Speculative Sampling via Residual Distribution Shaping [79.1905186547363]
ResiSpecは、検証中に提案の配布を戦略的に改革するフレームワークである。
候補の偏光を防止し、最先端のマルチ候補法よりも最大1.92$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2026-08-25T11:25:55Z) - When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs [42.32694162421078]
CALVERは、パールの因果基準に対して構造化されたトレースをスコアする訓練不要なシンボル検証器である。
CALVERは、複数のグラフ正解を許容するCLEAR検索1価クエリにおいて、報酬モデル、LLM審査員、モデルの信頼性が30%近く残っている42.1%に達する。
論文 参考訳(メタデータ) (2026-08-04T11:45:46Z) - Two Calls, Two Moments, and the Vote-Accuracy Curve of Repeated LLM Inference [4.28787537081191]
条件-i.d.呼び出しの繰り返しLLM推論における二項正当性層について検討した。
固定された多数決投票の予算は、鋭い分布のない2つの呼び出し間隔を持つ。
QNLI と QQP に対する LLM の呼出実験により, 投射した2発呼領域に3発と5発の発声アキュラシーが含まれていることが示された。
論文 参考訳(メタデータ) (2026-05-05T05:40:09Z) - Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs [72.82403830490084]
我々は、復号規則は正確さによって校正されるべきであり、自信だけではならないと論じている。
Greedy-Threshold はこの目標を達成するための単純な戦略を提案します。
この結果から,不確実性の下での復号化が問題視され,数学や一般推論のベンチマークで有意な差がみられた。
論文 参考訳(メタデータ) (2025-10-07T14:46:12Z) - Latent Veracity Inference for Identifying Errors in Stepwise Reasoning [78.29317733206643]
本稿では、精度割当てに対する離散探索アルゴリズムであるVeracity Search(VS)を紹介する。
その他の方法では、後続の精度値よりも後続の分布において難解な推論を行う。
VSを一般化し、新しいコンテキストで正確なゼロショットの精度推論を可能にする。
論文 参考訳(メタデータ) (2025-05-17T04:16:36Z) - The Decisive Power of Indecision: Low-Variance Risk-Limiting Audits and Election Contestation via Marginal Mark Recording [51.82772358241505]
リスクリミット監査(リスクリミット監査、RLA)は、大規模な選挙の結果を検証する技術である。
我々は、効率を改善し、統計力の進歩を提供する監査の新たなファミリーを定めている。
新しい監査は、複数の可能なマーク解釈を宣言できるように、キャストボイトレコードの標準概念を再考することで実現される。
論文 参考訳(メタデータ) (2024-02-09T16:23:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。