論文の概要: Best-of-Evidence: Best-of-N Selection under Partial Verification
- arxiv url: http://arxiv.org/abs/2607.20950v1
- Date: Thu, 23 Jul 2026 06:03:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.29954
- Title: Best-of-Evidence: Best-of-N Selection under Partial Verification
- Title(参考訳): ベスト・オブ・エビデンス:部分的検証によるベスト・オブ・N選択
- Authors: Cenwei Zhang, Teng Fang, Yuxia Wang, Derek Li, Bryan Dai, Lei You,
- Abstract要約: ベスト・オブ・エビデンス(Best-of-Evidence、BE)は、BoN候補プールを固定する推論時選択フレームワークである。
BoEは部分的な検証の下で選択を形式化し、実用的なスコアベースのコントローラを提供する。
4つの医療用VQA設定の共通リーダ実験は、BoEが固定プールの選択を改善し、いくつかのBoN障害を解消できることを示している。
- 参考スコア(独自算出の注目度): 10.320644220913069
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: BoN improves model outputs by sampling several candidates and selecting one with a proxy score, but it assumes that complete candidates can be evaluated reliably. Many vision-language tasks instead provide only partial verification: a finding, span, value, region, or relation may be checkable even when no dependable whole-response verifier exists. Moreover, the same claim may recur across candidates with opposing stances, allowing one observation to support part of the pool and contradict another. We introduce Best-of-Evidence (BoE), an inference-time selection framework that keeps the BoN candidate pool fixed, represents reusable claims with a signed candidate--factor graph, and allocates a limited budget to evidence actions that can change the final choice. BoE formalizes selection under partial verification and provides a practical score-based controller, with the zero-budget case recovering the underlying BoN decision. Theoretically, we show that residual evidence capacity limits any evidence-driven improvement and that shared factor queries can achieve an O(log K) versus Θ(K) query separation in a factor-code model. Common-ledger experiments on four medical VQA settings show that BoE can improve fixed-pool selection and rescue some BoN failures when evidence is reliable, contrastive, and decision-relevant, while also revealing the channel-quality and candidate-generation limits that prevent universal gains.
- Abstract(参考訳): BoNは複数の候補をサンプリングし、プロキシスコアで1つを選択することでモデル出力を改善するが、完全な候補を確実に評価できると仮定する。
探索、スパン、値、領域、あるいは関係性は、信頼できる全応答検証が存在しない場合でもチェック可能である。
さらに、同じ主張が反対の立場で候補者の間で再主張され、ある観察者がプールの一部を支持し、別の観察者が矛盾することを許す。
我々は、BoN候補プールを固定した推論時選択フレームワークであるBest-of-Evidence(BoE)を導入し、署名された候補-要素グラフで再利用可能なクレームを表現し、最終的な選択を変える可能性のある行動を示すために限られた予算を割り当てる。
BoEは部分的検証の下で選択を定式化し、ゼロ予算ケースが基礎となるBoN決定を回復する実用的なスコアベースコントローラを提供する。
理論的には、残余証拠の容量はエビデンス駆動による改善を制限し、共有ファクタークエリは、係数コードモデルにおけるO(log K) と O(K) のクエリ分離を達成できることが示される。
4つの医療用VQA設定における共通リーダ実験は、BoEが信頼性、コントラスト、決定関連性のあるBoN障害を解消すると同時に、普遍的な利得を妨げるチャネル品質および候補世代制限を明らかにすることを示し、BoEが固定プール選択を改善し、いくつかのBoN障害を救済できることを示している。
関連論文リスト
- Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction [4.273094752480624]
本稿では,対話的証明理論に基づく推論時間プロトコルであるPVDを導入する。
PVDは回答と構造化された信頼判定の両方を生成し、システムは不確実なケースを棄却しながら高信頼の回答を報告できる。
論文 参考訳(メタデータ) (2026-05-24T15:23:27Z) - Pushing the Boundaries of Multiple Choice Evaluation to One Hundred Options [4.902225285395898]
本稿では,候補セットを100まで拡張する大規模オプション評価プロトコルを提案する。
この枠組みを韓国の正書法誤り検出タスクに適用する。
その結果、低いオプション設定での強いパフォーマンスは、モデルの能力を誇張できることが示された。
論文 参考訳(メタデータ) (2026-04-16T05:22:12Z) - GEM: Guided Expectation-Maximization for Behavior-Normalized Candidate Action Selection in Offline RL [7.213487945222728]
GEM(Guided expectation-Maximization)は,マルチモーダルかつ制御可能なアクション選択を実現する分析フレームワークである。
推測中、GEMは、行動正規化サポートと結びついた保守的なアンサンブルの低信頼を用いて、候補ベースの選択を行う。
実証的には、GEMはD4RLベンチマークで競合し、計算を再トレーニングせずに意思決定品質と交換する単純な推論時予算ノブ(候補数)を提供する。
論文 参考訳(メタデータ) (2026-03-24T14:04:43Z) - Online Conformal Selection with Accept-to-Reject Changes [14.619101485265322]
アクセプション・トゥ・リジェクト・チェンジ(OCS-ARC)を用いたオンラインコンフォーマル・セレクションを提案する。
オンラインのBenjamini-Hochberg手順を候補選択プロセスに組み込む。
我々は,OCS-ARCが任意の段階において,名目レベル以下で偽発見率(FDR)を制御できることを理論的に保証する。
論文 参考訳(メタデータ) (2025-08-19T13:58:38Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - The Decisive Power of Indecision: Low-Variance Risk-Limiting Audits and Election Contestation via Marginal Mark Recording [51.82772358241505]
リスクリミット監査(リスクリミット監査、RLA)は、大規模な選挙の結果を検証する技術である。
我々は、効率を改善し、統計力の進歩を提供する監査の新たなファミリーを定めている。
新しい監査は、複数の可能なマーク解釈を宣言できるように、キャストボイトレコードの標準概念を再考することで実現される。
論文 参考訳(メタデータ) (2024-02-09T16:23:54Z) - Error-based Knockoffs Inference for Controlled Feature Selection [49.99321384855201]
本手法では, ノックオフ特徴量, エラーベース特徴重要度統計量, ステップダウン手順を一体化して, エラーベースのノックオフ推定手法を提案する。
提案手法では回帰モデルを指定する必要はなく,理論的保証で特徴選択を処理できる。
論文 参考訳(メタデータ) (2022-03-09T01:55:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。