論文の概要: ARBITER: Reasoning Trajectory Basins and Majority Vote Failures in Test-Time Sampling
- arxiv url: http://arxiv.org/abs/2605.26172v1
- Date: Mon, 25 May 2026 04:07:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:41.268314
- Title: ARBITER: Reasoning Trajectory Basins and Majority Vote Failures in Test-Time Sampling
- Title(参考訳): ARBITER:テスト時間サンプリングにおける軌道境界と多数投票失敗の関連
- Authors: Meng Cai, Lars Kulik, Farhana Choudhury,
- Abstract要約: ARBITERは、ベースモデル独自のサンプル出力、隠蔽状態、導出エビデンスのみを使用して、盆地間の相互作用をモデル化するモデルに依存しないアプローチである。
精度は78%中盤から82%中盤まで向上し、利用可能なオラクルのヘッドルームの約22%を回復する。
- 参考スコア(独自算出の注目度): 3.2669068153591687
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When language models use test-time sampling, they generate multiple reasoning trajectories and select an answer by majority vote. We show that these trajectories are not independent: for a given question, they concentrate into a small number of clusters, or reasoning basins, each defined by a normalized final answer and the solutions that reach it. A majority vote therefore selects the most stable basin rather than the most accurate one, which creates wrong-majority failures where the correct answer is present but outvoted. We introduce ARBITER, a model-agnostic approach that models interactions between basins using only the base model's own sampled outputs, hidden states, and derived evidence. Most direct correction strategies fail; ARBITER instead uses conservative additive evidence on top of consensus. In its simplest parameter-free form, ARBITER-Δ adds same-model evidence to the majority prior, while ARBITER-Enc augments this with bounded residual signals from hidden states over complete solutions. On GSM8K with Qwen3-4B, consensus over K=24 samples achieves around the mid-94% range, while a same-pool top-2 oracle reaches around the mid-96% range. ARBITER recovers a subset of these cases using zero external information. Across three model families and three math benchmarks, it yields consistent gains with no net-negative cases; for example, on Llama-3.1-8B MMLU-HS-Math, it improves accuracy from the mid-78% range to the mid-82% range, recovering about 22% of the available oracle headroom, indicating that this headroom can be partially recovered from the sample pool itself.
- Abstract(参考訳): 言語モデルがテスト時間サンプリングを使用する場合、複数の推論軌道を生成し、多数決で回答を選択する。
与えられた質問に対して、彼らは少数のクラスタに集中し、それぞれが正規化された最終回答とそれに到達する解によって定義される推論台に焦点を合わせている。
したがって、多数決は最も正確なものよりも最も安定したものを選ぶ。
ベースモデル独自のサンプル出力,隠蔽状態,および導出エビデンスのみを用いて,盆地間の相互作用をモデル化するモデルに依存しないアプローチであるARBITERを紹介する。
ほとんどの直接的な修正戦略は失敗し、ARBITERはコンセンサスの上に保守的な付加的な証拠を使用する。
最も単純なパラメータフリーの形式では、ARBITER-Δは前者と同じモデルエビデンスを多数に追加し、ARBITER-Encは完全な解上の隠れ状態からの有界残留信号でこれを補強する。
Qwen3-4BのGSM8Kでは、K=24サンプルに対するコンセンサスは約94%の範囲で達成され、同じプールトップ2オラクルは96%の範囲で達成される。
ARBITERは、外部情報ゼロを用いてこれらのケースのサブセットを復元する。
例えば、Llama-3.1-8B MMLU-HS-Mathでは、78%中盤から82%中盤まで精度を向上し、利用可能なオラクルのヘッドルームの約22%を回復し、このヘッドルームがサンプルプール自体から部分的に回収可能であることを示す。
関連論文リスト
- Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline [56.53954182896384]
大規模言語モデルのための簡単な訓練後改良アルゴリズムである自己検証蒸留を提案する。
自己検証蒸留(Self-Verified Distillation)は、未ラベルの種問に対する候補解を生成する。
プロンプトベースの自己検証を使用してフィルタリングし、結果の自己計算データセットをトレーニングする。
トレーニングデータ構築中に、より多くの候補世代をサンプリングし、より大きな検証予算を使用することで、高品質な自己計算データが得られることがわかった。
論文 参考訳(メタデータ) (2026-05-20T17:26:10Z) - Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - Beyond Pass@k: Breadth-Depth Metrics for Reasoning Boundaries [2.9807229517491827]
モデルが解ける問題の割合を測るCover@tauを提案する。
Pass@kとは異なり、Cover@tauは明確な信頼性閾値の下で推論をキャプチャする。
Cover@tau-based metrics を用いていくつかのRLVRモデルを評価し,Pass@1 と比較してアルゴリズムの相対ランクがどう変化するかを示した。
論文 参考訳(メタデータ) (2025-10-09T15:14:58Z) - Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers [63.99316853136304]
ミラー・クリティク(Mirror-Critique)は、情報的批評で検証者を訓練する枠組みである。
我々は、高品質な批判データを合成するために、小さな命令調整モデルを展開する。
結果として得られるミラー検証は、ソリューション毎に複数の批判を生成することで、候補ソリューションを評価するためにデプロイされる。
論文 参考訳(メタデータ) (2025-09-27T06:50:24Z) - Internalizing Self-Consistency in Language Models: Multi-Agent Consensus Alignment [22.305033366660187]
言語モデル(LM)は矛盾する推論子であり、しばしば同じプロンプトに対する矛盾した応答を生成する。
適切に整合した推論モデルの本質的な性質として自己整合性を定式化し、MACA(Multi-Agent Consensus Alignment)を導入する。
MACAは、エージェントが自分自身をより決定的かつ簡潔に教えることを可能にし、外部の監督なしにマルチエージェント設定におけるピアインサイトをより活用する。
論文 参考訳(メタデータ) (2025-09-18T17:27:28Z) - The Majority is not always right: RL training for solution aggregation [53.1050856072799]
我々はアグリゲータモデルをトレーニングし、最終的な正解をレビューし、精査し、合成する。
重要な要素は、簡単なトレーニング例と厳しいトレーニング例のバランスを取ることだ。
我々の手法であるAggLMは、強いルールベースと報酬モデルベースラインの両方を上回ります。
論文 参考訳(メタデータ) (2025-09-08T16:39:38Z) - Not All Votes Count! Programs as Verifiers Improve Self-Consistency of Language Models for Math Reasoning [24.386388107656334]
本稿では,自然言語から派生した翻訳プログラムを検証メカニズムとして活用するフレームワークであるProveを紹介する。
バニラ多数決とは異なり、我々の手法は、対応するプログラム出力が生成した解と矛盾する解をフィルタリングし、検証に合格する解のみを集約する。
以上の結果から,すべてのモデルサイズとデータセットにまたがる数学的推論タスクの解決において,Proveはバニラ多数投票を一貫して上回る結果となった。
論文 参考訳(メタデータ) (2024-10-16T14:24:55Z) - DCR: Divide-and-Conquer Reasoning for Multi-choice Question Answering with LLMs [9.561022942046279]
大規模言語モデル(LLM)の推論能力を高めるため,DCR(Divide and Conquer Reasoning)を提案する。
まず、信頼性スコア(mathcalCS$)に基づいて質問を2つのサブセットに分類する。
特に,質問を信頼性スコア(mathcalCS$)に基づいて2つのサブセットに分類する。
論文 参考訳(メタデータ) (2024-01-10T14:38:46Z) - IBADR: an Iterative Bias-Aware Dataset Refinement Framework for
Debiasing NLU models [52.03761198830643]
IBADR(Iterative Bias-Aware dataset Refinement framework)を提案する。
まず、プール内のサンプルのバイアス度を定量化するために浅いモデルを訓練する。
次に、各サンプルにバイアス度を表すバイアス指標をペアにして、これらの拡張サンプルを使用してサンプルジェネレータを訓練する。
このようにして、このジェネレータは、バイアスインジケータとサンプルの対応関係を効果的に学習することができる。
論文 参考訳(メタデータ) (2023-11-01T04:50:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。