論文の概要: When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs
- arxiv url: http://arxiv.org/abs/2608.11403v1
- Date: Tue, 11 Aug 2026 20:08:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 19:07:54.366074
- Title: When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs
- Title(参考訳): 自己整合性バックファイア: 多数決投票は, 小型LLMのハードサイエンス問題の大部分に迫る
- Abstract要約: GPQAダイアモンドの完全なベンチマークでは、2つの命令チューニングモデルにおける問題の大部分において、多数決はプロブレム当たりの精度を低下させる。
47の探索問題で観察された151個のプロブレムの確認分割に対して, この効果が事前登録された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-consistency (SC) via majority vote is a widely used way to spend inference-time compute: sample N chains of thought, return the plurality answer. On the full GPQA Diamond benchmark (198 graduate-level science questions), majority voting reduces per-problem accuracy on a majority of problems for two instruction-tuned models from different families: 56.6% of problems for Qwen2.5-7B and 65.7% for Llama-3-8B, with Qwen the primary demonstration and Llama corroborating the direction from a near-chance baseline. The effect was pre-registered on a 151-problem confirmatory split after being observed on 47 exploratory problems, and all four confirmatory hypotheses passed. A grid oracle that routes each problem to the best N across {1, 2, 4, 8, 16, 32, 64} marks a theoretical upper bound 14 accuracy points above N = 1 for Qwen and 17 for Llama, an oracle bound requiring ground truth rather than a deployable method. No verifier-free gate reaches it: neither a plurality-agreement gate nor a token-entropy gate moves accuracy more than 0.002 from fixed-budget voting at N = 64. The mechanism is direct: confidence does not track correctness on these problems. In the highest-agreement bin the plurality answer is correct about half the time for Qwen, and for Llama that bin is less accurate than its lowest-agreement bin. We pre-register and confirm these findings on small instruction-tuned models; we do not test reasoning-native models, which we flag as the central open question.
- Abstract(参考訳): 多数決による自己整合性(SC)は、推論時間の計算に広く用いられる方法である。
GPQAダイアモンドの完全なベンチマーク(198の大学院レベルの科学問題)では、多数決は、2つの命令チューニングモデルで異なるファミリーからの問題の56.6%がQwen2.5-7B、65.7%がLlama-3-8Bで、Qwenが最初のデモンストレーションを行い、Llamaが近距離ベースラインから方向を調整している。
この効果は47の探索問題で観察された151個のプロブレムの確認分割に対して事前登録され、4つの確認仮説が通過した。
各問題を {1, 2, 4, 8, 16, 32, 64} を越えて最良 N にルートする格子オラクルは、Qwen の N = 1 上、Llama の 17 上の理論上界 14 の精度点を示す。
複数のゲートもトークンエントロピーゲートも、N = 64の固定予算投票から0.002以上の精度を動かす。
信頼はこれらの問題の正確性を追跡するものではない。
最上位ビンでは、複数の回答がQwenの約半分のタイミングで正確であり、Llamaの場合、ビンはその最下位ビンよりも精度が低い。
我々は、これらの発見を小さな命令調整モデルで事前登録し、確認する。
関連論文リスト
- Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints [4.41537705949485]
言語モデル審査員は、トレーニングデータをゲートし、世代をスコアし、リーダーボードを駆動する。
我々は、事前登録された2つのキャンペーンにおいて、すべてのしきい値が事前に固定された状態で、その仮定を監査した。
52,988件の要求を監査し、スピアマン0.400で0.90と一致した。
証拠を3段階のスナップショット識別はしご、8つの設計ルール、レポートチェックリストに抽出する。
論文 参考訳(メタデータ) (2026-09-03T17:59:43Z) - Phantom Gains: Auditing Self-Improvement Against a Measured Null [10.74609430659738]
我々は、Qwen3-8Bで32ドル(約2万2000円)のLoRA自己訓練を行い、同じパイプラインを通り抜ける凍結制御を行った。
我々は7つの測定失敗を識別し、それぞれが、その制御が欠如しているときに報告された発見を逆転させる。
論文 参考訳(メタデータ) (2026-08-20T17:30:14Z) - What Would Fix This RAG Failure? Auditing Counterfactual Response with Paired Evidence Interventions [0.0]
我々はPair-IDを紹介した。Pair-IDは1つのクエリ、検索状態、読み取り定数を格納し、次に2つの操作を横断する。
19,981のベンチマーククエリで11,105のQwen障害が特定され、SHA-256オーダーが1200を選択して、サンプリングされた応答を生成する。
その結果,ハッシュ選択された有資格障害サンプルにおいて有意な速度でエビデンスが発生し,観察された故障から部分的に予測可能であり,読者に条件付きであることが示唆された。
論文 参考訳(メタデータ) (2026-08-09T22:43:27Z) - Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models [0.0]
マルチモデルLPMシステムは単一モデルの精度を上回ります。
彼らの利益は、ほとんど報告されない量で占められていることを示す。
論文 参考訳(メタデータ) (2026-06-25T17:06:06Z) - Reasoning Quality Emerges Early: Data Curation for Reasoning Models [58.56882815783977]
我々は,初期推論トークンのみを用いて,多種多様かつ挑戦的な推論例を識別可能であることを示す。
本手法は,トークン効率を91%向上させながら,既存のベースラインを最大1.7%向上させる。
論文 参考訳(メタデータ) (2026-06-25T09:32:58Z) - OQMD: Single-Qubit Rotation Control Improves Low-CNOT Multiclass Quantum Classification [4.669017653337737]
本研究は、最適量子計測復号法(OQMD)の研究である。
OQMD: 測定前に読み出し層をトレーニングすることで、量子結果が古典的なラベルにどのようにマッピングされるかを最適化する。
実験では、OQMDのハードウエアネイティブな1つの具体的実現として、トレーニング可能な3つの1量子ビット回転を用いる。
論文 参考訳(メタデータ) (2026-06-12T04:05:48Z) - When to Think Deeply: Inhibitory Deliberation for LLM Reasoning [5.19759149737193]
我々は、応答条件による抑制的熟考のためのフレームワークであるIDPRを提案する。
IDPRはまず簡潔な直感的な回答を生成し、次に抑制コントローラを使用して決定する。
IDPRは最も高い補正精度を達成し、応答条件による阻害が迅速な答えをよりよく識別することを示す。
論文 参考訳(メタデータ) (2026-06-04T21:57:27Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Large Language Models Decide Early and Explain Later [47.20810161393936]
本研究では, 強制解の完成度を用いた推理段階における予測解の進化について検討する。
プローブベースの停止を含むシンプルさは、クエリ毎の推論トークン使用量を500トークン削減できることを示す。
論文 参考訳(メタデータ) (2026-04-24T06:26:24Z) - Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering [7.1559850008795385]
大きな言語モデル(LLM)は質問回答(QA)設定で一般的に使用される。
既存のUQアプローチは、科学的QAでは弱い検証が残っている。
推論要求QAにおけるUQ指標を評価するための,最初の大規模ベンチマークを紹介する。
論文 参考訳(メタデータ) (2026-01-30T20:02:34Z) - Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs [72.82403830490084]
我々は、復号規則は正確さによって校正されるべきであり、自信だけではならないと論じている。
Greedy-Threshold はこの目標を達成するための単純な戦略を提案します。
この結果から,不確実性の下での復号化が問題視され,数学や一般推論のベンチマークで有意な差がみられた。
論文 参考訳(メタデータ) (2025-10-07T14:46:12Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - VeriThinker: Learning to Verify Makes Reasoning Model Efficient [52.74493506816969]
大型推論モデルは、Chain-of-Thought (CoT)推論を用いて複雑なタスクで優れている。
過度に考える傾向は、必然的に長い推論連鎖に繋がる。
我々は,CoT圧縮の新しい手法であるVeriThinkerを紹介する。
論文 参考訳(メタデータ) (2025-05-23T14:17:56Z) - Not All Votes Count! Programs as Verifiers Improve Self-Consistency of Language Models for Math Reasoning [24.386388107656334]
本稿では,自然言語から派生した翻訳プログラムを検証メカニズムとして活用するフレームワークであるProveを紹介する。
バニラ多数決とは異なり、我々の手法は、対応するプログラム出力が生成した解と矛盾する解をフィルタリングし、検証に合格する解のみを集約する。
以上の結果から,すべてのモデルサイズとデータセットにまたがる数学的推論タスクの解決において,Proveはバニラ多数投票を一貫して上回る結果となった。
論文 参考訳(メタデータ) (2024-10-16T14:24:55Z) - PRover: Proof Generation for Interpretable Reasoning over Rules [81.40404921232192]
本稿では,ルールベース上の二項質問に応答し,対応する証明を生成するトランスフォーマーモデルを提案する。
本モデルは,効率的な制約付き学習パラダイムを用いて,証明グラフに対応するノードやエッジを予測できることを学習する。
我々は、QAと証明生成のための有望な結果を示すために、合成、手書き、人文による規則ベースの実験を行う。
論文 参考訳(メタデータ) (2020-10-06T15:47:53Z) - Selective Question Answering under Domain Shift [90.021577320085]
モデルがドメイン外の入力に対して過度に信頼されているため、モデルのソフトマックス確率のみに基づくアテンションポリシーは不適切である。
キャリブレータをトレーニングして、QAモデルがアースする入力を識別し、エラーを予測した場合に停止する。
提案手法は,80%の精度を維持しながら56%の質問に回答するが,それに対してモデルの確率を直接使用する場合,80%の精度で48%しか回答しない。
論文 参考訳(メタデータ) (2020-06-16T19:13:21Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。