論文の概要: When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs
- arxiv url: http://arxiv.org/abs/2608.11403v2
- Date: Sat, 15 Aug 2026 22:30:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 13:30:43.576879
- Title: When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs
- Title(参考訳): 自己整合性バックファイア: 多数決投票は, 小型LLMのハードサイエンス問題の大部分に迫る
- Abstract要約: 多数決による自己整合性は、小命令チューニングモデルのGPQAダイアモンド問題において、プロブレム毎の精度を低下させる。
このバージョンでは、最も自然な修復も失敗し、v1が1つとして扱われた3つの信号障害を分離する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-consistency via majority vote reduces per-problem accuracy on most GPQA Diamond problems for small instruction-tuned models: 56.6% of problems for Qwen2.5-7B and 65.7% for Llama-3-8B. The obvious remedy is a verifier-free confidence gate. This version reports that the most natural repair also fails, and separates three signal failures that v1 treated as one. A token-entropy gate fails for a measurement reason: averaged over a chain of some 602 tokens, the statistic is a measurement of the prose rather than of confidence in the answer. On Qwen2.5-7B-Instruct-Turbo, 198 problems at 64 samples each, a sample whose answer contradicts its own problem's plurality still emits that answer at a median margin of 20.52 nats, with 75.7% above 10 nats. Both quantities were pre-registered and tested once on 69 problems no exploratory analysis had read; both passed. The unit is the whole result: pooled across the benchmark the margin separates correct from incorrect samples by +0.0604 on the fraction above 10 nats [+0.0183, +0.1017], excluding zero; per-problem and paired it does not, at -0.0168 [-0.0527, +0.0182], crossing zero. The claim is not that token log-probabilities carry no information, but that a signal with real across-question discrimination is close to useless for the within-question decision a router faces. The plurality-agreement gate's failure remains without a mechanism, and we report it as an open problem. These new claims rest on one model: a registered second-model replication was sampled and could not be evaluated, and we report that rejection rather than the result. We separately report that on hosted serverless inference at a small budget, three reasoning-native models could not be evaluated, for three separately measured reasons; all three are downloadable, so this bounds what a metered per-token API buys rather than what is knowable.
- Abstract(参考訳): 多数決による自己整合性はGPQAダイアモンド問題の大部分において、Qwen2.5-7Bの問題の56.6%、Llama-3-8Bの問題の65.7%の精度を低下させる。
明らかな治療は、検証不要な信頼ゲートである。
このバージョンでは、最も自然な修復も失敗し、v1が1つとして扱われた3つの信号障害を分離する。
トークンエントロピーゲート(英: token-entropy gate)は、約602個のトークンの連鎖上で平均化され、統計学は答えに対する自信ではなく、散文の測定である。
Qwen2.5-7B-Instruct-Turboでは、それぞれ64のサンプルで198の問題を発生させるが、答えが矛盾するサンプルは、20.52ナットの中央値で答えを出力し、10ナットより75.7%高い。
どちらの量も事前登録され、69件の問題を1回に1回テストしたが、探索分析は読めなかった。
誤差は10ナット [+0.0183, +0.1017] 以上で、0を除いた分数で0.0604 +0.0604 となり、その差は-0.0168 [-0.0527, +0.0182] である。
この主張は、トークンのログ確率は情報を持たないが、実際のクロスクエスト差別を持つ信号は、ルータが直面している内部クエスト判断では役に立たない、というものである。
複数ゲートの故障は機構を持たず,未解決の問題として報告する。
これらの新たな主張は1つのモデルに依存しており、登録された第2モデルの複製をサンプリングし、評価することはできず、結果よりも拒絶を報告します。
我々は、小さな予算でホストされたサーバーレス推論について、3つの理由付けネイティブモデルを評価することができなかったことを別々に報告した。
関連論文リスト
- Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints [4.41537705949485]
言語モデル審査員は、トレーニングデータをゲートし、世代をスコアし、リーダーボードを駆動する。
我々は、事前登録された2つのキャンペーンにおいて、すべてのしきい値が事前に固定された状態で、その仮定を監査した。
52,988件の要求を監査し、スピアマン0.400で0.90と一致した。
証拠を3段階のスナップショット識別はしご、8つの設計ルール、レポートチェックリストに抽出する。
論文 参考訳(メタデータ) (2026-09-03T17:59:43Z) - Phantom Gains: Auditing Self-Improvement Against a Measured Null [10.74609430659738]
我々は、Qwen3-8Bで32ドル(約2万2000円)のLoRA自己訓練を行い、同じパイプラインを通り抜ける凍結制御を行った。
我々は7つの測定失敗を識別し、それぞれが、その制御が欠如しているときに報告された発見を逆転させる。
論文 参考訳(メタデータ) (2026-08-20T17:30:14Z) - What Would Fix This RAG Failure? Auditing Counterfactual Response with Paired Evidence Interventions [0.0]
我々はPair-IDを紹介した。Pair-IDは1つのクエリ、検索状態、読み取り定数を格納し、次に2つの操作を横断する。
19,981のベンチマーククエリで11,105のQwen障害が特定され、SHA-256オーダーが1200を選択して、サンプリングされた応答を生成する。
その結果,ハッシュ選択された有資格障害サンプルにおいて有意な速度でエビデンスが発生し,観察された故障から部分的に予測可能であり,読者に条件付きであることが示唆された。
論文 参考訳(メタデータ) (2026-08-09T22:43:27Z) - Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models [0.0]
マルチモデルLPMシステムは単一モデルの精度を上回ります。
彼らの利益は、ほとんど報告されない量で占められていることを示す。
論文 参考訳(メタデータ) (2026-06-25T17:06:06Z) - Reasoning Quality Emerges Early: Data Curation for Reasoning Models [58.56882815783977]
我々は,初期推論トークンのみを用いて,多種多様かつ挑戦的な推論例を識別可能であることを示す。
本手法は,トークン効率を91%向上させながら,既存のベースラインを最大1.7%向上させる。
論文 参考訳(メタデータ) (2026-06-25T09:32:58Z) - OQMD: Single-Qubit Rotation Control Improves Low-CNOT Multiclass Quantum Classification [4.669017653337737]
本研究は、最適量子計測復号法(OQMD)の研究である。
OQMD: 測定前に読み出し層をトレーニングすることで、量子結果が古典的なラベルにどのようにマッピングされるかを最適化する。
実験では、OQMDのハードウエアネイティブな1つの具体的実現として、トレーニング可能な3つの1量子ビット回転を用いる。
論文 参考訳(メタデータ) (2026-06-12T04:05:48Z) - When to Think Deeply: Inhibitory Deliberation for LLM Reasoning [5.19759149737193]
我々は、応答条件による抑制的熟考のためのフレームワークであるIDPRを提案する。
IDPRはまず簡潔な直感的な回答を生成し、次に抑制コントローラを使用して決定する。
IDPRは最も高い補正精度を達成し、応答条件による阻害が迅速な答えをよりよく識別することを示す。
論文 参考訳(メタデータ) (2026-06-04T21:57:27Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Large Language Models Decide Early and Explain Later [47.20810161393936]
本研究では, 強制解の完成度を用いた推理段階における予測解の進化について検討する。
プローブベースの停止を含むシンプルさは、クエリ毎の推論トークン使用量を500トークン削減できることを示す。
論文 参考訳(メタデータ) (2026-04-24T06:26:24Z) - Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering [7.1559850008795385]
大きな言語モデル(LLM)は質問回答(QA)設定で一般的に使用される。
既存のUQアプローチは、科学的QAでは弱い検証が残っている。
推論要求QAにおけるUQ指標を評価するための,最初の大規模ベンチマークを紹介する。
論文 参考訳(メタデータ) (2026-01-30T20:02:34Z) - Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs [72.82403830490084]
我々は、復号規則は正確さによって校正されるべきであり、自信だけではならないと論じている。
Greedy-Threshold はこの目標を達成するための単純な戦略を提案します。
この結果から,不確実性の下での復号化が問題視され,数学や一般推論のベンチマークで有意な差がみられた。
論文 参考訳(メタデータ) (2025-10-07T14:46:12Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - VeriThinker: Learning to Verify Makes Reasoning Model Efficient [52.74493506816969]
大型推論モデルは、Chain-of-Thought (CoT)推論を用いて複雑なタスクで優れている。
過度に考える傾向は、必然的に長い推論連鎖に繋がる。
我々は,CoT圧縮の新しい手法であるVeriThinkerを紹介する。
論文 参考訳(メタデータ) (2025-05-23T14:17:56Z) - Not All Votes Count! Programs as Verifiers Improve Self-Consistency of Language Models for Math Reasoning [24.386388107656334]
本稿では,自然言語から派生した翻訳プログラムを検証メカニズムとして活用するフレームワークであるProveを紹介する。
バニラ多数決とは異なり、我々の手法は、対応するプログラム出力が生成した解と矛盾する解をフィルタリングし、検証に合格する解のみを集約する。
以上の結果から,すべてのモデルサイズとデータセットにまたがる数学的推論タスクの解決において,Proveはバニラ多数投票を一貫して上回る結果となった。
論文 参考訳(メタデータ) (2024-10-16T14:24:55Z) - PRover: Proof Generation for Interpretable Reasoning over Rules [81.40404921232192]
本稿では,ルールベース上の二項質問に応答し,対応する証明を生成するトランスフォーマーモデルを提案する。
本モデルは,効率的な制約付き学習パラダイムを用いて,証明グラフに対応するノードやエッジを予測できることを学習する。
我々は、QAと証明生成のための有望な結果を示すために、合成、手書き、人文による規則ベースの実験を行う。
論文 参考訳(メタデータ) (2020-10-06T15:47:53Z) - Selective Question Answering under Domain Shift [90.021577320085]
モデルがドメイン外の入力に対して過度に信頼されているため、モデルのソフトマックス確率のみに基づくアテンションポリシーは不適切である。
キャリブレータをトレーニングして、QAモデルがアースする入力を識別し、エラーを予測した場合に停止する。
提案手法は,80%の精度を維持しながら56%の質問に回答するが,それに対してモデルの確率を直接使用する場合,80%の精度で48%しか回答しない。
論文 参考訳(メタデータ) (2020-06-16T19:13:21Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。