論文の概要: Does Verbose Chain-of-Thought Really Help? In-Distribution Evidence that Content, Not Length, Matters
- arxiv url: http://arxiv.org/abs/2606.30128v1
- Date: Mon, 29 Jun 2026 11:06:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.199863
- Title: Does Verbose Chain-of-Thought Really Help? In-Distribution Evidence that Content, Not Length, Matters
- Title(参考訳): Verbose Chain-of-Thoughtは本当に役に立つのか? コンテンツは長さではなく長さで、流通中の証拠
- Authors: Wenlong Wang, Fergal Reid,
- Abstract要約: 思考の連鎖はLSM推論を改善するが、ソースは競合する。
それぞれのモデルを同じ質問に繰り返しサンプリングし、同じ推論計画に従って、より長い自然世代とペアリングする。
余分なトークンは、独立に訓練されたすべての理性者に対して、本質的には変化しない。
同じ意味的内容を表す2つのトレースが、より冗長な場合に異なる結果をもたらすかどうかを問う。
- 参考スコア(独自算出の注目度): 10.230437172157474
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Chain-of-thought (CoT) prompting improves LLM reasoning, but the source is contested: do the intermediate steps help because they carry useful semantic content, or because conditioning on more tokens buys extra computation before the model commits to an answer? We bring two lines of evidence to bear. First, in distribution: we repeatedly sample each model on the same question and pair a shorter with a longer of its own natural generations that follow the same reasoning plan, so nothing is rewritten and both traces are genuinely in-distribution. Across 25 models the extra tokens leave accuracy essentially unchanged for every independently-trained reasoner, and a blind analysis of the surplus tokens shows that what gain exists elsewhere tracks validation- and checking-content, not verbosity per se. Second, as a controlled intervention, we ask whether two traces expressing the same semantic content (the same facts, operations, and intermediate values, verified through directed acyclic graph equivalence) produce different outcomes when one is more verbose, using a dual-validator design across four targets and eight benchmarks with number-redacted completion and stratified bootstrap confidence intervals. Verbose traces do improve accuracy (25 of 32 benchmark-target cells are positive under at least one validator), but the effects are modest (typically 1-4 points) and depend on the quality of the verbose prose, not merely its length. Under maximum numerical redaction the effect is amplified (median 3.24x across four arithmetic benchmarks), and length-matched non-reasoning filler recovers none of it. Both lines converge: what matters is what the extra tokens do (the reasoning and validation content they carry), not how many there are, a picture neither a pure forward-pass-compute nor a pure semantic-content account fully explains.
- Abstract(参考訳): CoT(Chain-of- Thought)の促進はLCM推論を改善するが、ソースは競合している: 中間ステップは有用なセマンティックコンテンツを運ぶのに役立つのか、それとも、より多くのトークンの条件付けが、モデルが答えにコミットする前に余分な計算を買うからか?
証拠は2行ある。
まず、分布において、各モデルを同じ質問に対して繰り返しサンプリングし、同じ推論計画に従って、より長い自然世代とペアリングする。
25年にわたって、余剰トークンの精度は、独立に訓練されたすべての理性者に本質的に変化せず、余剰トークンの盲点分析により、他の場所に存在するものは、各自の冗長性ではなく、バリデーションとチェックコンテントをトラックしていることを示している。
第二に、制御された介入として、同じ意味的内容を表す2つのトレース(同じ事実、操作、中間値、有向非巡回グラフ等価性によって検証される)が、より冗長な場合に異なる結果をもたらすかどうかを問う。
バーボーストレースは精度を向上する(少なくとも1つのバリデータの下で32個のベンチマークターゲットセルのうち25個は正である)が、効果は穏やか(典型的には1-4点)であり、その長さだけでなく、動詞の散文の品質にも依存する。
最大数値の再作用の下では、効果は増幅され(4つの算術ベンチマークの中間3.24倍)、長さにマッチしない非共振式フィラーはそれを回復しない。
両方の行が収束する: 重要なことは、余分なトークンが何をするか(それらが持つ推論と検証のコンテンツ)、その数ではなく、純粋なフォワードパス計算も純粋なセマンティック・コンテント・アカウントも完全に説明できない写真である。
関連論文リスト
- Decoding in Order-Agnostic Language Models: Chain-Rule Deviation and Uniform Spreading [0.6916773850242582]
順序に依存しない言語モデル(OALM)は任意の条件セットの下でマスク付きトークンを予測するために訓練される。
学習条件はコヒーレントな関節分布の正確な分解ではないことを示す。
信頼性トレースの形状に基づく相補的診断を提案する。
論文 参考訳(メタデータ) (2026-05-31T04:25:36Z) - CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization [50.59956036193097]
検証可能な報酬(RLVR)を用いた強化学習における正しい解を生成するモデル
各トークンは、決定的な推論ステップであれ、文法的なフィラーであれ、同じ報酬信号を受信する。
コントラストエビデンスポリシー最適化(CEPO)を提案する。
CEPOは、全てのトークンに対してよりシャープな質問をする:「正しい答えは、このトークンを好むか?」が、「正しい答えは、正しい答えは、それを好む一方で、間違った答えはそれを好まないか?」。
論文 参考訳(メタデータ) (2026-05-19T06:46:19Z) - Reliable Chain-of-Thought via Prefix Consistency [6.053609157192373]
正しい回答を持つトレースは、間違った回答を持つトレースよりも、元の回答を頻繁に再現する。
この違いを信頼性信号、プレフィックス一貫性として使用し、各候補の回答を再生の頻度によって重み付けします。
論文 参考訳(メタデータ) (2026-05-08T12:28:05Z) - Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts [51.84894623128418]
現代の推論言語モデルは、すべてのトークンが寄与し、ステップを順番に消費しなければならないと暗黙的に仮定して、シーケンシャルな連鎖トレースを生成する。
我々は、モデル生成推論連鎖に適用した、系統的な介入パイプライン、除去、マスキング、シャッフル、ノイズ注入により、両方の仮定に挑戦する。
解答抽出は, スパース, 秩序不感, 構造的に堅牢な情報基板上で行う。
論文 参考訳(メタデータ) (2026-05-08T06:15:50Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - Decomposing Reasoning Efficiency in Large Language Models [2.4149105714758545]
我々はトークン効率を、固定されたトークン予算の下での完了、与えられた完了条件の正確性、冗長性といった、解釈可能な要因に分解する。
推論トレースが利用可能であれば、冗長だが拡張された推論からループを分離するために決定論的トレース品質尺度を追加します。
我々の分解は、異なる効率の介入を示唆する異なるボトルネックプロファイルを明らかにします。
論文 参考訳(メタデータ) (2026-02-10T14:09:18Z) - Probing the Trajectories of Reasoning Traces in Large Language Models [4.599673637363014]
本研究では,大規模言語モデルにおける推論トレースの軌跡を探索するプロトコルを提案する。
得られた推論トークンの比率が大きくなるにつれて、精度と決定のコミットメントが一貫して増加することが分かっています。
軌道探索が推論モデルのより効率的かつ安全な展開のための診断を提供することを示す。
論文 参考訳(メタデータ) (2026-01-30T16:45:16Z) - Regularization Through Reasoning: Systematic Improvements in Language Model Classification via Explanation-Enhanced Fine-Tuning [2.247737938202007]
細調整中に各ラベルに簡単な説明を付けると、より優れたモデルが得られるかどうかを評価する。
我々は、人間による説明を、構文的に不整合でありながら原文と一致するテキストに置き換える。
この効果はデータセットにまたがって持続し、種子を訓練することで、ゲインは構造よりも意味から生じないことを示している。
論文 参考訳(メタデータ) (2025-11-03T20:25:42Z) - Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations [83.93566096400723]
ランダムにサンプリングされたトークン化が与えられた場合、命令調整されたモデルは元の性能の最大93.4%を維持している。
文字レベルのセグメンテーションは文字列操作とコード理解タスクを最大+14%改善する。
右列桁のグルーピングは、大数の算術を+33%向上させる。
論文 参考訳(メタデータ) (2025-06-23T18:02:26Z) - Beyond the Last Answer: Your Reasoning Trace Uncovers More than You Think [51.0691253204425]
我々は2つの質問に答えるために中間的推論ステップを解析する: 最終的な答えはモデルの最適結論を確実に表すか?
我々のアプローチは、推論トレースを言語的手がかりに基づくシーケンシャルなサブソートに分割することである。
これらの解答を最も頻繁な解(モード)を選択して集約すると、元の完全トレースから得られる解のみに依存するよりも、はるかに高い精度が得られることが判明した。
論文 参考訳(メタデータ) (2025-04-29T12:39:07Z) - ReCEval: Evaluating Reasoning Chains via Correctness and Informativeness [67.49087159888298]
ReCEvalは2つの重要な特性(正確性と情報性)を通じて推論チェーンを評価するフレームワークである。
本稿では、ReCEvalが様々なエラータイプを効果的に識別し、従来の手法と比較して顕著な改善をもたらすことを示す。
論文 参考訳(メタデータ) (2023-04-21T02:19:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。