論文の概要: Not All LLM Reasoning is Visible in the Chain-of-Thought
- arxiv url: http://arxiv.org/abs/2607.22925v1
- Date: Fri, 24 Jul 2026 21:32:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.929367
- Title: Not All LLM Reasoning is Visible in the Chain-of-Thought
- Title(参考訳): LLMのすべての推論は、チェーン・オブ・サートで可視であるとは限らない
- Authors: Vatsal Baherwani, Tom Goldstein, Ashwinee Panda,
- Abstract要約: フロンティアモデルは、意味的に無関係なフィラートークンを利用して、合成推論タスクのパフォーマンスを改善することによって、目に見えない推論を示す。
我々は,Claude Opus 4.5 が主タスクの精度を犠牲にすることなく,隠れたモジュラー演算制約を満たすことができることを示す。
- 参考スコア(独自算出の注目度): 48.129884329641975
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A key question for AI safety is whether a language model expresses all of its reasoning in its output tokens. We demonstrate a concrete failure mode where frontier models exhibit invisible reasoning by leveraging semantically irrelevant filler tokens to improve performance on synthetic reasoning tasks. We evaluate 13 frontier language models across three tasks and find that many models benefit significantly from filler tokens, with accuracy improvements of up to 13 percentage points. The benefit depends on which tokens are used and differs across models. We further show that filler tokens enable Claude Opus 4.5 to satisfy a hidden modular arithmetic constraint without sacrificing accuracy on its primary task, demonstrating that invisible reasoning can serve objectives entirely invisible to CoT monitoring. Reinforcement learning gives Qwen3-235B strong preferences over filler token content, but neither RL nor supervised fine-tuning produces a filler token benefit that persists at test time. Our results indicate that frontier models already perform consequential computation with no interpretable trace in their output tokens.
- Abstract(参考訳): AIの安全性に関する重要な疑問は、言語モデルが出力トークンのすべての推論を表現しているかどうかである。
本研究では,セマンティックに無関係なフィラートークンを活用して,フロンティアモデルが目に見えない推論を示す,具体的な故障モードを示す。
3つのタスクにまたがる13のフロンティア言語モデルを評価し,最大13ポイントの精度向上を図った。
利点は、どのトークンが使われ、モデルによって異なるかによって異なります。
さらに,Claude Opus 4.5は,初期タスクの精度を犠牲にすることなく,隠れたモジュラー演算制約を満たすことができることを示す。
強化学習はQwen3-235Bにフィラートークンの内容よりも強い優先順位を与えるが、RLも教師付き微調整もテスト時に持続するフィラートークンの利点を生まない。
以上の結果から,フロンティアモデルはすでに,その出力トークンに解釈可能なトレースを含まない逐次計算を行っていることが示唆された。
関連論文リスト
- Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models [22.525318796588568]
シンク・アット・ハード(Think-at-Hard, TaH)は、ハードトークンでのみ深く反復する動的潜在思考法である。
TaHは5つの挑戦的なベンチマークで推論のパフォーマンスを向上する。
論文 参考訳(メタデータ) (2025-11-11T18:57:02Z) - FrugalPrompt: Reducing Contextual Overhead in Large Language Models via Token Attribution [3.4666771782038652]
大規模言語モデル(LLM)は、その恒星の性能の大部分を入力コンテキストの拡大に負っているが、そのような冗長性は金銭的コスト、炭素フットプリント、推論時間の遅延を膨らませている。
本稿では,LLMのための新しいプロンプト圧縮フレームワークであるFrugalPromptを紹介する。
我々は,4つのNLPタスク(感性分析,コモンセンスQA,要約,数学的推論)にまたがるアプローチを評価する。
論文 参考訳(メタデータ) (2025-10-18T10:22:13Z) - Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations [83.93566096400723]
ランダムにサンプリングされたトークン化が与えられた場合、命令調整されたモデルは元の性能の最大93.4%を維持している。
文字レベルのセグメンテーションは文字列操作とコード理解タスクを最大+14%改善する。
右列桁のグルーピングは、大数の算術を+33%向上させる。
論文 参考訳(メタデータ) (2025-06-23T18:02:26Z) - Wait, We Don't Need to "Wait"! Removing Thinking Tokens Improves Reasoning Efficiency [24.56015832583054]
高度な推論には、"Wait" や "Hmm" などのトークンによって信号される明示的な自己回帰が必要である。
推論中にこれらのトークンを抑えることで、明示的な自己回帰を無効にする、シンプルで効果的なアプローチであるNoWaitを提案する。
論文 参考訳(メタデータ) (2025-06-10T01:54:04Z) - Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability [53.51560766150442]
臨界トークンは推論軌道内の要素であり、誤った結果に大きな影響を及ぼす。
本稿では,これらのトークンをロールアウトサンプリングによって識別する新しいフレームワークを提案する。
クリティカルトークンの識別と置換がモデル精度を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2024-11-29T18:58:22Z) - Let's Think Dot by Dot: Hidden Computation in Transformer Language Models [30.972412126012884]
言語モデルの連鎖応答は、ほとんどのベンチマークのパフォーマンスを改善する。
変換器は、2つの難解なアルゴリズムタスクを解くための思考の連鎖の代わりに無意味なフィラートークンを使用できることを示す。
フィラートークンを使用する学習は困難であり、収束するためには、具体的で密集した監督が必要である。
論文 参考訳(メタデータ) (2024-04-24T09:30:00Z) - Guiding Language Model Reasoning with Planning Tokens [122.43639723387516]
大規模言語モデル(LLM)は、最近、複雑な推論タスクを実行する能力に対して、かなりの関心を集めている。
より構造的なチェーン・オブ・シークレット・ステップの創出を促す階層的な生成手法を提案する。
提案手法では、トレーニング可能なパラメータ(0.001%)の無視可能な増加が必要であり、完全な微調整か、よりパラメータ効率の良いスキームで適用することができる。
論文 参考訳(メタデータ) (2023-10-09T13:29:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。