論文の概要: Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning
- arxiv url: http://arxiv.org/abs/2606.25524v2
- Date: Thu, 25 Jun 2026 04:37:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 15:44:16.378612
- Title: Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning
- Title(参考訳): Cliff Tokens: LLMの数学的推論における単一障害トリガーの同定
- Authors: Jaeyong Ko, Pilsung Kang, Yukyung Lee,
- Abstract要約: 本稿では,トークン単位のポテンシャルが適応しきい値以下で著しく低下するトークンである崖トークンを紹介する。
7つのモデルと3つの数学的推論ベンチマークで、崖のトークンが障害トリガーとして機能する。
我々は, 決定論的, 不確実, サンプルオフの崖を, 欲求選択とトークンエントロピーによって定義した崖分類を導入する。
- 参考スコア(独自算出の注目度): 6.995468813502183
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) reach high accuracy in mathematical reasoning, but individual traces on the same problem diverge; some arrive at the correct answer while others fail. Prior work analyzes failure at the step, chunk, or sentence level, or at tokens where failure has already occurred. Neither identifies the precise token that triggers the shift toward failure. We introduce the cliff token, a token where the token-wise potential drops significantly under an adaptive threshold that scales with the local token-wise potential, based on a one-sided two-proportion z-test. Across seven models and three mathematical reasoning benchmarks (GSM1K, MATH500, AIME 2025), cliff tokens act as failure triggers; deleting the first cliff token and resampling recovers pass@64 to 1.0, while keeping it limits recovery to between 0.71 and 1.00. We further introduce a cliff taxonomy of deterministic, uncertain, and sampled-off cliffs, defined by greedy choice and token entropy. Each type has distinct probabilistic characteristics, and the taxonomy generalizes across model scales. Finally, we validate the taxonomy via single-token preference optimization at cliff positions (Cliff-DPO). Trained on GSM8K, Cliff-DPO improves accuracy across benchmarks by up to +6.6. Optimizing at uncertain and sampled-off cliffs improves reasoning, while deterministic cliffs do not.
- Abstract(参考訳): 大きな言語モデル(LLM)は数学的推論において高い精度に達するが、同じ問題の個々のトレースは分岐し、あるものは正しい答えに到達し、あるものは失敗する。
以前の作業では、ステップやチャンク、文レベル、あるいはすでに障害が発生しているトークンの障害を分析していました。
どちらも、失敗へのシフトを引き起こす正確なトークンを特定しません。
一方のz-テストに基づいて,トークン単位のポテンシャルが局所的なトークン単位のポテンシャルと共にスケールする適応しきい値の下で,トークン単位のポテンシャルが著しく低下するトークンである崖トークンを導入する。
7つのモデルと3つの数学的推論ベンチマーク(GSM1K, MATH500, AIME 2025)にまたがって、崖のトークンは障害トリガーとして機能し、最初の崖のトークンを削除してresamplingはpass@64から1.0にリカバリするが、リカバリは0.71から1.00に制限される。
さらに, 決定性, 不確実性, サンプルオフの崖を, 欲求選択とトークンエントロピーによって定義した崖分類を導入する。
それぞれのタイプは異なる確率的特性を持ち、分類はモデルスケールにまたがって一般化する。
最後に,崖位置 (Cliff-DPO) における一点選好最適化による分類の検証を行った。
GSM8Kで訓練されたCliff-DPOは、ベンチマークの精度を+6.6まで向上させる。
不確実でサンプリングされた崖での最適化は推論を改善するが、決定論的崖は改善しない。
関連論文リスト
- ESPO: Early-Stopping Proximal Policy Optimization [78.79610718910628]
ESPO(Early-Stopping Proximal Policy Optimization)は、軌道上の障害を検出し、ロールアウトを早期に終了する。
DeepSeek-R1-Distill-Qwen-7Bでは、ESPOはAIME2024(46.28%対45.25%)、AMC2023(85.83%対82.94%)、MATH-500(87.42%対85.43%)でPPOを上回っている。
論文 参考訳(メタデータ) (2026-05-28T12:40:22Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - The Coupling Tax: How Shared Token Budgets Undermine Visible Chain-of-Thought Under Fixed Output Limits [12.316478346055618]
思考の連鎖推論はしばしば、モデルを長く考えることで言語モデル精度を改善するための単調な方法として扱われる。
トレースと最終回答の推論が1つのアウトプットの予算を共有している場合、長いトレースは彼らがサポートしようとしている回答をかき集めることができます。
GSM8K、MATH-500、および5つのBIG-Bench HardタスクをQwen3モデルで3つのスケールで実行し、GSM8KとMATH-500では最大2048トークンまでの予算で非思考モードマッチや優れた思考モードを実現した。
論文 参考訳(メタデータ) (2026-05-08T12:54:53Z) - Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts [51.84894623128418]
現代の推論言語モデルは、すべてのトークンが寄与し、ステップを順番に消費しなければならないと暗黙的に仮定して、シーケンシャルな連鎖トレースを生成する。
我々は、モデル生成推論連鎖に適用した、系統的な介入パイプライン、除去、マスキング、シャッフル、ノイズ注入により、両方の仮定に挑戦する。
解答抽出は, スパース, 秩序不感, 構造的に堅牢な情報基板上で行う。
論文 参考訳(メタデータ) (2026-05-08T06:15:50Z) - VeriX-Anon: A Multi-Layered Framework for Mathematically Verifiable Outsourced Target-Driven Data Anonymization [0.0]
VeriX-Anonは、オープンソースのターゲット駆動k匿名化のための多層検証フレームワークである。
認証決定木のメルクル式ハッシュによる決定論的検証、ランダムフォレスト決定境界付近の境界センチネルによる確率的検証、および暗号識別子による正確な重複性ツインズの組み合わせである。
12のシナリオのうち11の偏差を正しく検出した。
論文 参考訳(メタデータ) (2026-04-14T08:22:18Z) - SELFDOUBT: Uncertainty Quantification for Reasoning LLMs via the Hedge-to-Verify Ratio [0.038379177968040606]
言語モデル推論のための単一パス不確実性フレームワークであるSELFDOUBTを提案する。
私たちのキーシグナルであるHedge-to-Verify Ratio(HVR)は、推論トレースが不確実性マーカーを含むかどうかを検出し、もしそうであれば、明示的な自己チェック行動によってオフセットされているかどうかを検出する。
SELFDOUBTは単一の観測された推論軌道で動作し、任意のプロプライエタリなAPI上でのレイテンシとコスト制約によるデプロイメントに適している。
論文 参考訳(メタデータ) (2026-04-07T19:19:29Z) - Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models [22.525318796588568]
シンク・アット・ハード(Think-at-Hard, TaH)は、ハードトークンでのみ深く反復する動的潜在思考法である。
TaHは5つの挑戦的なベンチマークで推論のパフォーマンスを向上する。
論文 参考訳(メタデータ) (2025-11-11T18:57:02Z) - Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs [72.82403830490084]
我々は、復号規則は正確さによって校正されるべきであり、自信だけではならないと論じている。
Greedy-Threshold はこの目標を達成するための単純な戦略を提案します。
この結果から,不確実性の下での復号化が問題視され,数学や一般推論のベンチマークで有意な差がみられた。
論文 参考訳(メタデータ) (2025-10-07T14:46:12Z) - Computational-Statistical Tradeoffs at the Next-Token Prediction Barrier: Autoregressive and Imitation Learning under Misspecification [50.717692060500696]
対数損失を伴う次のトーケン予測は自己回帰シーケンスモデリングの基盤となる。
次トーケン予測は、適度な誤差増幅を表す$C=tilde O(H)$を達成するために堅牢にすることができる。
C=e(log H)1-Omega(1)$。
論文 参考訳(メタデータ) (2025-02-18T02:52:00Z) - Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability [53.51560766150442]
臨界トークンは推論軌道内の要素であり、誤った結果に大きな影響を及ぼす。
本稿では,これらのトークンをロールアウトサンプリングによって識別する新しいフレームワークを提案する。
クリティカルトークンの識別と置換がモデル精度を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2024-11-29T18:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。