論文の概要: Towards Understanding Pause Token Fine-Tuning Dynamics: A Mode Retention Perspective
- arxiv url: http://arxiv.org/abs/2609.04489v1
- Date: Thu, 03 Sep 2026 21:23:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.831363
- Title: Towards Understanding Pause Token Fine-Tuning Dynamics: A Mode Retention Perspective
- Title(参考訳): ポーゼトーケンファインチューニングダイナミクスの理解に向けて--モード保持の視点から
- Abstract要約: 停止トークンが微調整のトレーニングダイナミクスをいかに形作るかを示す。
Masked Boundary Pauseは推論を継続的に改善し、数学では最大6ポイント、コードでは2.5ポイントまで向上する。
これらの結果は、停止トークンを、保持-適応トレードオフに関するトレーニング-動的介入として再キャストする。
- 参考スコア(独自算出の注目度): 7.155337546555976
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pause-token methods improve LLM reasoning by inserting special tokens into sequences. Prior work explains these gains through computational expressivity. However, there is relatively little investigation into the training dynamics of pause tokens. We explore how pause tokens reshape the training dynamics of fine-tuning. Two controlled pilots expose distinct asymmetries. On a synthetic continual-learning task, masked pauses overwrite a previously-learned distribution roughly 4x less at matched final adaptation (H1, mode retention); on a synthetic math-reasoning probe, the boundary-adjacent token comes to encode substantially more downstream-step information (H2, non-myopic compression). We formalize a training rule consistent with both - Masked Boundary Pause (MBP), pause tokens placed at reasoning-step boundaries with their loss masked. Across 1B-8B Qwen and Llama models, MBP consistently improves reasoning, achieving gains of up to 6 points on math and 2.5 points on code, while preserving general language understanding abilities. We further demonstrate that this mode-preserving strategy extend gains to GRPO. These results recast pause tokens as a training-dynamics intervention on the retention-adaptation trade-off, rather than merely an inference-time computation device.
- Abstract(参考訳): Pause-token 法は特別なトークンをシーケンスに挿入することで LLM 推論を改善する。
以前の研究は、計算的表現性を通してこれらの利益を説明する。
しかし,停止トークンのトレーニング力学についてはほとんど研究されていない。
我々は、停止トークンが微調整のトレーニングダイナミクスをいかに形作るかを探る。
2人の操縦士が異なる非対称性を明らかにします。
合成連続学習タスクにおいて、マスク付き一時停止は、マッチした最終適応(H1、モード保持)において、予め学習した分布を約4倍少なく上書きし(H1、モード保持)、合成数学推論プローブでは、境界付トークンが、かなり下流の情報を符号化する(H2、非ミオピック圧縮)。
Masked Boundary Pause (MBP) は、損失をマスクした推論ステップ境界に配置されたトークンを一時停止する。
1B-8B QwenとLlamaのモデル全体で、MBPは推論を継続的に改善し、一般的な言語理解能力を保ちながら、数学で最大6ポイント、コードで2.5ポイントのゲインを達成している。
さらに,このモード保存戦略がGRPOへのゲインを拡大することを示す。
これらの結果は、単に推論時間計算装置ではなく、保持適応トレードオフに対するトレーニング・ダイナミックス介入として停止トークンをリキャストする。
関連論文リスト
- SuperThoughts: Reasoning Tokens in Superposition [26.164480068360362]
ロング・チェーン・オブ・ソート (Long Chain-of-Thought, CoT) 推論は問題解決を改善するが、逐次トークン生成のために計算コストがかかる。
我々は,連続したCoTトークンのペアを1つの潜在表現に圧縮するSuperThoughtsを提案する。
SuperThoughtsは最小限の劣化で精度を維持しながら、$sim$20-30%のCoT長短縮を実現している。
論文 参考訳(メタデータ) (2026-06-11T19:42:18Z) - When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning [60.714416943748866]
シングルストリームの自己回帰インターフェースでは、同じトークンがモデル状態を更新し、不可逆的な公約を構成する。
そこで我々は,Side-by-Side (SxS) Interleaved Reasoningを導入する。
論文 参考訳(メタデータ) (2026-05-05T02:59:58Z) - Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization [74.91418266859297]
インプシットプロセス報酬モデル(PRM)は、推論プロセスに沿ってきめ細かな報酬信号を提供する。
トレーニングはシーケンスレベルの集約のみを制限しますが、推論はローカルステップの品質を反映するためにトークンレベルのスコアが必要です。
本稿では,予測精度を推定するプレフィックス条件付き値関数を直接学習する新しいインプリシット・プレフィックス・バリュー・リワード・モデル(IPVRM)を提案する。
また,サンプルトークンと高確率候補トークンの両方に対してTDの利点を演算する分散レベルRL(DistRL)を提案する。
論文 参考訳(メタデータ) (2026-04-14T18:19:54Z) - AdaPonderLM: Gated Pondering Language Models with Token-Wise Adaptive Depth [23.442686851761298]
AdaPonderLMは、事前トレーニング中にトークン単位の早期終了を学習する、自己教師型リカレント言語モデルである。
AdaPonderLMは、比較可能な言語モデリングの難易度と競合する下流の精度を維持しながら、推論計算を約10%削減する。
論文 参考訳(メタデータ) (2026-03-02T14:28:16Z) - FrugalPrompt: Reducing Contextual Overhead in Large Language Models via Token Attribution [3.4666771782038652]
大規模言語モデル(LLM)は、その恒星の性能の大部分を入力コンテキストの拡大に負っているが、そのような冗長性は金銭的コスト、炭素フットプリント、推論時間の遅延を膨らませている。
本稿では,LLMのための新しいプロンプト圧縮フレームワークであるFrugalPromptを紹介する。
我々は,4つのNLPタスク(感性分析,コモンセンスQA,要約,数学的推論)にまたがるアプローチを評価する。
論文 参考訳(メタデータ) (2025-10-18T10:22:13Z) - Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space [38.50132130644233]
計算変換器における推論時間の計算をスケールするための現在のアプローチは、答えを生成する前に明示的な連鎖トークンを出力するようにトレーニングすることに依存している。
Thoughtbubblesは、残留ストリームのフォークや削除を学ぶことで、潜在空間における並列適応計算を実行するトランスフォーマーである。
Thoughtbubbles は標準デコーダ LM と OpenWebText と peS2o のパープレキシティおよびHellaSwag や LAMBADA などのゼロショット評価において、非適応並列計算手法の両方に優れる。
論文 参考訳(メタデータ) (2025-09-30T19:49:15Z) - Soft Tokens, Hard Truths [17.640897774014707]
この研究は、強化学習(RL)を通して連続CoTを学習するスケーラブルな方法を導入する。
我々は、RL探索を提供するために、トークンと入力埋め込みのノイズを混ぜた「ソフト」トークンを使用します。
LlamaとQwenのモデルによる数学推論ベンチマークでは、連続CoTによるトレーニングは、pass@1で離散CoTと一致し、pass@32でそれらを上回ります。
論文 参考訳(メタデータ) (2025-09-23T15:43:47Z) - Multipole Attention for Efficient Long Context Reasoning [64.94673641704289]
大規模推論モデル (LRM) は複雑な問題解決タスクにおいて有望な精度の向上を示す。
LRMは、答える前に考えるために、長い連鎖推論を生成する必要がある。
本稿では,重要なトークンに対してのみ正確に注意を払うことで,自己回帰推論を高速化するマルチポール注意法を提案する。
論文 参考訳(メタデータ) (2025-06-16T03:00:40Z) - VQToken: Neural Discrete Token Representation Learning for Extreme Token Reduction in Video Large Language Models [35.38573641029626]
最小限の離散トークンを用いてビデオ全体を表現することを目的としたExtreme Short Token Reductionという新しいタスクを紹介した。
Extreme Short Token Reductionタスクでは、私たちのVQTokenはシーケンスをオリジナルの長さのわずか0.07パーセントまで圧縮し、NextQA-MCベンチマークでは0.6%の精度しか達成していません。
論文 参考訳(メタデータ) (2025-03-21T09:46:31Z) - Train for the Worst, Plan for the Best: Understanding Token Ordering in Masked Diffusions [14.85882273040068]
仮面拡散モデル (MDMs) は、離散領域にまたがる生成的モデリングのための有望な代替手法として登場した。
適応推論は、事前訓練されたMDMの精度を7$%から90$%に向上させ、ARMを7times$のパラメータで上回ります。
論文 参考訳(メタデータ) (2025-02-10T18:47:21Z) - Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning [53.57895922042783]
大規模言語モデル(LLM)は、チェーン・オブ・シークレット(CoT)データに基づいて訓練された場合、推論と計画が優れている。
そこで我々は,遅延離散トークンを用いて推論過程を部分的に抽象化するハイブリッド表現を提案する。
論文 参考訳(メタデータ) (2025-02-05T15:33:00Z) - FIRP: Faster LLM inference via future intermediate representation prediction [54.897493351694195]
FIRPはデコードステップ毎に1つではなく複数のトークンを生成する。
いくつかのモデルとデータセットで1.9x-3xのスピードアップ比を示す広範な実験を行った。
論文 参考訳(メタデータ) (2024-10-27T15:53:49Z) - Toward Understanding BERT-Like Pre-Training for DNA Foundation Models [78.48760388079523]
既存のDNA配列の事前訓練方法は、NLPからのBERT事前訓練の直接的な採用に依存している。
マスク境界を連続的に拡張することにより,BERTライクな事前学習作業の難易度を徐々に向上させるRandomMaskという新しい手法を提案する。
RandomMaskは、マシューのエピジェネティック・マーク・予測の相関係数の68.16%を突破し、ベースラインの19.85%を突破した。
論文 参考訳(メタデータ) (2023-10-11T16:40:57Z) - Revisiting Token Dropping Strategy in Efficient BERT Pretraining [102.24112230802011]
トークンドロップは、複数の中間層で入力トークンのサブセットの計算をスキップすることで、BERTのようなマスク付き言語モデルの事前トレーニングを高速化する戦略である。
しかし,トークンのドロップは意味的損失問題を起こしやすく,意味論的タスクの処理に不足していることが実証的に判明した。
そこで本研究では,トークンのドロップを改善するために,シンプルで効果的な意味一貫性学習法(ScTD)を提案する。
論文 参考訳(メタデータ) (2023-05-24T15:59:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。