論文の概要: Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning
- arxiv url: http://arxiv.org/abs/2608.04771v1
- Date: Wed, 05 Aug 2026 12:36:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.922836
- Title: Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning
- Title(参考訳): トークンが少ない、キャッシュが小さい:リワードコーディネートされた効率的な推論
- Authors: Qiyuan Zhu, Dezhi Li, Pengyu Cheng, Tianle Chen, Jiacheng Wang, Ruijie Shen, Hao Gu, Sida Lin, Zirui Liu, Jiacheng Liu, Sirui Han,
- Abstract要約: 大きな推論モデルは、長いチェーン・オブ・ソート(CoT)推論を通じて複雑なタスクに優れる。
KV-cache圧縮は一般的なソリューションであるが、既存の推論指向のメソッドは、キャッシュから削除したものによってのみ圧縮を判断する。
軽量プロセス逆推定器が各完了ステップをスコアし、3つのコンポーネントを駆動するフレームワークであるReCoを提案する。
- 参考スコア(独自算出の注目度): 15.652256738395018
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Reasoning Models (LRMs) excel on complex tasks through long chain-of-thought (CoT) reasoning, but their lengthy intermediate steps cause severe overthinking that inflates inference cost. KV-cache compression is a common solution, yet existing reasoning-oriented methods apply a uniform policy across the trajectory and judge compression only by what it removes from the cache. Two observations point the other way. First, a reasoning state's tolerance to context loss varies along the trajectory, and process reward tracks it: deleting tokens at high-reward steps preserves accuracy far better than deleting the same budget at random. Second, compression is not free on the generation side, since a smaller cache leads the model to generate more tokens, partly canceling the saving. Together these motivate coordinating both sides under a single process reward. We propose ReCo (Reward-Coordinated Compression), a step-wise framework in which a lightweight process-reward estimator scores each completed step and drives three components: (1) reward-adaptive KV-cache compression that shrinks the retained cache harder at high-reward steps and less at low-reward ones, (2) a reward-banded penalty on reflection tokens that curbs redundant generation, and (3) confidence-based early stopping that triggers when the reasoning is reliable. Across three reasoning models and six benchmarks, ReCo reduces generated tokens by 37%-65% and end-to-end latency by 2.08x-2.35x over Full CoT, all while largely preserving accuracy.
- Abstract(参考訳): 大きな推論モデル(LRM)は、長いチェーン・オブ・シンク(CoT)推論を通じて複雑なタスクを排他的に処理するが、その長い中間ステップは推論コストを膨らませるような過度な過大な考えを引き起こす。
KV-cache圧縮は一般的な方法であるが、既存の推論指向の手法では、キャッシュから取り除くものだけによって、軌跡と判断された圧縮に統一的なポリシーを適用する。
2つの観察は反対の方向を向いている。
まず、推論状態の文脈損失に対する耐性は軌道に沿って変化し、プロセス報酬はそれを追跡する: 高い逆ステップでトークンを削除することは、同じ予算をランダムに削除するよりもはるかに正確である。
第二に、圧縮は生成側では無料ではない。キャッシュが小さくなれば、より多くのトークンが生成され、部分的に保存がキャンセルされるからだ。
これらのモチベーションは、双方を単一のプロセス報酬の下で調整する。
ReCo(Reward-Coordinated Compression)は、軽量プロセス逆推定器が各完了ステップをスコアし、(1)高逆ステップでキャッシュを小さくし、低逆ステップでキャッシュを小さくする報酬適応KVキャッシュ圧縮(Reward-Adaptive KV-cache compression)、(2)冗長生成を抑制するリフレクショントークンに対する報酬バンド化ペナルティ(Reward-Coordinated Compression)、(3)信頼性ベースの早期停止(Resistence-based Early Stop)の3つのコンポーネントを駆動するステップワイズフレームワークを提案する。
3つの推論モデルと6つのベンチマークで、ReCoは生成されたトークンを37%-65%削減し、エンドツーエンドのレイテンシをFull CoTで2.08x-2.35x削減した。
関連論文リスト
- ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation [72.54604107217669]
textscpass@$k$は圧縮後にほぼ消滅するが、textscpass@$k$は繰り返しサンプリングの下でほぼ回復する。
回復は、密集したトークンレベルの監督の下で、圧縮されたモデル自身のオン政治状態で訓練すべきである。
我々は,教師が確認した反復接尾辞を検知する短時間のOPDスケジュールであるtextbfshortopdを提案する。
論文 参考訳(メタデータ) (2026-07-14T17:50:50Z) - SelKV: Selective KV Cache Merging with Per-Token Merge-or-Drop and Attention Compensation [0.0]
大規模言語モデルは、メモリフットプリントがコンテキスト長とともに線形に増加するキー値(KV)キャッシュに依存して、テキストを自動回帰的に生成する。
最近の圧縮法はトークンマージによるコストを軽減している。
これらの制約に対処するKVキャッシュ圧縮のためのトレーニングフリーでデュアルコンポーネントのフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-19T17:44:56Z) - ExpThink: Experience-Guided Reinforcement Learning for Adaptive Chain-of-Thought Compression [14.830831997228657]
大きな推論モデル(LRM)は、拡張チェーン・オブ・シークレット(CoT)推論を通じて高いパフォーマンスを達成するが、過度のトークン消費と高い推論遅延に悩まされる。
両次元を2つの相補的な機構で処理するRLフレームワークである textbfExpThinkxspace を提案する。
複数の数学的推論ベンチマークの実験により、textbfExpThinkxspaceは平均応答長を最大77%削減し、同時に精度を向上することを示した。
論文 参考訳(メタデータ) (2026-05-08T09:37:30Z) - Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression [55.63153956934198]
Chain-of-Thought (CoT)推論はLarge Language Models (LLMs)の推論能力をうまく向上させる
既存のCoT圧縮法は、しばしば高い圧縮比で論理的忠実度が著しく低下する。
本稿では,Extra-CoTと呼ばれる新しいEXTreme-RAtio Chain-of-Thought Compressionフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-09T06:57:15Z) - CtrlCoT: Dual-Granularity Chain-of-Thought Compression for Controllable Reasoning [29.057579417751203]
チェーン・オブ・シント(CoT)はLCM推論を改善するが、冗長なトレースによって高いレイテンシとメモリコストを発生させる。
セマンティック抽象化とトークンレベルのプルーニングを調和させるデュアルグラニュラリティCoT圧縮フレームワークである textbfCtrlCoT を提案する。
論文 参考訳(メタデータ) (2026-01-28T10:38:49Z) - R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning [80.104336426172]
CoT(Chain-of- Thought)は、大規模言語モデルの問題解決能力を高める。
CoTは長い自己回帰軌道のためにかなりの推論コストを発生させる。
トレーニング不要なハイブリッドデコーディングフレームワークであるR-Stitchを紹介する。
論文 参考訳(メタデータ) (2025-07-23T08:14:36Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z) - Sparsity Forcing: Reinforcing Token Sparsity of MLLMs [40.93786579652003]
マルチモーダル大規模言語モデル(MLLM)におけるトークンの分散性を,単純なRLベースのポストトレーニングフレームワークであるtextitSparsity Forcing を用いて明示的に強化する。
本手法では,複数ロールアウトを異なるトークン予算で実行し,効率(トーケン還元率)と性能(回答正当性)の両方を共同報酬として定式化することにより,効率・正確性トレードオフを探索する。
論文 参考訳(メタデータ) (2025-04-23T01:45:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。