論文の概要: Memory Augmentation Unlocks Efficient Chain-of-Thought Reasoning
- arxiv url: http://arxiv.org/abs/2608.21265v2
- Date: Wed, 26 Aug 2026 12:50:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:14.882286
- Title: Memory Augmentation Unlocks Efficient Chain-of-Thought Reasoning
- Title(参考訳): メモリ拡張は、効率的なチェーン・オブ・ソート推論を解き放つ
- Abstract要約: 大規模言語モデルは複雑なタスクを解決するためにしばしばChain-of-Thought (CoT)推論に依存する。
CoT圧縮は生成を短縮するが、アグレッシブ圧縮は論理コヒーレンスを阻害し、性能を低下させる。
我々はこのトレードオフをコンテキスト生成代行法(Context-Generation Substitution Law)として定式化し、明確な推論コンテキストをデコード時生成の一部に置き換える。
- 参考スコア(独自算出の注目度): 29.263926212060014
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models often rely on Chain-of-Thought (CoT) reasoning to solve complex tasks, but verbose reasoning traces introduce substantial inference overhead. CoT compression shortens generation, yet aggressive compression may disrupt logical coherence and degrade performance. We formalize this trade-off as the Context-Generation Substitution Law, where explicit reasoning context substitutes for part of decode-time generation. Based on this principle, we propose Memory-Augmented Compression, a training-free framework that constructs reusable reasoning memories from historical traces and retrieves them as prefill-side scaffolds. Rather than using raw demonstrations, these memories summarize reusable reasoning patterns, key constraints, and critical operations to compensate for information lost during compression. Experiments show that Memory consistently improves prompt-based Chain-of-Draft (CoD) compression across mathematical reasoning, complex reasoning, and science question answering tasks, yielding accuracy gains of 21.4, 28.0, 29.5, and 6.61 points over CoD on GSM8K, MATH, BBH, and MMLU-Sci, while achieving a 1.14-1.49x latency speedup latency speedup over standard CoT. Memory is also compatible with token-level, reasoning-trace-level, and inference-state compression mechanisms.
- Abstract(参考訳): 大規模言語モデルは、複雑なタスクを解決するために、しばしばChain-of-Thought (CoT)推論に依存するが、冗長な推論トレースは、かなりの推論オーバーヘッドをもたらす。
CoT圧縮は生成を短縮するが、アグレッシブ圧縮は論理コヒーレンスを阻害し、性能を低下させる。
我々はこのトレードオフをコンテキスト生成代行法(Context-Generation Substitution Law)として定式化し、明確な推論コンテキストをデコード時生成の一部に置き換える。
この原理に基づいて,過去の痕跡から再利用可能な推論メモリを構築し,それらを予備的な足場として検索するトレーニング不要なフレームワークであるMemory-Augmented Compressionを提案する。
生のデモンストレーションを使う代わりに、これらの記憶は再利用可能な推論パターン、鍵制約、圧縮時に失われた情報を補う重要な操作を要約する。
実験により、メモリは数学的推論、複雑な推論、科学的な質問応答タスクにまたがるプロンプトベースのChain-of-Draft (CoD)圧縮を一貫して改善し、GSM8K、MATH、BBH、MMLU-Sci上のCoD上の21.4、28.0、29.5、6.61ポイントの精度向上を実現し、標準CoTよりも1.14-1.49倍の遅延スピードアップを実現した。
メモリはトークンレベル、推論トレースレベル、推論状態圧縮機構とも互換性がある。
関連論文リスト
- MemoSight: Unifying Context Compression and Multi Token Prediction for Reasoning Acceleration [43.3663361769054]
CoT推論(Chain-of-Thought reasoning)は、LCMが難解な推論問題を解くことを可能にする。
CoT推論は、スピードとメモリ使用量の観点からスケーリングの問題に直面します。
我々は,コンテキスト圧縮とマルチトークン予測を統合した統合フレームワークであるMemoSight (Memory-Foresight-based reasoning)を提案する。
論文 参考訳(メタデータ) (2026-04-16T11:29:40Z) - LightThinker++: From Reasoning Compression to Memory Management [61.2260619973687]
大きな言語モデル(LLM)は複雑な推論において優れているが、その効率は長い思考トレースの認知的オーバーヘッドの増加によって制限される。
LLMが動的に中間的思考をコンパクトな意味表現に圧縮できる方法であるLightThinkerを提案する。
私たちはフレームワークをLightThinker++に進化させ、Explicit Adaptive Memory Managementを導入しました。
論文 参考訳(メタデータ) (2026-04-04T10:46:09Z) - Shorter Thoughts, Same Answers: Difficulty-Scaled Segment-Wise RL for CoT Compression [3.6889211112573985]
CoT(Chain-of- Thought)は推論の信頼性を向上させるが、トークンコストを増大させる。
ナイーブなRLベースの圧縮は、ユーザ対応の回答を好ましくないほど短縮することができる。
難スケールセグメンテーションワイズGRPOを提案する。
論文 参考訳(メタデータ) (2026-03-08T11:49:24Z) - Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning [47.87361916374891]
本稿では,チャンクワイズ圧縮と選択的メモリリコールに基づく,効率的な長文推論のためのフレームワークを提案する。
このフレームワークは、長い入力をチャンクに分割し、各チャンクを学習圧縮機を用いて圧縮されたメモリ表現に符号化する。
ピークGPUメモリ使用量の最大2倍の削減と,MemAgent上での6倍の推論高速化を実現している。
論文 参考訳(メタデータ) (2026-02-09T08:33:11Z) - Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression [55.63153956934198]
Chain-of-Thought (CoT)推論はLarge Language Models (LLMs)の推論能力をうまく向上させる
既存のCoT圧縮法は、しばしば高い圧縮比で論理的忠実度が著しく低下する。
本稿では,Extra-CoTと呼ばれる新しいEXTreme-RAtio Chain-of-Thought Compressionフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-09T06:57:15Z) - ReGuLaR: Variational Latent Reasoning Guided by Rendered Chain-of-Thought [49.203970812338916]
明示的な推論連鎖は、かなりの計算冗長性をもたらす。
近年の潜時推論法は、推理過程を潜時空間に圧縮することによりこれを緩和しようとする。
我々はRendered CoT-Guided Variational Latent Reasoning (ReGuLaR)を提案する。
論文 参考訳(メタデータ) (2026-01-30T17:08:06Z) - CtrlCoT: Dual-Granularity Chain-of-Thought Compression for Controllable Reasoning [29.057579417751203]
チェーン・オブ・シント(CoT)はLCM推論を改善するが、冗長なトレースによって高いレイテンシとメモリコストを発生させる。
セマンティック抽象化とトークンレベルのプルーニングを調和させるデュアルグラニュラリティCoT圧縮フレームワークである textbfCtrlCoT を提案する。
論文 参考訳(メタデータ) (2026-01-28T10:38:49Z) - UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression [86.33995240043936]
UniGistは、大規模言語モデルのためのシーケンスレベルのロングコンテキスト圧縮フレームワークである。
生のトークンを特別な圧縮トークン(gist)に微粒な方法で置き換えることで、コンテキスト情報を効率的に保存する。
提案手法は,圧縮トークンの実際の除去を可能にすることで,フレキシブルな推論もサポートしている。
論文 参考訳(メタデータ) (2025-09-19T08:47:37Z) - ThinkLess: A Training-Free Inference-Efficient Method for Reducing Reasoning Redundancy [8.962703809086628]
ThinkLessは推論効率のよいフレームワークで、推論生成を早期に終了し、モデルを変更することなく出力品質を維持する。
我々はThinkLessが完全長のChain-of-Thought(CoT)デコードに匹敵する精度を実現し,デコード時間とメモリ消費を大幅に削減することを示した。
論文 参考訳(メタデータ) (2025-05-21T15:58:16Z) - LightThinker: Thinking Step-by-Step Compression [74.34839026338342]
提案するLightThinkerは,大規模言語モデルを用いて推論中の中間的思考を動的に圧縮する手法である。
人間の認知プロセスにインスパイアされたLightThinkerは、思考ステップをコンパクトな表現に圧縮し、元の推論チェーンを捨てる。
実験によると、LightThinkerは競合精度を維持しながら、ピークメモリ使用量と推論時間を短縮する。
論文 参考訳(メタデータ) (2025-02-21T16:57:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。