論文の概要: Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models
- arxiv url: http://arxiv.org/abs/2606.25519v2
- Date: Mon, 29 Jun 2026 20:25:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 13:50:27.692615
- Title: Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models
- Title(参考訳): 量子化は推論を膨らませる:低ビット推論モデルの隠れコストとしてのトークンインフレ
- Authors: Xinyu Lian, Walid Krichene, Beichen Huang, Masahiro Tanaka, Olatunji Ruwase, Li Zhang, Minjia Zhang,
- Abstract要約: 学習後量子化の低ビット化はテスト時間計算コストを隠蔽できることを示す。
INT4/INT3量子化は精度を保ちつつも、推論と推論の使用量を増加させ、期待されるトーケン毎のスピードアップを相殺することを発見した。
- 参考スコア(独自算出の注目度): 19.14957817129379
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Quantization is widely used to reduce the inference cost of large language models, but its effect on reasoning models is not fully captured by final-answer accuracy or per-token latency. We show that low-bit post-training quantization can introduce a hidden test-time compute cost: quantized reasoning models often generate longer chains of thought even when they still answer correctly. Across mathematical reasoning, code generation, scientific question answering, and agentic tool-use benchmarks, we find that INT4/INT3 quantization can preserve accuracy but increase reasoning-token usage, offsetting the expected per-token speedup. To measure this effect, we introduce the CoT Token Inflation Ratio, which compares reasoning length between quantized and full-precision models averaged across all evaluation benchmarks. We further show that token inflation is accompanied by behavioral changes in the reasoning trace, including more intermediate steps and greater semantic repetition. These changes translate into measurable end-to-end real-world serving penalties. Finally, we evaluate mitigation strategies and find that prompting and decoding-time sampling offer inconsistent accuracy-length trade-offs, while quantization-aware training shows more promise in reducing both accuracy degradation and token inflation. Our results suggest that reasoning-token usage should be reported alongside accuracy when evaluating quantized reasoning models.
- Abstract(参考訳): 量子化は大規模言語モデルの推論コストを削減するために広く用いられているが、推論モデルに対するその効果は、最終回答の正確さや単語毎のレイテンシによって完全には捉えられていない。
低ビット後量子化はテスト時間計算コストを隠蔽しうることを示す。
数学的推論,コード生成,科学的質問応答,エージェントツール使用ベンチマークなどを通じて,INT4/INT3量子化は精度を保ちつつも,推論による使用率を向上し,期待されるトーケン毎のスピードアップを相殺することを発見した。
この効果を測定するために,すべての評価ベンチマークで評価された量子化モデルと完全精度モデルの推論長を比較するCoT Token Inflation Ratioを導入する。
さらに、トークンのインフレーションには、より中間的なステップやより深い意味的反復を含む、推論トレースの行動変化が伴っていることを示す。
これらの変更は、測定可能なエンドツーエンドのサービスペナルティに変換される。
最後に、緩和戦略を評価し、復号時サンプリングが不整合な精度長トレードオフを提供するのに対して、量子化対応トレーニングは精度劣化とトークンインフレーションの両面においてより有望であることを示す。
この結果から,定量化推論モデルを評価する際には,精度と併用して推論・トークンの使用を報告すべきであることが示唆された。
関連論文リスト
- Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery [40.94400211806987]
生成プロセスの不安定性はトークン数を膨らませるため、2ビットのアグレッシブ推論がエンドツーエンドのスピードアップを達成できないことを示す。
Qwen3推論モデルの完全な推論トレースを数学的および常識的なベンチマークで分析する。
以上の結果から, 異常を制御可能な世代病理として扱うと, 極端に低ビット推論が現実的になることがわかった。
論文 参考訳(メタデータ) (2026-06-01T10:04:09Z) - Quantized Reasoning Models Think They Need to Think Longer, but They Do Not [20.88617888340002]
学習後量子化(PTQ)は大規模言語モデルを効率的に展開するために広く用いられているが、推論モデルへの影響はよく理解されていない。
数学、コーディング、科学のQAを通じて、攻撃的なPTQは、チェーン・オブ・ソート(CoT)の長さを増大させながら精度を低下させる。
量子化モデルの失敗の最大52%において、モデルは中間的推論ステップで正しい答えに達するが、最終的な答えとして出力しない。
論文 参考訳(メタデータ) (2026-05-29T18:00:00Z) - Decomposing Reasoning Efficiency in Large Language Models [2.4149105714758545]
我々はトークン効率を、固定されたトークン予算の下での完了、与えられた完了条件の正確性、冗長性といった、解釈可能な要因に分解する。
推論トレースが利用可能であれば、冗長だが拡張された推論からループを分離するために決定論的トレース品質尺度を追加します。
我々の分解は、異なる効率の介入を示唆する異なるボトルネックプロファイルを明らかにします。
論文 参考訳(メタデータ) (2026-02-10T14:09:18Z) - Arbitrage: Efficient Reasoning via Advantage-Aware Speculation [71.45710345765528]
投機的復号化は、高速だが不正確なドラフトモデルを用いて推論を加速し、自動回帰的にトークンを提案する。
しかし、意味論的に等価なステップにおけるトークンミスマッチによる不要な拒絶のため、従来のトークンレベルの投機的デコーディングは、タスクの推論に苦労する。
提案するArbitrageは,ドラフトモデルとターゲットモデルとの相対的優位性に基づいて動的に生成をルーティングする,新しいステップレベルの投機生成フレームワークである。
論文 参考訳(メタデータ) (2025-12-04T17:50:53Z) - TokenSqueeze: Performance-Preserving Compression for Reasoning LLMs [57.217593337454026]
TokenSqueezeは、パフォーマンスを保ち、自己生成データにのみ依存しながら推論パスを凝縮する新しいLong2Shortメソッドである。
TokenSqueeze は MATH500 ベンチマークの精度を維持しながらトークンの使用量を削減できることを示す。
論文 参考訳(メタデータ) (2025-11-17T10:38:56Z) - Learning to Reason Efficiently with Discounted Reinforcement Learning [57.28725125116862]
大きな推論モデル(LRM)は、しばしば過剰なトークンを消費し、計算コストと遅延を膨らませる。
より長い応答によって精度が向上するという仮定に挑戦する。
割引強化学習装置(小額のトークンコストと解釈できる)を用いた推論トークンのペナルティ化と、制限された政策クラスにおけるブラックウェル最適性の分析により、簡潔で正確な推論を奨励する。
論文 参考訳(メタデータ) (2025-10-27T16:17:45Z) - Entropy After $\langle \texttt{/Think} \rangle$ for reasoning model early exiting [38.93424884988798]
正しい解に到達した後も、回答を再検討し続けながら、大きな推論モデルが過大評価されていることを示す。
We propose Entropy After /Think> (EAT) for monitoring and decide whether to exit reasoning early。
EATは、正確性を損なうことなく、トークン使用量を13~21%削減する。
論文 参考訳(メタデータ) (2025-09-30T16:59:37Z) - Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations [83.93566096400723]
ランダムにサンプリングされたトークン化が与えられた場合、命令調整されたモデルは元の性能の最大93.4%を維持している。
文字レベルのセグメンテーションは文字列操作とコード理解タスクを最大+14%改善する。
右列桁のグルーピングは、大数の算術を+33%向上させる。
論文 参考訳(メタデータ) (2025-06-23T18:02:26Z) - Token-Supervised Value Models for Enhancing Mathematical Problem-Solving Capabilities of Large Language Models [56.32800938317095]
既存の検証器はテスト時の木探索技術に準最適である。
トークン制御値モデル(TVM)を提案する。
TVMは各トークンに、正しい最終回答に達する確率を反映した確率を割り当てる。
論文 参考訳(メタデータ) (2024-07-12T13:16:50Z) - AQD: Towards Accurate Fully-Quantized Object Detection [94.06347866374927]
本稿では,浮動小数点演算を除去するために,AQDと呼ばれる高精度な量子化オブジェクト検出ソリューションを提案する。
我々のAQDは、非常に低ビットのスキームの下での完全精度と比較して、同等またはそれ以上の性能を実現しています。
論文 参考訳(メタデータ) (2020-07-14T09:07:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。