論文の概要: InfoDensity: Rewarding Information-Dense Traces for Efficient Reasoning
- arxiv url: http://arxiv.org/abs/2603.17310v1
- Date: Wed, 18 Mar 2026 03:11:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-19 18:32:57.492277
- Title: InfoDensity: Rewarding Information-Dense Traces for Efficient Reasoning
- Title(参考訳): 情報密度:効率的な推論のための情報密度トレースのリワード
- Abstract要約: 冗長性は単に長さの問題ではなく、中間的推論品質の低下の症状であると主張する。
本稿では,AUCに基づく報酬と単調報酬を組み合わせたRLトレーニングのための報奨フレームワークであるInfoDensityを,推論品質の統一尺度として提案する。
- 参考スコア(独自算出の注目度): 36.37924312794855
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) with extended reasoning capabilities often generate verbose and redundant reasoning traces, incurring unnecessary computational cost. While existing reinforcement learning approaches address this by optimizing final response length, they neglect the quality of intermediate reasoning steps, leaving models vulnerable to reward hacking. We argue that verbosity is not merely a length problem, but a symptom of poor intermediate reasoning quality. To investigate this, we conduct an empirical study tracking the conditional entropy of the answer distribution across reasoning steps. We find that high-quality reasoning traces exhibit two consistent properties: low uncertainty convergence and monotonic progress. These findings suggest that high-quality reasoning traces are informationally dense, that is, each step contributes meaningful entropy reduction relative to the total reasoning length. Motivated by this, we propose InfoDensity, a reward framework for RL training that combines an AUC-based reward and a monotonicity reward as a unified measure of reasoning quality, weighted by a length scaling term that favors achieving equivalent quality more concisely. Experiments on mathematical reasoning benchmarks demonstrate that InfoDensity matches or surpasses state-of-the-art baselines in accuracy while significantly reducing token usage, achieving a strong accuracy-efficiency trade-off.
- Abstract(参考訳): 拡張推論能力を持つ大規模言語モデル(LLM)はしばしば冗長で冗長な推論トレースを生成し、不要な計算コストを発生させる。
既存の強化学習アプローチでは、最終応答長を最適化することでこの問題に対処するが、中間推論ステップの品質を無視し、モデルに報酬のハッキングの脆弱性を負わせている。
冗長性は単に長さの問題ではなく、中間的推論品質の低下の症状であると主張する。
そこで本研究では,解答分布の条件エントロピーを理論的に追跡する実験を行った。
高品質な推論トレースは、低不確実性収束と単調な進行という2つの一貫した性質を示す。
これらの結果から,高品質な推論トレースは情報密度が高いことが示唆され,各ステップは総推論長に対して有意なエントロピー減少に寄与することがわかった。
そこで我々は,AUCに基づく報酬と単調報酬を組み合わせたRLトレーニングの報奨フレームワークであるInfoDensityを提案する。
数学的推論ベンチマークの実験では、InfoDensityは最先端のベースラインを精度で一致または超過し、トークンの使用を著しく削減し、高い精度と効率のトレードオフを実現する。
関連論文リスト
- ChainPrune: Evaluating and Reducing Redundancy in Long Chain-of-Thought Reasoning [48.3829293800053]
そこで我々は,新しい推論経路意味構造最適化法ChainPruneを提案する。
我々は,自己生成的推論経路を木構造に集約し,その後に複数基準の優越的経路選択プロセスを行う。
我々は、DPOに基づく選好学習手法と教師付き損失を併用し、効果的に偽報酬抑制を緩和する。
論文 参考訳(メタデータ) (2026-08-22T09:09:05Z) - Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning [42.17614767170884]
そこで本研究では,入力からテキストを推論トレースに広範囲にコピーする手法を提案する。
各プロンプトをタスク関連キーエビデンスと無関係インタプタコンテキストに分離することにより,根本原因が不十分であることを示す。
この診断に触発されたGEARは,キーエビデンスと重複するグラウンドング報酬と無関係な文脈と重複するイントラクタペナルティを付与し,精度を向上する報酬形成手法である。
論文 参考訳(メタデータ) (2026-07-21T17:59:21Z) - Stabilizing Efficient Reasoning with Step-Level Advantage Selection [54.563811052329235]
我々は,長さを意識しない標準のGRPOを用いて,短文のポストトレーニング単独で,すでにかなりの推理圧縮を誘導していることを示す。
そこで本稿では, 適切なロールアウトにおける低信頼度ステップと, 検証済みロールアウトにおける高信頼度ステップにゼロアドバンテージを割り当てるステップレベルアドバンテージ選択(SAS)を提案する。
論文 参考訳(メタデータ) (2026-04-27T03:34:59Z) - Pause or Fabricate? Training Language Models for Grounded Reasoning [50.104657152302956]
不完全情報に基づくグラウンドド推論のために,対話型強化学習(GRIL)によるグラウンドド推論を提案する。
GRILは推論プロセスを2つの段階に分解する: 明確化と一時停止、利用可能な情報が十分かどうかを識別する。
GSM8K-InsufficientおよびMetaMATH-Insufficientの実験では、GRILは前提検出を大幅に改善し(最大45%)、平均応答長を20%以上削減しながらタスク成功率が30%向上した。
論文 参考訳(メタデータ) (2026-04-21T16:45:29Z) - Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning [66.22060690012512]
大規模な推論モデルは、より多くのテストタイム計算で改善されるが、しばしば過大評価され、正確さを向上することなくコストを上昇させる必要のない長い連鎖を生み出す。
本研究は,本質的な貢献に基づいて,ステップ間の長さ短縮を割り当てる,きめ細かいフレームワークであるSWAPを提案する。
論文 参考訳(メタデータ) (2026-02-27T20:23:59Z) - ReGuLaR: Variational Latent Reasoning Guided by Rendered Chain-of-Thought [49.203970812338916]
明示的な推論連鎖は、かなりの計算冗長性をもたらす。
近年の潜時推論法は、推理過程を潜時空間に圧縮することによりこれを緩和しようとする。
我々はRendered CoT-Guided Variational Latent Reasoning (ReGuLaR)を提案する。
論文 参考訳(メタデータ) (2026-01-30T17:08:06Z) - In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback [38.915062716409686]
InTROはトークンレベルの探索と,正確かつ簡潔な推論のための自己フィードバックを可能にする,新たなフレームワークである。
InTROは他のベースラインを一貫して上回り、ベースモデルと比較して解の精度を最大20%向上させる。
その思考の連鎖は明らかに簡潔であり、冗長性が低下している。
論文 参考訳(メタデータ) (2025-11-13T01:47:06Z) - AALC: Large Language Model Efficient Reasoning via Adaptive Accuracy-Length Control [18.273777938294327]
大きな推論モデル(LRM)は、長いチェーン・オブ・シークレットを生成することで印象的な推論能力を達成する。
我々は、強化学習に組み込まれた軽量で精度の高い長さの報酬であるALCを紹介する。
提案手法は,元の精度を維持したり改善したりしながら,応答長を50%以上削減することを示す。
論文 参考訳(メタデータ) (2025-06-25T06:29:18Z) - ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation [74.37307916314407]
提案するフレームワークはConciseHintと呼ばれ,推論モデルが簡潔に話すことを継続的に奨励する。
DeepSeek-R1 および Qwen-3 シリーズを含む最先端の LRM 実験により,本手法が簡潔な推論を効果的に生成できることが実証された。
論文 参考訳(メタデータ) (2025-06-23T16:20:44Z) - Think Clearly: Improving Reasoning via Redundant Token Pruning [57.01254508252785]
推論過程における冗長性を意図的に除去することで、性能が大幅に向上することを示す。
本手法は, 推論集約型ベンチマークにおいて, トレーニングを伴わずに, 全体的な精度を著しく向上することを示した。
論文 参考訳(メタデータ) (2025-06-17T06:04:01Z) - Think or Not? Exploring Thinking Efficiency in Large Reasoning Models via an Information-Theoretic Lens [51.90059610606049]
本稿では,情報理論レンズによる推論プロセスの効率を再考する。
本稿では,理想的な推論経路と段階的な情報提供から分岐を定量化するために,InfoBias と InfoGain という2つの指標を提案する。
これらの知見に触発されて,信頼度が十分に高ければ推論を動的に停止する,エントロピーに基づく適応的思考戦略を導入する。
論文 参考訳(メタデータ) (2025-05-23T13:38:56Z) - Concise Reasoning via Reinforcement Learning [13.657506042120167]
我々は強化学習(RL)の中核的原則を再考する。
簡潔さと正確さの自然な相関関係を明らかにする。
RLトレーニングの二次段階の導入は、非常に小さな問題セットを用いて、思考の連鎖を著しく減少させることが示される。
論文 参考訳(メタデータ) (2025-04-07T15:35:54Z) - Verbosity-Aware Rationale Reduction: Effective Reduction of Redundant Rationale via Principled Criteria [18.612187958340407]
大規模言語モデル(LLM)は、最終回答の品質を高めるために、広範囲な中間推論単位(トークン、文など)を生成することに依存する。
トークンレベルの削減を明確な基準なしで適用する従来の手法は、完全に合理的に訓練されたモデルと比較して、性能が劣る。
本稿では,冗長な推論文を識別・除去するために,確率に基づく基準,冗長性を活用した文レベルの合理的化フレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-30T15:15:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。