Fugu-MT 論文翻訳(概要): IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning

論文の概要: IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning

arxiv url: http://arxiv.org/abs/2602.19049v1
Date: Sun, 22 Feb 2026 05:30:14 GMT
ステータス: 翻訳完了
システム内更新日: 2026-02-24 17:42:02.459209
Title: IAPO: Information-Aware Policy Optimization for Token-Efficient Reasoning
Title（参考訳）: IAPO:Token-Efficient Reasoningのための情報認識ポリシー最適化
Authors: Yinhan He, Yaochen Zhu, Mingjia Shi, Wendy Zheng, Lin Su, Xiaoqing Wang, Qi Guo, Jundong Li,
Abstract要約: 既存のシーケンスレベルの報酬形成手法はトークン間での推論の取り組みを限定的に制御できると主張している。我々は,各トークンの条件付き相互情報に基づいてトークンの利点を割り当てる情報理論後学習フレームワークIAPOを提案する。 IAPOは推論精度を常に改善し、推論長を最大36%削減し、既存のトークン効率のRL法より優れている。
参考スコア（独自算出の注目度）: 47.55414301744048
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Large language models increasingly rely on long chains of thought to improve accuracy, yet such gains come with substantial inference-time costs. We revisit token-efficient post-training and argue that existing sequence-level reward-shaping methods offer limited control over how reasoning effort is allocated across tokens. To bridge the gap, we propose IAPO, an information-theoretic post-training framework that assigns token-wise advantages based on each token's conditional mutual information (MI) with the final answer. This yields an explicit, principled mechanism for identifying informative reasoning steps and suppressing low-utility exploration. We provide a theoretical analysis showing that our IAPO can induce monotonic reductions in reasoning verbosity without harming correctness. Empirically, IAPO consistently improves reasoning accuracy while reducing reasoning length by up to 36%, outperforming existing token-efficient RL methods across various reasoning datasets. Extensive empirical evaluations demonstrate that information-aware advantage shaping is a powerful and general direction for token-efficient post-training. The code is available at https://github.com/YinhanHe123/IAPO.
Abstract（参考訳）: 大規模言語モデルは、正確性を改善するために考えられた長い連鎖にますます依存している。我々はトークン効率のポストトレーニングを再考し、既存のシーケンスレベルの報酬形成手法はトークン間の推論の取り組みをどのように割り当てるかを限定的に制御できると主張している。このギャップを埋めるために,各トークンの条件付き相互情報(MI)に基づいてトークンの利点を割り当てる情報理論後学習フレームワークIAPOを提案する。これは、情報的推論のステップを特定し、低ユーティリティな探索を抑えるための、明示的で原則化されたメカニズムをもたらす。 IAPOは, 正当性を損なうことなく, 冗長性推論における単調性低下を誘導できることを示す理論的解析を行った。実証的には、IAPOは推論の精度を一貫して改善し、推論の長さを最大36%削減し、さまざまな推論データセットで既存のトークン効率のRLメソッドを上回っている。広汎な経験的評価は、情報認識による有利な整形がトークン効率の高いポストトレーニングのための強力で汎用的な方向であることを証明している。コードはhttps://github.com/YinhanHe123/IAPOで公開されている。

関連論文リスト

ENTRA: Entropy-Based Redundancy Avoidance in Large Language Model Reasoning [30.786062954495403]
大規模な推論モデル(LRM)は、単純なタスクであっても必要以上に長い推論チェーンを生成するため、過度に考え直されることが多い。本稿では,性能を保ちながら冗長な推論を抑制するエントロピーベースのトレーニングフレームワークであるENTRAを提案する。
論文参考訳（メタデータ） (2026-01-12T01:26:30Z)
In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback [38.915062716409686]
InTROはトークンレベルの探索と,正確かつ簡潔な推論のための自己フィードバックを可能にする,新たなフレームワークである。 InTROは他のベースラインを一貫して上回り、ベースモデルと比較して解の精度を最大20%向上させる。その思考の連鎖は明らかに簡潔であり、冗長性が低下している。
論文参考訳（メタデータ） (2025-11-13T01:47:06Z)
Distribution Preference Optimization: A Fine-grained Perspective for LLM Unlearning [26.120338506874976]
モデルユーティリティ全体を維持しながら、特定のデータの影響を取り除くことを目的としたアンラーニングは、重要な研究領域になりつつある。 textbfDistribution textbfPreference textbfOptimization (DiPO)と呼ばれる新しい未学習アルゴリズムを導出する。 DiPOはTOFUベンチマークで最高の品質を獲得し、MUSEベンチマークで主要なスケーラビリティと持続可能性を維持している。
論文参考訳（メタデータ） (2025-10-06T12:49:00Z)
HiPO: Hybrid Policy Optimization for Dynamic Reasoning in LLMs [54.16300997612526]
大規模言語モデル (LLM) は、複雑なタスクの正確性を改善するために、Chain-of-Thought (CoT) 推論にますます依存している。本稿では適応推論制御のフレームワークであるHybrid Policy Optimization(HiPO)を紹介する。数学とコーディングベンチマークによる実験は、HiPOがトークン長を大幅に削減し、正確性を維持したり改善したりすることを示した。
論文参考訳（メタデータ） (2025-09-28T16:46:12Z)
Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model [7.8354921036790275]
大きな推論モデル(LRM)は複雑な問題を解決するのに優れているが、過度なジレンマに直面している。単純なタスクを扱う場合、思考トークンがオーバーロードされた冗長なレスポンスを生成することが多い。これらのトークンは、リフレクションやバックトラックのような不要な高レベルの推論動作を引き起こし、効率を低下させる。
論文参考訳（メタデータ） (2025-06-30T13:30:33Z)
IGD: Token Decisiveness Modeling via Information Gain in LLMs for Personalized Recommendation [79.22388408461458]
我々は,トークン決定性をチューニングと復号の両方に統合する情報ゲインに基づく決定性対応トークンハンドリング(IGD)戦略を導入する。 IGDはリコメンデーションの精度を一貫して改善し、強力なベースラインに比べて広く使われているランキングの指標で顕著に向上した。
論文参考訳（メタデータ） (2025-06-16T08:28:19Z)
Think or Not? Exploring Thinking Efficiency in Large Reasoning Models via an Information-Theoretic Lens [51.90059610606049]
本稿では,情報理論レンズによる推論プロセスの効率を再考する。本稿では,理想的な推論経路と段階的な情報提供から分岐を定量化するために,InfoBias と InfoGain という2つの指標を提案する。これらの知見に触発されて,信頼度が十分に高ければ推論を動的に停止する,エントロピーに基づく適応的思考戦略を導入する。
論文参考訳（メタデータ） (2025-05-23T13:38:56Z)
Efficient Inference for Large Reasoning Models: A Survey [74.17203483365171]
LRM(Large Reasoning Models)は、Large Language Models(LLM)の推論能力を大幅に向上させる。しかし、それらの熟考的推論プロセスはトークンの使用、メモリ消費、推論時間に非効率をもたらす。本調査では, LRMに特化して設計された効率的な推論手法を概説し, 推論品質を維持しつつトークンの非効率を緩和することに着目した。
論文参考訳（メタデータ） (2025-03-29T13:27:46Z)
The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models [69.798277882245]
大規模言語モデルの推論効率を向上させるために,Unsupervised Prefix Fine-Tuning (UPFT)を導入した。 UPFTはラベル付きデータや徹底的なサンプリングの必要性を取り除く。実験の結果,UPFTは教師付き手法の性能と一致していることがわかった。
論文参考訳（メタデータ） (2025-03-04T18:56:03Z)
Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability [53.51560766150442]
臨界トークンは推論軌道内の要素であり、誤った結果に大きな影響を及ぼす。本稿では,これらのトークンをロールアウトサンプリングによって識別する新しいフレームワークを提案する。クリティカルトークンの識別と置換がモデル精度を大幅に向上させることを示す。
論文参考訳（メタデータ） (2024-11-29T18:58:22Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。