論文の概要: EvoThink: Evolving Thinking in Large Reasoning Models via Self-Pruning and Aha-Moment Preference Optimization
- arxiv url: http://arxiv.org/abs/2607.19962v1
- Date: Wed, 22 Jul 2026 09:40:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.049595
- Title: EvoThink: Evolving Thinking in Large Reasoning Models via Self-Pruning and Aha-Moment Preference Optimization
- Title(参考訳): EvoThink: 自己計画とAha-Moment優先最適化による大規模推論モデルにおける思考の進化
- Abstract要約: 大規模な推論モデル(LRM)は、冗長な検証ステップのために過度に検討されることが多い。
冗長な検証を減らし,新たな推論経路の探索を促すフレームワークであるEvoThinkを提案する。
- 参考スコア(独自算出の注目度): 23.37325724250601
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Reasoning Models (LRMs) often suffer from overthinking due to redundant verification steps. Existing approaches for mitigating overthinking, such as fast-slow thinking switching and reasoning trajectory compression, fail to make a fine-grained distinction between beneficial and redundant steps within the LRM's reasoning process, and may thus impair reasoning capability in their pursuit of efficiency. To simultaneously improve reasoning efficiency and capability, we propose EvoThink, a framework that reduces redundant verification and encourages the exploration of new reasoning paths. EvoThink comprises two key components: Self-Pruning Training (SPT), an unsupervised method that iteratively prunes redundant reasoning steps and self-trains on the concise trajectories; and Aha-Moment Preference Optimization (AMPO), which, inspired by genetic algorithms, identifies valuable failed reasoning attempts, synthesizes from-wrong-to-right aha-moment data, and optimizes the model to internalize this reasoning pattern. Extensive evaluations across mathematical reasoning and code generation benchmarks demonstrate that EvoThink not only substantially reduces inference-time token usage but also improves the reasoning capability of LRMs.
- Abstract(参考訳): 大規模な推論モデル(LRM)は、冗長な検証ステップのために過度に検討されることが多い。
高速スロー思考の切り替えや軌道圧縮の推論といった、既存の過度な思考を緩和するためのアプローチは、LRMの推論プロセスにおける有益ステップと冗長ステップを微妙に区別することができないため、効率の追求において推論能力を損なう可能性がある。
EvoThinkは冗長な検証を減らし,新たな推論経路の探索を促すフレームワークである。
EvoThinkは、簡潔な軌道上で冗長な推論ステップと自己訓練を反復的に引き起こす教師なしの方法であるSelf-Pruning Training (SPT)と、遺伝的アルゴリズムにインスパイアされたAha-Moment Preference Optimization (AMPO)の2つの重要なコンポーネントで構成されている。
数学的推論とコード生成のベンチマークによる広範囲な評価は、EvoThinkが推論時トークンの使用を著しく削減するだけでなく、LRMの推論能力も改善していることを示している。
関連論文リスト
- ChainPrune: Evaluating and Reducing Redundancy in Long Chain-of-Thought Reasoning [48.3829293800053]
そこで我々は,新しい推論経路意味構造最適化法ChainPruneを提案する。
我々は,自己生成的推論経路を木構造に集約し,その後に複数基準の優越的経路選択プロセスを行う。
我々は、DPOに基づく選好学習手法と教師付き損失を併用し、効果的に偽報酬抑制を緩和する。
論文 参考訳(メタデータ) (2026-08-22T09:09:05Z) - CiPO: Counterfactual Unlearning for Large Reasoning Models through Iterative Preference Optimization [54.774620283208776]
大きな推論モデル(LRM)は、複雑な問題に対処するための長いチェーン・オブ・シント(CoT)推論を強調する。
既存の方法は、CoTトレースから望ましくない知識を完全に排除するか、推論プロセスへの干渉によって推論性能を低下させるかのいずれかである。
LRMにおけるCoT推論の目的的介入として、非学習を再定義する新しいフレームワークである反復的選好最適化(CiPO)を通じて、対実的アンラーニングを導入する。
論文 参考訳(メタデータ) (2026-04-17T08:56:36Z) - When Is Thinking Enough? Early Exit via Sufficiency Assessment for Efficient Reasoning [52.21239821135325]
本稿では、効率的な推論のための新しいフレームワークDTSR(Dynamic Thought Sufficiency in Reasoning)を紹介する。
人間のメタ認知にインスパイアされたDTSRは、リフレクションシグナルモニタリングとThought Sufficiency Checkという2つの段階で動作する。
DTSRは推論長を28.9%から34.9%削減し、性能損失を最小限に抑えている。
論文 参考訳(メタデータ) (2026-04-08T07:56:28Z) - Does Your Reasoning Model Implicitly Know When to Stop Thinking? [45.954548163594204]
LRMは思考を止めるための適切な時間を暗黙的に知っているが、この能力は現在のサンプリングパラダイムによって隠蔽されている。
そこで我々は,この効率的な推論可能性を解き放つ新しいサンプリングパラダイムであるSAGEを紹介した。
論文 参考訳(メタデータ) (2026-02-09T07:38:22Z) - Promoting Efficient Reasoning with Verifiable Stepwise Reward [7.385337642642193]
大規模推論モデル(LRM)は近年、強化学習によって支援された複雑な推論タスクにおいて大きな進歩を遂げている。
LRMは、単純な問題に対する過度な計算を過度に行い、効率を低下させることにしばしば悩まされる。
本稿では,中間状態の推論軌道における性能に基づいて報酬を割り当てる,ルールベースで検証可能なステップワイド報酬機構(VSRM)を提案する。
論文 参考訳(メタデータ) (2025-08-14T02:43:53Z) - Exploring and Exploiting the Inherent Efficiency within Large Reasoning Models for Self-Guided Efficiency Enhancement [101.77467538102924]
大きな推論モデル(LRM)は、効率を阻害し、推論コストを膨らませる過剰な考えを示す。
LRM効率を向上させるための2つの軽量手法を提案する。
まず,学習不要なアクティベーションステアリング技術であるEfficic Steeringを導入する。
第2に,タスクの正確さと簡潔さを動的にバランスする強化学習フレームワークである自己回帰効率RLを開発する。
論文 参考訳(メタデータ) (2025-06-18T17:18:12Z) - Don't Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models [68.96619605651155]
大規模推論モデル(LRM)は、過度に考えることによって出力長を大幅に増加させる可能性がある。
モデル生成推論経路を異なる思考パターンに分割する動的最適化フレームワークを提案する。
提案手法は, 最大12%の精度向上を実現し, トークン使用量を約5,000から3,000に削減する。
論文 参考訳(メタデータ) (2025-05-27T20:59:29Z) - Let LRMs Break Free from Overthinking via Self-Braking Tuning [68.93713497579853]
大きな推論モデル(LRM)は思考の長い連鎖を生成することによって推論能力を著しく向上させた。
この性能向上は、生成プロセス中の冗長な推論を大幅に増加させるコストが伴う。
本稿では、モデルが独自の推論プロセスを制御することを許容する観点から、過度に検討する新しいフレームワーク、Self-Braking Tuning(SBT)を提案する。
論文 参考訳(メタデータ) (2025-05-20T16:53:40Z) - Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models [49.61246073215651]
大規模言語モデル(LLM)は複雑なタスクにおいて顕著な機能を示した。
OpenAI o1とDeepSeek-R1の最近の進歩は、System-2推論ドメインのパフォーマンスをさらに改善した。
しかし、冗長な出力と冗長な出力による計算オーバーヘッドも大幅に発生する。
論文 参考訳(メタデータ) (2025-03-20T17:59:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。