論文の概要: CAT: Confidence-Adaptive Thinking for Efficient Reasoning of Large Reasoning Models
- arxiv url: http://arxiv.org/abs/2607.00862v1
- Date: Wed, 01 Jul 2026 12:27:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.889675
- Title: CAT: Confidence-Adaptive Thinking for Efficient Reasoning of Large Reasoning Models
- Title(参考訳): CAT:大規模推論モデルの効率的な推論のための信頼性適応思考
- Abstract要約: CAT(Confidence-Adaptive Thinking)は、モデル固有の自己確実性信号の信頼性を優先最適化プロセスに組み込むフレームワークである。
我々の研究により、LRMは不確実なことを検討しながら、信頼性の高い応答を効果的に圧縮することができ、実用的な産業シナリオにおける精度とレイテンシのバランスをとるための、潜在的に堅牢なソリューションを提供する。
- 参考スコア(独自算出の注目度): 18.894895416263296
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Reasoning Models (LRMs) have achieved remarkable success on complex tasks by leveraging long chain-of-thought (CoT) trajectories, yet they frequently exhibit overthinking on simple queries, resulting in significant token overhead and reduced inference efficiency. However, existing compression methods predominantly apply uniform length reduction or rely on coarse-grained difficulty estimation, often leading to performance degradation on difficult problems. To address this limitation, we propose Confidence-Adaptive Thinking (CAT), a framework that incorporates the model's intrinsic self-certainty signals as confidence into the preference optimization process, which autonomously modulates reasoning lengths based on problem difficulty. Experimental results show that CAT consistently outperforms state-of-the-art baselines on reasoning accuracy across multiple benchmarks on different base models. Our work enables LRMs to effectively compress confident responses while deliberating on uncertain ones, offering a potentially robust solution for balancing accuracy and latency in practical industrial scenarios.
- Abstract(参考訳): 大規模推論モデル(LRM)は、長いチェーン・オブ・シークレット(CoT)トラジェクトリを活用することで複雑なタスクにおいて顕著な成功を収めたが、単純なクエリを過度に検討し、トークンのオーバーヘッドが大きくなり、推論効率が低下する。
しかし,従来の圧縮法では,一様長の削減や粗粒度の難易度推定に大きく依存しており,しばしば難易度が低下する。
この制限に対処するために,本モデル固有の自己確実性信号の信頼性を優先最適化プロセスに組み込んだフレームワークである信頼適応思考(CAT)を提案する。
実験結果から、CATは、異なるベースモデル上の複数のベンチマークにおいて、推論精度において、最先端のベースラインを一貫して上回ることを示した。
我々の研究により、LRMは不確実なことを検討しながら、信頼性の高い応答を効果的に圧縮することができ、実用的な産業シナリオにおける精度とレイテンシのバランスをとるための、潜在的に堅牢なソリューションを提供する。
関連論文リスト
- Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning [87.18590662029432]
本稿では,プロアクティブルーティングパラダイムであるPRPを提案する。このパラダイムは,ドラフトモデルとターゲットモデルの両方の能力を評価することで,早期意思決定を可能にする。
筆者らの試案であるレーティング学習 (DRL) は内部信頼度推定器を内蔵し, 共同レーティング学習 (JRL) は対象モデルが与えられたクエリをどの程度処理できるかを予測する。
これらの評価により、詳細なインスタンスレベルの textbfProactive Routing が可能になり、全体的なパフォーマンスを損なうことなく、推論を大幅に高速化できる。
論文 参考訳(メタデータ) (2026-06-29T12:30:24Z) - SuCo: Sufficiency-guided Continuous Adaptive Reasoning [59.17222918775686]
大型共振モデル(LRM)は、しばしば超長鎖(CoT)を生成する。
この非効率を緩和するための既存の取り組みは、通常、個別の推論モードや固定予算層に依存します。
我々は,CoTトラジェクトリの最短接頭辞として定義された最小サフィシエント CoT (MSC) を導入する。
論文 参考訳(メタデータ) (2026-06-16T08:52:15Z) - Better, Faster: Harnessing Self-Improvement in Large Reasoning Models [88.9107786925265]
本稿では,2つの単純なyet- Effectiveアプローチにより,大規模推論モデルにおける自己改善を効果的に促進するHSIRを提案する。
具体的には、HSIRはデータの不均衡を軽減するために、検証済みの外部サンプリング戦略を導入する。
HSIRはまた、望ましくないソリューションを定量化しフィルタリングするために、固有の多様性スコアも設計している。
論文 参考訳(メタデータ) (2026-05-24T10:54:46Z) - LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models [24.128148876541783]
OpenAI o1やDeepSeek-R1のような大きな推論モデルは、推論能力が向上するにつれて、次第に冗長になりがちである。
これらの拡張されたChain-of-Length trajectories(CoT)は、根底にある問題、無駄な計算、レイテンシ、コンテキスト予算を超えることが多い。
静的をオンラインの自己適応機構に置き換える手法であるLEAD(Thought-Efficient Adaptive and Dynamic reasoning)を提案する。
論文 参考訳(メタデータ) (2026-05-10T23:05:02Z) - DiSCTT: Consensus-Guided Self-Curriculum for Efficient Test-Time Adaptation in Reasoning [0.5371337604556311]
TestTTは、テストタイム最適化戦略を割り当てる、困難に認識され、コンセンサスに導かれるセルフカリキュラムフレームワークである。
TestTTが強い計算ベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-05T16:38:50Z) - ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning [2.1461777157838724]
ReasonBENCHは,大規模言語モデル(LLM)推論における基盤不安定性を定量化する最初のベンチマークである。
異なる領域からのタスク全体で、推論戦略とモデルの大部分は高い不安定性を示す。
我々はさらに、解答率と安定性のトレードオフに対するプロンプト、モデル家族、スケールの影響を解析する。
論文 参考訳(メタデータ) (2025-12-08T18:26:58Z) - The Virtues of Brevity: Avoid Overthinking in Parallel Test-Time Reasoning [0.7874708385247352]
最短解を選択するための単純かつ直感的手法は極めて有効であることを示す。
このアプローチが自己整合性などの複雑な手法と競合していることを確認する。
論文 参考訳(メタデータ) (2025-10-24T00:47:17Z) - Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression [68.69801176669843]
本稿では,冗長なステップを誘発し,難易度を推定するオンラインポストトレーニングRL手法を提案する。
TRAAC(Think Right with Adaptive, Attentive Compression)は、絶対精度が平均8.4%向上する。
我々のモデルは数学データセットに基づいて訓練されているが、分布外データセットの精度と効率性を示す。
論文 参考訳(メタデータ) (2025-10-02T02:00:20Z) - Prolonged Reasoning Is Not All You Need: Certainty-Based Adaptive Routing for Efficient LLM/MLLM Reasoning [27.498043430208085]
チェーン・オブ・ソート(CoT)推論への過剰依存はモデル性能を損なう可能性がある。
我々はCAR(Adaptive Reasoning)を提案する。
CARは、モデルの難易度に基づいて、短い回答と長い形式の推論を切り替える。
論文 参考訳(メタデータ) (2025-05-21T06:20:17Z) - Scalable Chain of Thoughts via Elastic Reasoning [61.75753924952059]
Elastic Reasoningは、スケーラブルな思考の連鎖のための新しいフレームワークである。
推論は、独立して割り当てられた予算で、思考と解決の2つのフェーズに分けられる。
我々のアプローチは、制約のない設定でもより簡潔で効率的な推論をもたらす。
論文 参考訳(メタデータ) (2025-05-08T15:01:06Z) - ConCISE: Confidence-guided Compression in Step-by-step Efficient Reasoning [64.93140713419561]
大型推論モデル (LRM) は、Chain-of-Thought (CoT) による複雑な推論タスクで強く機能するが、しばしば冗長な出力に悩まされる。
既存の微調整ベースの圧縮手法は、ポストホックプルーニングを動作させるか、コヒーレンスを推論する破壊を危険にさらすか、サンプリングベースの選択に依存するかのいずれかである。
ConCISEは、簡潔な推論連鎖を生成するために設計されたフレームワークであり、信頼注入を統合して推論の信頼性を高める。
論文 参考訳(メタデータ) (2025-05-08T01:40:40Z) - Scalable Best-of-N Selection for Large Language Models via Self-Certainty [75.1351701045874]
Best-of-N selectionは、Large Language Models(LLMs)の推論性能を改善するための重要なテクニックである。
本稿では, LLM出力の固有確率分布を利用して, 外部報酬モデルを必要としない応答品質を推定する, 新規で効率的な指標である自己確実性を提案する。
本研究は, LLM推論能力を向上させるための実用的で効率的な方法として, 自己確実性を確立した。
論文 参考訳(メタデータ) (2025-02-25T19:08:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。