論文の概要: HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs
- arxiv url: http://arxiv.org/abs/2605.28398v1
- Date: Wed, 27 May 2026 12:35:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:56.048141
- Title: HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs
- Title(参考訳): HRBench:ハイブリッド推論LDMにおけるシンキングモードスイッチ戦略のベンチマークと理解
- Authors: Yansong Ning, Mianpeng Liu, Jingwen Ye, Weidong Zhang, Hao Liu,
- Abstract要約: 本稿では,ハイブリッド推論 LLM における思考モードスイッチングの研究のための統合評価フレームワークHRBenchを紹介する。
HRBenchは,3つのスイッチング戦略ファミリ,プロンプトベースの選択,外部ルーティング,投機的実行という,2つの軸に沿って設計空間を編成する。
Qwen3.5-2B から Kimi-K2.5-1.1T までの6つの LLM と、数学、科学、およびコードをカバーする5つの推論ベンチマークを評価した。
- 参考スコア(独自算出の注目度): 24.56687265111928
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hybrid-reasoning large language models (LLMs) expose explicit controls over reasoning effort, allowing users or systems to trade off answer quality against inference cost. However, existing methods for adaptive thinking-mode selection are typically evaluated under different models, datasets, and implementation assumptions, making it difficult to compare their practical behavior. We introduce HRBench, a unified evaluation framework for studying thinking-mode switching in hybrid-reasoning LLMs. HRBench organizes the design space along two axes: three switching strategy families, prompt-based selection, external routing, and speculative execution, and four training regimes, training-free, SFT, offline and online RL, yielding 12 controlled evaluation settings. We evaluate these settings across 6 LLMs, from Qwen3.5-2B to Kimi-K2.5-1.1T, and 5 reasoning benchmarks covering mathematics, science, and code, while reimplementing 12+ representative prior methods within the same pipeline. Our analysis characterizes how different switching strategies occupy distinct effectiveness-efficiency trade-off regions: prompt-based methods often provide favorable token-accuracy trade-offs, routing methods offer more stable cost reduction, and speculative methods tend to improve accuracy at higher token cost. We further find that training affects strategies differently, and that the preferred strategy varies with model scale and task domain. HRBench provides reference implementations and a unified evaluation platform to support more controlled research on efficient reasoning in hybrid-reasoning LLMs. Our data, code and repository are available at https://github.com/usail-hkust/HRBench.
- Abstract(参考訳): ハイブリッド推論型大規模言語モデル(LLM)は、推論作業に対する明示的なコントロールを公開し、ユーザやシステムが推論コストに対して応答品質をトレードオフできるようにする。
しかしながら、適応的な思考モード選択のための既存の手法は、通常、異なるモデル、データセット、実装の前提の下で評価されるため、それらの実践的振る舞いを比較することは困難である。
本稿では,ハイブリッド推論 LLM における思考モードスイッチングの研究のための統合評価フレームワークHRBenchを紹介する。
HRBenchは,3つのスイッチング戦略ファミリ,プロンプトベースの選択,外部ルーティング,投機的実行,トレーニングフリー,SFT,オフライン,オンラインRLの4つのトレーニング体制,12のコントロールされた評価設定という,2つの軸に沿って設計空間を編成する。
Qwen3.5-2B から Kimi-K2.5-1.1T までの6つの LLM にまたがってこれらの設定を評価し、同じパイプライン内で 12 以上の代表的事前メソッドを再実装しながら、数学、科学、コードをカバーする5つの推論ベンチマークを行った。
我々の分析では、異なる切替戦略が異なる有効効率トレードオフ領域をどのように占めているかを特徴付けている: プロンプトベースの手法は、しばしば好適なトークン精度トレードオフを提供し、ルーティング手法は、より安定したコスト削減を提供し、投機的手法は、より高いトークンコストで精度を向上させる傾向がある。
さらに、トレーニングが戦略に異なる影響を及ぼし、望ましい戦略がモデルスケールやタスクドメインによって異なることが分かりました。
HRBenchは参照実装と統一評価プラットフォームを提供し、ハイブリッド推論LLMにおける効率的な推論に関するより制御された研究を支援する。
私たちのデータ、コード、リポジトリはhttps://github.com/usail-hkust/HRBench.orgで公開されています。
関連論文リスト
- PARM: Pipeline-Adapted Reward Model [60.769414637325326]
リワードモデル(RM)は、大規模言語モデル(LLM)を人間の好みと整合させることの中心であり、高度な復号化戦略を推進している。
これまでの作業はシングルステップ生成に重点を置いていたが、現実のアプリケーションはますますマルチステージパイプラインを採用するようになっている。
我々は、最適化のためのコード生成を通じてこれを調査し、報酬モデルを定式化とソリューション段階の両方に統合するパイプラインを構築する。
論文 参考訳(メタデータ) (2026-04-20T14:29:08Z) - Strategy Executability in Mathematical Reasoning: Leveraging Human-Model Differences for Effective Guidance [86.46794021499511]
戦略利用と戦略実行可能性の間には、これまで未定のギャップがある。
SSR(Selective Strategy Retrieval)は,実行可能性を明確にモデル化するテストタイムフレームワークである。
SSRは、直接解決、文脈内学習、単一ソースガイダンスよりも信頼性が高く一貫した改善をもたらす。
論文 参考訳(メタデータ) (2026-02-26T03:34:23Z) - Maximizing the efficiency of human feedback in AI alignment: a comparative analysis [1.561268797057701]
RLHF(Reinforcement Learning from Human Feedback)における選好推論のための代替サンプリングと評価戦略について検討する。
我々の最高のパフォーマンス手法であるSwiss InfoGainは、プロキシ相互情報ゲインペアリングルールを備えたスイスのトーナメントシステムを採用しており、制約付きアノテーション予算において他の方法よりも大幅に優れています。
本実験は,適応的資源認識戦略が冗長性を低減し,堅牢性を向上し,嗜好学習における統計的に有意な改善をもたらすことを示す。
論文 参考訳(メタデータ) (2025-11-16T21:55:59Z) - Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs [69.2486294522259]
BaRPはBandit Routing-feedback with Preferencesアプローチであり、デプロイと同じ部分フィードバック制限の下でトレーニングされる。
提案手法は,学習中のオンラインフィードバック設定をシミュレートし,新たなプロンプトに適応する。
論文 参考訳(メタデータ) (2025-10-08T18:24:59Z) - Plan before Solving: Problem-Aware Strategy Routing for Mathematical Reasoning with LLMs [49.995906301946]
既存の手法は通常、数学的推論を行うためにLLM(Large Language Models)をガイドするための固定戦略を利用する。
分析の結果,単一戦略は問題固有の要件に適応できず,有効性と効率性のトレードオフを見落としていることが明らかとなった。
本稿では,PRISM(Planning and Routing through Instance-Specific Modeling)を提案する。
論文 参考訳(メタデータ) (2025-09-29T07:22:41Z) - SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling [58.05959902776133]
私たちはSingle-Passを紹介します。
Reference-Guided Evaluation (SPARE)は、効率的なステップごとのアノテーションを可能にする新しい構造化フレームワークである。
数学的推論(GSM8K, MATH)、マルチホップ質問応答(MuSiQue-Ans)、空間推論(SpaRP)にまたがる4つの多様なデータセットにおけるSPAREの有効性を実証する。
ProcessBenchでは、SPAREがデータ効率のよいアウト・オブ・ディストリビューションの一般化を実証し、トレーニングサンプルの$sim$16%しか使用していない。
論文 参考訳(メタデータ) (2025-06-18T14:37:59Z) - Route to Reason: Adaptive Routing for LLM and Reasoning Strategy Selection [7.045509749924679]
Route-To-Reason(RTR)は、予算制約下でのタスク難易度に応じて、LMと推論戦略の両方を動的に割り当てる新しい統一ルーティングフレームワークである。
RTRは、専門家モデルと推論戦略の両方の圧縮された表現を学び、推論時に共同で適応的な選択を可能にする。
論文 参考訳(メタデータ) (2025-05-26T02:53:17Z) - PATS: Process-Level Adaptive Thinking Mode Switching [53.53401063490537]
現在の大言語モデル(LLM)は、通常、難易度に関わらず、すべての質問に対して、単純または複雑に固定された推論戦略を採用する。
このようなタスクと推論プロセスの複雑さの変化の無視は、パフォーマンスと効率のバランスを損なう。
既存の手法では, 難易度が異なる問題に対処するために, 学習不要な高速スロー思考システムを導入しようとするが, 厳密な解レベルの戦略調整によって制限される。
プロセスレベル適応思考モードスイッチング(PATS)という新しい推論パラダイムを提案し,各ステップの難易度に基づいてLLMが推論戦略を動的に調整し,そのバランスを最適化する。
論文 参考訳(メタデータ) (2025-05-25T17:58:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。