論文の概要: Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions
- arxiv url: http://arxiv.org/abs/2608.07968v2
- Date: Tue, 11 Aug 2026 02:23:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.526095
- Title: Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions
- Title(参考訳): 難しい、スマートではない - 関係テスト時間計算に失敗した推論モデル
- Authors: Chenrui Fan, Yize Cheng, Ming Li, Yongyuan Liang, Tianyi Zhou, Soheil Feizi,
- Abstract要約: この設定を研究するための試験スタイル評価フレームワークを導入する。
モデルは、さまざまな困難と価値に関する質問に対して、戦略的に共通の予算を割り当てることに失敗している。
これらの知見は, 従来の調査単位の評価では得られない, 個別の能力として, グローバルな予算配分を確立した。
- 参考スコア(独自算出の注目度): 59.21329728895449
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reasoning language models increasingly use test-time compute to improve performance, but existing evaluations typically study this compute one question at a time. Yet when multiple problems share an end-to-end cost or latency constraint, models must decide how to divide limited inference compute among them. We introduce an exam-style evaluation framework for studying this setting, in which a model must distribute one shared token budget across questions with different difficulty and point values to maximize its total score. Across several open and frontier reasoning models, we find that models fail to allocate a shared budget strategically across questions of varying difficulties and values. Models behave largely as greedy sequential solvers: they prioritize questions by presentation order, front-load effort on early questions, and remain insensitive to value, with these tendencies becoming more pronounced as the number of questions grows. Explicit planning prompts spread compute more evenly but do not produce value- or difficulty-aware prioritization. The same behavioral pattern extends from mathematical to code reasoning. These findings establish global budget allocation as a distinct capability that is not captured by conventional per-question evaluation and remains a challenge for current reasoning models.
- Abstract(参考訳): 言語モデルの推論では、テスト時間計算を用いてパフォーマンスを向上させる傾向にあるが、既存の評価では、この計算を1回ずつ研究している。
しかし、複数の問題がエンドツーエンドのコストやレイテンシの制約を共有している場合、モデルは制限された推論計算を分割する方法を決定する必要がある。
本稿では,この設定を学習するための試験式評価フレームワークを提案する。このフレームワークでは,モデルがスコアを最大化するために,難易度とポイント値の異なる質問に対して,共通のトークン予算を分散しなければならない。
いくつかのオープンかつフロンティアな推論モデルにおいて、モデルは様々な困難と価値に関する質問に対して戦略的に共通の予算を割り当てることに失敗する。
モデルは、プレゼンテーションの順序による質問の優先順位付け、初期の質問に対するフロントエンドの取り組み、価値に敏感なままであり、これらの傾向は、質問の数が増えるにつれてより顕著になる。
明示的なプランニングは、計算をより均等に広めるが、価値や困難を意識した優先順位付けは発生しない。
同じ振る舞いパターンは、数学的からコード推論へと拡張されます。
これらの知見は, 従来の調査単位の評価では捉えられず, 現状の推論モデルでは依然として課題であり, グローバルな予算配分を個別の能力として確立している。
関連論文リスト
- How Inference Compute Shapes Frontier LLM Evaluation [2.7633794124150426]
私たちは、ソフトウェアエンジニアリング、数学、医学、サイバーセキュリティにまたがる7つの挑戦的なベンチマークで、最大12のフロンティア言語モデルを評価します。
より新しいモデルは大きな予算でより高いパフォーマンスに到達し、より難しいタスクを解き、より確実に解決する。
評価は推論時間計算の関数として機能を報告し、プロトコルの選択を明示的に指定し、大きな共有計算範囲でモデル生成を比較するべきであると論じる。
論文 参考訳(メタデータ) (2026-06-16T13:40:53Z) - TRIAGE: Evaluating Prospective Metacognitive Control in LLMs under Resource Constraints [0.0]
メタ認知制御のための言語モデルをテストするためのフレームワークであるTRIAGEを紹介する。
現状の言語モデルでは, メタ認知制御にかなりのギャップがあることが判明した。
論文 参考訳(メタデータ) (2026-05-13T12:10:05Z) - MorphoBench: A Benchmark with Difficulty Adaptive to Model Reasoning [61.04601861108966]
大規模モデルの推論能力を評価するために,複数分野の質問を取り入れたベンチマークであるMorphoBenchを提案する。
MorphoBenchは、モデルの推論プロセスで生成されたキーステートメントを活用することで、質問の分析的課題を適応的に修正する。
我々は1300以上のテスト質問を集め、o3やGPT-5といったモデルの推論能力に基づいてMorphoBenchの難易度を反復的に調整した。
論文 参考訳(メタデータ) (2025-10-16T03:30:56Z) - T$^2$: An Adaptive Test-Time Scaling Strategy for Contextual Question Answering [49.5489716597489]
T$2$: Think-to-Thinkは質問の複雑さに基づいて推論深度を動的に適応する新しいフレームワークである。
T$2$は、質問を構造的要素に分解し、候補推論戦略と同じような例を生成し、これらの戦略を複数の基準に対して評価し、元の質問に最も適切な戦略を適用する、という4つの重要なステップで機能する。
論文 参考訳(メタデータ) (2025-05-23T03:18:02Z) - THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models [65.39456695678713]
本稿では,問題レベルの難易度を近似的に測定し,問題の難易度と最適なトークン使用量との間に明確な関係があることを実証する。
一般に、推論モデルは、特に簡単な問題に対して、キャリブレーションが不十分である。
トレーニング不要なブラックボックス復号法であるTHOUGHTTERMINATORを導入する。
論文 参考訳(メタデータ) (2025-04-17T22:16:30Z) - Reliable and Efficient Amortized Model-based Evaluation [57.6469531082784]
幅広いベンチマークの平均スコアは、実際に言語モデルを使用することをガイドするシグナルを提供する。
コストを下げるための一般的な試みは、ベンチマークのサブセットの平均スコアを計算することである。
このアプローチは、平均スコアがベンチマークサブセットの質問の難しさと合わさったため、信頼性の低いLM性能をしばしば引き起こす。
我々は、その内容から質問難度を予測するモデルを訓練し、信頼性のある測定をコストのごく一部で行えるようにした。
論文 参考訳(メタデータ) (2025-03-17T16:15:02Z) - Are You Doubtful? Oh, It Might Be Difficult Then! Exploring the Use of Model Uncertainty for Question Difficulty Estimation [12.638577140117702]
本研究では,不確実性の特徴が難易度予測に大きく寄与することを示し,難易度は質問に正しく答えられる学生数に逆比例することを示した。
このアプローチの価値を示すことに加えて,USMLEとCMCQRDの公開データセット上で,我々のモデルが最先端の結果を達成することも観察した。
論文 参考訳(メタデータ) (2024-12-16T14:55:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。