論文の概要: How Much Can Language Models Gain from Test-Time Computation?
- arxiv url: http://arxiv.org/abs/2610.01110v2
- Date: Tue, 06 Oct 2026 05:32:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.253813
- Title: How Much Can Language Models Gain from Test-Time Computation?
- Title(参考訳): テスト時間計算で言語モデルにどの程度のメリットがあるのか?
- Abstract要約: SELF-POTは、競合数学、競合プログラミング、エージェント環境にわたるモデルのテスト時間ポテンシャルを測定する。
選択や批判を含むすべてのモデルコールをドルで課金する。
モデルが追加の推論から得られるゲインと、より強いモデルに対する追加の推論を伴う低コストモデルである。
- 参考スコア(独自算出の注目度): 16.91705643450433
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: How much can test-time computation improve a language model, and at what cost? Test-time scaling is widely proposed as a substitute for larger models, but existing comparisons mostly evaluate one domain at a time and rarely charge selection to the budget. We introduce SELF-POT, a benchmark and evaluation framework that measures the test-time potential of a model across competition mathematics, competitive programming, and agentic workflows. SELF-POT separates candidate coverage from final accuracy on static tasks, tracks correctness transitions under revision, and measures protocol completion alongside task success in agentic environments. Under a unified budget rule, it compares Direct inference with parallel sampling and self-revision under fixed multiples of the Direct budget, and charges every model call, including selection and critique, in dollars. This design supports two kinds of comparison: the gain a model obtains from additional inference, and a lower-cost model with additional inference against a stronger model. Across five low-cost reasoning models on 350 sealed tasks, with Claude Opus 5.5 Direct as the reference, the returns depend on the domain, the selection rule, and failure handling. When we replay the retained programming candidate pools, public-example selection raises correct submissions from 376 to 453 of 500 scheduled cells while saving 12-49% of logical API cost across models, and simply retaining an available candidate when judging fails recovers 61 submissions at unchanged cost. On identical mathematics pools, judging with fallback yields 186 correct submissions versus 182 for voting, while voting saves 12-21% of logical API cost. These controlled replays show how selection and failure handling change the gains realized from the same generated candidates, and they quantify the marginal value of a model judge.
- Abstract(参考訳): テスト時の計算は言語モデルをどのように改善できるのか。
テストタイムスケーリングは大規模モデルの代用として広く提案されているが、既存の比較では1つのドメインを1度に評価しており、予算の選択はめったに行われない。
SELF-POT(SELF-POT)は、競合数学、競合プログラミング、エージェントワークフローを対象とするモデルのテスト時間ポテンシャルを測定するベンチマークおよび評価フレームワークである。
SELF-POTは、静的タスクの最終精度から候補カバレッジを分離し、修正中の正確性遷移を追跡し、エージェント環境におけるタスク成功と並行してプロトコルの完了を測定する。
統一された予算ルールの下では、ダイレクト推論とダイレクト予算の固定された倍率の下での並列サンプリングと自己修正を比較し、選択や批判を含むすべてのモデルコールをドルで課金する。
この設計は、モデルが追加の推論から得られるゲインと、より強いモデルに対する追加の推論を伴う低コストモデルという2つの種類の比較をサポートする。
350の封印されたタスクに対する5つの低コスト推論モデルにおいて、Claude Opus 5.5 Directが参照として、リターンはドメイン、選択ルール、障害処理に依存する。
保持されたプログラミング候補プールをリプレイすると、公開サンプル選択は500のスケジュールされたセルの376から453までの正しいサブミッションを上昇させ、モデル間で論理的なAPIコストの12~49%を節約し、判定失敗時に利用可能な候補をそのまま保持する。
同一の数学プールでは、フォールバックで判断すると186の正解が182に対して、投票は12-21%の論理APIコストを節約する。
これらの制御されたリプレイは、同じ生成した候補から得られた利得をどのように変化させるかを示し、モデル判定器の限界値の定量化を行う。
関連論文リスト
- Same Scores, Different Decisions: Evaluating JEV and Language Models for Legal Document Understanding [65.85599131866623]
私たちはJevとContractNLIの9つの言語モデルを比較します。
制御された比較は、仮説の可視性、要求された出力、および出力順序によって異なる。
Jevは、評価された構成の中で、最低コストと中央値のレスポンス時間を持っています。
論文 参考訳(メタデータ) (2026-09-23T10:53:01Z) - DAREBench: Deployment-Aware and Reliable Evaluation of Models as Agents [16.576661790025668]
DAREBenchは、ワークロードの変動を捉え、信頼できるエージェント評価をサポートするために設計されたベンチマークである。
単一のモデルがすべてのワークロードグループ、テキスト、マルチモーダルタスクを支配しているわけではない。
これらの結果は、エージェントのデプロイメントとモデルの選択は、ワークロードプロファイル、デプロイメントモード、精度の高いトレードオフを考慮するべきであることを示唆している。
論文 参考訳(メタデータ) (2026-09-05T12:36:59Z) - MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents [50.27505102982638]
本稿では,ツールコールエージェントのベンチマークおよび評価フレームワークであるMM-ToolSandBoxを紹介する。
このフレームワークは16のアプリケーションドメインで500以上のツールにまたがるステートフルな実行環境を提供する。
マルチイメージのマルチターンタスクをサポートしており、エージェントは実行可能ツールコールに徐々に視覚的な入力を入力しなければならない。
論文 参考訳(メタデータ) (2026-07-13T17:13:09Z) - Resample or Reroute? Budget-Aware Test-Time Model Selection for Large Language Models [0.10152838128195468]
この研究は、大規模言語モデルに対する予算対応テストタイムモデル選択を定式化する。
単位コスト当たりの限界精度の推定によるオンライン再サンプリング・オー・リルート(RoR)割り当てポリシーを提案する。
11モデルのオープンウェイトプールから4つの異なる難易度ベンチマークで新たに生成した正しさテンソルの実験により、提案されたRoRポリシーは、単一ルート、一コミットルータ、予算対応のベスト・オブ・K、カスケード、ランダム・アロケーションベースラインに対して、良好なコスト品質のロバスト性を達成することが示された。
論文 参考訳(メタデータ) (2026-07-09T16:34:15Z) - ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation [33.22383550511664]
ArenaBencherは自動ベンチマーク進化のためのモデルに依存しないフレームワークである。
アリーナベンチャーを数学の問題解決、常識推論、安全領域に適用する。
論文 参考訳(メタデータ) (2025-10-09T17:59:55Z) - The NazoNazo Benchmark: A Cost-Effective and Extensible Test of Insight-Based Reasoning in LLMs [3.9977256267361754]
そこで本研究では,日本人児童のライドルから構築した費用効果評価指標であるNazonazoについて紹介する。
GPT-5以外のモデルは人間の性能に匹敵せず、平均精度は52.9%である。
論文 参考訳(メタデータ) (2025-09-18T07:50:04Z) - Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs [71.7892165868749]
LLM(Commercial Large Language Model) APIは基本的な信頼の問題を生み出します。
ユーザーは特定のモデルに課金するが、プロバイダが忠実に提供できることを保証することはない。
我々は,このモデル置換問題を定式化し,現実的な逆条件下での検出方法を評価する。
我々は,信頼された実行環境(TEE)を実用的で堅牢なソリューションとして使用し,評価する。
論文 参考訳(メタデータ) (2025-04-07T03:57:41Z) - Sample, Don't Search: Rethinking Test-Time Alignment for Language Models [55.2480439325792]
新しいテストタイムアライメントアプローチであるQAlignを紹介します。
テスト時間計算をスケールする際、QAlignは各プロンプトの最適配向分布からのサンプリングに収束する。
マルコフ連鎖モンテカルロのテキスト生成における最近の進歩を取り入れることで、基礎となるモデルを変更したり、ロジットアクセスを必要とせずに、より良い整合出力を可能にする。
論文 参考訳(メタデータ) (2025-04-04T00:41:40Z) - Ranked from Within: Ranking Large Multimodal Models Without Labels [73.96543593298426]
ソフトマックス分布から導かれる不確実性スコアは,様々なタスクにまたがるランキングモデルに対して,ロバストな基礎となることを示す。
これにより、ラベルのないデータに対するLMMのランク付けが容易になり、手動のアノテーションを必要とせずに、多様なターゲットドメインのモデルを選択するための実践的なアプローチを提供する。
論文 参考訳(メタデータ) (2024-12-09T13:05:43Z) - The Right Tool for the Job: Matching Model and Instance Complexities [62.95183777679024]
NLPモデルが大きくなればなるほど、訓練されたモデルを実行するには、金銭的・環境的なコストを発生させる重要な計算資源が必要である。
我々は、推論中、早期(かつ高速)の"exit"を可能にする文脈表現微調整の修正を提案する。
3つのテキスト分類データセットと2つの自然言語推論ベンチマークの2つのタスクで、5つの異なるデータセットに対して提案した修正を検証した。
論文 参考訳(メタデータ) (2020-04-16T04:28:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。