論文の概要: When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty
- arxiv url: http://arxiv.org/abs/2608.00685v1
- Date: Sat, 01 Aug 2026 14:14:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.866413
- Title: When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty
- Title(参考訳): LLMのオーケストレーションはいつ有効か? - 精度、コスト、タスクの難しさの制御された評価
- Abstract要約: オーケストレーションはしばしば、追加の推論時間計算を割り当てることで推論を改善すると仮定されるが、その利益はそのコストを正当化しないかもしれない。
我々は,タスクのみとチェーン・オブ・シークレット(CoT)の単一呼び出しベースラインに対して,セルフリファイン,ベスト・オブ・N$,ディベートの評価を行う。
以上の結果から,オーケストレーション決定はモデル固有であり,適度な精度の獲得が追加の推論コストを正当化するかどうかを考慮すべきであることが示唆された。
- 参考スコア(独自算出の注目度): 17.41874642505417
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM orchestration is often assumed to improve reasoning by allocating additional inference-time computation, yet its gains may not justify its cost. Existing comparisons also frequently overlook differences in optimization effort, making it difficult to isolate the value of orchestration itself. We conduct a controlled evaluation of Self-Refine, Best-of-$N$, and Debate against task-only and chain-of-thought (CoT) single-call baselines across five LLM backbones and three domains: competitive programming, chess puzzles, and mathematics. For comparability, we optimize each method with GEPA under the same optimization budget and evaluate all methods on the same difficulty-stratified benchmark items. Orchestration yields moderate but benchmark-dependent gains: averaged across backbones within each benchmark, the largest improvement is 4.6 percentage points over optimized CoT inference and 4.5 points over task-only inference, while requiring approximately 2 to 4 times the mean total tokens of task-only inference. Human-derived difficulty is associated with lower absolute accuracy in all three benchmarks, but within-benchmark analyses do not indicate that orchestration effects increase with task difficulty. By contrast, exploratory mixed-effects analyses reveal strong interactions between orchestration method and backbone model across all three benchmarks, showing that orchestration effectiveness depends substantially on the underlying model. Our results suggest that orchestration decisions should be model-specific and account for whether moderate accuracy gains justify the additional inference cost. More broadly, evaluations of LLM orchestrations should control optimization effort and report model-specific accuracy--cost trade-offs rather than treating additional inference-time structure as uniformly beneficial.
- Abstract(参考訳): LLMオーケストレーションはしばしば推論時間計算を割り当てることで推論を改善すると仮定されるが、その利得はそのコストを正当化するものではない。
既存の比較も最適化作業の違いをよく見落としているため、オーケストレーション自体の価値を分離することは困難である。
我々は,5つのLLMバックボーンと3つのドメイン(競合プログラミング,チェスパズル,数学)にわたるタスク専用およびチェーンオブシンク(CoT)単一コールベースラインに対して,自己決定,ベストオブN$,ディベートの評価を行う。
コンパラビリティのために、同じ最適化予算の下で各手法をGEPAで最適化し、同じ難易度階層化されたベンチマーク項目上で全ての手法を評価する。
各ベンチマーク内のバックボーンの平均値は、最適化されたCoT推論よりも4.6ポイント、タスクのみ推論より4.5ポイント、タスクのみ推論の合計トークンの約2~4倍である。
ヒト由来の難易度は3つのベンチマークすべてにおいて絶対精度が低いことに関連付けられているが、ベンチマーク内分析では、オーケストレーション効果がタスクの難易度とともに増加することを示すものではない。
対照的に、探索的な混合効果分析では、オーケストレーション手法とバックボーンモデルの間の3つのベンチマーク間の強い相互作用が示され、オーケストレーションの有効性は基礎となるモデルに大きく依存している。
以上の結果から,オーケストレーション決定はモデル固有であり,適度な精度の獲得が追加の推論コストを正当化するかどうかを考慮すべきであることが示唆された。
より広範に、LLMオーケストレーションの評価は、追加の推論時間構造を一様利益として扱うのではなく、最適化の取り組みを制御し、モデル固有の精度-コストトレードオフを報告すべきである。
関連論文リスト
- Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization [60.89431018071735]
グループ相対的な優位性を持つ強化学習は、訓練後の言語モデル推論のデファクトスタンダードとなっている。
異なる報酬プロファイルを持つロールアウトは、同じ利点を享受でき、現在の飽和度に関わらず、全ての目的が固定相対重みで最適化されることを示す。
本研究では,各報酬目標を独立に標準化し,目標飽和度をバッチレベルで推定した値に従って貢献を適応的に割引する飽和度認識再重み付けを導入する。
論文 参考訳(メタデータ) (2026-08-17T04:07:50Z) - LLM-as-a-Verifier: A General-Purpose Verification Framework [74.40111651545979]
本稿では,汎用検証フレームワーク LLM-as-a-Verifier を紹介する。
追加のトレーニングを必要とせずに、エージェントタスクに対してきめ細かいフィードバックを提供する。
いくつかのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-06T17:59:35Z) - How Inference Compute Shapes Frontier LLM Evaluation [2.7633794124150426]
私たちは、ソフトウェアエンジニアリング、数学、医学、サイバーセキュリティにまたがる7つの挑戦的なベンチマークで、最大12のフロンティア言語モデルを評価します。
より新しいモデルは大きな予算でより高いパフォーマンスに到達し、より難しいタスクを解き、より確実に解決する。
評価は推論時間計算の関数として機能を報告し、プロトコルの選択を明示的に指定し、大きな共有計算範囲でモデル生成を比較するべきであると論じる。
論文 参考訳(メタデータ) (2026-06-16T13:40:53Z) - Granularity-Regulated Adaptive Computational Efficiency for Optimal Verification in Test-Time Scaling [0.0]
テストタイムスケーリング(TTS)は、大規模言語モデルの推論性能を改善するための強力なパラダイムとして登場した。
TTSの中心的なコンポーネントは、検索プロセスのガイドとして候補ソリューションを選択したり、スコア付けしたりするアンフェリファイア(enmphverifier)である。
計算予算が大きければきめの粗い検証が優先されるのに対して、粗い粗い検証は低予算で易確率なシステムでは好まれる。
論文 参考訳(メタデータ) (2026-04-28T18:19:16Z) - EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models [32.041688648831794]
EffiReason-Benchは、効率的な推論手法の厳密なクロスパラダイム評価のための統一ベンチマークである。
ステップバイステップ評価を実現するため,CommonsenseQAとLogiQAの認証済みCoTアノテーションを構築した。
本稿では,不連続性を伴わないスムーズで安定した評価を提供する経済トレードオフモデルに着想を得た原則的指標であるE3-Scoreを提案する。
論文 参考訳(メタデータ) (2025-11-13T11:14:46Z) - AI Annotation Orchestration: Evaluating LLM verifiers to Improve the Quality of LLM Annotations in Learning Analytics [0.17240671897505613]
大規模言語モデル(LLM)は、学習相互作用の注釈付けにますます使われていますが、信頼性に関する懸念は彼らのユーティリティを制限します。
検証指向のオーケストレーション・プロンプティングモデルが自身のラベル(自己検証)をチェックしたり、相互に監査(相互検証)するかどうかを検証し、学習談話の質的コーディングを向上させるかを検証する。
論文 参考訳(メタデータ) (2025-11-12T22:35:36Z) - Peering Inside the Black Box: Uncovering LLM Errors in Optimization Modelling through Component-Level Evaluation [0.0]
大規模言語モデル(LLM)のためのコンポーネントレベル評価フレームワークを提案する。
GPT-5、LLaMA 3.1命令、DeepSeek Mathを様々な複雑さの最適化問題で評価する。
その結果、GPT-5は他のモデルよりも一貫して優れており、チェーン・オブ・シンク、自己整合性、モジュール性がより効果的であることを証明している。
論文 参考訳(メタデータ) (2025-10-19T17:47:59Z) - Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs [57.10533368622962]
大規模言語モデル(LLM)の自己補正は、推論性能を高める重要な要素として現れる。
本研究では,自己補正戦略の有効性を評価するためのベンチマークであるCorrectBenchを紹介する。
その結果,1) 自己補正手法は, 複雑な推論タスクにおいて, 精度を向上させることが可能であり, 2) 異なる自己補正戦略の混合により, 効率は低下するものの, さらなる改善がもたらされることが明らかとなった。
論文 参考訳(メタデータ) (2025-10-17T02:40:19Z) - Intra-request branch orchestration for efficient LLM reasoning [52.68946975865865]
大規模言語モデル(LLM)は、複雑なタスクの正確性を改善するために、推論時推論アルゴリズムにますます依存している。
それまでの作業は、トークンの使用を減らすことを中心に、多くの場合、正確さを犠牲にしつつ、他のレイテンシ要因を見越すことに重点を置いていた。
本稿では,LLMサービスシステムであるDUCHESSについて,予測によって導かれるリクエスト内ブランチオーケストレーションにより,精度を犠牲にすることなく,コストとレイテンシを低減できるシステムを提案する。
論文 参考訳(メタデータ) (2025-09-29T15:52:08Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z) - Reward-Guided Speculative Decoding for Efficient LLM Reasoning [80.55186052123196]
Reward-Guided Speculative Decoding (RSD)は,大規模言語モデル(LLM)における推論の効率向上を目的とした新しいフレームワークである。
RSDは、厳密な偏りを強制する既存の投機的復号法とは対照的に、制御されたバイアスをハイリワード出力の優先順位付けに取り入れている。
RSDは,対象モデルのみでの復号化に対して,高い効率向上を実現し,並列復号法よりも高い精度を実現している。
論文 参考訳(メタデータ) (2025-01-31T17:19:57Z) - Self-Evaluation Guided Beam Search for Reasoning [61.523627290397556]
我々は,Large Language Model (LLM) の推論プロセスのガイドと校正を行うための段階的自己評価機構を導入する。
本稿では,ビームサーチによる自己評価ガイダンスを統合した復号アルゴリズムを提案する。
我々のアプローチは、GSM8K、AQuA、StrategyQAにおいて、対応するCodexバックボンドベースラインをわずかに精度6.34%、9.56%、および5.46%で上回る。
論文 参考訳(メタデータ) (2023-05-01T02:37:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。