論文の概要: Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference
- arxiv url: http://arxiv.org/abs/2607.25018v3
- Date: Fri, 31 Jul 2026 02:55:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.23089
- Title: Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference
- Title(参考訳): コンフォーマルカスケード:マルチティアLPM推論のための分布自由精度保証
- Abstract要約: 大規模言語モデル(LLM)のカスケードは、簡単なクエリを小さなモデルにルーティングし、ハードクエリを大きなモデルに遅延することで、推論コストを削減する。
我々は,多層推論フレームワークであるtextbfConformal Cascade (CC) を導入する。
- 参考スコア(独自算出の注目度): 6.094431019524038
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) cascades reduce inference cost by routing easy queries to a small model and deferring hard queries to a larger one. Production cascades govern this deferral through a confidence threshold, but LLM confidence scores are miscalibrated, the threshold must be tuned per model pair and per domain, and no setting yields a formal bound on cascade accuracy. We introduce \textbf{Conformal Cascade} (CC), a multi-tier inference framework that uses conformal prediction set size as the deferral rule: accept when the calibrated set collapses to a single answer, defer otherwise. The procedure delivers a distribution-free, finite-sample accuracy guarantee. By a per-tier union bound, the prediction set at the accepting tier covers the correct answer with probability at least $1 - Kα$ for any user-specified $α$; under a selection-preservation condition (consistent with, but not strictly implied by, our marginal coverage results), the bound tightens to $1 - α$. We further characterise expected cascade cost as an explicit function of $α$ and the calibration-set acceptance rate. Across 18 multiple-choice benchmarks spanning science, medicine, commonsense, and standardized exams, evaluated on two-tier cascades drawn from four open-weight model families, CC strictly improves over the strongest calibration-tuned heuristic cascade on the majority of family--benchmark pairs, with the largest gains on reasoning-heavy benchmarks where majority vote is unreliable; on easier benchmarks the cascade commits the vast majority of queries to the small model at no accuracy cost. Extension to open-ended generation requires an answer-clustering step that we leave for future work. The method requires no model training and only black-box API access.
- Abstract(参考訳): 大規模言語モデル(LLM)のカスケードは、簡単なクエリを小さなモデルにルーティングし、ハードクエリを大きなモデルに遅延することで、推論コストを削減する。
生産カスケードは信頼しきい値を通じてこのデリラルを統治するが、LCMの信頼性スコアは誤校正され、モデルのペアとドメインごとに閾値を調整しなければならない。
これは多層推論フレームワークで、共形予測セットのサイズをdeferral ruleとして用い、キャリブレーションされたセットが単一回答に崩壊した場合、それ以外はdeferral ruleとして受け入れる。
この手順は、分布のない有限サンプル精度を保証する。
階層毎の結合境界によって、受け入れ階層での予測セットは、任意のユーザ指定の$α$に対して、確率が1 - Kα$以上で正しい解をカバーしている。
さらに,期待カスケードコストをα$とキャリブレーションセットの受け入れ率の明示的な関数として特徴付ける。
科学、医学、コモンセンス、標準化された試験にまたがる18の多重選択ベンチマークは、4つのオープンウェイトモデルファミリーから引き出された2階層のカスケードで評価され、CCは最も高いキャリブレーションで調整されたヒューリスティックなカスケードよりも厳密に改善されている。
オープン・エンド・ジェネレーションへの拡張には、今後の作業のために出発する回答・クラスタリングのステップが必要です。
この方法は、モデルトレーニングを必要とせず、ブラックボックスAPIのみアクセスする。
関連論文リスト
- Calibration-Aware Uncertainty Cascades for Efficient Heterogeneous Model Collaboration [18.045450334322545]
不均一なモデルコラボレーションは、予測性能と推論コストのバランスをとるために、異なるモデルの相補的な強みを活用することを目指している。
既存のアプローチでは、ルーティング決定を固定されたタスクとモデルプールに結びつける訓練されたルータや、しきい値が不均一なモデル間で一貫性のあるセマンティクスを欠いている生の自信のカスケードに頼っているのが一般的である。
本稿では,各モデルの信頼性を独立に校正し,検証データを用いてデプロイメントポリシを選択する,シンプルなポストホックフレームワークであるCAUCを提案する。
論文 参考訳(メタデータ) (2026-09-10T12:14:54Z) - Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving [69.5155152169752]
大規模言語モデル(LLM)のための2段階カスケードソリューションを提案する。
ステージ1は、受信するクエリをクラスタ化し、各クラスタを最もコスト効率の良いモデルに割り当てる。
ステージ2は品質推定(QE)カスケードを追加し、ステージ1からの出力が低品質であると判断されると、クエリはより強力なモデルにエスカレーションされる。
テストデータセットでは、カスケードシステムは最強モデルの精度の97-99%を保持し、TPOT(Time Per Output Token)を削減している。
タスクの正確性ラベルのみを必要とし、手動で再構成することなくモデルプールの変更に適応する。
論文 参考訳(メタデータ) (2026-06-25T18:29:24Z) - A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering [19.55210880950831]
予測されたモデルの信頼度がその経験的精度と一致しているかを測り、大規模言語モデル(LLM)の信頼性デプロイメントの中心となる。
オープンエンド質問応答(QA)のための校正評価フレームワークSem-ECEを紹介する。
フレームワーク内の2つの推定器について検討する。同じサンプルの自己整合性スコアであるSem$-ECEと、自信評価から回答の選択を分離する保留変数であるSem$-ECEである。
論文 参考訳(メタデータ) (2026-05-08T19:53:49Z) - Is Escalation Worth It? A Decision-Theoretic Characterization of LLM Cascades [0.0]
制約付き最適化と双対性に基づく決定論的フレームワークを開発する。
フレームワークを5つのプロバイダから8つのモデルにまたがる5つのベンチマークで検証します。
論文 参考訳(メタデータ) (2026-05-07T14:32:27Z) - Self-Calibrating Language Models via Test-Time Discriminative Distillation [18.46710400838861]
大規模言語モデル(LLM)は、しばしば間違って答える質問に対して体系的に過度に信頼されている。
我々は、テスト時間トレーニング(TTT)パイプラインである$textbfSECL$ ($textbfSE$lf-$textbfC$alibrating $textbfL$anguage Modelsを紹介します。
論文 参考訳(メタデータ) (2026-03-18T13:28:50Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - C3PO: Optimized Large Language Model Cascades with Probabilistic Cost Constraints for Reasoning [24.65381108650337]
大規模言語モデル(LLM)は複雑な推論タスクにおいて印象的な結果を得たが、その高い推論コストは、現実世界のデプロイメントにとって大きな障壁であり続けている。
既存のカスケード法はラベル付きデータによる教師付きトレーニングに依存しており、理論的一般化の保証は提供せず、テスト時間計算コストの制限も与えている。
確率的コスト制約の下でLLMカスケードを最適化するための自己教師型フレームワークであるC3POを紹介する。
論文 参考訳(メタデータ) (2025-11-10T18:50:27Z) - Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs [72.82403830490084]
我々は、復号規則は正確さによって校正されるべきであり、自信だけではならないと論じている。
Greedy-Threshold はこの目標を達成するための単純な戦略を提案します。
この結果から,不確実性の下での復号化が問題視され,数学や一般推論のベンチマークで有意な差がみられた。
論文 参考訳(メタデータ) (2025-10-07T14:46:12Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - Data-Driven Calibration of Prediction Sets in Large Vision-Language Models Based on Inductive Conformal Prediction [0.0]
動的しきい値キャリブレーションとクロスモーダル整合性検証を統合したモデル非依存不確実性定量化法を提案する。
このフレームワークは、様々なキャリブレーションとテストの分割比で安定したパフォーマンスを実現し、医療、自律システム、その他の安全に敏感な領域における現実的な展開の堅牢性を強調している。
この研究は、マルチモーダルAIシステムにおける理論的信頼性と実用性の間のギャップを埋め、幻覚検出と不確実性を考慮した意思決定のためのスケーラブルなソリューションを提供する。
論文 参考訳(メタデータ) (2025-04-24T15:39:46Z) - Robust Conformal Prediction with a Single Binary Certificate [58.450154976190795]
コンフォーマル予測(CP)は、任意のモデルの出力を、真のラベルを(調整可能な)高い確率でカバーすることを保証した予測セットに変換する。
我々は,MCサンプルが著しく低い場合でも,より小さな集合を生成する頑健な共形予測を提案する。
論文 参考訳(メタデータ) (2025-03-07T08:41:53Z) - When Does Confidence-Based Cascade Deferral Suffice? [69.28314307469381]
カスケードは、推論コストをサンプル毎に適応的に変化させる古典的な戦略である。
deferralルールは、シーケンス内の次の分類子を呼び出すか、または予測を終了するかを決定する。
カスケードの構造に執着しているにもかかわらず、信頼に基づく推論は実際は極めてうまく機能することが多い。
論文 参考訳(メタデータ) (2023-07-06T04:13:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。