論文の概要: Conformalized Large Language Models under Configuration Shift
- arxiv url: http://arxiv.org/abs/2608.01460v1
- Date: Sun, 02 Aug 2026 19:34:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.247729
- Title: Conformalized Large Language Models under Configuration Shift
- Title(参考訳): 構成シフト下におけるコンフォーマル化大言語モデル
- Abstract要約: コンフォーマル予測は不確実性定量化のための分布のないフレームワークである。
非整合性スコアは、単に固定モデルではなく、推論パイプラインによって引き起こされることが多い。
構成シフトがCPの妥当性を損なうことを示す。
- 参考スコア(独自算出の注目度): 46.502741608809174
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Conformal prediction (CP) is a distribution-free framework for uncertainty quantification that has recently been adapted to large language models (LLMs), providing prediction sets with finite-sample coverage guarantees under exchangeability. Yet for LLMs, nonconformity scores are often induced by an inference pipeline, not just a fixed model, making them depend not only on the data distribution but also on configurable factors such as the prompt template, decoding parameters, and deployment setting. Since such configurations are routinely modified in practice but rarely treated as a source of shift, their impact on CP validity remains poorly understood. We call this \emph{configuration shift} and study it systematically along three axes: prompt template, decoding temperature, and weight quantization. In a broad empirical study spanning $9$ LLMs, $4$ datasets, and $4$ nonconformity scores, we find that configuration shift consistently erodes CP validity, often driving empirical coverage below the target. By contrast, efficiency is largely preserved: valid prediction sets remain close in size to the i.i.d. baseline. We derive coverage lower bounds that attribute this loss to a discrepancy between calibration and test score distributions, and use their finite-sample plug-in versions as empirical diagnostics of shift severity. We further show that these findings lead to practical mitigations: bound-inspired recalibration is effective with limited test examples, while fragility-aware calibration ensembling recovers much of the lost coverage without test data.
- Abstract(参考訳): コンフォーマル予測(CP)は不確実性定量化のための分布のないフレームワークであり、最近大きな言語モデル(LLM)に適応し、交換可能性の下で有限サンプルカバレッジを保証する予測セットを提供する。
LLMでは、非整合性スコアは、固定モデルだけでなく、推論パイプラインによっても引き起こされることが多く、データ分散だけでなく、プロンプトテンプレートやデコードパラメータ、デプロイメント設定といった設定可能な要素にも依存する。
このような構成は、実際には定期的に変更されているが、シフトの源として扱われることはほとんどないため、CPの有効性に対する影響はよく分かっていない。
我々はこれを「emph{configuration shift}」と呼び、これを3つの軸に沿って体系的に研究する: プロンプトテンプレート、復号温度、重み量子化。
9ドルのLLM、4ドルのデータセット、4ドルの非整合性スコアからなる広範な実証的研究では、構成シフトがCPの妥当性を損なうことが分かり、しばしばターゲットよりも低い経験的カバレッジを駆動している。
対照的に、効率性はほとんど保存されており、有効な予測セットは、i.d.ベースラインに近いサイズのままである。
この損失をキャリブレーションとテストスコアの分布の相違に起因した低い範囲を導出し,その有限サンプルプラグインバージョンをシフト重大性の実証診断に用いた。
さらに, これらの知見は, 限定的な試験例ではバウンダリインスパイアされたリカレーションが有効であり, 脆弱性を考慮したキャリブレーションアンサンブルは, テストデータなしで, 失われたカバレッジの多くを回復させる。
関連論文リスト
- Robust Bayes-Assisted Conformal Prediction [0.9558392439655014]
ベイズ支援型共形予測は、ベイズモデリングの強みと、正確に分布のない頻繁なカバレッジ保証を組み合わせる。
頑健な非整合性スコアを構築するためのベイズ支援フレームワークRoBAS(Robust Bayes-Assisted Shrinkage:Robust Bayes-Assisted Shrinkage)を紹介する。
論文 参考訳(メタデータ) (2026-07-05T11:26:37Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Adversarial Stress Tests for Quantum Certification [0.0]
古典的なベンチマークの明らかな違反は、真の非古典的な振る舞いを示唆する必要はない。
マーチンゲールセーフな低信頼境界に基づくプロトコルに依存しないアライメント原理を定式化する。
適応学習に基づく古典的エージェントは許容可能な古典的集合を拡大しないことを示す。
論文 参考訳(メタデータ) (2026-03-13T03:49:58Z) - Softmax is not Enough (for Adaptive Conformal Classification) [5.184894950445513]
コンフォーマル予測(CP)は不確実性定量化のための分布のないフレームワークである。
非整合性スコアはソフトマックス出力から導かれるもので、与えられた入力についてモデルが真に確実であるかの信頼性の低い指標となる。
本稿では,Helmholtz Free Energyをモデル不確実性とサンプルの難易度を指標として,ソフトマックス前のロジット空間の情報を活用する新しい手法を提案する。
論文 参考訳(メタデータ) (2026-02-23T04:33:04Z) - LATA: Laplacian-Assisted Transductive Adaptation for Conformal Uncertainty in Medical VLMs [61.06744611795341]
医用視覚言語モデル(VLM)は医用画像の強力なゼロショット認識器である。
本研究では,ラプラシアン支援トランスダクティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ(texttttextbfLATA,ラプラシアン支援トランスダクティブ・アダプティブ・アダプティブ・アダプティブ)を提案する。
texttttextbfLATAは交換性を損なうことなくゼロショット予測をシャープにする。
論文 参考訳(メタデータ) (2026-02-19T16:45:38Z) - BayesTTA: Continual-Temporal Test-Time Adaptation for Vision-Language Models via Gaussian Discriminant Analysis [41.09181390655176]
CLIPのような視覚言語モデル(VLM)は、強いゼロショット認識を実現するが、実世界のシナリオに共通する時空間的な分散シフトの下で大幅に劣化する。
テスト分布が時間とともに徐々に変化するCT-TTA(textitContinal-Temporal Test-Time Adaptation)として、この実践的問題を定式化する。
我々は、時間的に一貫した予測を実行し、視覚表現を動的に調整する、ベイズ適応フレームワークであるtextitBayesTTAを提案する。
論文 参考訳(メタデータ) (2025-07-11T14:02:54Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - DOTA: Distributional Test-Time Adaptation of Vision-Language Models [69.41389326333771]
トレーニングデータとテストデータの間に大きな分散ギャップが存在する場合、視覚言語の基礎モデルは信頼できない。
本稿では,DOTA(DistributiOnal Test-time Adaptation)を提案する。
この分散中心のアプローチは、モデルが継続的に学習し、デプロイメント環境に適応することを可能にする。
論文 参考訳(メタデータ) (2024-09-28T15:03:28Z) - Adapting Prediction Sets to Distribution Shifts Without Labels [16.478151550456804]
我々は、共形予測(CP)と呼ばれる標準設定値予測フレームワークに焦点を当てる。
本稿では, シフトテスト領域からのラベルなしデータのみを用いて, 実用性を向上させる方法について検討する。
提案手法は,既存のベースラインよりも一貫した改善を実現し,完全教師付き手法の性能にほぼ一致することを示す。
論文 参考訳(メタデータ) (2024-06-03T15:16:02Z) - Robust Conformal Prediction under Distribution Shift via Physics-Informed Structural Causal Model [24.58531056536442]
整形予測(CP)は、テスト入力上の集合を予測することによって不確実性を扱う。
このカバレッジは、キャリブレーションとテストデータセットの差分分布が$P_X$であったとしても、テストデータ上で保証することができる。
本稿では,上界を小さくする物理インフォームド構造因果モデル(PI-SCM)を提案する。
論文 参考訳(メタデータ) (2024-03-22T08:13:33Z) - When Does Confidence-Based Cascade Deferral Suffice? [69.28314307469381]
カスケードは、推論コストをサンプル毎に適応的に変化させる古典的な戦略である。
deferralルールは、シーケンス内の次の分類子を呼び出すか、または予測を終了するかを決定する。
カスケードの構造に執着しているにもかかわらず、信頼に基づく推論は実際は極めてうまく機能することが多い。
論文 参考訳(メタデータ) (2023-07-06T04:13:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。