論文の概要: Guaranteed Adaptive Modality Acquisition: When the Policy Chooses Its Own Calibration Group
- arxiv url: http://arxiv.org/abs/2608.15520v1
- Date: Sun, 16 Aug 2026 04:19:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.327082
- Title: Guaranteed Adaptive Modality Acquisition: When the Policy Chooses Its Own Calibration Group
- Title(参考訳): 適応的モダリティ獲得の保証:政策が独自の校正グループを選択するとき
- Authors: Melika Baghi,
- Abstract要約: マルチモーダルシステムは、入力のいくつかのみを保持する推論を開始し、残りをコストで取得することができる。
パターン条件保証が有効であり続けると特徴付け、2つの有限サンプル構成を与える。
逆例は、カリブレーション非依存のグルーピングマップに対して証明された保証が、ポリシーが端末群キャリブレーションに依存した場合、転送する必要はないことを示している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A multimodal system may begin inference holding only some of its inputs and may acquire the rest at a cost. With adaptive acquisition, the policy determines which inputs are ultimately observed, so we state the guarantee conditional on that terminal input pattern. Conditional calibration normally assumes the grouping map is fixed independently of the calibration sample, which policy-induced grouping does not satisfy. We characterize when pattern-conditional guarantees remain valid and give two finite-sample constructions: threshold-free routing with calibration applied at the terminal pattern, and simultaneous certification of complete policy-pattern pairs, which lets calibration data select the deployed policy. A counterexample shows that a guarantee proved for a calibration-independent grouping map need not transfer once the policy makes the terminal group calibration-dependent. We call the resulting method RouteCert. On a clinical electrocardiogram task with a staged, cost-ordered lead protocol, the certified policy answers 71.2% of held-out patients at an observed 7.4% disagreement with the cardiologist's diagnosis at 48.8% of the prespecified ordinal cost of acquiring every stage, and all three acquisition stages carry their own certificate. On masked multimodal benchmarks, certifying pointwise at each terminal pattern holds observed worst-pattern selective risk, measured against the full-information reference decision rather than the true label, at 0.034 where a pooled design reaches 0.145 against a 0.10 cap, at a comparable answered fraction (0.350 vs 0.342); under the budget-matched simultaneous comparison the answered fraction falls to 0.305.
- Abstract(参考訳): マルチモーダルシステムは、入力のいくつかのみを保持する推論を開始し、残りをコストで取得することができる。
適応的な取得により、どの入力が最終的に観測されるかが決定され、その端末入力パターンに保証条件が記述される。
条件キャリブレーションは通常、ポリシーによるグルーピングが満たさないキャリブレーションサンプルとは独立にグルーピングマップが固定されていると仮定する。
パターン条件保証が有効であり続けると、端末パターンに適用されたキャリブレーション付きしきい値なしルーティングと、キャリブレーションデータがデプロイされたポリシーを選択するための完全なポリシ-パターンペアの同時認証という、2つの有限サンプル構成を特徴付ける。
逆例では、カリブレーション非依存のグルーピングマップに対して証明された保証が、ポリシーが端末群キャリブレーションに依存した場合、転送する必要はないことを示している。
結果のメソッドを RouteCert と呼びます。
医療用心電図タスクにおいて、段階的、コスト順のリードプロトコルを用いて、認定された政策回答71.2%は、測定された7.4%の患者に対して、各段階の取得に予め規定された基準費用の48.8%の診断に不一致であり、3つの取得段階がそれぞれ独自の証明書を保有している。
マスク付きマルチモーダルベンチマークでは、各端末パターンにおけるポイントワイド認証は、真ラベルよりも完全な情報参照決定に対して測定された最悪のパターン選択リスクを観測し、プールされた設計が0.10キャップに対して0.145まで到達した0.034を、同等の回答率(0.350対0.342)で達成し、予算整合同時比較では、回答された割合は0.305に低下する。
関連論文リスト
- Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation [6.047519836191728]
有限行動ポリシークラス上でプロトコルレベルの識別可能性監査を形式化する。
監査はモデルコールをゼロにし、診断ケースを解決します。
このケースは、モデル推論の前に、どのように評価設計の妥当性を構造的に確認できるかを示す。
論文 参考訳(メタデータ) (2026-08-13T14:49:47Z) - Post-Hoc Trajectory-Risk Certification for Modular LLM-Based Security Agents [1.4915002678801434]
ボンフェロニ配置は分布自由であるが,相関誤差下では保守的であることを示す。
粗いラベルの選択は、学習された依存なしにほぼ完璧な相関関係を作ることができる。
ステージ単位の証明書とペアの重なり合うバウンドを用いたモジュール証明書は、正の平均利得が0.6%となる。
論文 参考訳(メタデータ) (2026-08-04T23:48:36Z) - When Does Learning to Stop Help? A Cost-Aware Study of Early Exits in Reasoning Models [4.8190992438931035]
LearnStopは、プレフィックスオブザーバブルな機能の上に隠された状態のないロジスティックストッパーである。
学習は、答えが振動し、正しさの証拠が広がる場所を給与する。
コスト計算は、KVキャッシュでトークンを32%節約するのと同じ方針で、ブラックボックスの繰り返しプリフィルで121%余分なコストがかかる。
論文 参考訳(メタデータ) (2026-06-29T19:33:42Z) - When Can Conformal Risk Control Certify LLM Outputs? Bounds, Impossibility, and Adaptation for Structured Generation [0.11280931253550518]
構造化世代 (NER, 抽出, QA, 分類) にデプロイされる大規模言語モデル (LLM) には、正式な信頼性保証がない。
我々は、共形リスク制御(CRC)が構造化LLM出力を証明でき、かつ、それが証明不可能な場合に特徴付ける。
論文 参考訳(メタデータ) (2026-06-27T19:25:07Z) - CausalGuard: Conformal Inference under Graph Uncertainty [41.621090965517524]
CausalGuardは、グラフ条件が二重に頑健な擬似アウトカムを集約した後、校正する構造重共役フレームワークである。
直接評価可能な目標に対して、名目90%以上の範囲を達成し、グラフに依存しない共形ベースラインが大きなパディングを必要とする場合、幅を小さくする。
論文 参考訳(メタデータ) (2026-05-21T02:56:46Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Pause and Reflect: Conformal Aggregation for Chain-of-Thought Reasoning [8.024041325202612]
自己整合性を考慮した思考の連鎖(CoT)推論は、複数のサンプル推論パスを集約することで性能を向上させる。
集約不確実性に直接対処するCoT推論のコンフォメーション手順を導入する。
提案手法は,多数決を推理経路よりも重み付けしたスコアアグリゲーションに置き換え,共形リスク制御を用いた棄権規則を校正する。
論文 参考訳(メタデータ) (2026-05-13T20:33:59Z) - Conditional Coverage Diagnostics for Conformal Prediction [47.93989136542648]
条件付きカバレッジ推定が分類問題であることを示す。
得られたメトリクスの族をターゲットカバレッジ(ERT)の過剰なリスクと呼びます。
ERTのオープンソースパッケージと、以前の条件付きカバレッジメトリクスをリリースしています。
論文 参考訳(メタデータ) (2025-12-12T18:47:39Z) - Conformal Lesion Segmentation for 3D Medical Images [82.92159832699583]
本稿では,データ駆動しきい値の校正をコンフォーマル化することで,テスト時間FNRが目標許容値以下であることを保証する,リスク制約付きフレームワークを提案する。
5つのバックボーンモデルにまたがる6つの3D-LSデータセット上でのCLSの統計的健全性と予測性能を検証し,臨床実践におけるリスク認識セグメンテーションの展開に関する実用的な知見を得た。
論文 参考訳(メタデータ) (2025-10-19T08:21:00Z) - SAFER: Risk-Constrained Sample-then-Filter in Large Language Models [38.97678256807034]
本稿では,無意識サンプリングと共形フィルタリングを組み合わせた2段階リスク制御フレームワークを提案する。
その結果,SAFERはタスク固有の基準やキャリブレーションテストのスプリット比と互換性があることが判明した。
論文 参考訳(メタデータ) (2025-10-11T12:12:41Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。