論文の概要: Hierarchical Group-Conditional Conformal Risk Control for Selective Prediction in Language Models
- arxiv url: http://arxiv.org/abs/2607.24562v1
- Date: Mon, 27 Jul 2026 15:31:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.479888
- Title: Hierarchical Group-Conditional Conformal Risk Control for Selective Prediction in Language Models
- Title(参考訳): 言語モデルにおける選択予測のための階層型グループ・コンフォメーション型リスク制御
- Abstract要約: コンフォーマルリスク制御(CRC)は、禁忌を伴う選択的予測に対して厳格な限界リスク保証を与える。
グループ構成の微妙な変更により、標準CRCは最大47%の試験で予算に違反している。
ユーザ定義グループ階層のすべてのノードに対して同時リスク保証を実現するポストホックキャリブレーションフレームワークであるHG-CRCを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models serve heterogeneous populations structured by domain, topic difficulty, and linguistic style. Conformal risk control (CRC) gives rigorous marginal risk guarantees for selective prediction with abstention, but marginal guarantees do not imply per-group ones: a model can meet the population budget while systematically over-exposing subgroups to errors. Under mild shift in group composition, standard CRC violates the budget in up to 47% of trials. We propose HG-CRC (Hierarchical Group-Conditional CRC), a post-hoc calibration framework enforcing simultaneous risk guarantees across all nodes of a user-defined group hierarchy. It applies a Bonferroni correction over nodes and a leaf-first policy that uses the most specific applicable threshold, falling back to coarser nodes when a finer one is uncertified or rejects the example. It needs only a held-out calibration set, with no retraining. We evaluate on three models (Qwen3-4B, Llama-3.1-8B-Instruct, Gemma-3-4B) and two benchmarks (ARC Challenge, MMLU-Pro) across eight configurations probing IID generalization, heterogeneity, mixture/domain/prompt/difficulty shift, label noise, and quantization. Main result: HG-CRC reaches an empirical 0% violation rate and WGER=0 on ARC Challenge for high-accuracy models (Qwen3-4B, Llama-3.1-8B). At 500 bootstrap trials these zeros are empirical upper bounds (true rate up to 0.6%), not certified. Results are benchmark-specific: on MMLU-Pro these models abstain entirely or (Llama) retain WGER=0.014. Gemma-3-4B, poorly calibrated here, degrades gracefully by abstaining. Participation cost vs. global CRC is 22 to 37 points. Ablations show hierarchical depth clears the budget: removing difficulty level returns violations to about 11%. Bonferroni is needed for the theoretical guarantee, though its empirical effect matters only with many nodes.
- Abstract(参考訳): 大規模な言語モデルは、ドメイン、トピックの難易度、言語スタイルによって構成された異種集団を提供する。
コンフォーマル・リスク・コントロール(CRC)は、厳密な限界リスク保証を与えるが、限界リスク保証はグループごとの予測を含まない。
グループ構成の微妙な変更により、標準CRCは最大47%の試験で予算に違反している。
本稿では,HG-CRC(Hierarchical Group-Conditional CRC)を提案する。
ノードに対するBonferroni補正と、最も具体的に適用可能なしきい値を使用するリーフファーストポリシーを適用し、より精細なノードが認証されていない場合やサンプルを拒否する場合に、粗いノードにフォールバックする。
キャリブレーションも必要で、再訓練は不要。
我々は、IID一般化、不均一性、混合/ドメイン/分岐/拡散シフト、ラベルノイズ、量子化の8つの構成からなる3つのモデル(Qwen3-4B, Llama-3.1-8B-Instruct, Gemma-3-4B)と2つのベンチマーク(ARC Challenge, MMLU-Pro)について評価した。
主な結果:HG-CRCは実験的な0%の違反率に達し、WGER=0は高精度モデル(Qwen3-4B、Llama-3.1-8B)のARCチャレンジに挑戦した。
500回のブートストラップ試験では、これらのゼロは実証的な上限(実際には0.6%)であり、認定されていない。
MMLU-Proでは、これらのモデルは完全または(Llama)WGER=0.014を維持している。
ここでのキャリブレーションが不十分なGemma-3-4Bは、吸収によって優雅に劣化する。
参加費対グローバルCRCは22~37ポイント。
アブレーションは、階層的な深さが予算をクリアすることを示している。
ボンフェロニは理論的な保証のために必要であるが、その経験的効果は多くのノードでのみ重要である。
関連論文リスト
- Certified Optimal Measurement Reduction over Quantum Context Landscapes [0.0]
RANGEを用いて,Fockproxy-co-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockpr oxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockpr oxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockpr oxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockpr oxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy-Fockproxy。
論文 参考訳(メタデータ) (2026-07-18T16:06:52Z) - Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - When Can Conformal Risk Control Certify LLM Outputs? Bounds, Impossibility, and Adaptation for Structured Generation [0.11280931253550518]
構造化世代 (NER, 抽出, QA, 分類) にデプロイされる大規模言語モデル (LLM) には、正式な信頼性保証がない。
我々は、共形リスク制御(CRC)が構造化LLM出力を証明でき、かつ、それが証明不可能な場合に特徴付ける。
論文 参考訳(メタデータ) (2026-06-27T19:25:07Z) - BOKBO (Best of K Bad Options): Calibrated Abstention for VLA Policies [1.3918848543076061]
VLA(Vision-suite-action)ポリシー、RoboMonkey、SEAL、MG-Select、V-GPSなどのメソッドに対するテストタイムスケーリングは、推論時にK候補アクションチャンクをサンプリングし、検証-ベストを実行する。
K-sample VLA推論のための最初の共形吸収層であるBOKBOを提案する。
論文 参考訳(メタデータ) (2026-05-28T23:39:09Z) - Federated Naive Bayes with Real Mixture of Gaussians and Institutional Governance Regularization for Network Intrusion Detection [0.0]
侵入検知のためのフェデレーション学習は、すべての参加機関が共有モデルに等しく貢献するという欠陥のある前提に基づいている。
実際には、成熟したセキュリティコントロールと低い脆弱性エクスポージャーを持つ金融機関は、弱いコントロールと高い脆弱性エクスポージャーを持つ政府機関と根本的に異なるデータを生成する。
ローカルモデルをモデルとして扱うことで、組織が標準的なリスク管理監査を通じて収集した情報を破棄する。
論文 参考訳(メタデータ) (2026-05-18T16:54:49Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness [61.45587642780908]
画像テキスト基礎モデルのパラメータ効率向上のための3段階のアプローチを提案する。
本手法は, マイノリティ標本同定とロバストトレーニングアルゴリズムの2つの重要な要素を改良する。
我々の理論分析は,PPAが少数群の識別を向上し,バランスの取れたグループエラーを最小限に抑えるためにベイズが最適であることを示している。
論文 参考訳(メタデータ) (2025-03-12T15:46:12Z) - Modeling the Q-Diversity in a Min-max Play Game for Robust Optimization [61.39201891894024]
群分布的ロバスト最適化(群 DRO)は、事前定義された群に対する最悪の損失を最小限にすることができる。
グループDROフレームワークをQ-Diversityを提案して再構築する。
インタラクティブなトレーニングモードによって特徴付けられるQ-Diversityは、アノテーションからグループ識別を緩和し、直接パラメータ化を行う。
論文 参考訳(メタデータ) (2023-05-20T07:02:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。