論文の概要: Conformity Breaks Conformal Prediction
- arxiv url: http://arxiv.org/abs/2609.04445v1
- Date: Thu, 03 Sep 2026 20:05:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.8116
- Title: Conformity Breaks Conformal Prediction
- Title(参考訳): ConformityがConformal Predictionを破る
- Abstract要約: 同型証明は、LLMが単独で回答し、同じLLMが全会一致で間違った答えを主張するピアを見ている場合、無効である場合に有効である。
マルチエージェントLLMシステムにおいて,このシフトが共形予測を静かに破ることを示す。
- 参考スコア(独自算出の注目度): 1.3583317564926913
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A conformal certificate can be valid when an LLM answers alone and invalid when the same LLM sees peers that unanimously assert a wrong answer. The question is unchanged; the model's score for the correct answer changes. We call this a score-mechanism shift: clean calibration certifies how the model scores answers alone, but not how it scores them under peer pressure. We show that this shift silently breaks conformal prediction in multi-agent LLM systems. Across open-weight models and multiple-choice QA tasks, coverage falls from a calibrated 90% to 74% under unanimous-wrong peers at the standard alpha = 0.10 operating point. The average hides a sharper failure: by targeting the low-confidence items the certificate still covers, an attacker nearly halves coverage on that subgroup, from 87% to 47%, while the monitored average remains much higher. The failure also reaches the decision layer: a system that should escalate when uncertain can instead become confident enough to act on the attacker's wrong answer. Standard conformal fixes do not solve the problem, because the question distribution has not changed; the model's scoring behavior has.
- Abstract(参考訳): 同型証明は、LLMが単独で回答し、同じLLMが全会一致で間違った答えを主張するピアを見ている場合、無効である場合に有効である。
問題は変わらず、正しい答えに対するモデルのスコアが変わる。
クリーンキャリブレーションは、モデルのスコアが単独でどのように答えるかを証明しますが、ピアプレッシャー下でのスコアの方法ではありません。
マルチエージェントLLMシステムにおいて,このシフトが共形予測を静かに破ることを示す。
オープンウェイトモデルとマルチチョイスQAタスク全体にわたって、カバー範囲は、標準アルファ = 0.10 の操作点において、一貫したピアの下で90%から 74% に調整されている。
証明書がカバーしている低信頼のアイテムをターゲットにすることで、攻撃者はサブグループのカバレッジを87%から47%に半減させ、監視対象の平均はずっと高いままになります。
不確実な時にエスカレートすべきシステムは、攻撃者の間違った答えに対処するのに十分な自信を持つことができる。
問題分布は変化していない; モデルのスコアリング動作は変化している。
関連論文リスト
- LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails [0.0]
自己改善エージェントパイプラインは、その中心に問題がある。
評価信号は、判定バイアス、ハーネスとメートル法故障、地道エラー、報酬ハッキングの11のクラスで失敗した。
ProCTORは、ステートフルオーケストレータがすべてのツールアクセスを保持し、ステートレスサブエージェントが障害を診断し、それらが適用できないドラフト突然変異を診断する、教師と学生のループである。
論文 参考訳(メタデータ) (2026-09-02T07:54:23Z) - Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation [52.58737865652009]
NLPにおけるMultiple-choice Question answering (MCQA)ベンチマークは、数右スコアリング(精度)を用いる。
教育試験において、スコアリング方式は、応答モードモデルが従うこと、および応答のグレーディングルールの組み合わせであり、どの能力に報酬を与えるかを規定する重要な設計選択である。
我々は、MCQAが6つの教育にインスパイアされた6つのスキームで、正確性を超えた能力を評価することで、数字右の代替手段がどのように変化するかを検討する。
論文 参考訳(メタデータ) (2026-08-30T16:35:22Z) - LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning [6.241883798820154]
モデル間コンセンサス(モデル間コンセンサス)について検討し、独立に訓練されたモデル(各モデルが一度解ける程度)が最終解に一致するかを検討した。
パネルをLCM判定として扱い、合意の構造は、他のモデルのスコアではなく、検証信号である。
3つのパネル統計値から平均絶対誤差0.03$までのコンセンサス精度を予測する。
論文 参考訳(メタデータ) (2026-07-11T05:57:54Z) - PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents [0.0]
自己進化型エージェントは、自身のプロンプト、スキル、オーモーフィケーションの変更を繰り返し提案することで改善する。
Qwen2.5 のエージェント (0.5B-3B) が GSM8K, SVAMP, ARC-Challenge のプロンプトレベルで自己進化する際、greedy は 30-42% の偽陽性と 10-33% の有害な編集をコミットする。
PACEは実際のものをコミットし、グリーディのホールトアウトの精度を著しく低いばらつきと約18%低い評価コストで一致させる。
論文 参考訳(メタデータ) (2026-06-06T11:12:11Z) - Empirical Bayes Conformal Prediction for Vision and Language Models [20.40115871314124]
コンフォーマル予測(CP)は、現代のビジョンと言語モデルに対して、分布のないカバレッジを提供する。
標準CP は 1 つの実現法を使い、平均列キャリブレートの変種は点推定に滑らかな多重実現法を用いる。
実験的なベイズ共形予測フレームワークについて述べる。これは$r$-valuesを用いて、スコアの変動性を不確実な非整合性スコアに変換する。
論文 参考訳(メタデータ) (2026-05-22T03:17:14Z) - The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation [67.26315138466312]
モデルロールアウトから経験的信頼性を推定するキャリブレーション対応のOPDフレームワークであるCaOPDを提案する。
本研究は, 能力蒸留が信頼性を示唆するものではないこと, 信頼性をポストトレーニングの本質的な目的として扱うべきであることを明らかにする。
論文 参考訳(メタデータ) (2026-04-18T04:43:40Z) - From Debate to Decision: Conformal Social Choice for Safe Multi-Agent Deliberation [12.294365308421606]
我々は、議論のアウトプットを調整された行動逆エスカレート決定に変換する、ポストホックな意思決定層であるConformal Social Choiceを紹介する。
階層的なアクションポリシーは、シングルトンセットを自律的なアクションにマップし、より大きなセットを人間のエスカレーションにマップする。
この層は議論が確実に間違っている場合に作用しないため、残りの共形シングルトンは90.0--96.8%の精度に達する。
論文 参考訳(メタデータ) (2026-04-09T00:15:20Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs [72.82403830490084]
我々は、復号規則は正確さによって校正されるべきであり、自信だけではならないと論じている。
Greedy-Threshold はこの目標を達成するための単純な戦略を提案します。
この結果から,不確実性の下での復号化が問題視され,数学や一般推論のベンチマークで有意な差がみられた。
論文 参考訳(メタデータ) (2025-10-07T14:46:12Z) - LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models [69.68379406317682]
暗黙的および明示的な信頼マーカーを校正するリスナー対応微調整法 (LACIE) を提案する。
我々は,LACIEがリスナーをモデル化し,回答が正しいかどうかだけでなく,リスナーに受け入れられるかどうかを考察する。
LACIEによるトレーニングの結果、正しい回答の受け入れレベルを維持しながら、誤った回答が受け入れられる割合が47%減少することがわかった。
論文 参考訳(メタデータ) (2024-05-31T17:16:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。