論文の概要: Learning When to Trust via Selective Context Preference Optimization
- arxiv url: http://arxiv.org/abs/2608.06377v1
- Date: Thu, 06 Aug 2026 17:59:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.816287
- Title: Learning When to Trust via Selective Context Preference Optimization
- Title(参考訳): 選択的文脈選好最適化による信頼すべき時期の学習
- Authors: Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong,
- Abstract要約: 言語モデルは次第に外部の信号に答えを条件付けている。
誤解を招く人は正しい答えを間違えることがある。
私たちはその問題を選択的信頼と再考した。
- 参考スコア(独自算出の注目度): 34.54211638111961
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models increasingly condition their answers on external signals, and a single misleading one can turn a correct answer wrong. The obvious remedy, training models to resist such signals, hides a failure mode: a model that ignores all context looks robust yet is useless when the context is worth trusting. We recast the problem as selective trust and introduce MIST, a human-annotated benchmark that renders each reasoning item under four matched conditions (clean, misleading, correct-context, and irrelevant-context), together with SC2W, a paired metric counting how often a misleading signal flips a clean-correct answer to wrong. Across a comprehensive benchmark study, we observe that such a susceptibility is universal. We then propose SCOPE, which mines clean-correct/misleading-wrong failures and optimizes a standard Direct Preference Optimization (DPO) objective over matched preference pairs balanced equally across all four conditions, rather than over misleading items alone. Our approach substantially reduces SC2W on popular open-sourced models while preserving accuracy when the added context is clean, correct, or irrelevant. With this work, we argue that models should be judged on selective trust, not on resistance alone.
- Abstract(参考訳): 言語モデルは、外部の信号に回答を条件付けし、誤解を招く1つが正しい答えを間違える可能性がある。
このような信号に抵抗するモデルをトレーニングする明らかな治療法は、障害モードを隠蔽する — すべてのコンテキストを無視しながら堅牢に見えるモデルは、コンテキストが信頼に値する場合には、役に立たない。
我々は、この問題を選択的信頼として再考し、各推論項目を4つの一致した条件(クリーン、ミスリーディング、正しいコンテキスト、無関係なコンテキスト)でレンダリングする人間アノテーションのベンチマークであるMISTと、ミスリーディング信号が誤りを正す頻度をカウントするペアメトリックであるSC2Wを紹介した。
総合的なベンチマーク研究全体を通して、そのような感受性は普遍的であることを観察する。
次に、クリーンな誤り/ミスリーディングの失敗をマイニングし、ミスリーディングアイテムのみではなく、4つの条件で均等にバランスした一致した選好ペアに対して、標準の直接選好最適化(DPO)目標を最適化するSCOPEを提案する。
提案手法は,追加のコンテキストがクリーンで,正しいか,あるいは無関係である場合の精度を保ちながら,人気のあるオープンソースモデル上でのSC2Wを大幅に削減する。
この作業では、モデルが選択的信頼に基づいて判断されるべきであり、抵抗のみに基づいて判断されるべきである、と論じる。
関連論文リスト
- LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning [6.241883798820154]
モデル間コンセンサス(モデル間コンセンサス)について検討し、独立に訓練されたモデル(各モデルが一度解ける程度)が最終解に一致するかを検討した。
パネルをLCM判定として扱い、合意の構造は、他のモデルのスコアではなく、検証信号である。
3つのパネル統計値から平均絶対誤差0.03$までのコンセンサス精度を予測する。
論文 参考訳(メタデータ) (2026-07-11T05:57:54Z) - CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction [51.56484100374058]
既存のLLM(Large Language Models)のキャリブレーション手法は、しばしば信頼性の重要な次元、すなわちモデルの振舞いの堅牢性を見落としている。
我々は,モデルが注意をそらす可能性を直接測定し,罰する,新しいポストホックキャリブレーション手法であるtextscCaliDistを紹介した。
textscCaliDistは、強いベースラインと比較して、期待の低いエラー(ECE)とBrier Scoreを一貫して達成します。
論文 参考訳(メタデータ) (2026-06-04T07:27:53Z) - Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy [41.17236645999555]
本研究では,現実的な質問応答や数学的推論タスクにおいて,意味保存的言い回しの下でモデル解がどう変化するかを検討する。
4つのベンチマークと13のモデルで、モデル出力はプロンプトの正確な表現に依存することが多い。
多くの質問に対して、モデルはフレーズによって正しい答えと間違った答えを交互に行い、ミスマッチ率は23%以上に達する。
論文 参考訳(メタデータ) (2026-05-18T16:45:13Z) - Pause and Reflect: Conformal Aggregation for Chain-of-Thought Reasoning [8.024041325202612]
自己整合性を考慮した思考の連鎖(CoT)推論は、複数のサンプル推論パスを集約することで性能を向上させる。
集約不確実性に直接対処するCoT推論のコンフォメーション手順を導入する。
提案手法は,多数決を推理経路よりも重み付けしたスコアアグリゲーションに置き換え,共形リスク制御を用いた棄権規則を校正する。
論文 参考訳(メタデータ) (2026-05-13T20:33:59Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs [72.82403830490084]
我々は、復号規則は正確さによって校正されるべきであり、自信だけではならないと論じている。
Greedy-Threshold はこの目標を達成するための単純な戦略を提案します。
この結果から,不確実性の下での復号化が問題視され,数学や一般推論のベンチマークで有意な差がみられた。
論文 参考訳(メタデータ) (2025-10-07T14:46:12Z) - Judging with Confidence: Calibrating Autoraters to Preference Distributions [56.17041629492863]
信頼性の高いオートラッターは、対象の個体群によって定義される嗜好の完全な分布をモデル化することを学ぶ必要がある、と我々は主張する。
異なるデータ条件に合わせた2つの学習方法を提案する。
この結果から, 分布マッチング目的の微調整オートレーダは, 目的の好み分布に整合した有言確率予測を導出することがわかった。
論文 参考訳(メタデータ) (2025-09-30T20:36:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。