論文の概要: Signed Lexical Confidence for Risk-Calibrated Intent Routing
- arxiv url: http://arxiv.org/abs/2610.00262v1
- Date: Thu, 24 Sep 2026 07:06:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.587093
- Title: Signed Lexical Confidence for Risk-Calibrated Intent Routing
- Title(参考訳): リスクキャリブレーションされたインテントルーティングのための署名付き語彙信頼
- Abstract要約: 文分類器のロジットマージンとスパース語彙モデルの予測意図に対するサポートを結合した符号付き語彙ゲートを導入する。
正の証拠を語彙的合意に割り当て、負の証拠を語彙的に好意的に競合する意図に割り当てることにより、ゲートは符号のない語彙的信頼またはハード・コンセンサス・ルールよりも多くの情報を保持する。
提案機能では,テスト済みの語彙信頼機能よりも平均エラーランキングが向上し,バイナリ契約よりもデータセットに依存したゲインが得られた。
- 参考スコア(独自算出の注目度): 0.15293427903448023
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Selective intent routing allows an assistant to act on reliable predictions while deferring uncertain requests. Standard confidence scores primarily reflect the base model's representation, leaving an opportunity to incorporate complementary evidence without changing its decisions. We introduce a signed lexical gate that combines a sentence classifier's logit margin with a sparse lexical model's support for the classifier's predicted intent. By assigning positive evidence to lexical agreement and negative evidence to a lexically favored competing intent, the gate retains more information than either unsigned lexical confidence or a hard agreement rule. An independent binomial calibration stage selects an operating threshold for a specified risk target. Across ten runs on BANKING77, CLINC150, and HWU64, the proposed score reduces area under the risk-coverage curve by 15.8%, 15.1%, and 11.8% relative to a learned semantic-only gate. At a nominal 5% error target, it increases accepted coverage by 1.83 and 5.14 percentage points on BANKING77 and HWU64, while CLINC150 is already near full coverage. At a stricter 2% target, the simultaneous binomial procedure yields a nonempty policy in all 30 dataset-run combinations at the available calibration budgets. Matched controls show that the proposed feature improves average error ranking over the tested unsigned lexical-confidence feature, with dataset-dependent gains over binary agreement. The resulting two-feature gate provides a compact, interpretable confidence enhancement for risk-calibrated intent routing while preserving the base classifier's predictions.
- Abstract(参考訳): 選択意図ルーティングは、不確実な要求を遅延しながら、アシスタントが信頼できる予測を行うことを可能にする。
標準信頼スコアは主にベースモデルの表現を反映しており、決定を変更することなく補完的な証拠を組み込む機会を残している。
文分類器のロジットマージンとスパース語彙モデルの予測意図に対するサポートを結合した符号付き語彙ゲートを導入する。
正の証拠を語彙的合意に割り当て、負の証拠を語彙的に好意的に競合する意図に割り当てることにより、ゲートは符号のない語彙的信頼またはハード・コンセンサス・ルールよりも多くの情報を保持する。
独立二項校正段階は、特定リスク目標に対する動作しきい値を選択する。
BANKING77、CLINC150、HWU64の10回にわたって、提案されたスコアは、学習された意味のみのゲートに対して、リスク被覆曲線の領域を15.8%、15.1%、11.8%削減する。
名目上の5%のエラーターゲットでは、BANKING77とHWU64で許容範囲が1.83と5.14ポイント増加し、CLINC150はすでに完全にカバーされている。
厳格な2%の目標で、同時二項法は、利用可能なキャリブレーション予算で、30のデータセットと実行された組み合わせ全てで空でないポリシーを下す。
一致したコントロールでは、提案された機能は、テスト済みの語彙信頼機能よりも平均エラーランキングを改善し、バイナリ契約よりもデータセット依存的なゲインを実現している。
結果として生じる2機能ゲートは、基本分類器の予測を保ちながら、リスク校正インテントルーティングのコンパクトで解釈可能な信頼性向上を提供する。
関連論文リスト
- Epistemic Learning from Imprecise Annotation [9.75434908987426]
本稿では,クレダル集合(redal set)と呼ばれる,可塑性ラベリング分布の凸集合を監督し,予測分布の集合を学習するフレームワークを提案する。
我々は,最悪のケースとベストケースの損失を最小限に抑えるために訓練された2つの分類ヘッドと共有バックボーンを組み合わせた悲観的・最適化的クレダル分類器(POCC)を用いて,フレームワークをインスタンス化する。
POCCは、予測精度、キャリブレーション、不確実性に基づく選択的分類と競争ベースラインとの良好なバランスを達成する。
論文 参考訳(メタデータ) (2026-09-28T04:29:52Z) - Testing-Driven Reliability Audit of Trajectory-Based Early Outcome Prediction for LLM Agents: Target-Specific Calibration Transfer Persists Within a Single Benchmark [0.0]
軌道に基づく早期結果の予測は、結果が十分に予測可能になったときにランを終了させることにより、エージェント評価に関連する費用を削減できる。
このような転送障害がエージェントシステムにまたがっているのか、あるいは特定のターゲットエージェント/ヘッドの組み合わせに集中しているのかは不明だ。
パブリックなSWE-bench Verified trajectoriesと凍結したデュアルヘッド早期アウト予測パイプラインを使用して、我々は、Left-one-agent-out calibration auditを実行した。
論文 参考訳(メタデータ) (2026-09-22T03:57:30Z) - Available Guardrails: Certifying Selective Prediction across ML Systems [40.57629016626049]
安全, 粒度, サービストラフィックのトレードオフを明らかにする動的プログラムを開発する。
1つの計画上の候補分割を分割し、その中の1つを選択すると、このギャップの一部が回復することを示す。
相補的妥当性保存レバーは、報告ユニット間で家庭的にエラー予算を割り当て、追加のカバレッジを回復する。
論文 参考訳(メタデータ) (2026-09-18T17:36:52Z) - $TCP_α$: Margin-Controlled Confidence estimation for reliable Music Information Retrieval [7.679660052685777]
ディープニューラルネットワークは、しばしば過信であり、誤った予測にも高い信頼を割り当てる。
既存のターゲットは、重複する信頼値を正しい予測と間違った予測に割り当てる一方、決定境界付近のエラーは正しい予測と区別できない信頼スコアを受け取る。
提案するTCP_$は,不特定サンプルに対してマージン制御されたペナルティを導入することで,これらの制限を解消する新しい信頼度ターゲットである。
論文 参考訳(メタデータ) (2026-08-20T17:58:50Z) - ReliableNet: A Chance-Constrained Approach to Trustworthy Classification in Deep Learning [0.0]
自信と間違いの両方がある予測は、重大な信頼性の失敗です。
本稿では,JCW(Joint Confident-Wrong)確率を制約するReliableNetを提案する。
ReliableNetは、データセット毎にJCW予算内で認証される唯一のメソッドである。
論文 参考訳(メタデータ) (2026-08-10T15:58:19Z) - Conditional Coverage Diagnostics for Conformal Prediction [47.93989136542648]
条件付きカバレッジ推定が分類問題であることを示す。
得られたメトリクスの族をターゲットカバレッジ(ERT)の過剰なリスクと呼びます。
ERTのオープンソースパッケージと、以前の条件付きカバレッジメトリクスをリリースしています。
論文 参考訳(メタデータ) (2025-12-12T18:47:39Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - Conformal Prediction Sets with Improved Conditional Coverage using Trust Scores [52.92618442300405]
有限サンプルにおいて、正確に分布のない条件付きカバレッジを達成することは不可能である。
本稿では,最も重要となる範囲を対象とするコンフォメーション予測アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-01-17T12:01:56Z) - Equal Opportunity of Coverage in Fair Regression [50.76908018786335]
我々は、予測の不確実性の下で公正な機械学習(ML)を研究し、信頼性と信頼性のある意思決定を可能にする。
本研究は,(1)類似した結果の異なる集団に対するカバー率が近いこと,(2)人口全体のカバー率が一定水準にあること,の2つの特性を達成することを目的としたカバーの平等機会(EOC)を提案する。
論文 参考訳(メタデータ) (2023-11-03T21:19:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。