論文の概要: A Query Is Not a Commitment: Learning to Correct Expert Answers in Online Deferral
- arxiv url: http://arxiv.org/abs/2610.07084v1
- Date: Mon, 05 Oct 2026 11:55:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.54595
- Title: A Query Is Not a Commitment: Learning to Correct Expert Answers in Online Deferral
- Title(参考訳): クエリはコミットではない - オンラインデフレで専門家の回答を正すための学習
- Abstract要約: そこで本研究では,学習者が専門家を選別し,回答を得る前に修正機能を修正するオンライン学習について検討する。
観察された損失は、専門家の品質と未完成の修正の両方を反映している。
本稿では,ORUCBを提案する。
- 参考スコア(独自算出の注目度): 6.792743621449621
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: An inaccurate expert can still provide useful information after correction. We study online learning to defer in which the learner chooses an expert and fixes a correction function before purchasing its answer, then applies that function to the answer received. The difficulty is that observed losses reflect both expert quality and an unfinished correction: early errors can discourage queries that would be valuable after learning. We propose ORUCB, which pools shared and expert-specific polynomial responses. A bound on cumulative response-learning error calibrates confidence-weighted risk regression and exploration, allowing the router to account for this error when deciding which answers to buy. Under bounded residuals and disagreements, a fixed feasible model of optimal responses, and linear models of free and optimal queried risk, the calibrated algorithm achieves high-probability pseudo-regret $O(\sqrt T\log(T+1))$ over $T$ rounds for fixed problem parameters. The guarantee permits singular answer distributions and misspecified shared responses; optimality is relative to the bounded response class. On four test streams, the selected cubic policy has lower fee-inclusive cost than seven baselines that deploy answers unchanged. Comparisons with a common correction learner examine routing, while six-price comparisons measure cost and query rates.
- Abstract(参考訳): 不正確な専門家は、訂正後も有用な情報を提供することができる。
本研究は,学習者が専門家を選別し,回答を取得する前に修正関数を修正し,その関数を受信した回答に適用するオンライン学習について検討する。
観察された損失は、専門家の品質と未完成の修正の両方を反映している。
共有および専門家固有の多項式応答をプールするORUCBを提案する。
累積応答学習誤差は、信頼度重み付けされたリスクレグレッションと探索を校正し、どの回答を購入するかを決める際にルータがこのエラーを考慮できる。
有界残差と不一致、最適応答の固定可能なモデル、および自由および最適クエリリスクの線形モデルの下で、キャリブレーションされたアルゴリズムは、固定問題パラメータに対する$O(\sqrt T\log(T+1))$オーバーT$ラウンドを達成する。
この保証は特異応答分布と不特定共有応答を許容し、最適性は有界応答クラスと相対的である。
4つのテストストリームでは、選択された立方体ポリシーは、回答を展開しない7つのベースラインよりも、手数料非包括的なコストが低い。
一般的な修正学習者との比較ではルーティングを,6値比較ではコストとクエリ率を測定した。
関連論文リスト
- When Should LLMs Trust Their Own Revisions? A Risk-Aware Study of Intrinsic Self-Correction [29.91953104203498]
内在的な自己訂正は、新たな外部証拠を受け取らずに、言語モデルに自身の回答を改訂するよう要求する。
第2のパスはミスを回復できるが、すでに正しい回答を覆すこともできる。
このトレードオフを,BoolQ,GSM8K,Corr2Cause上で29個のオープンウェイトLLMに対して検討した。
論文 参考訳(メタデータ) (2026-09-23T21:05:53Z) - Online Set Learning from Precision and Recall Feedback [60.00180898830079]
オンライン設定でドメインの未知のサブセットである$N_texttarget$を学習する問題を考察する。
この単純なオンラインセット学習問題は、精度とリコール型のフィードバックで様々な学習シナリオを抽象化する。
この設定で仮説クラスが学習可能であることを示し、それが有限のヴァプニク・チェルヴォネンキス次元を持つ場合に限る。
論文 参考訳(メタデータ) (2026-05-10T14:28:05Z) - Decision from Suboptimal Classifiers: Excess Risk Pre- and Post-Calibration [52.70324949884702]
バッチ二分決定における近似的後続確率を用いた余剰リスクの定量化を行う。
我々は、再校正のみが後悔のほとんどに対処する体制と、後悔が集団的損失に支配される体制を識別する。
NLP実験では、これらの量によって、より高度なポストトレーニングの期待値が運用コストに値するかどうかが分かる。
論文 参考訳(メタデータ) (2025-03-23T10:52:36Z) - Rationale-Aware Answer Verification by Pairwise Self-Evaluation [11.763229353978321]
信頼性のある検証器の訓練には,最終回答の正しさに加えて,有理数の有効性の確保が必要であることを示す。
本結果から, 信頼性検証には, 正解の正確性に加えて, 有理数の有効性の確保が必要であることが示唆された。
論文 参考訳(メタデータ) (2024-10-07T08:53:00Z) - The Perils of Optimizing Learned Reward Functions: Low Training Error Does Not Guarantee Low Regret [64.04721528586747]
報奨モデルの十分に低いテスト誤差は、最悪の場合の後悔を確実にすることを示す。
次に、ポリシー正則化技術を用いても、同様の問題が持続することを示す。
論文 参考訳(メタデータ) (2024-06-22T06:43:51Z) - A Mutual Information Maximization Approach for the Spurious Solution
Problem in Weakly Supervised Question Answering [60.768146126094955]
弱々しい教師付き質問応答は通常、最終的な答えのみを監督信号として持つ。
偶然に正解を導出する刺激的な解が多数存在するかもしれないが、そのような解の訓練はモデルの性能を損なう可能性がある。
本稿では,質問応答対と予測解間の相互情報の最大化により,このような意味的相関を明示的に活用することを提案する。
論文 参考訳(メタデータ) (2021-06-14T05:47:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。