論文の概要: Benchmarking candidate coverage and rejection policy transfer in typed decision models
- arxiv url: http://arxiv.org/abs/2610.03387v2
- Date: Tue, 06 Oct 2026 02:17:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.274332
- Title: Benchmarking candidate coverage and rejection policy transfer in typed decision models
- Title(参考訳): 型付き決定モデルにおける候補カバレッジと拒否ポリシー伝達のベンチマーク
- Abstract要約: 公開参照ラベルを用いてLaya,Jev,Qwen2.5-7B-Instructを比較した。
ソースキャリブレーションは、しばしばターゲットの動作点を保存するのに失敗する。
10の意図的候補を持つLayaは、スコープ外クエリの99.0%を検出するが、カバークエリの48.8%を拒否する。
- 参考スコア(独自算出の注目度): 7.736174008951463
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Rejection policies must remain useful as candidate sets and tasks change. We compare Laya, Jev and Qwen2.5-7B-Instruct using public reference labels, testing Laya/Jev policy transfer at equal calibration budgets and all three models on artificial omission, natural retrieval misses and public out-of-scope queries. Source calibration often fails to preserve the target operating point. A Jev policy calibrated on DBpedia rejects 69.3% of covered Emotion test inputs, while an Emotion policy loses detection entirely. Retrieval exposes a different tradeoff: with ten intent candidates, Laya detects 99.0% of out-of-scope queries but rejects 48.8% of covered queries. Separating missing-answer sources reveals these costs alongside retrieval coverage. The benchmark provides shared inputs, explicit decision and failure categories, and reproducible scoring to assess rejection policies under the conditions in which they are reused. Code and benchmark artifacts are available at https://github.com/luckykevvv/Decision_Model_Benchmark.
- Abstract(参考訳): 拒絶ポリシーは、候補セットとタスクの変更として有用でなければならない。
ラヤ,Jev,Qwen2.5-7B-インストラクトを公開基準ラベルを用いて比較し,均等なキャリブレーション予算でLaya/Jevポリシ転送をテストする。
ソースキャリブレーションは、しばしばターゲットの動作点を保存するのに失敗する。
DBpediaで校正されたJevポリシーは、カバーされた感情テスト入力の69.3%を拒絶し、Emotionポリシーは完全に検出を失う。
10の意図的候補を持つLayaは、スコープ外クエリの99.0%を検出するが、カバークエリの48.8%を拒否する。
欠落した回答ソースを分離すると、検索カバレッジとともにこれらのコストが明らかになる。
このベンチマークは、共有インプット、明示的な決定と失敗カテゴリ、再現可能なスコアを提供し、再利用条件下での拒絶ポリシーを評価する。
コードとベンチマークアーティファクトはhttps://github.com/luckykevvv/Decision_Model_Benchmarkで公開されている。
関連論文リスト
- Pinning Decisions Before Failure: Executable Records of Underspecified Choices in AI-Assisted Code Generation [0.0]
自然言語の要件は質問をオープンにし、それを実装するよう要求されたモデルが静かに解決する。
3つのモデルから600以上のテストスイートが生成され、42.7%は競合するリードを区別するテストを含んでいない。
要件の未特定点を名前で列挙し、それぞれのコンストラクタに対して、そのポイントでのみ異なる2つの捨てられた実装を列挙します。
結果は、名前付きポイント、確認された入力、および2つの結果の中から選択した値の判定ピンとして記録される。
論文 参考訳(メタデータ) (2026-10-02T12:46:07Z) - CreateScore: Domain-Theory-Informed Bayesian Routing for LLM-Based CV Screening [0.0]
提案するCreateScoreは、基準レベルLLMルーティングのためのドメイン理論インフォームドベイズネットワークである。
ディリクレ・マルチノミカル条件付き確率表を持つグラフは、CV証拠を後続の不確実性に変換する。
低不確実性判定は局所8Bモデルによって解決され、不確実性判定は120B参照モデルにエスカレーションされる。
論文 参考訳(メタデータ) (2026-10-02T08:06:24Z) - IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications [52.570108663867046]
研究のアイデアは、新しく、一貫性があり、科学的に妥当であるが、その提案された手法は、忠実な実装のために不十分に指定されている。
提案手法は,実装を対象とする研究手法仕様の体系化の可否を,有能な実装者やコーディングエージェントに十分な方法論的情報を提供して,前提条件を満たさずに目的とする手法を構築することができるかを検討する。
IdeaAMBIGは660のエビデンス基底インスタンスのベンチマークで、レポートとGitHubの問題から163の現実世界のギャップと、コーディフィケーション対応のリファレンスに注入される合成ギャップを497のコントロールで管理する。
論文 参考訳(メタデータ) (2026-09-09T17:59:04Z) - CARRE: Counterfactual Action Retrieval and Reason Evaluation for Explainable Churn Prescription [5.823033362443801]
CARREは,検索強化候補生成,費用対効果評価,大規模言語モデル(LLM)推論を組み合わせた3段階のフレームワークである。
IBM Telco Customer Churnデータセットでは、CARREは通常のSHAPベースラインよりも79.8%高い平均モデル予測リスク削減を実現している。
論文 参考訳(メタデータ) (2026-09-09T06:08:02Z) - Abstention Errors and Segment Support in CUAD: An Auditable Contract-Extraction Case Study [0.0]
本稿では,CUAD が発行した 102-contract test split に対する固定公開 RoBERTa チェックポイントの再現性評価について述べる。
30,464の返却候補文字列のうち19,562は注釈付き回答のない質問に現れる。
このシステムは2,938問のうち1,335問に答え、45.4%が偽陽性である。
論文 参考訳(メタデータ) (2026-09-07T21:26:53Z) - Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs [42.32694162421078]
CALVERは、パールの因果基準に対して構造化されたトレースをスコアする訓練不要なシンボル検証器である。
CALVERは、複数のグラフ正解を許容するCLEAR検索1価クエリにおいて、報酬モデル、LLM審査員、モデルの信頼性が30%近く残っている42.1%に達する。
論文 参考訳(メタデータ) (2026-08-04T11:45:46Z) - Beyond Correctness: Evaluating Subjective Writing Preferences Across Cultures [87.75098311090642]
現在の選好学習法は、標準ベンチマークで高い精度を達成するが、客観的な品質信号を取り除いた場合、顕著な性能劣化を示す。
我々は、8つのクリエイティブな著作ジャンルにまたがる1,800の人手による好みペア(1,200の英語、600の中国語)のデータセットであるWriteingPreferenceBenchを紹介した。
論文 参考訳(メタデータ) (2025-10-16T12:23:13Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - Improving Selective Visual Question Answering by Learning from Your
Peers [74.20167944693424]
VQA(Visual Question Answering)モデルは、間違っていた場合の回答を控えるのに苦労する可能性がある。
本稿では,複数モーダル選択関数の学習におけるLearning from Your Peers (LYP) アプローチを提案する。
提案手法では,学習データの異なるサブセットに基づいて訓練されたモデルの予測を,選択的VQAモデルの最適化のターゲットとして利用する。
論文 参考訳(メタデータ) (2023-06-14T21:22:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。