論文の概要: Risk Is Not Review Value: Wrong-Answer Exposure Under Bounded Review Budgets
- arxiv url: http://arxiv.org/abs/2609.07095v1
- Date: Mon, 07 Sep 2026 06:33:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.371073
- Title: Risk Is Not Review Value: Wrong-Answer Exposure Under Bounded Review Budgets
- Title(参考訳): リスクはレビューの価値ではない-バウンド・レビュー・バッジ(表
- Abstract要約: LLMアシスタントは、ユーザーがそれを見る前に、人間がレビューできるよりも多くの回答を生成することが多い。
WOR(Wrong-Answer Exposure Ratio)とPRRE(Post-Repair residual exposure)によるレビューキューの評価を行った。
PRREは、ランキングに使用される余裕スコアを数値的に再利用しない修理可能性ルールを使用している。
- 参考スコア(独自算出の注目度): 8.011258884089948
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM assistants often produce more answers than humans can review before users see them. Most evaluations ask whether an answer is wrong, unsupported, or low-confidence. Bounded review budgets instead ask which answers should be checked first under a fixed review budget. Risk alone is not enough: a high-risk answer may be hard to repair, while a moderately risky answer may be directly correctable from available evidence. For generated-answer evaluation, we model review prioritization as exposure reduction, where review value combines estimated wrongness, intervention affordance, impact, and cost. We evaluate review queues with Wrong-Answer Exposure Ratio (WAER), the fraction of wrong answers left unreviewed, and post-repair residual exposure (PRRE), the fraction still exposed after deterministic benchmark-supported repairs. PRRE uses repairability rules that do not numerically reuse the affordance scores used for ranking. On a 720-item TAT-QA/SciFact stress benchmark, review-value ranking keeps answer-level WAER nearly unchanged at 20% budget (0.605 vs. 0.600) but lowers PRRE from 0.881 to 0.716. These results show that trustworthy LLM evaluation should measure not only error detection, but also how limited review capacity reduces exposed wrong answers.
- Abstract(参考訳): LLMアシスタントは、ユーザーがそれを見る前に、人間がレビューできるよりも多くの回答を生成することが多い。
ほとんどの評価では、答えが間違っているか、サポートされていないか、自信の低いかを問う。
境界付きレビュー予算は、その代わりに、どの回答をまず、固定されたレビュー予算の下でチェックすべきかを尋ねます。
リスクだけでは十分ではない: 高リスクの回答は修理が難しいかもしれないし、適度にリスクの高い答えは、利用可能な証拠から直接修正できるかもしれない。
提案手法では,予測誤り,介入の可否,影響,コストを評価値と組み合わせて,被曝低減として優先度付けをモデル化する。
我々は,Wrong-Answer Exposure Ratio (WAER) によるレビューキューの評価を行った。
PRREは、ランキングに使用される余裕スコアを数値的に再利用しない修理可能性ルールを使用する。
720項目のTAT-QA/SciFactストレスベンチマークでは、回答レベルWAERは20%の予算(0.605対0.600)でほぼ変化しないが、PRREは0.881から0.716に低下する。
これらの結果から, 信頼度の高いLCM評価は, 誤り検出だけでなく, レビュー能力の制限によって誤った回答が減ることを示す。
関連論文リスト
- ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation [54.82704239643649]
本稿では, 紙固有の診断と具体的, 基礎的なリビジョン計画とを結びつける, 反感に満ちたポストトレーニングフレームワークである ActReview を紹介する。
我々の中心的な洞察は、著者の反論は、レビュアーの懸念に対処するための妥当な行動を明らかにし、それゆえ、リビジョン指向のフィードバックに対する潜在的な監督を提供することができるということである。
またActReview-Benchは、診断品質とリビジョンの有用性を評価するために、1,000インスタンスの人為的なベンチマークである。
論文 参考訳(メタデータ) (2026-09-08T17:30:16Z) - More Criticism Does Not Make a Better Review: EquiReview-R [5.8331781561663645]
我々は、AI支援レビューを、構造化された関心事セットのエビデンスガイダンスによる洗練として再考した。
EquiReview-Rを導入し、局所的な証拠に対する既存の懸念を解決する。
未確認論文の凍結コホート上では、EquiReview-R は未定の非不等式基準を満たす。
論文 参考訳(メタデータ) (2026-09-03T14:49:24Z) - Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning [9.345403722854543]
私たちは、専用のレビューステージが間違った候補を正しい候補に変えるのに役立つという仮定をテストします。
我々は、このギャップがレビュアーの品質によって説明されるのか、それともプロトコルが進める次の回答に批判が変わるのかを問う。
論文 参考訳(メタデータ) (2026-07-16T18:38:10Z) - LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation [79.03892269184145]
LivingArenaは自動汚染耐性評価フレームワークである。
モデルは質問を交互に提案し、相手が正しく答えられないアイテムを提示する。
質問者は、相手の知識境界を積極的に特定し、活用することが奨励される。
論文 参考訳(メタデータ) (2026-06-19T06:20:58Z) - Intelligence Is Not the Bottleneck: Validating an LLM First-Pass Manuscript Score Against Peer-Review Outcomes [0.0]
大規模言語モデル(LLM)システムは、ピアレビューを支援するためにますます提案されている。
ほとんどの評価は、システムが割り当てる数値スコアの妥当性ではなく、機械生成レビューテキストの散文を判断する。
提案した原稿を読み取って5つの0-100品質ディメンションと重み付き総合スコアを出力するAIPRを検証する。
論文 参考訳(メタデータ) (2026-06-14T16:13:15Z) - PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges [33.739528721872844]
役に立ち、現実的」な回答を求めるあいまいなルーリックは、事実を発明したり、ユーザーの意図に反する、洗練された答えに報いることができる。
PReMISEは, 構造的妥当性, 信頼性, 嗜好適合性, 対向ロバスト性という4つの軸に沿って, LLM-judge の下で使用されるすべてのルーブリックを監査するフレームワークである。
選好ランク選択は、ペア化された応答の判定精度を65.0%から6.8.6%に引き上げ、最強のルーリック発見ベースラインと競合し、クロスジャッジスイープの審査員のうち2人を導いた。
論文 参考訳(メタデータ) (2026-05-29T03:45:11Z) - Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations [3.262230127283452]
審査員が不正に完了したクエリに応答すると,評価者が自己優先の判断を下す可能性があることを示す。
評価基準(Evaluator Quality Baseline)を導入し,審査員が不正に投票した確率と,別のモデルから不正な反応を投票した確率とを比較した。
論文 参考訳(メタデータ) (2026-01-30T04:38:18Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Reconfidencing LLMs from the Grouping Loss Perspective [56.801251926946485]
大規模言語モデル(LLM)は、自信のある音調で幻覚的な答えを生じさせる可能性がある。
近年の研究では、不確実性制御はキャリブレーションを超えて行わなければならないことが示されている。
そこで我々は,MistralとLLaMAの回答に対する信頼度を評価するために,知識ベースから導出した新しい評価データセットを構築した。
論文 参考訳(メタデータ) (2024-02-07T15:40:22Z) - Confidence-Budget Matching for Sequential Budgeted Learning [69.77435313099366]
問合せ予算で意思決定問題を定式化する。
我々は,多腕バンディット,線形バンディット,強化学習問題を考察する。
我々は,CBMに基づくアルゴリズムが逆性の存在下で良好に動作することを示す。
論文 参考訳(メタデータ) (2021-02-05T19:56:31Z) - Automating App Review Response Generation [67.58267006314415]
本稿では,レビューと回答の知識関係を学習することで,レビュー応答を自動的に生成する新しいアプローチRRGenを提案する。
58のアプリと309,246のレビュー-レスポンスペアの実験では、RRGenはBLEU-4の点で少なくとも67.4%のベースラインを上回っている。
論文 参考訳(メタデータ) (2020-02-10T05:23:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。