論文の概要: Which Medical Questions Deserve Rationales? Perturbation-Sensitive Selection for Robust QA
- arxiv url: http://arxiv.org/abs/2609.09684v1
- Date: Wed, 09 Sep 2026 03:58:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.893325
- Title: Which Medical Questions Deserve Rationales? Perturbation-Sensitive Selection for Robust QA
- Title(参考訳): どの医学的質問が合理性を保つか : ロバストQAに対する摂動感的選択
- Abstract要約: 本稿では,ルート平均2乗ロバスト性に基づくサンプル優先化(RMS-RSP)を提案する。
RMS-RSPは5つのデータセットで同じ方向で平均1.91点と2.85点の堅牢な精度とセマンティック一貫性を改善する。
- 参考スコア(独自算出の注目度): 12.797519888387628
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Medical question-answering datasets often contain answer labels, whereas high-quality rationales remain scarce, noisy, or costly to validate. This changes the acquisition question: rather than asking which questions should be labeled, we ask which already-labeled questions should receive rationale supervision under a fixed token budget. We study an offline version of this problem in which candidate rationales are visible to the selector but withheld from downstream training unless selected. We propose root-mean-square Robustness-based Sample Prioritization (RMS-RSP), which perturbs hidden states only at rationale tokens and measures the resulting shift in the gold-versus-best-distractor margin. Across five medical QA datasets, MedGemma-4B-IT, three training seeds, ten budgeted non-RSP selectors, and an unbudgeted full-supervision reference, RMS-RSP provides a deliberately qualified result. Its locked-budget accuracy is 60.61% on average versus 60.08% for Random, with a statistically resolved gain only on AfriMed-QA (+1.44 points). Its full-budget accuracy area is not better than Random. However, after three answer-option reorderings, RMS-RSP improves robust accuracy and semantic consistency by 1.91 and 2.85 points on average, respectively, with the same direction on all five datasets. Training on every pool rationale raises macro accuracy to 63.74%, but consumes 29--254 times more rationale tokens and does not uniformly improve robustness. These findings do not establish universal accuracy gains; they instead suggest that rationale-local boundary sensitivity can identify supervision that improves invariance to semantically equivalent formatting changes.
- Abstract(参考訳): 医学的な問合せデータセットは、しばしば回答ラベルを含むが、高品質な合理性は、検証するに足りず、うるさく、うるさく、あるいはコストがかかる。
どの質問にラベルを付けるべきかを問うのではなく、どのラベル付けされた質問が固定されたトークン予算の下で合理的な監督を受けるべきかを問う。
提案手法は,選択者に対して有意な有理数が表示されるが,選択者以外は下流での訓練を控える,という問題のオフライン版について検討する。
本稿では,ルート平均二乗ロバスト性に基づくサンプル優先法(RMS-RSP)を提案する。
5つの医学的QAデータセット、MedGemma-4B-IT、3つの訓練種、10つの予算付き非RSPセレクタ、そして未予算のフルスーパービジョン参照において、RMS-RSPは意図的に適格な結果を提供する。
ロックバジェットの精度は平均60.61%でランサムは60.08%で、統計学的にはAfriMed-QA(+1.44点)でしか利得が得られない。
フル予算の精度はRandomほどではない。
しかし、3つのリオーダーの後、RMS-RSPは5つのデータセットでそれぞれ1.91点と2.85点の堅牢な精度とセマンティック一貫性を改善した。
プールの合理化の訓練では、マクロ精度は63.74%まで上昇するが、29~254倍の合理化トークンを消費し、ロバスト性は均一に向上しない。
これらの発見は、普遍的な精度向上を確立せず、代わりに、合理的局所境界感度は意味論的に等価なフォーマット変更への不変性を改善する監督を識別できることを示唆している。
関連論文リスト
- Adaptive Conformal Redistribution for Inter-class Transitional Uncertainty in Medical Image Classification [9.578682349231789]
アダプティブコンフォメーション(Adaptive conformal redistribution, AdaConRed)は、曖昧な予測セットを洗練されたクラス割り当てに変換する、ラベルのないポストコンフォーマル決定ルールである。
AdaConRedはLAC、APS、RAPSを同じバックボーンと再配布規則で上回る。
コンフォーマルな予測は、移行性疾患のカテゴリが存在する行動可能な意思決定支援に向けて、不確実性を超えて拡張することができる。
論文 参考訳(メタデータ) (2026-09-10T06:21:30Z) - PruneShift: A Framework for Evaluating Decision Reliability in Structured Pruning [1.8023933646971537]
構造化プルーニングは、すべての実現可能なマスクに対する直接的なタスク評価が高すぎるため、サロゲート目的を使用する。
本研究では,予測忠実度,セレクタ出力近傍の忠実度,選択されたプルーニング判定の品質を分離する評価フレームワークPruneShiftを紹介する。
論文 参考訳(メタデータ) (2026-08-30T12:52:16Z) - Know Before You Fetch: Calibrated Retrieval-Budget Allocation for Retrieval-Augmented Generation [10.60293484295824]
適応RAGをキャリブレーションした検索予算配分として定式化する。
シーケンスログの確率とプレフィックスログの不確実性信号を正しさの確率に調整する。
シーケンスログの確率については、TriviaQAでは0.275から0.062に、NQでは0.643から0.009に、MS MARCOでは0.711から0.031に低下する。
論文 参考訳(メタデータ) (2026-06-29T08:36:33Z) - TriageRA-CCF: Source-Side Clinical Confidence and Coverage Signals for Adaptive Rank Budgeting in Medical LLMs [8.601855281320903]
TriageRA-CCFは、適応的なランク予算の医療用大言語モデルのためのソースサイドの教師である。
ソーストレーニングデータからのみ計算される3つの信号、ベースモデル回答の信頼性、メタデータセル臨床カバレッジ、および対実的クローズミスプロキシを組み合わせる。
一致したCMBソーストレーニングプロトコルの下で、TriageRA-CCFはLoRA、DoRA、MoELoRAベースラインの中で最高の平均精度を達成する。
論文 参考訳(メタデータ) (2026-06-28T12:52:07Z) - The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning [54.0056619145783]
プロセス・リワード・モデル (Process Reward Models, PRM) は、段階的なフィードバックを提供することで、推論のためのクレジット割り当てを改善する。
ステップレベルのトレーニングデータにおいて,重度の不均衡に起因するPRMの隠れバイアスを同定する。
対照的な段階比較から学習するポリシ対応のPRMトレーニングフレームワークであるPRISMを提案する。
論文 参考訳(メタデータ) (2026-06-08T06:22:33Z) - Instance-Optimal Estimation with Multiple LLM Judges on a Budget [84.31744861038106]
我々は、この問題を*予算付きヘテロスケダティックなマルチジャッジ推定*として定式化する。
K$のプロンプト-レスポンスペア、J$の既知のコストと未知のクエリ-ジャッジ分散が与えられた場合、目標は、$ell_p$-errorを最小化しながら、有界スコアベクトルを推定することである。
EST-IVWEは,予算の低次項までのオラクルIVWEレートと一致していることを示す。
論文 参考訳(メタデータ) (2026-05-22T08:26:08Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Pause and Reflect: Conformal Aggregation for Chain-of-Thought Reasoning [8.024041325202612]
自己整合性を考慮した思考の連鎖(CoT)推論は、複数のサンプル推論パスを集約することで性能を向上させる。
集約不確実性に直接対処するCoT推論のコンフォメーション手順を導入する。
提案手法は,多数決を推理経路よりも重み付けしたスコアアグリゲーションに置き換え,共形リスク制御を用いた棄権規則を校正する。
論文 参考訳(メタデータ) (2026-05-13T20:33:59Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - Knowing When to Answer: Adaptive Confidence Refinement for Reliable Audio-Visual Question Answering [15.39457034915546]
我々は,textitReliable Audio-Visual Question Answering (mathcalR$-AVQA) に公式な問題を定式化する。
本稿では,$mathcalR$-AVQAの性能を高める軽量な手法であるAdaptive Confidence Refinement (ACR)を提案する。
論文 参考訳(メタデータ) (2026-02-04T08:35:33Z) - Self-Evaluation Guided Beam Search for Reasoning [61.523627290397556]
我々は,Large Language Model (LLM) の推論プロセスのガイドと校正を行うための段階的自己評価機構を導入する。
本稿では,ビームサーチによる自己評価ガイダンスを統合した復号アルゴリズムを提案する。
我々のアプローチは、GSM8K、AQuA、StrategyQAにおいて、対応するCodexバックボンドベースラインをわずかに精度6.34%、9.56%、および5.46%で上回る。
論文 参考訳(メタデータ) (2023-05-01T02:37:59Z) - Delving into Probabilistic Uncertainty for Unsupervised Domain Adaptive
Person Re-Identification [54.174146346387204]
ドメイン適応型人物再識別のための確率的不確実性誘導プログレッシブラベル精錬(P$2$LR)という手法を提案する。
擬似ラベルの不確実性を測定し、ネットワークトレーニングを容易にする定量的基準を確立する。
本手法はDuke2Marketタスクではベースラインが6.5%,Market2MSMTタスクでは2.5%,最先端手法では2.5%を上回った。
論文 参考訳(メタデータ) (2021-12-28T07:40:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。