論文の概要: TriageRA-CCF: Source-Side Clinical Confidence and Coverage Signals for Adaptive Rank Budgeting in Medical LLMs
- arxiv url: http://arxiv.org/abs/2606.29375v1
- Date: Sun, 28 Jun 2026 12:52:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.899157
- Title: TriageRA-CCF: Source-Side Clinical Confidence and Coverage Signals for Adaptive Rank Budgeting in Medical LLMs
- Title(参考訳): TriageRA-CCF : 医療用LLMにおける適応的ランク予算化のための病原的信頼性と包括的信号
- Authors: Shucan Ji, Yining Huang, Hongliang Guo,
- Abstract要約: TriageRA-CCFは、適応的なランク予算の医療用大言語モデルのためのソースサイドの教師である。
ソーストレーニングデータからのみ計算される3つの信号、ベースモデル回答の信頼性、メタデータセル臨床カバレッジ、および対実的クローズミスプロキシを組み合わせる。
一致したCMBソーストレーニングプロトコルの下で、TriageRA-CCFはLoRA、DoRA、MoELoRAベースラインの中で最高の平均精度を達成する。
- 参考スコア(独自算出の注目度): 8.601855281320903
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Medical large language models are commonly adapted with a fixed low-rank budget, even though medical questions differ substantially in confidence, clinical coverage, and cross-domain difficulty. We study adaptive rank budgeting for parameter-efficient medical question answering: for each question, the adapter decides whether to activate a small, medium, or large subset of LoRA rank channels. The central challenge is that a naive adaptive budget router can collapse to unstable choices or spend capacity without improving shifted benchmarks. We propose TriageRA-CCF, a source-side teacher for adaptive rank-budgeted LoRA. It combines three signals computed only from source training data: base-model answer confidence, metadata-cell clinical coverage, and a counterfactual close-miss proxy. These signals supervise a straight-through budget router over active ranks {2,4,8}, together with budget-cost, entropy, and rank-balance regularization. Under a matched CMB-source training protocol, TriageRA-CCF achieves the best average accuracy among LoRA, DoRA, and MoELoRA baselines on both Qwen3-8B and Llama3.1-8B. The gains are modest and non-uniform across benchmarks: +0.21 average points over the strongest external baseline on Qwen3-8B and +0.16 on Llama3.1-8B. Component ablations show that confidence, coverage, and counterfactual signals all provide useful budget supervision, but their combination is not monotonically best on every backbone.
- Abstract(参考訳): 医学的な大きな言語モデルは、信頼性、臨床カバレッジ、ドメイン横断の難しさに大きく違いがあるにもかかわらず、固定された低ランクの予算で一般的に適応される。
各質問に対して、LoRAランクチャンネルの小さい、中、または大きなサブセットをアクティベートするかを決定する。
中心的な課題は、適応的な適応型予算ルータが、シフトしたベンチマークを改善することなく不安定な選択や使用能力に崩壊する可能性があることだ。
適応型ランク予算LoRAの教材としてTriageRA-CCFを提案する。
ソーストレーニングデータからのみ計算される3つの信号、ベースモデル回答の信頼性、メタデータセル臨床カバレッジ、および対実的クローズミスプロキシを組み合わせる。
これらの信号は、予算コスト、エントロピー、ランクバランス正則化とともに、アクティブなランク {2,4,8} 上のストレートな予算ルータを監督する。
一致したCMBソーストレーニングプロトコルの下で、TriageRA-CCFは、Qwen3-8BとLlama3.1-8Bの両方で、LoRA、DoRA、MoELoRAのベースライン間で最高の平均精度を達成する。
ベンチマークにおける利得は、Qwen3-8Bで最強のベースライン上の+0.21点、Llama3.1-8Bで+0.16点である。
コンポーネントの短縮は、信頼、カバレッジ、および反ファクトのシグナルがすべて有用な予算管理を提供することを示しているが、それらの組み合わせはすべてのバックボーンで単調にベストではない。
関連論文リスト
- TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Shift-Dependent Asymmetry: Orthogonal Inverse Low-Rank Adaptation for Federated Medical Segmentation [60.41721951405564]
Low-Rank Adaptation (LoRA)は、医療画像のためのセグメンテーション基盤モデルの効率的なフェデレーション微調整を可能にする。
ほとんどの連合LoRA法は、医学的セグメンテーションにおいてエンコーダ-デコーダ非対称性の下で破れる一様アグリゲーション規則を採用している。
このミスマッチの絡み合いは、サイト固有のバイアスと解剖を共有し、一般化を損なう。
本稿では,効率的な更新空間における共有局所コリニアリティを罰する部分空間直交正規化器を提案する。
論文 参考訳(メタデータ) (2026-06-07T15:39:28Z) - Learning When to Act: Communication-Efficient Reinforcement Learning via Run-Time Assurance [0.27998963147546146]
Lyapunov の安全性保護の下で制御入力と通信効率のタイミング決定を単一ポリシで学習できることが示される。
実行時保証層は、1ステップのリアプノフ予測と事前計算されたLQRバックアップを介してポリシーをオーバーライドする。
12-state 3D quadrotor のケーススタディでは、古典的な STC が難解な高次元システムにフレームワークを拡張している。
論文 参考訳(メタデータ) (2026-05-11T23:55:15Z) - Adaptive Selection of LoRA Components in Privacy-Preserving Federated Learning [6.087223232267447]
LoRAを用いた大規模モデルの微分プライベートな微調整は、LoRAの乗法構造に起因する凝集誤差に悩まされる。
3つの軸で定義される適応的フレームワークAS-LoRAを提案する(レイヤワイド自由度、ラウンドワイド適応度、曲率認識スコア)。
理論的には、AS-LoRAは階層化されたスケジュールの再構築エラーフロアを排除し、収束を加速し、よりフラットなミニマへのソリューションを暗黙的にバイアスし、追加のプライバシーコストを発生させない。
論文 参考訳(メタデータ) (2026-05-07T07:01:00Z) - MOSAIC: Multi-Objective Slice-Aware Iterative Curation for Alignment [1.356919241968803]
3つの目標を一度にバランスを取らなければならない場合に、固定された微調整予算を割り当てる方法について検討する。
統一L1-L3評価インタフェース上に構築された閉ループデータ混合探索のための多目的フレームワークMOSAICを提案する。
論文 参考訳(メタデータ) (2026-03-19T09:00:47Z) - Med-DualLoRA: Local Adaptation of Foundation Models for 3D Cardiac MRI [1.2782432265370094]
Med-DualLoRAは,グローバルな共有およびローカルなローランク適応(LoRA)を加法分解によって分散する,クライアント対応パラメータ効率の高い微調整フレームワークである。
ACDCとM&Msデータセットを併用した多心式3次元CMR FMによる疾患検出法について検討した。
論文 参考訳(メタデータ) (2026-03-11T16:52:21Z) - DARC: Disagreement-Aware Alignment via Risk-Constrained Decoding [59.16244104797919]
本稿では,リスク制約付き復号法(DARC)*による分散アライメント(Disagreement-Aware Alignment)を提案する。
DARCは応答選択を、分布的に堅牢で、リスクに敏感な意思決定として捉えている。
アライメントベンチマークの実験では、DARCは競合平均品質を維持しながら、不一致と尾のリスクを低減する。
論文 参考訳(メタデータ) (2026-03-09T09:21:29Z) - A Federated and Parameter-Efficient Framework for Large Language Model Training in Medicine [59.78991974851707]
大規模言語モデル(LLM)は、質問応答や診断など、医療ベンチマークにおいて強力なパフォーマンスを示している。
ほとんどの医療用LDMは、異種システムの一般化性と安全性の制限に直面している単一の機関のデータに基づいて訓練されている。
本稿では, LLMを医療応用に適用するためのモデルに依存しない, パラメータ効率のよいフェデレーション学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T18:48:21Z) - Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts [75.20929587906228]
LLM(Large Language Model)を利用したマルチエージェントシステム(MAS)は、複雑なタスクにおける協調推論、ツールの使用、役割特化調整を急速に進めている。
しかし、信頼性クリティカルなデプロイメントは、体系的な障害モード、すなわち命令の競合による階層的コンプライアンスによって妨げられている。
論文 参考訳(メタデータ) (2025-09-27T08:43:34Z) - Actor-Critic based Improper Reinforcement Learning [61.430513757337486]
我々は,未知のマルコフ決定プロセスに対して,学習者に100万ドルのベースコントローラを付与する不適切な強化学習環境を考える。
本稿では,(1)ポリシーグラディエントに基づくアプローチ,(2)単純なアクター・クリティカル・スキームとNatural Actor-Criticスキームを切り替えるアルゴリズムを提案する。
論文 参考訳(メタデータ) (2022-07-19T05:55:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。