論文の概要: Wasserstein Equilibrium Decoding for Reliable Medical Visual Question Answering
- arxiv url: http://arxiv.org/abs/2605.18313v1
- Date: Mon, 18 May 2026 12:31:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 23:51:08.404488
- Title: Wasserstein Equilibrium Decoding for Reliable Medical Visual Question Answering
- Title(参考訳): Wasserstein Equilibrium Decoding for Reliable Medical Visual Question Answering
- Authors: Luca Hagen, Johanna P. Müller, Weitong Zhang, Mengyun Qiao, Bernhard Kainz,
- Abstract要約: 小さなビジョン言語モデル(2-8B)は、プライバシの制約、接続性の制限、低レイテンシ要求のため、clin-icalデプロイメントに適しています。
我々は,これまでテキストのみのクローズドエンドNLPタスクに制限されていたゲーム理論デコーディングを,オープンエンド医療用VQAの視覚言語モーダルに拡張する。
- 参考スコア(独自算出の注目度): 22.33442451621913
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Small vision-language models (2-8B) are well-suited for clin- ical deployment due to privacy constraints, limited connectivity, and low-latency requirements favouring on-device or on-premise inference. However, their limited capacity exacerbates the generation of plausible but incorrect outputs. We extend game-theoretic decoding, previously restricted to text-only, closed-ended NLP tasks, to vision-language mod- els for open-ended Medical VQA. We introduce a semantically aware Wasserstein stopping criterion that replaces lexical order matching, en- abling convergence based on semantic consensus among near-synonymous candidate answers and avoiding unnecessary iterations caused by clini- cally equivalent ranking swaps. On VQA-RAD and PathVQA, we ob- tain consistent, statistically significant improvements over greedy and discriminative baselines. On VQA-RAD, we improve Qwen3-VL-2B by +3.5 percentage points (p < 0.01), surpassing the greedy 4B model, with similar trends at larger scales. On PathVQA, Gemma-3-4B with BDG matches MedGemma-4B under greedy decoding despite no domain- specific fine-tuning. At accuracy parity with classic BDG, the Wasser- stein criterion reduces average convergence iterations by approximately 20%, improving inference efficiency while preserving the game-theoretic equilibrium behaviour. Code is available at https://github.com/luca-hagen/ Wasserstein-BDG-medical-VQA.
- Abstract(参考訳): 小さなビジョン言語モデル(2-8B)は、プライバシ制約、接続性に制限があり、デバイスやオンプレミスの推論を好む低レイテンシ要件のため、clin-icalデプロイメントに適している。
しかし、その限られた能力は、可塑性だが誤った出力の発生を悪化させる。
我々は,これまでテキストのみのクローズドエンドNLPタスクに制限されていたゲーム理論デコーディングを,オープンエンド医療用VQAの視覚言語モーダルに拡張する。
本稿では,語彙的順序マッチングに取って代わる意味的に認識されたWasserstein停止基準を導入し,ほぼ匿名の候補解間のセマンティックコンセンサスに基づく収束と,Cclini-cally同値なランキングスワップによる不要な反復を回避する。
VQA-RADとPathVQAでは、欲求と差別の基準線よりも一貫性があり、統計的に有意な改善が見られた。
VQA-RADでは,Qwen3-VL-2Bを+3.5ポイント(p < 0.01)改善し,グリーディ4Bモデルを上回った。
PathVQAでは、Gemma-3-4BとBDGはMedGemma-4Bにマッチするが、ドメイン固有の微調整はない。
古典的BDGと同等の精度で、Wasser-stein criterion は平均収束イテレーションを約20%削減し、ゲーム理論平衡挙動を保ちながら推論効率を向上させる。
コードはhttps://github.com/luca-hagen/ Wasserstein-BDG-medical-VQAで公開されている。
関連論文リスト
- RVPO: Risk-Sensitive Alignment via Variance Regularization [13.192921543523283]
本稿では, 利便集約時のリワード間分散をペナルティ化するリスクセンシティブなフレームワークであるReward-Variance Policy Optimization (RVPO)を提案する。
我々はTaylor拡張を通して、LogSumExp(SoftMin)オペレータがスムーズな分散ペナルティとして効果的に働くことを示す。
モデルがより簡単な目的を活かすために難しい制約を無視しないようにすることで、RVPOはHealthBenchの全体的なスコアを改善する。
論文 参考訳(メタデータ) (2026-05-07T06:43:05Z) - Auditing Frontier Vision-Language Models for Trustworthy Medical VQA: Grounding Failures, Format Collapse, and Domain Adaptation [4.177028541321909]
医療用VQAの5つの視覚言語モデル(VLM)を2つの信頼関連軸に沿って評価する。
モデルは解剖学的および病理学的ターゲットを不十分にローカライズする。
同じモデルをローカライズして回答するセルフグラウンドパイプラインは、VQAの精度を低下させる。
論文 参考訳(メタデータ) (2026-04-30T11:11:47Z) - Agri-CPJ: A Training-Free Explainable Framework for Agricultural Pest Diagnosis Using Caption-Prompt-Judge and LLM-as-a-Judge [40.23111543895404]
本稿では,Agri-CPJ (Caption-Prompt-Judge)について述べる。
2つの候補応答は相補的な視点から生成され、LLM判定器はドメイン固有の基準に基づいてより強い応答を選択する。
CDDMBench では、GPT-5-Nano と GPT-5-mini 生成キャプションをペアリングすると、疾患分類では textbf+22.7 pp となり、QA では textbf+19.5 ポイントが非カプセルベースラインでスコアされる。
論文 参考訳(メタデータ) (2026-04-26T13:33:45Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - LATA: Laplacian-Assisted Transductive Adaptation for Conformal Uncertainty in Medical VLMs [61.06744611795341]
医用視覚言語モデル(VLM)は医用画像の強力なゼロショット認識器である。
本研究では,ラプラシアン支援トランスダクティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ・アダプティブ(texttttextbfLATA,ラプラシアン支援トランスダクティブ・アダプティブ・アダプティブ・アダプティブ)を提案する。
texttttextbfLATAは交換性を損なうことなくゼロショット予測をシャープにする。
論文 参考訳(メタデータ) (2026-02-19T16:45:38Z) - DecompressionLM: Deterministic, Diagnostic, and Zero-Shot Concept Graph Extraction from Language Models [24.759051210517658]
DecompressionLMはゼロショットの概念グラフ抽出のためのステートレスフレームワークである。
提案手法は,共通復号法に基づく探索手法の3つの制限を対象とする。
論文 参考訳(メタデータ) (2026-01-30T22:56:56Z) - Toward Uncertainty-Aware and Generalizable Neural Decoding for Quantum LDPC Codes [0.9453554184019106]
量子誤り訂正(QEC)はスケーラブルな量子コンピューティングに不可欠である。
我々は,ドット生成物とマルチヘッドの両方に注意を集中させるベイズグラフニューラルデコーダである textbfQuBA を提案する。
textbfSAGU textbf(Sequential Aggregate Generalization under Uncertainty)は、ドメイン間の堅牢性を向上したマルチコードトレーニングフレームワークである。
論文 参考訳(メタデータ) (2025-10-05T01:08:39Z) - Less Greedy Equivalence Search [52.818153111470394]
Greedy Equivalence Search (GES)は、観測データから因果探索を行うためのスコアベースのアルゴリズムである。
我々はGESの変種であるLose Greedy Equivalence Search (LGES)を開発した。
論文 参考訳(メタデータ) (2025-06-27T15:39:48Z) - Handling Imbalanced Pseudolabels for Vision-Language Models with Concept Alignment and Confusion-Aware Calibrated Margin [56.37346003683629]
擬似ラベルを用いた下流タスクへの視覚言語モデル(VLM)の適用が注目されている。
主な障害は、VLMによって生成された擬似ラベルが不均衡になり、性能が低下する傾向があることである。
本稿では,概念アライメントと混乱を考慮したマージン機構を取り入れた新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-04T10:24:34Z) - Self-Evaluation Guided Beam Search for Reasoning [61.523627290397556]
我々は,Large Language Model (LLM) の推論プロセスのガイドと校正を行うための段階的自己評価機構を導入する。
本稿では,ビームサーチによる自己評価ガイダンスを統合した復号アルゴリズムを提案する。
我々のアプローチは、GSM8K、AQuA、StrategyQAにおいて、対応するCodexバックボンドベースラインをわずかに精度6.34%、9.56%、および5.46%で上回る。
論文 参考訳(メタデータ) (2023-05-01T02:37:59Z) - Distribution-free uncertainty quantification for classification under
label shift [105.27463615756733]
2つの経路による分類問題に対する不確実性定量化(UQ)に焦点を当てる。
まず、ラベルシフトはカバレッジとキャリブレーションの低下を示すことでuqを損なうと論じる。
これらの手法を, 理論上, 分散性のない枠組みで検討し, その優れた実用性を示す。
論文 参考訳(メタデータ) (2021-03-04T20:51:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。