論文の概要: Candidate-Expanding Routing with Permutation-Stabilized Experts for Mixed-Format Medical VQA
- arxiv url: http://arxiv.org/abs/2609.00959v1
- Date: Tue, 01 Sep 2026 09:18:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.516527
- Title: Candidate-Expanding Routing with Permutation-Stabilized Experts for Mixed-Format Medical VQA
- Title(参考訳): 混合型医療用VQA用変量安定化エキスパートによる候補拡大ルーティング
- Authors: Hai-Dang Nguyen, Huy-Hieu Pham,
- Abstract要約: VQA(Mixed-format Medical visual question answering)は、安定したオプション選択と機械可読な自由テキスト出力を必要とする。
両課題を,応答テキストメモリ,置換安定化専門家,スパース候補拡張ルータを用いて解決する。
- 参考スコア(独自算出の注目度): 2.313903538324245
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixed-format medical visual question answering (VQA) requires stable option selection and machine-readable free-text output. The two formats fail differently: multiple-choice predictions can change with option symbols or positions, while clinically plausible open answers can fail automated evaluation when serialization is malformed. We address both challenges with an answer-text memory, a permutation-stabilized vision--language expert, and a sparse candidate- expanding router. The cyclic schedule follows prior work; our contribution is to make expert top-2 a routable candidate alongside memory and expert top-1. On a 1,403-case retrospective internal analysis, this expansion improves a matched binary router from 88.95% to 91.73% (+2.78 percentage points; 95% CI 1.57--3.99), with 56 rescued errors and 17 regressions. Oracle coverage rises from 90.31% to 96.15%, and the final submitted configuration reaches 92.23% on the same retrospective split. For open questions, strict generation and deterministic guards produce 475/475 schema- valid participant-facing outputs without repair, retry, or hard-gate failure. Visual ablations reveal substantial textual dependence. Candidate expansion supplies the principal controlled routing gain; open-path evidence establishes output-contract validity rather than clinical correctness in medical use or deployment.
- Abstract(参考訳): VQA(Mixed-format Medical visual question answering)は、安定したオプション選択と機械可読な自由テキスト出力を必要とする。
複数選択予測はオプションのシンボルや位置で変更可能であり、臨床的に妥当なオープン回答はシリアライゼーションが不正な場合に自動評価を失敗する可能性がある。
両課題を,応答テキストメモリ,置換安定化ビジョン-言語エキスパート,スパース候補拡張ルータを用いて解決する。
私たちの貢献は、専門家のトップ2を、メモリとエキスパートのトップ1と共に、扱いにくい候補にすることにあります。
1,403ケースの内部分析では、一致したバイナリルータを88.95%から91.73%(+2.78ポイント、95% CI 1.57--3.99)に改善し、56のエラーと17のレグレッションがある。
Oracle のカバレッジは 90.31% から 96.15% に上昇し、最終提出された構成は同じレトロスペクティブの分割で 92.23% に達した。
オープンな質問に対して、厳密な生成と決定論的ガードは、修正、再試行、ハードゲートの失敗なしに、475/475のスキーマに有効な参加者対応出力を生成する。
視覚的な省略は、相当なテキスト依存を示す。
オープンパスの証拠は、医療使用やデプロイメントにおける臨床的正確性よりも、アウトプット・コントラクションの妥当性を確立している。
関連論文リスト
- Case2Flow: Bridging Patient Cases and Guideline Flowcharts through Multimodal Retrieval [65.99409194536337]
Case2Flowは、患者に対して最も関連性の高いガイドラインフローチャートを取得するために設計されたタスクである。
FlowAtlasは、2,080の医療ガイドラインから抽出された202のフローチャートのキュレートコーパスである。
CRISPは、非形式的パッチを抑えることで遅延相互作用検索を鋭くする訓練不要スコアリング手法である。
論文 参考訳(メタデータ) (2026-08-26T21:27:22Z) - Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents [60.650808962786364]
外部判断や選択時間テストの実行なしに,ネイティブなMoEルータトレースがステアリングと選択をガイドできるかどうかを検討する。
我々の分析は、ルーティングが堅牢な行動的役割シグナルを提供することを示している。トークン・グラニュラ・リードアウトと決定整合比較セットは、ルーティングを効果的に制御する。
オープンウェイトスパースMOEエージェントを用いたSWEベンチ検証を行い,評価を行った。
論文 参考訳(メタデータ) (2026-08-23T03:07:03Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - Know Before You Fetch: Calibrated Retrieval-Budget Allocation for Retrieval-Augmented Generation [10.60293484295824]
適応RAGをキャリブレーションした検索予算配分として定式化する。
シーケンスログの確率とプレフィックスログの不確実性信号を正しさの確率に調整する。
シーケンスログの確率については、TriviaQAでは0.275から0.062に、NQでは0.643から0.009に、MS MARCOでは0.711から0.031に低下する。
論文 参考訳(メタデータ) (2026-06-29T08:36:33Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Agri-CPJ: A Training-Free Explainable Framework for Agricultural Pest Diagnosis Using Caption-Prompt-Judge and LLM-as-a-Judge [40.23111543895404]
本稿では,Agri-CPJ (Caption-Prompt-Judge)について述べる。
2つの候補応答は相補的な視点から生成され、LLM判定器はドメイン固有の基準に基づいてより強い応答を選択する。
CDDMBench では、GPT-5-Nano と GPT-5-mini 生成キャプションをペアリングすると、疾患分類では textbf+22.7 pp となり、QA では textbf+19.5 ポイントが非カプセルベースラインでスコアされる。
論文 参考訳(メタデータ) (2026-04-26T13:33:45Z) - Improving Selective Visual Question Answering by Learning from Your
Peers [74.20167944693424]
VQA(Visual Question Answering)モデルは、間違っていた場合の回答を控えるのに苦労する可能性がある。
本稿では,複数モーダル選択関数の学習におけるLearning from Your Peers (LYP) アプローチを提案する。
提案手法では,学習データの異なるサブセットに基づいて訓練されたモデルの予測を,選択的VQAモデルの最適化のターゲットとして利用する。
論文 参考訳(メタデータ) (2023-06-14T21:22:01Z) - Reliable Visual Question Answering: Abstain Rather Than Answer
Incorrectly [100.60560477391732]
我々は、信頼性のある視覚的質問応答(VQA)のための問題定式化を促進する。
私たちは、彼らのカバレッジ、回答された質問の一部、そしてその部分のエラーの両方を分析します。
最高のパフォーマンスモデルは、VQA v2データセットで71%以上の精度を達成するが、そのオプションを導入することで、低いエラー(1%)のリスクを達成するために、8%未満の質問に答えることが制限されることがわかった。
これにより、マルチモーダル選択関数を用いて、予測された回答の正しさを直接推定し、例えば5.0%から16.7%のカバレッジを3倍にすることができることを示す。
論文 参考訳(メタデータ) (2022-04-28T16:51:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。