論文の概要: $M^3 QuestionIng$: Multi-modal Multi-span Medical Question Answering
- arxiv url: http://arxiv.org/abs/2606.28329v1
- Date: Tue, 19 May 2026 15:18:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.955389
- Title: $M^3 QuestionIng$: Multi-modal Multi-span Medical Question Answering
- Title(参考訳): M^3 QuestionIng$: Multi-modal Multi-span Medical Question Answering
- Abstract要約: 医療におけるAIの採用は、医療質問回答(MedQA)におけるアクセシビリティと精度の重要要件を強調している。
マルチモーダル・マルチスパン医療質問応答フレームワークであるM3QAFrame$を提案する。
我々のアプローチは、様々な評価指標で既存の手法よりも一貫して優れています。
- 参考スコア(独自算出の注目度): 17.27739628789954
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The growing adoption of AI in healthcare, particularly in preventive care, highlights the critical need for accessibility and precision in Medical Question Answering (MedQA). In recent years, significant efforts have been made to develop multi-span medical question-answering systems, where the answer to a query may span multiple sections or paragraphs of a source document. However, existing systems fall short of aligning with real-world scenarios, where source documents often include both textual and visual content, requiring answers to incorporate images for better comprehension. To address this gap, we propose $M^3QAFrame$, a multi-modal, multi-span medical question-answering framework that leverages visual cues to enhance the generation of comprehensive answers drawn from diverse textual and visual spans. The model takes the context, query, and images as input and outputs an answer containing both textual answers and relevant images. The text and image embeddings are processed using a transformer-based architecture to determine the sentence and image relevance. We curate a multi-modal, multi-span medical question-answering ($M^3 QuestionIng$) dataset containing queries, medical contexts, associated medical images, and extractive answers. Additionally, each query-answer pair is labeled with user intent and query type to enhance query and context comprehension. Extensive experiments show that our approach consistently outperforms existing methods across various evaluation metrics.
- Abstract(参考訳): 医療におけるAIの採用の増加、特に予防医療において、医療質問回答(MedQA)におけるアクセシビリティと正確性の重要性が強調されている。
近年,質問に対する回答が資料の複数節ないし段落にまたがるマルチスパン医療質問応答システムの開発に,多大な努力が払われている。
しかし、既存のシステムは実世界のシナリオと整合するに足りず、ソース文書にはテキストコンテンツとビジュアルコンテンツの両方が含まれており、より良い理解のためにイメージを組み込む必要がある。
このギャップに対処するために,多様なテキストやビジュアルスパンから引き出された包括的回答の生成を促進するために,視覚的手がかりを活用するマルチモーダル・マルチスパン医療質問応答フレームワークであるM^3QAFrame$を提案する。
このモデルは、コンテキスト、クエリ、イメージを入力として取り、テキストの回答と関連するイメージの両方を含む回答を出力する。
テキストと画像の埋め込みは、変換器ベースのアーキテクチャを用いて処理され、文と画像の関連性を決定する。
我々は,クエリ,医療コンテキスト,関連する医療画像,抽出回答を含むマルチモーダル・マルチスパン医療質問応答(M^3 QuestionIng$)データセットをキュレートする。
さらに、クエリと問合せのペアには、クエリとコンテキストの理解を強化するために、ユーザインテントとクエリタイプがラベル付けされている。
大規模な実験により,本手法は様々な評価指標において,既存の手法より一貫して優れていることが示された。
関連論文リスト
- Rethinking Patient Education as Multi-turn Multi-modal Interaction [8.98413612284677]
MedImageEduはマルチターン・エビデンス・グラウンドド・ラジオロジー患者教育のためのベンチマークである。
DoctorAgentはPatentAgentと対話し、教育レベル、健康リテラシー、パーソナリティなどの要因をキャプチャーする。
患者の質問が視覚的サポートの恩恵を受ける場合、DoctorAgentは、レポート、ケースイメージ、そして現在の質問を、ベンチマークが提供する描画ツールに発行することができる。
このツールはイメージ(s)を返すが、その後DoctorAgentはイメージ(s)と接地された平易な説明からなる最終的なマルチモーダル応答を生成する。
論文 参考訳(メタデータ) (2026-04-16T06:06:50Z) - MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering [51.19392014547221]
検索型マルチモーダル文書QAは,視覚的にリッチな文書から複雑なマルチモーダル構造を持つ関連情報を識別し,統合することを目的としている。
現在のアプローチは、サージェントなコンテンツを見渡すクエリに依存しないドキュメント表現に依存しています。
本稿では,クエリ適応生成を導入したMultimodal Adaptive Retrieval-Augmented (MARA)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-01T12:27:40Z) - MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering [44.41273615523289]
マルチモーダルソース属性システムを評価するための最初のベンチマークであるMAVISを紹介する。
我々のデータセットは157Kの視覚的QAインスタンスで構成されており、各回答にはマルチモーダル文書を参照したファクトレベルの引用が注釈付けされている。
本研究では,情報性,接地性,流感の3次元に沿って細粒度自動測定値を作成し,人間の判断と強い相関関係を示す。
論文 参考訳(メタデータ) (2025-11-15T10:14:59Z) - BRIT: Bidirectional Retrieval over Unified Image-Text Graph [0.0]
Retrieval-Augmented Generation (RAG) は、大規模言語モデルによって生成された応答の品質と関連性を高めるための有望な手法として登場した。
本稿では、文書内の様々なテキストイメージ接続をマルチモーダルグラフに統一する、新しいマルチモーダルRAGフレームワークBRITを提案する。
BRITは、画像からテキストへの経路とテキストへの経路の両方をグラフでトラバースすることにより、関連する画像やテキストを直接検索するだけでなく、関連するコンテンツも検索する。
論文 参考訳(メタデータ) (2025-05-24T01:20:51Z) - Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks [62.758680527838436]
複数のテキストリッチな画像を含む視覚言語タスクを扱うためのMLLMであるLeopardを提案する。
まず、テキストリッチでマルチイメージのシナリオに合わせて、約100万の高品質なマルチモーダル命令チューニングデータをキュレートした。
第2に,視覚列長の割り当てを動的に最適化する適応型高解像度マルチイメージ符号化モジュールを提案する。
論文 参考訳(メタデータ) (2024-10-02T16:55:01Z) - Medical Vision-Language Pre-Training for Brain Abnormalities [96.1408455065347]
本稿では,PubMedなどの公共リソースから,医用画像・テキスト・アライメントデータを自動的に収集する方法を示す。
特に,まず大きな脳画像テキストデータセットを収集することにより,事前学習プロセスの合理化を図るパイプラインを提案する。
また,医療領域におけるサブフィギュアをサブキャプションにマッピングするというユニークな課題についても検討した。
論文 参考訳(メタデータ) (2024-04-27T05:03:42Z) - Asking Multimodal Clarifying Questions in Mixed-Initiative
Conversational Search [89.1772985740272]
混合開始型会話検索システムでは、質問を明確にすることで、意図を単一のクエリで表現するのに苦労するユーザを支援する。
マルチモーダル情報が関係するシナリオでは、非テクスチャ情報を用いることで、明確化のプロセスを改善することができると仮定する。
質問を明確にする4k以上のマルチモーダルを含むMelonというデータセットを収集し、14k以上の画像で濃縮する。
クエリの明確化フェーズにおけるマルチモーダルコンテンツの重要性を理解するために,いくつかの解析を行った。
論文 参考訳(メタデータ) (2024-02-12T16:04:01Z) - Towards Unifying Medical Vision-and-Language Pre-training via Soft
Prompts [63.84720380390935]
textiti. には、重い融合モジュールを使用するかどうかに応じて、融合エンコーダタイプと二重エンコーダタイプという2つの典型的なタイプがある。
PTUnifier という2つのタイプを統一する手法を提案する。
まず、最も代表的な画像/テキストを格納する機能バンクとして機能する視覚的およびテキスト的プロンプトを導入することで、入力形式を統一する。
論文 参考訳(メタデータ) (2023-02-17T15:43:42Z) - Probabilistic Compositional Embeddings for Multimodal Image Retrieval [48.450232527041436]
画像検索において複数のマルチモーダルクエリを構成する上で,より困難なシナリオについて検討する。
任意の数のクエリイメージと(あるいは)テキストが与えられた場合、我々のゴールは、複数のマルチモーダルクエリで指定されたセマンティックな概念を含むターゲットイメージを検索することである。
様々なクエリのセマンティクスを柔軟にエンコードできる情報埋め込みを学習するための,新しい多モード確率的合成法(MPC)を提案する。
論文 参考訳(メタデータ) (2022-04-12T14:45:37Z) - MuVAM: A Multi-View Attention-based Model for Medical Visual Question
Answering [2.413694065650786]
本稿では,医療用視覚質問応答のためのマルチビューアテンションベースモデル(MuVAM)を提案する。
医用画像の高レベルの意味をテキスト記述に基づいて統合する。
2つのデータセットの実験では、MuVAMの有効性が最先端の手法を超えていることが示されている。
論文 参考訳(メタデータ) (2021-07-07T13:40:25Z) - MultiModalQA: Complex Question Answering over Text, Tables and Images [52.25399438133274]
テキスト,テーブル,画像に対する共同推論を必要とするデータセットであるMultiModalQAを提案する。
大規模で複雑なマルチモーダル質問を生成するための新しいフレームワークを使用してMMQAを作成します。
次に、単一のモダリティから回答できる質問を受け取り、それらを組み合わせてクロスモーダルな質問を生成する形式言語を定義します。
論文 参考訳(メタデータ) (2021-04-13T09:14:28Z) - Learning Contextualized Document Representations for Healthcare Answer
Retrieval [68.02029435111193]
コンテキスト談話ベクトル(英: Contextual Discourse Vectors、CDV)は、長文からの効率的な回答検索のための分散文書表現である。
本モデルでは,階層型LSTMレイヤとマルチタスクトレーニングを併用したデュアルエンコーダアーキテクチャを用いて,臨床エンティティの位置と文書の談話に沿った側面をエンコードする。
我々の一般化モデルは、医療パスランキングにおいて、最先端のベースラインを著しく上回っていることを示す。
論文 参考訳(メタデータ) (2020-02-03T15:47:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。