論文の概要: Measuring and Improving Complex-Atomic Answer Consistency in Endoscopic VQA
- arxiv url: http://arxiv.org/abs/2607.17834v1
- Date: Mon, 20 Jul 2026 11:25:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.603722
- Title: Measuring and Improving Complex-Atomic Answer Consistency in Endoscopic VQA
- Title(参考訳): 内視鏡的VQAにおける複雑原子アンサーの整合性の測定と改善
- Abstract要約: 内視鏡的視覚的質問応答 (VQA) は, より複雑な質問に対して, 個別の事実クエリではなく, 複数の内視鏡的回答成分を組み合わせた質問をする傾向にある。
複雑な答えが同一画像の原子答えと一致しているかどうかを評価するための,2組の複雑な答え整合性ベンチマークであるEndoCAを紹介する。
- 参考スコア(独自算出の注目度): 16.87604959527652
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Endoscopic visual question answering (VQA) increasingly asks complex questions that combine several endoscopic answer components rather than isolated factual queries. Such complex answers may be scored as correct even when the same model fails on associated atomic questions. We introduce EndoCA, a paired complex-atomic answer consistency benchmark for evaluating whether complex answers remain consistent with same-image atomic answers. EndoCA contains two suites: EndoCA-Core evaluates compact question-complexity patterns commonly seen in practical endoscopic VQA, and EndoCA-Diagnostic supports controlled analysis across increasing question complexity. We evaluate 11 VLMs spanning open, medical, endoscopy-adapted, and closed-source models on EndoCA. Some VLMs achieve high complex-answer accuracy, yet their atomic-answer accuracy and complex-atomic answer consistency remain substantially lower. To reduce this complex-atomic inconsistency, we introduce Atomic-Support Reconciliation (ASR), a training-free mechanism that uses model-generated atomic answers as contextual premises for answer revision and consistency-guided selective answering. On four selected publicly available models, ASR-Revise improves paired complex-atomic correctness with modest changes in complex-answer accuracy, while ASR-Selective improves accuracy on answered cases by allowing the model to abstain from less reliable cases. Together, EndoCA and ASR provide a consistency-aware benchmark and a training-free mechanism for answer reconciliation and selective answering in endoscopic VQA.
- Abstract(参考訳): 内視鏡的視覚的質問応答 (VQA) は, より複雑な質問に対して, 個別の事実クエリではなく, 複数の内視鏡的回答成分を組み合わせた質問をする傾向にある。
そのような複雑な答えは、同じモデルが関連する原子問題で失敗しても正しいと評価される。
複雑な答えが同一画像の原子答えと一致しているかどうかを評価するための,2組の複雑な答え整合性ベンチマークであるEndoCAを紹介する。
EndoCA-Coreは、実用的内視鏡VQAでよく見られるコンパクトな質問複雑パターンを評価し、EndoCA-Diagnosticは、質問複雑度の増加にまたがる制御解析をサポートする。
オープン,医療,内視鏡適応,クローズドソースの11種類のVLMをEndoCA上で評価した。
いくつかのVLMは高い複素応答精度を達成するが、原子応答精度と複素応答一貫性は著しく低いままである。
この複雑な原子間不整合を低減するために、モデル生成原子応答を文脈的前提として利用し、応答の修正と整合性誘導による選択解答を行う訓練自由機構であるAtomic-Support Reconciliation(ASR)を導入する。
選択された4つの公開モデルでは、ASR-Reviseは、複雑な問合せ精度をわずかに変化させることで、ペア化された複雑原子の精度を改善し、一方、ASR-Selectiveは、信頼性の低いケースからモデルを吸収することで、回答されたケースの精度を向上する。
同時に、EndoCAとASRは、内視鏡的VQAにおいて、一貫性を意識したベンチマークと、回答の和解と選択的な回答のためのトレーニング不要のメカニズムを提供する。
関連論文リスト
- Boosting Self-Consistency with Ranking [56.38798757709555]
自己整合性は、複数の推論パスをサンプリングし、最も頻繁な回答を選択することで、大きな言語モデルを改善する。
この制限は、自己整合性における解答選択をランク付け問題として再構成する、ランク付け改善自己整合性(RISC)に対処する。
論文 参考訳(メタデータ) (2026-06-03T16:12:30Z) - Structure Guided Retrieval-Augmented Generation for Factual Queries [6.076287232501258]
Retrieval-Augmented Generation (RAG) は、大規模言語モデル(LLM)における幻覚を軽減するために提案されている。
我々は、Exact Retrieval Problem (ERP)という新しい研究問題を導入する。
我々の知る限りでは、全てのクエリ条件を満たすためにRAGに構造情報を明示的に組み込んだ最初の問題定式化である。
我々は,20のドメインにまたがる複雑な条件を含む,120000の事実指向QAペアからなる大規模データセットであるExact Retrieval Question Answering (ERQA)を構築し,公開する。
論文 参考訳(メタデータ) (2026-04-21T14:43:53Z) - ComposeRAG: A Modular and Composable RAG for Corpus-Grounded Multi-Hop Question Answering [42.238086712267396]
ComposeRAGは、RAGパイプラインをアトミックで構成可能なモジュールに分解する、新しいモジュラー抽象化である。
精度と接地忠実性の両方において、一貫して強いベースラインを上回ります。
検証ファーストの設計は、低品質の検索設定において、未解決の回答を10%以上削減する。
論文 参考訳(メタデータ) (2025-05-30T21:10:30Z) - Atomic Fact Decomposition Helps Attributed Question Answering [29.67882325906939]
Attributed Question Answering (AQA)は、質問に対する信頼できる回答と信頼できる属性レポートを提供することを目的としている。
本稿では,アトミックな事実分解に基づくRetrieval and Editingフレームワークを提案する。
生成した長文の回答を、命令調整されたLSMによって分子節と原子事実に分解する。
論文 参考訳(メタデータ) (2024-10-22T05:25:54Z) - Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity [59.57065228857247]
Retrieval-augmented Large Language Models (LLMs) は、質問回答(QA)のようなタスクにおける応答精度を高めるための有望なアプローチとして登場した。
本稿では,クエリの複雑さに基づいて,LLMの最適戦略を動的に選択できる適応型QAフレームワークを提案する。
オープンドメインのQAデータセットを用いて、複数のクエリの複雑さを網羅し、QAシステムの全体的な効率性と精度を高めることを示す。
論文 参考訳(メタデータ) (2024-03-21T13:52:30Z) - QADYNAMICS: Training Dynamics-Driven Synthetic QA Diagnostic for
Zero-Shot Commonsense Question Answering [48.25449258017601]
State-of-the-artはCommonSense Knowledge Basesから構築されたQAペア上での微調整言語モデルにアプローチする。
本稿では,QA診断と改善のためのトレーニング動的フレームワークQADYNAMICSを提案する。
論文 参考訳(メタデータ) (2023-10-17T14:27:34Z) - SQUARE: Automatic Question Answering Evaluation using Multiple Positive
and Negative References [73.67707138779245]
SQuArE (Sentence-level QUestion AnsweRing Evaluation) という新しい評価指標を提案する。
文レベルの抽出(回答選択)と生成(GenQA)の両方のQAシステムでSQuArEを評価する。
論文 参考訳(メタデータ) (2023-09-21T16:51:30Z) - An Empirical Comparison of LM-based Question and Answer Generation
Methods [79.31199020420827]
質問と回答の生成(QAG)は、コンテキストが与えられた質問と回答のペアのセットを生成することで構成される。
本稿では,シーケンス・ツー・シーケンス言語モデル(LM)を微調整する3つの異なるQAG手法を用いて,ベースラインを確立する。
実験により、学習時間と推論時間の両方で計算的に軽量なエンドツーエンドQAGモデルが一般に堅牢であり、他のより複雑なアプローチよりも優れていることが示された。
論文 参考訳(メタデータ) (2023-05-26T14:59:53Z) - Adapting Neural Link Predictors for Data-Efficient Complex Query
Answering [45.961111441411084]
本稿では,複雑な問合せタスクに対して,ニューラルネットワーク予測スコアを再校正するために最適化されたパラメータ効率のスコア強調モデルを提案する。
CQD$mathcalA$は現在の最先端手法よりもはるかに正確な結果が得られる。
論文 参考訳(メタデータ) (2023-01-29T00:17:16Z) - Successive Prompting for Decomposing Complex Questions [50.00659445976735]
最近の研究は、大規模言語モデル(LM)の機能を活用して、数ショットで複雑な質問応答を行う。
そこでは、複雑なタスクを単純なタスクに繰り返し分解し、それを解決し、最終解を得るまでプロセスを繰り返します。
我々の最良のモデル(逐次プロンプト付き)は、DROPデータセットの数ショットバージョンにおいて、5%の絶対F1の改善を実現します。
論文 参考訳(メタデータ) (2022-12-08T06:03:38Z) - Simple or Complex? Complexity-Controllable Question Generation with Soft
Templates and Deep Mixture of Experts Model [15.411214563867548]
本稿では,ソフトテンプレートのセレクタとして専門家(MoE)の混合を取り入れた,エンドツーエンドのニューラル複雑性制御可能な質問生成モデルを提案する。
本手法では,質問の複雑さを評価するために,新しいクロスドメイン複雑度推定器を導入する。
2つのベンチマークQAデータセットの実験結果は、我々のQGモデルが、自動評価と手動評価の両方において最先端の手法よりも優れていることを示している。
論文 参考訳(メタデータ) (2021-10-13T08:16:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。