論文の概要: DocAttriBench: Benchmarking Answer Grounding in Document Visual Question Answering
- arxiv url: http://arxiv.org/abs/2609.20574v2
- Date: Tue, 22 Sep 2026 10:45:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.854965
- Title: DocAttriBench: Benchmarking Answer Grounding in Document Visual Question Answering
- Title(参考訳): DocAttriBench: ドキュメントビジュアル質問回答におけるアンサーグラウンドのベンチマーク
- Abstract要約: 本稿ではDocAttriBench(DAB)について紹介する。
MAPPETは、候補要素をマスキングした後の難易度の増加を測定し、モデルの信頼性に最も寄与する要素に対する応答を属性とする。
DABは、基盤があり、検証可能で、信頼できるドキュメントVQAモデルを開発するためのスケーラブルなベンチマークを提供する。
- 参考スコア(独自算出の注目度): 47.902547414098215
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Answer grounding in document visual question answering remains an open challenge: most benchmarks lack grounding annotations or provide limited-quality labels, while constructing grounded datasets still requires costly manual effort. We introduce DocAttriBench (DAB), a large-scale benchmark for fine-grained, element-level source attribution in Document VQA, grounding answers to specific layout elements such as text blocks, tables, and images. To build DAB, we propose a Mask-based Perplexity-Derived Attribution method (MAPPET) that combines document layout and language modeling to identify the most informative element for each answer. MAPPET measures the increase in perplexity after masking candidate elements and attributes the answer to the element contributing most to model confidence. Applying MAPPET to multiple existing Document VQA datasets yields DAB, with 237k documents and 296k question-answer pairs with element-level grounding. We benchmark grounding-capable multimodal LLMs on DAB, evaluating answer accuracy, attribution accuracy, and overall answer quality. Results show that while larger models generally achieve higher answer accuracy, even the strongest models often fail to localize the supporting elements. DAB provides a scalable benchmark for developing grounded, verifiable, and trustworthy Document VQA models. Dataset and code are available at https://aimagelab.github.io/DocAttriBench/.
- Abstract(参考訳): ほとんどのベンチマークには注釈や限定品質のラベルが欠けているが、基盤化されたデータセットの構築には依然として手作業が要る。
我々はDocAttriBench (DAB)を導入し、文書VQAの細粒度要素レベルのソース属性を大規模にベンチマークし、テキストブロック、テーブル、画像などの特定のレイアウト要素に答えを与える。
DABを構築するために,文書レイアウトと言語モデリングを組み合わせて回答毎の最も情報性の高い要素を識別する,Mask ベースの Perplexity-Derived Attribution 法 (MAPPET) を提案する。
MAPPETは、候補要素をマスキングした後の難易度の増加を測定し、モデルの信頼性に最も寄与する要素に対する応答を属性とする。
複数の既存のDocument VQAデータセットにMAPPETを適用すると、DABが生成される。
提案手法は,DAB上での接地可能なマルチモーダルLLMをベンチマークし,解答精度,帰属精度,全体の解答品質を評価した。
その結果、より大きなモデルでは解答精度が向上するが、最強モデルでさえしばしば支持要素のローカライズに失敗することがわかった。
DABは、基盤があり、検証可能で、信頼できるドキュメントVQAモデルを開発するためのスケーラブルなベンチマークを提供する。
データセットとコードはhttps://aimagelab.github.io/DocAttriBench/で入手できる。
関連論文リスト
- DIAGRAMS: A Review Framework for Reasoning-Level Attribution in Diagram QA [56.73431446011309]
ダイアグラム質問応答(ダイアグラムQA)は、各問合せ対を答えを導き出すために必要なすべての視覚領域にリンクする推論レベルの属性を必要とする。
私たちは、データセット固有の構造からインターフェースロジックを分離する軽量でスキーマ駆動のレビューフレームワークであるDIAGRAMSを紹介します。
論文 参考訳(メタデータ) (2026-04-29T02:34:51Z) - ELOQ: Resources for Enhancing LLM Detection of Out-of-Scope Questions [52.33835101586687]
本研究では,検索した文書が意味的に類似しているように見えるスコープ外質問について検討するが,答えるために必要な情報がない。
本稿では,閉経後の文書から多様なスコープ外質問を自動的に生成するための,幻覚に基づくELOQを提案する。
論文 参考訳(メタデータ) (2024-10-18T16:11:29Z) - RepLiQA: A Question-Answering Dataset for Benchmarking LLMs on Unseen Reference Content [13.187520657952263]
大規模言語モデル(LLM)は大量のデータに基づいて訓練されており、そのほとんどは自動的にインターネットから取り除かれる。
トレーニングセットに漏れたかもしれない テストスプリットのモデルを評価する 結論を誤解させる傾向がある
本稿では,質問応答とトピック検索タスクに適したRepLiQAという新しいテストデータセットを提案する。
論文 参考訳(メタデータ) (2024-06-17T17:52:54Z) - Read and Think: An Efficient Step-wise Multimodal Language Model for Document Understanding and Reasoning [0.0]
既存の文書理解モデルは、1つの単語やフレーズで直接答えを生成する傾向がある。
文書画像の段階的問合せ対を生成するためにMLLM(Multi-modal Large Language Models)を用いる。
次に、生成された高品質なデータを使用して、DocAssistantと呼ばれる、人間化された文書理解と推論モデルをトレーニングします。
論文 参考訳(メタデータ) (2024-02-26T01:17:50Z) - DCQA: Document-Level Chart Question Answering towards Complex Reasoning
and Common-Sense Understanding [19.713647367008143]
文書レベルの質問応答(DCQA)という新しいタスクを導入する。
新たに開発されたベンチマークデータセットは、チャートを幅広いスタイルで統合した50,010の合成文書からなる。
本稿では,テーブルデータ,リッチな色集合,および基本的な質問テンプレートを利用する強力な質問応答生成エンジンの開発について述べる。
論文 参考訳(メタデータ) (2023-10-29T11:38:08Z) - Towards Complex Document Understanding By Discrete Reasoning [77.91722463958743]
VQA(Document Visual Question Answering)は、自然言語による質問に答えるために、視覚的に豊富なドキュメントを理解することを目的としている。
我々は3,067の文書ページと16,558の質問応答ペアからなる新しいドキュメントVQAデータセットTAT-DQAを紹介する。
我々は,テキスト,レイアウト,視覚画像など,多要素の情報を考慮に入れたMHSTという新しいモデルを開発し,異なるタイプの質問にインテリジェントに対処する。
論文 参考訳(メタデータ) (2022-07-25T01:43:19Z) - Robust Question Answering Through Sub-part Alignment [53.94003466761305]
我々はアライメント問題として質問応答をモデル化する。
私たちは、SQuAD v1.1でモデルをトレーニングし、いくつかの逆および外ドメインデータセットでそれをテストします。
論文 参考訳(メタデータ) (2020-04-30T09:10:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。