論文の概要: Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts
- arxiv url: http://arxiv.org/abs/2604.21344v1
- Date: Thu, 23 Apr 2026 06:59:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-24 14:40:06.343809
- Title: Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts
- Title(参考訳): Beyond Single Plots: マルチチャートに対する質問回答のベンチマーク
- Abstract要約: マルチチャート画像上の質問応答に特化して設計された中規模データセットであるPolyChartQAを紹介する。
質問タイプ,難易度,質問ソース,マルチチャートのキー構造的特徴を問うPolyChartQAにおける9つの最先端マルチモーダル言語モデル(MLM)の性能評価を行った。
- 参考スコア(独自算出の注目度): 3.2880869992413246
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Charts are widely used to present complex information. Deriving meaningful insights in real-world contexts often requires interpreting multiple related charts together. Research on understanding multi-chart images has not been extensively explored. We introduce PolyChartQA, a mid-scale dataset specifically designed for question answering over multi-chart images. PolyChartQA comprises 534 multi-chart images (with a total of 2,297 sub-charts) sourced from peer-reviewed computer science research publications and 2,694 QA pairs. We evaluate the performance of nine state-of-the-art Multimodal Language Models (MLMs) on PolyChartQA across question type, difficulty, question source, and key structural characteristics of multi-charts. Our results show a 27.4% LLM-based accuracy (L-Accuracy) drop on human-authored questions compared to MLM-generated questions, and a 5.39% L-accuracy gain with our proposed prompting method.
- Abstract(参考訳): チャートは複雑な情報を示すために広く使われている。
実世界の文脈において意味のある洞察を引き出すには、しばしば複数の関連するチャートをまとめて解釈する必要がある。
マルチチャート画像の理解に関する研究は、まだ広く研究されていない。
マルチチャート画像上の質問応答に特化して設計された中規模データセットであるPolyChartQAを紹介する。
PolyChartQAは、534枚のマルチチャートイメージ(合計2,297枚のサブチャート)と2,694枚のQAペアで構成されている。
質問タイプ,難易度,質問ソース,マルチチャートのキー構造的特徴を問うPolyChartQAにおける9つの最先端マルチモーダル言語モデル(MLM)の性能評価を行った。
提案手法では, MLMによる質問に対して, 27.4%のLLMに基づく精度(L-精度)が低下し, 5.39%のL-精度が得られた。
関連論文リスト
- LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning [25.04804547776196]
マルチモーダルな大言語モデル(MLLM)は、拡張されたコンテキストウィンドウとより強力な推論機能によって急速に進化している。
既存のベンチマークはシングルチャートの知覚に重点を置いているが、単純なチャートとチャートの接続はこれらの能力を評価するには不十分である。
VQAセットに平均6.5のイメージと31.2の質問を含むベンチマークであるLongChartを紹介する。
10種類の最先端MLLMを評価し,解析パターン,補助ツール,画像摂動に対する頑健さの3つの要因について検討した。
論文 参考訳(メタデータ) (2026-08-02T15:48:04Z) - ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning [54.86473583610112]
グラフの連鎖推論に反射的相互作用を統合するPointCoTを提案する。
位置アノテーションに基づいてMLLMにバウンディングボックスと再レンダリングチャートを生成することで、テキスト推論ステップと視覚的接地領域の接続を確立する。
我々は、いくつかのグラフベンチマークにおいて最先端のモデルであるChartPointQ2とChartPointQ2.5を開発した。
論文 参考訳(メタデータ) (2025-11-29T04:01:55Z) - POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering [69.52231076699756]
PolyChartQAは10の言語で22,606のチャートと26,151の質問応答ペアをカバーする最初の大規模多言語チャート回答ベンチマークである。
我々は、最先端のLLMベースの翻訳を活用し、パイプラインにおける厳密な品質制御を適用し、生成された多言語チャートの言語的および意味的一貫性を確保する。
論文 参考訳(メタデータ) (2025-07-16T06:09:02Z) - InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts [20.95897015354387]
InfoChartQAは、インフォグラフィックチャートの理解に基づいてマルチモーダル大言語モデル(MLLM)を評価するためのベンチマークである。
5,642組のインフォグラフィックと平易なチャートが含まれており、それぞれが同じ基礎データを共有するが、視覚的な表示では異なる。
視覚的要素に基づく質問を設計し、そのユニークな視覚的デザインとコミュニケーション意図を捉える。
論文 参考訳(メタデータ) (2025-05-25T08:28:03Z) - ChartQAPro: A More Diverse and Challenging Benchmark for Chart Question Answering [27.58410749367183]
新しいベンチマークであるChartQAProを紹介した。これは157のさまざまなソースから1,341のチャートを含み、さまざまなチャートタイプにまたがっている。
21モデルによる評価は,ChartQAPro上でのLVLMの性能低下を示す。
論文 参考訳(メタデータ) (2025-04-07T21:05:06Z) - Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering [45.67334913593117]
誤解を招く可視化は、公衆の理解にリスクをもたらし、データ駆動通信に関わるAIシステムに対して安全上の懸念を提起する。
我々は、24の最先端MLLMをベンチマークし、ミスリーダータイプとチャートフォーマット間での性能を分析し、新しい地域対応推論パイプラインを提案する。
我々の研究は、堅牢で信頼性があり、責任ある視覚コミュニケーションの要求に沿うMLLMを開発するための基盤を築いた。
論文 参考訳(メタデータ) (2025-03-23T18:56:33Z) - Chart-HQA: A Benchmark for Hypothetical Question Answering in Charts [62.45232157149698]
本稿では,同じ質問に対して仮定を課し,グラフの内容に基づいた反実的推論を行うようモデルに強制する,新しいChart hypothetical Question Answering (HQA)タスクを提案する。
さらに,MLLMの効率的なテキスト編集機能と人間の知識を併用して,多種多様な高品質HQAデータを低コストで生成する,人間とAIの対話型データ合成手法であるHAIを導入する。
論文 参考訳(メタデータ) (2025-03-06T05:08:40Z) - Distill Visual Chart Reasoning Ability from LLMs to MLLMs [64.32993770646165]
マルチモーダル大言語モデル(MLLM)における複雑なチャートQ&Aタスクの解決には高度な視覚的推論能力が必要である
我々は,LLMからMLLMへの視覚的推論能力を蒸留するための費用効率,効率,スケーラブルなデータ合成手法であるCode-as-Intermediary Translation (CIT)を提案する。
ReachQAは、MLLMの認識と推論能力を高めるために、3kの推論集約チャートと20kのQ&Aペアを含むデータセットである。
論文 参考訳(メタデータ) (2024-10-24T14:50:42Z) - MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems [18.188725200923333]
チャート関連タスクの既存のベンチマークは、実世界のマルチチャートシナリオの複雑さを捉えるのに不足している。
直接質問応答,並列質問応答,比較推論,シーケンシャル推論の4つの重要な領域でMLLMの能力を評価するベンチマークであるMultiChartQAを紹介する。
本研究は,マルチチャート理解の課題と,この分野での進歩を促進するためのマルチチャートQAの可能性を明らかにするものである。
論文 参考訳(メタデータ) (2024-10-18T05:15:50Z) - CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs [62.84082370758761]
CharXivは、arXiv論文の2,323のチャートを含む総合的な評価スイートである。
品質を確保するために、すべてのチャートと質問は、人間の専門家によって手書きされ、キュレーションされ、検証されます。
その結果、最強のプロプライエタリモデルの推論スキルの間に、かなり過小評価されていたギャップが明らかとなった。
論文 参考訳(メタデータ) (2024-06-26T17:50:11Z) - ChartX & ChartVLM: A Versatile Benchmark and Foundation Model for Complicated Chart Reasoning [55.22996841790139]
我々は、チャート領域における既製のマルチモーダル言語モデル(MLLM)の能力をベンチマークする。
ChartXは18種類のチャートタイプ,7つのチャートタスク,22のディシプリナトピック,高品質なチャートデータを含むマルチモーダルな評価セットである。
我々は、解釈可能なパターンに強く依存するマルチモーダルタスクに対する新しい視点を提供するため、ChartVLMを開発した。
論文 参考訳(メタデータ) (2024-02-19T14:48:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。