論文の概要: Charts Are Beyond Pixels: Probing for Layer-Wise Chart Understanding and Editing
- arxiv url: http://arxiv.org/abs/2609.08657v1
- Date: Tue, 08 Sep 2026 12:26:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.646044
- Title: Charts Are Beyond Pixels: Probing for Layer-Wise Chart Understanding and Editing
- Title(参考訳): チャートはPixelを超える:レイヤワイズチャートの理解と編集のための調査
- Abstract要約: ここでは、レイヤ属性、レイヤバインディング、可視性順序付けという、3つのコア概念を中心にまとめられたベンチマークであるLayerWiseBenchを紹介する。
制御された理解質問、編集対象、参照画像、評価領域を導出する。
結果、mIoUは1.49%から4.93%の範囲であり、視認性に制約のある編集はエディタ毎に最低のmIoUであることがわかった。
- 参考スコア(独自算出の注目度): 7.153295370588265
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Charts are structured visual compositions whose elements have distinct functional roles, semantic correspondences, and visibility relations. This structural view motivates evaluating whether models can understand and manipulate charts at the layer level. Existing chart benchmarks, however, primarily assess the correctness or fidelity of final outputs and do not directly evaluate these layer-wise behaviors. We present LayerWiseBench, a benchmark organized around three core concepts, layer attribution, layer binding, and visibility ordering, that structure its chart-understanding and chart-editing evaluations. Generated from executable chart programs, LayerWiseBench pairs each rendered chart with spatially aligned per-layer RGBA assets and construction-derived labels for functional roles, semantic bindings, and visibility relations. From this layer-wise representation, we derive controlled understanding questions, editing targets, reference images, and evaluation regions. It contains 2,800 source charts across 14 chart paradigms, from which we derive 7,329 layer-wise understanding questions and 53,791 instruction-guided editing variants. Among the evaluated VLMs, Qwen3.5-27B, which achieves the highest QA macro-average, obtains 93.04% accuracy on layer attribution and 97.46% on layer binding, but only 61.46% on visibility ordering. Across the four evaluated image editors, overall mIoU ranges from 1.49% to 4.93%, and visibility-constrained edits have the lowest mIoU for every editor, ranging from 0.37% to 2.00%. Taken together, these results identify tasks involving front-to-back relations between overlapping components as a recurring challenge across understanding and editing, motivating more explicit modeling of component identity and visibility relations.
- Abstract(参考訳): チャートは、異なる機能的役割、意味的対応、可視的関係を持つ、構造化された視覚的構成である。
この構造的な視点は、モデルがレイヤーレベルでチャートを理解し、操作できるかどうかを評価する動機となります。
しかし、既存のチャートベンチマークは主に最終的な出力の正確さや忠実さを評価しており、これらの階層的な振る舞いを直接評価していない。
本稿では、レイヤ属性、レイヤバインディング、可視性順序付けという3つのコア概念に基づいて構成されたベンチマークであるLayerWiseBenchについて紹介する。
実行可能なチャートプログラムから生成されたLayerWiseBenchは、各レンダリングチャートと、機能的役割、セマンティックバインディング、可視性関係のための空間的に整列されたRGBAアセットと構築から派生したラベルをペアリングする。
この階層表現から、制御された理解質問、編集対象、参照画像、評価領域を導出する。
14のグラフパラダイムにまたがる2,800のソースチャートがあり、そこから7,329の階層的理解質問と53,791の命令誘導編集変種が導出される。
評価されたVLMのうちQwen3.5-27Bは、QAのマクロ平均値が93.04%、層結合が97.46%、可視性が61.46%である。
4つの評価された画像エディタ全体では、mIoUは1.49%から4.93%の範囲で、可視性に制約のある編集は、すべてのエディタで最低のmIoUであり、0.37%から2.00%である。
これらの結果から,重なり合うコンポーネント間の前後関係に関するタスクが,コンポーネントのアイデンティティと可視性の関係のより明示的なモデリングを動機付け,理解と編集を繰り返す課題として認識される。
関連論文リスト
- DIAGRAMS: A Review Framework for Reasoning-Level Attribution in Diagram QA [56.73431446011309]
ダイアグラム質問応答(ダイアグラムQA)は、各問合せ対を答えを導き出すために必要なすべての視覚領域にリンクする推論レベルの属性を必要とする。
私たちは、データセット固有の構造からインターフェースロジックを分離する軽量でスキーマ駆動のレビューフレームワークであるDIAGRAMSを紹介します。
論文 参考訳(メタデータ) (2026-04-29T02:34:51Z) - Beyond Pixels: Introspective and Interactive Grounding for Visualization Agents [3.1626173943755975]
VLM(Vision-Language Models)は、しばしば誤読値、幻覚的詳細、チャート内の重なり合う要素を混乱させる。
現在のアプローチはピクセル解釈のみに依存し、Pixel-Only Bottleneckを作成する。
Introspective and Interactive Visual Grounding (IVG)は、スペック・グラウンド・イントロスペクションとビュー・グラウンド・インタラクションを組み合わせたフレームワークである。
論文 参考訳(メタデータ) (2026-04-22T22:47:23Z) - Chart Specification: Structural Representations for Incentivizing VLM Reasoning in Chart-to-Code Generation [11.18352269863283]
VLM(Vision-Language Models)は、チャート画像からプロットコードを生成することを約束している。
既存のアプローチは、主に監督された微調整と表面レベルのトークンの模倣に頼っている。
本稿では,テキストの模倣から意味的に根ざした監督へトレーニングを移行させる構造化中間表現であるChart Specificationを提案する。
論文 参考訳(メタデータ) (2026-02-11T14:08:06Z) - ChartE$^{3}$: A Comprehensive Benchmark for End-to-End Chart Editing [64.65742943745866]
ChartE$3$はEnd-to-End Chart Editingベンチマークである。
中間的な自然言語プログラムやコードレベルの監視に頼ることなく、モデルを直接評価する。
1200以上の高品質なサンプルが、十分に設計されたデータパイプラインを通じて構築されている。
論文 参考訳(メタデータ) (2026-01-29T13:29:27Z) - Charts Are Not Images: On the Challenges of Scientific Chart Editing [66.38730113476677]
textitFigEditは、3万以上のサンプルからなる科学的フィギュア編集のベンチマークである。
私たちのベンチマークでは、ピクセルレベルの操作の重大な制限が示されています。
textitFigEdit をリリースすることにより,構造対応図形編集の体系的な進歩の実現を目指す。
論文 参考訳(メタデータ) (2025-11-30T06:13:48Z) - ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning [54.86473583610112]
グラフの連鎖推論に反射的相互作用を統合するPointCoTを提案する。
位置アノテーションに基づいてMLLMにバウンディングボックスと再レンダリングチャートを生成することで、テキスト推論ステップと視覚的接地領域の接続を確立する。
我々は、いくつかのグラフベンチマークにおいて最先端のモデルであるChartPointQ2とChartPointQ2.5を開発した。
論文 参考訳(メタデータ) (2025-11-29T04:01:55Z) - RefChartQA: Grounding Visual Answer on Chart Images through Instruction Tuning [63.599057862999]
RefChartQAは、Chart Question Answering(ChartQA)とビジュアルグラウンドを統合した、新しいベンチマークである。
実験により,グラウンド化による空間認識を取り入れることで,応答精度が15%以上向上することが実証された。
論文 参考訳(メタデータ) (2025-03-29T15:50:08Z) - Benchmarking Multimodal RAG through a Chart-based Document Question-Answering Generation Framework [17.838177710655287]
MRAG(Multimodal Retrieval-Augmented Generation)は、外部知識を統合することで推論能力を向上させる。
既存のベンチマークは主に、現実世界のアプリケーションで広く使われているチャートのような複雑なビジュアルフォーマットを見渡す、単純な画像とテキストのインタラクションに焦点を当てている。
本稿では、構造化キーポイント抽出、クロスモーダル検証、キーポイントベース生成による評価データを生成するフレームワークであるCHARGE(CHARt-based document question-anwering GEneration)を提案する。
論文 参考訳(メタデータ) (2025-02-20T18:59:42Z) - HMGIE: Hierarchical and Multi-Grained Inconsistency Evaluation for Vision-Language Data Cleansing [54.970275599061594]
我々は階層的・多階層的不整合評価(HMGIE)と呼ばれる適応的評価フレームワークを設計する。
HMGIEは、様々な画像キャプチャー対の精度と完全性の両方をカバーする多粒度評価を提供する。
提案手法の有効性と柔軟性を検証するため,様々なタイプの画像キャプチャー・データセットであるMVTIDを構築した。
論文 参考訳(メタデータ) (2024-12-07T15:47:49Z) - ChartInsights: Evaluating Multimodal Large Language Models for Low-Level Chart Question Answering [27.193293027128558]
マルチモーダルな大言語モデル (MLLM) は、高レベルなChartQAタスクにおいて有望であるが、低レベルなChartQAタスクにおけるそれらの有効性はまだ未定である。
本稿では, MLLMを低レベルチャートQA上で新たにキュレートしたデータセットであるChartInsightsを用いて評価する。
低レベルのChartQAタスクに適した新しいテキストプロンプト戦略であるChain-of-Chartsを提案し、パフォーマンスを14.41%向上させ、83.58%の精度を達成する。
論文 参考訳(メタデータ) (2024-05-11T12:33:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。