論文の概要: Spatial Priming Outperforms Semantic Prompting: A Grid-Based Approach to Improving LLM Accuracy on Chart Data Extraction
- arxiv url: http://arxiv.org/abs/2605.08220v1
- Date: Wed, 06 May 2026 13:38:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.472342
- Title: Spatial Priming Outperforms Semantic Prompting: A Grid-Based Approach to Improving LLM Accuracy on Chart Data Extraction
- Title(参考訳): 空間プライミング性能のセマンティック・プロンプティング:チャートデータ抽出におけるLCM精度向上のためのグリッドベースアプローチ
- Abstract要約: マルチモーダルモデルは将来性を示すが、標準化されていないチャートでの精度は依然として課題である。
モデル性能(ハイレベルなセマンティックプライミング)や低レベルな空間プライミングを改善する最も効果的な戦略は何か?
解析の前に座標格子をチャート画像上に重ね合わせるという,単純だが効果的な空間プライミング手法を提案する。
- 参考スコア(独自算出の注目度): 41.99844472131922
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The automated extraction of data from scientific charts is a critical task for large-scale literature analysis. While multimodal Large Language Models (LLMs) show promise, their accuracy on non-standardized charts remains a challenge. This raises a key research question: what is the most effective strategy to improve model performance (high-level semantic priming) or low-level spatial priming? This paper presents a comparative investigation into these two distinct strategies. We describe our exploratory experiments with semantic methods, such as a two-stage metadata-first framework and Chain-of-Thought, which failed to produce a statistically significant improvement. In contrast, we present a simple but highly effective spatial priming method: overlaying a coordinate grid onto the chart image before analysis. Our quantitative experiment on a synthetic dataset demonstrates that this grid-based approach provides a statistically significant reduction in data extraction error (SMAPE reduced from 25.5% to 19.5%, p < 0.05) compared to a baseline. We conclude that for the current generation of multimodal models, providing explicit spatial context is a more effective and reliable strategy than high-level semantic guidance for this class of tasks.
- Abstract(参考訳): 科学的チャートからデータを自動的に抽出することは、大規模文献分析にとって重要な課題である。
マルチモーダルなLarge Language Models (LLM) は将来性を示すが、標準化されていないチャート上での精度は依然として課題である。
モデル性能(ハイレベルなセマンティックプライミング)や低レベルな空間プライミングを改善する最も効果的な戦略は何か?
本稿では,これら2つの異なる戦略について比較検討する。
本稿では,2段階のメタデータファーストフレームワークやChain-of-Thoughtといったセマンティックな手法による探索実験を行ったが,統計的に有意な改善は得られなかった。
対照的に、解析の前に座標格子をチャート画像上に重ね合わせるという、単純だが高効率な空間プライミング手法を提案する。
合成データセットに関する定量的実験により、このグリッドベースの手法は、ベースラインに比べて統計的にデータ抽出誤差(SMAPEは25.5%から19.5%、p < 0.05)を減少させることを示した。
現状のマルチモーダルモデルでは,このようなタスクの高レベルな意味指導よりも,空間的コンテキストを明示的に提供することが効果的で信頼性の高い戦略である,と結論付けている。
関連論文リスト
- SAS: Semantic-aware Sampling for Generative Dataset Distillation [55.27114962330541]
本稿では,コントラスト言語-画像事前学習(CLIP)をポストサンプリングのセマンティクスとして活用することで,データセット蒸留のセマンティック・アウェア・パースペクティブを導入する。
我々のゴールは、コンパクトであるだけでなく、意味的にクラス差別的で多様である蒸留データセットを得ることです。
論文 参考訳(メタデータ) (2026-05-18T08:05:46Z) - An Enhanced Model-based Approach for Short Text Clustering [58.60681789677676]
Twitter、Google+、Facebookなどのソーシャルメディアの人気が高まり、短いテキストのクラスタリングがますます重要になっている。
既存の手法は、トピックモデルに基づくアプローチと深層表現学習に基づくアプローチの2つのパラダイムに大別することができる。
短文の空間性と高次元性を効果的に扱えるDirichlet Multinomial Mixture Model (GSDMM) のギブスサンプリングアルゴリズムを提案する。
さらなる改良を保証しているGSDMMのいくつかの側面に基づいて,さらなる性能向上を目的とした改良されたアプローチであるGSDMM+を提案する。
論文 参考訳(メタデータ) (2025-07-18T10:07:42Z) - Prompt Tuning Vision Language Models with Margin Regularizer for Few-Shot Learning under Distribution Shifts [13.21626568246313]
視覚言語基礎モデルが、分布やクラスが全く異なるデータセットに適応できるかどうかを解析する。
本稿では,少数のサンプルに対して,このような大規模VLMを直接適用するための新しいプロンプトチューニング手法であるPromptMarginを提案する。
PromptMarginは、このタスクのテキストと視覚的なプロンプトを効果的に調整し、2つのメインモジュールを持っている。
論文 参考訳(メタデータ) (2025-05-21T13:26:56Z) - Boosting Graph Neural Network Expressivity with Learnable Lanczos Constraints [7.605749412696919]
グラフニューラルネットワーク(GNN)はグラフ構造化データの処理に優れるが、リンク予測タスクでは性能が劣ることが多い。
グラフラプラシア行列の固有基底に誘導された部分グラフを埋め込むことによりGNNの表現性を高める新しい手法を提案する。
本研究では,2-WLで区別できないグラフを,効率的な時間的複雑性を維持しながら識別できることを実証する。
論文 参考訳(メタデータ) (2024-08-22T12:22:00Z) - Rethinking the Effectiveness of Graph Classification Datasets in Benchmarks for Assessing GNNs [7.407592553310068]
本稿では,単純な手法とGNN間の性能差を調べるための,公正なベンチマークフレームワークに基づく経験的プロトコルを提案する。
また,データセットの複雑性とモデル性能を両立させることにより,データセットの有効性を定量化する新しい指標を提案する。
我々の発見は、ベンチマークデータセットの現在の理解に光を当て、新しいプラットフォームは、グラフ分類ベンチマークの将来的な進化を後押しする可能性がある。
論文 参考訳(メタデータ) (2024-07-06T08:33:23Z) - Improved Distribution Matching for Dataset Condensation [91.55972945798531]
本稿では,分布マッチングに基づく新しいデータセット凝縮法を提案する。
提案手法は,計算資源の少ない従来の最適化指向手法よりも優れている。
論文 参考訳(メタデータ) (2023-07-19T04:07:33Z) - Model-Agnostic Multitask Fine-tuning for Few-shot Vision-Language
Transfer Learning [59.38343286807997]
未知タスクの視覚言語モデルのためのモデル非依存型マルチタスクファインチューニング(MAMF)を提案する。
モデルに依存しないメタラーニング(MAML)と比較して、MAMFは二段階最適化を捨て、一階勾配のみを使用する。
MAMFは5つのベンチマークデータセット上で、数ショットの転送学習において古典的な微調整法よりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2022-03-09T17:26:53Z) - Revisiting LSTM Networks for Semi-Supervised Text Classification via
Mixed Objective Function [106.69643619725652]
我々は,単純なBiLSTMモデルであっても,クロスエントロピー損失でトレーニングした場合に,競争的な結果が得られるようなトレーニング戦略を開発する。
いくつかのベンチマークデータセット上で,テキスト分類タスクの最先端結果について報告する。
論文 参考訳(メタデータ) (2020-09-08T21:55:22Z) - The Little W-Net That Could: State-of-the-Art Retinal Vessel
Segmentation with Minimalistic Models [19.089445797922316]
数桁のパラメータが桁違いに少ない標準U-Netのミニマリストバージョンが、現在のベストプラクティスの性能を近似していることを示す。
また,W-Netと呼ばれる単純な拡張も提案する。
また、Artery/Veinセグメンテーション問題にもアプローチを試行し、その結果を最先端技術に整合させる。
論文 参考訳(メタデータ) (2020-09-03T19:59:51Z) - Semi-Supervised Learning with Meta-Gradient [123.26748223837802]
半教師付き学習における簡単なメタ学習アルゴリズムを提案する。
その結果,提案アルゴリズムは最先端の手法に対して良好に動作することがわかった。
論文 参考訳(メタデータ) (2020-07-08T08:48:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。