論文の概要: Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy
- arxiv url: http://arxiv.org/abs/2607.15176v2
- Date: Mon, 20 Jul 2026 18:15:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.24229
- Title: Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy
- Title(参考訳): 科学的可視化リテラシーのためのマルチモーダル大言語モデルのベンチマーク
- Abstract要約: マルチモーダルな大言語モデル(MLLM)は、可視化の解釈にますます利用されている。
科学的可視化リテラシー評価試験において,6つのMLLMをベンチマークした。
その結果,現在のMLLMではSciVisリテラシーが統一されていないことがわかった。
- 参考スコア(独自算出の注目度): 4.707083459088333
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Multimodal large language models (MLLMs) are increasingly used to interpret visualizations, yet current evaluations remain largely chart-centric and provide limited evidence of understanding of scientific visualization (SciVis). We benchmark six MLLMs on the scientific visualization literacy assessment test, a standardized SciVis literacy assessment comprising 49 items based on 18 scientific visualizations and illustrations, spanning 8 techniques and 11 task types. We evaluate three closed-source and three open-source models under a closed-world protocol and compare their performance using data from 485 human participants. Results show that current MLLMs do not exhibit uniform SciVis literacy. Gemini is the strongest model overall, exceeding the human mean across the evaluated subsets, whereas the open-source models remain below the human baseline. Performance is highly uneven across techniques and tasks: models perform best on scientific illustration, search, and spatial understanding, but struggle on texture-based and integration-based visualizations and on quantitative estimation. Error analysis reveals recurring failures in fine-grained quantitative estimation, flow-direction interpretation, and grounded encoding interpretation. These findings position SciVis literacy as a necessary benchmark dimension for evaluating multimodal AI systems. Our code and model outputs are publicly available at https://github.com/patdmp/mllm-scivis-lit-benchmark.
- Abstract(参考訳): MLLM(Multimodal large language model)は、可視化の解釈にますます利用されているが、現在の評価は、主にチャート中心であり、科学的可視化(SciVis)の理解の限られた証拠を提供する。
我々は,科学的可視化リテラシー評価テスト(SciVisリテラシー評価)の6つのMLLMをベンチマークし,科学的視覚化と図面に基づく49項目のSciVisリテラシー評価(SciVisリテラシー評価)を標準化した。
我々は,クローズドワールドプロトコルの下で3つのクローズドソースモデルと3つのオープンソースモデルを評価し,その性能を485人の参加者のデータを用いて比較した。
その結果,現在のMLLMではSciVisリテラシーが統一されていないことがわかった。
Geminiは全体として最強のモデルであり、評価されたサブセット全体の人間の平均を上回っている。
モデルは科学的図面、探索、空間的理解において最善を尽くすが、テクスチャベースと統合ベースの可視化と定量的推定では苦戦する。
誤り解析では、微粒な定量推定、流れ方向の解釈、接地された符号化の解釈において繰り返し発生する故障が明らかになる。
これらの結果から,SciVisリテラシーをマルチモーダルAIシステム評価に必要なベンチマークディメンションとして位置付けた。
私たちのコードとモデル出力はhttps://github.com/patdmp/mllm-scivis-lit-benchmarkで公開されています。
関連論文リスト
- Do MLLMs See What We See? Analyzing Visualization Literacy Barriers in AI Systems [23.262619529784185]
MLLM(Multimodal Large Language Models)における可視化リテラシーの障壁の体系的解析について述べる。
我々は、人間の可視化リテラシー研究に適応したバリア中心の戦略で、4つの最先端モデルから309の誤った応答をオープンコードした。
結果は、モデルは単純なチャートではうまく機能するが、色集約的なセグメントベースの視覚化に苦慮していることを示している。
論文 参考訳(メタデータ) (2026-01-18T21:08:23Z) - PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models [43.767942065379366]
サイコファシー(英: Sycophancy)は、AIモデルが実際の正確さや視覚的証拠の矛盾を犠牲にしてユーザー入力に同意する傾向である。
約2000組の視覚質問応答対からなる総合評価ベンチマーク「textitPENDULUM」を導入する。
本研究は, モデルロバスト性およびサイコファンおよび幻覚行動に対する感受性の顕著な変動を観察する。
論文 参考訳(メタデータ) (2025-12-22T12:49:12Z) - MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models [27.425377320206444]
MLLM(Multimodal large language model)は、様々な領域において大きな進歩を遂げている。
科学分野のベンチマークはMLLMの推論能力を評価する上で重要な役割を果たしてきた。
1)多言語シナリオにおけるモデルの推論能力の不十分な評価、2)MLLMの包括的なモダリティカバレッジの不十分な評価、3)科学的知識ポイントの詳細なアノテーションの欠如。
論文 参考訳(メタデータ) (2025-08-19T15:27:55Z) - SpatialViz-Bench: An MLLM Benchmark for Spatial Visualization [44.427830927596204]
SpaceViz-Benchは4つのサブ能力にまたがる12のタスクを持つ空間視覚化のための総合的なベンチマークである。
33種類の最先端MLLMを評価した結果,多彩な性能の変動がみられ,反直感的な結果が得られた。
論文 参考訳(メタデータ) (2025-07-10T10:27:20Z) - VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models [121.03333569013148]
VisuLogicは、6つのカテゴリにまたがる1,000の人間認証された問題のベンチマークです。
これらの質問は、複数の視点からMLLMの視覚的推論能力を評価するために評価することができる。
ほとんどのモデルは精度が30%以下で、25%のランダムベースラインよりわずかに高く、人間によって達成された51.4%よりはるかに低い。
論文 参考訳(メタデータ) (2025-04-21T17:59:53Z) - VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning [63.0285363282581]
MLLM(Multimodal Large Language Models)は、視覚情報とテキスト情報を統合するための強力なツールとなっている。
本稿では,MLLMの知覚的理解と抽象的関係推論を評価するためのベンチマークVOILAを紹介する。
我々は,現在のMLLMが画像間関係の理解に苦慮し,高レベルの関係推論において限られた能力を示すことを明らかにした。
論文 参考訳(メタデータ) (2025-02-25T23:36:19Z) - Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs [65.93003087656754]
VisFactorは、よく確立された認知心理学評価から20の視覚中心のサブテストをデジタル化するベンチマークである。
GPT、Gemini、Claude、LLaMA、Qwen、SEEDファミリーから20のフロンティアマルチモーダル言語モデル(MLLM)を評価する。
最高のパフォーマンスモデルは100点中25.19点のスコアしか得られず、精神的な回転、空間的関係推論、図形の識別といったタスクに一貫して失敗する。
論文 参考訳(メタデータ) (2025-02-23T04:21:32Z) - Polymath: A Challenging Multi-modal Mathematical Reasoning Benchmark [53.61633384281524]
PolyMATHはMLLMの認知的推論能力を評価するためのベンチマークである。
PolyMATHで最高のスコアは41%、36%、27%で、それぞれClaude-3.5 Sonnet、GPT-4o、Gemini-1.5 Proが獲得した。
さらにきめ細かい誤差解析により、これらのモデルは空間関係を理解し、引き出された高レベルの推論を行うのに苦労していることが明らかとなった。
論文 参考訳(メタデータ) (2024-10-06T20:35:41Z) - MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding [59.41495657570397]
本稿では,72の科学分野をカバーするNature Communicationsの記事からまとめられた包括的データセットについて述べる。
2つのベンチマークタスク(図のキャプションと複数選択)で19のプロプライエタリモデルとオープンソースモデルを評価し,人手による注釈を行った。
タスク固有データを用いた細調整Qwen2-VL-7Bは、GPT-4oや人間の専門家でさえも、マルチチョイス評価において優れた性能を示した。
論文 参考訳(メタデータ) (2024-07-06T00:40:53Z) - CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models [58.95889895912716]
我々は、自由形式のテキストで提供されるコンテキストを用いて視覚的理解を高めるモデルの有効性を評価するために、CODISと名付けられた新しいベンチマークを導入する。
以上の結果から,MLLMは必ずしも人体性能に劣っていることが示唆された。
このことは、MLLMが視覚を文脈依存的に理解する能力を高めることの必要性を浮き彫りにする。
論文 参考訳(メタデータ) (2024-02-21T08:21:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。