論文の概要: MMArt: A Multi-Perspective Multimodal Dataset for Visual Art Understanding
- arxiv url: http://arxiv.org/abs/2608.10706v2
- Date: Sun, 16 Aug 2026 12:53:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 13:30:43.571948
- Title: MMArt: A Multi-Perspective Multimodal Dataset for Visual Art Understanding
- Title(参考訳): MMArt:ビジュアルアート理解のためのマルチパースペクティブマルチモーダルデータセット
- Abstract要約: MMArtは,74,234点のWikiArt絵画を,独立に4つの注釈付き視点と統一キャプションで注釈付けしたデータセットである。
2つの相補性解析は、視点が真に異なる情報をエンコードすることを証明している。
生成解析により,形式的解析記述は構成様式を最もよく保存し,歴史的記述は再構成された画像に強い情緒的信号を運ぶことが示された。
- 参考スコア(独自算出の注目度): 20.027879114950306
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent vision-language models demonstrate impressive general visual understanding, yet their art interpretation remains shallow: they describe surface content but struggle with formal analysis, grounded historical interpretation, or affective characterization. We argue this is not only a model but also a dataset limitation. Existing art datasets are single perspective resources, where no dataset provides narrative, formal, emotional, and historical perspectives simultaneously for the same artworks. We introduce MMArt, a large-scale dataset of 74,234 WikiArt paintings, each annotated with four independently annotated perspectives plus a harmonized unified caption, produced by specialized vision-language models or human annotation and validated through complementary quality evaluations. Two complementarity analyses establish that perspectives encode genuinely distinct information. A generative analysis shows that formal analysis descriptions best preserve compositional style, and historical descriptions carry strong affective signal in reconstructed images. A discriminative retrieval analysis reveals task-asymmetry: narrative descriptions drive retrieval (R@1 = 44.0%), while formal descriptions, strongest for reconstruction, are nearly nondiscriminative at retrieval scale (R@1 = 7.8%). Leave-one-out analysis further confirms that historical descriptions are the least replaceable perspective across both tasks. Together, the two analyses establish that no single perspective suffices for all tasks, directly motivating MMArt multi-perspective design. The dataset, code, and additional information are available at https://shuaiwang97.github.io/MMArt/.
- Abstract(参考訳): 最近の視覚言語モデルは、印象的な一般的な視覚的理解を示すが、その芸術的解釈は、表面的内容を記述するが、形式的分析、基礎化された歴史的解釈、感情的な特徴づけに苦慮している。
これはモデルだけでなく、データセットの制限でもある、と私たちは主張します。
既存のアートデータセットは単一の視点リソースであり、同じアートワークに対して物語、形式、感情、歴史的視点を同時に提供するデータセットは存在しない。
我々は,74,234点のWikiArt絵画からなる大規模データセットであるMMArtを紹介し,それぞれに4つの独立な注釈付き視点と調和した統一キャプションを付加し,視覚言語モデルや人間のアノテーションによって生成し,補完的な品質評価によって検証した。
2つの相補性解析は、視点が真に異なる情報をエンコードすることを証明している。
生成解析により,形式的解析記述は構成様式を最もよく保存し,歴史的記述は再構成された画像に強い情緒的信号を運ぶことが示された。
物語記述が検索を駆動する(R@1 = 44.0%)のに対して、復元に最も強い形式記述は検索スケールではほとんど区別できない(R@1 = 7.8%)。
再帰的分析により、歴史的記述が両方のタスクにおいて最も置換可能な視点であることをさらに確認する。
この2つの分析は、MMArtのマルチパースペクティブ設計を直接動機付けるため、全てのタスクに対して単一の視点が十分でないことを証明している。
データセット、コード、追加情報はhttps://shuaiwang97.github.io/MMArt/で公開されている。
関連論文リスト
- Conducting Stylistic Analysis of Paintings through an Art-History Agent [0.0]
絵画のスタイリスティック分析を自動化するAIフレームワークを提案する。
視覚変換器(ViT)を大量の絵画のコーパスにメタデータで訓練することにより,この美術史固有のデータを埋め込みとして符号化する。
大型言語モデル(LLM)は、関連するアートワークとその付随するキュレーターによるテキストを取得して、それらを記述に合成することによって、それぞれの特徴を解釈する。
論文 参考訳(メタデータ) (2026-08-30T08:10:58Z) - Abstract4D: A Large-Scale Dataset and Framework for Understanding the Visual Language of Abstract Art [9.446232705010916]
Abstract4Dは、これまでで最大の抽象絵画のデータセットである。
大規模埋め込み可視化により抽象芸術の意味構造を解析する。
分類,クロスモーダル検索,テキスト・ツー・イメージ生成のためのベンチマークタスクを確立する。
論文 参考訳(メタデータ) (2026-08-28T13:51:38Z) - Bridging Cognitive Gap: Hierarchical Description Learning for Artistic Image Aesthetics Assessment [51.40989269202702]
審美的品質評価タスクは,AIGCの定量的評価システムの開発に不可欠である。
本研究では,記述生成による美的次元の分離を図った芸術的画像の美的評価フレームワークであるArtQuantを提案する。
提案手法は,従来のトレーニングの33%しか必要とせず,いくつかのデータセット上での最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-12-29T12:18:26Z) - Unlocking Comics: The AI4VA Dataset for Visual Understanding [62.345344799258804]
本稿では,1950年代のフレンチ・ベルジアン漫画に,深度推定,セマンティックセグメンテーション,サリエンシ検出,キャラクタ識別などのタスクを注記した新しいデータセットを提案する。
2つの異なる一貫したスタイルで構成され、自然画像から得られたオブジェクトの概念とラベルを取り入れている。
このような多様な情報を含むことで、このデータセットは計算の創造性を約束するだけでなく、アートのデジタル化やストーリーテリングの革新のための道も提供します。
論文 参考訳(メタデータ) (2024-10-27T14:27:05Z) - BookWorm: A Dataset for Character Description and Analysis [59.186325346763184]
本稿では,短い事実プロファイルを生成する文字記述と,詳細な解釈を提供する文字解析という2つのタスクを定義する。
本稿では,Gutenbergプロジェクトからの書籍と,人間による記述と分析のペアリングを行うBookWormデータセットを紹介する。
その結果,検索に基づくアプローチは両タスクにおいて階層的アプローチよりも優れていた。
論文 参考訳(メタデータ) (2024-10-14T10:55:58Z) - KALE: An Artwork Image Captioning System Augmented with Heterogeneous Graph [24.586916324061168]
本稿では,アートワーク開発のための知識付加型視覚言語モデルを提案する。
KALEはメタデータを2つの方法で組み込む: 第一に直接テキスト入力、第二にマルチモーダルなヘテロジニアス知識グラフである。
実験結果から,KALEは複数のアートデータセットにまたがる既存の最先端の作業に対して高い性能を発揮することが示された。
論文 参考訳(メタデータ) (2024-09-17T06:39:18Z) - GalleryGPT: Analyzing Paintings with Large Multimodal Models [64.98398357569765]
美術品の分析は、個人の審美性を豊かにし、批判的思考能力を促進することができる芸術鑑賞のための重要かつ基本的な技術である。
アートワークを自動解析する以前の作業は、主に分類、検索、その他の単純なタスクに焦点を当てており、AIの目標とは程遠い。
LLaVAアーキテクチャに基づいて微調整されたGalleryGPTと呼ばれる,絵画解析のための優れた大規模マルチモーダルモデルを提案する。
論文 参考訳(メタデータ) (2024-08-01T11:52:56Z) - ConTextual: Evaluating Context-Sensitive Text-Rich Visual Reasoning in Large Multimodal Models [92.60282074937305]
テキストリッチな画像に対して文脈に敏感な推論を必要とする人為的な命令を特徴とする新しいデータセットであるConTextualを紹介した。
そこで本研究では,14の基盤モデルの性能評価実験を行い,人為的な性能基準を確立する。
GPT-4Vとヒトのパフォーマンスの30.8%の有意な性能差を観察した。
論文 参考訳(メタデータ) (2024-01-24T09:07:11Z) - Visual Analytics for Efficient Image Exploration and User-Guided Image
Captioning [35.47078178526536]
事前訓練された大規模言語画像モデルの最近の進歩は、視覚的理解の新しい時代を後押ししている。
本稿では,視覚分析の領域でよく知られた2つの問題に取り組み,(1)大規模画像データセットの効率的な探索と潜在的なデータバイアスの同定,(2)画像キャプションの評価と生成過程のステアリングを行う。
論文 参考訳(メタデータ) (2023-11-02T06:21:35Z) - Weakly-Supervised Aspect-Based Sentiment Analysis via Joint
Aspect-Sentiment Topic Embedding [71.2260967797055]
アスペクトベース感情分析のための弱教師付きアプローチを提案する。
We learn sentiment, aspects> joint topic embeddeds in the word embedding space。
次に、ニューラルネットワークを用いて単語レベルの識別情報を一般化する。
論文 参考訳(メタデータ) (2020-10-13T21:33:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。