Fugu-MT 論文翻訳(概要): GalleryGPT: Analyzing Paintings with Large Multimodal Models

論文の概要: GalleryGPT: Analyzing Paintings with Large Multimodal Models

arxiv url: http://arxiv.org/abs/2408.00491v1
Date: Thu, 1 Aug 2024 11:52:56 GMT
ステータス: 翻訳完了
システム内更新日: 2024-08-04 20:46:24.440114
Title: GalleryGPT: Analyzing Paintings with Large Multimodal Models
Title（参考訳）: GalleryGPT: 大規模マルチモーダルモデルによる絵画の分析
Authors: Yi Bin, Wenhao Shi, Yujuan Ding, Zhiqiang Hu, Zheng Wang, Yang Yang, See-Kiong Ng, Heng Tao Shen,
Abstract要約: 美術品の分析は、個人の審美性を豊かにし、批判的思考能力を促進することができる芸術鑑賞のための重要かつ基本的な技術である。アートワークを自動解析する以前の作業は、主に分類、検索、その他の単純なタスクに焦点を当てており、AIの目標とは程遠い。 LLaVAアーキテクチャに基づいて微調整されたGalleryGPTと呼ばれる,絵画解析のための優れた大規模マルチモーダルモデルを提案する。
参考スコア（独自算出の注目度）: 64.98398357569765
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Abstract: Artwork analysis is important and fundamental skill for art appreciation, which could enrich personal aesthetic sensibility and facilitate the critical thinking ability. Understanding artworks is challenging due to its subjective nature, diverse interpretations, and complex visual elements, requiring expertise in art history, cultural background, and aesthetic theory. However, limited by the data collection and model ability, previous works for automatically analyzing artworks mainly focus on classification, retrieval, and other simple tasks, which is far from the goal of AI. To facilitate the research progress, in this paper, we step further to compose comprehensive analysis inspired by the remarkable perception and generation ability of large multimodal models. Specifically, we first propose a task of composing paragraph analysis for artworks, i.e., painting in this paper, only focusing on visual characteristics to formulate more comprehensive understanding of artworks. To support the research on formal analysis, we collect a large dataset PaintingForm, with about 19k painting images and 50k analysis paragraphs. We further introduce a superior large multimodal model for painting analysis composing, dubbed GalleryGPT, which is slightly modified and fine-tuned based on LLaVA architecture leveraging our collected data. We conduct formal analysis generation and zero-shot experiments across several datasets to assess the capacity of our model. The results show remarkable performance improvements comparing with powerful baseline LMMs, demonstrating its superb ability of art analysis and generalization. \textcolor{blue}{The codes and model are available at: https://github.com/steven640pixel/GalleryGPT.
Abstract（参考訳）: 美術品の分析は、個人の審美性を豊かにし、批判的思考能力を促進することができる芸術鑑賞のための重要かつ基本的な技術である。芸術の理解は、その主観的な性質、多様な解釈、複雑な視覚要素のために困難であり、美術史、文化的背景、美学の専門知識を必要とする。しかし、データ収集とモデル能力に制限されている従来のアートワークは、主に分類、検索、その他の単純なタスクに焦点を当てており、AIの目標とは程遠い。本稿では,大規模マルチモーダルモデルの顕著な知覚と生成能力に触発された包括的分析を更に進める。具体的には,まず,美術作品の段落分析,すなわち絵画の視覚的特徴に着目し,より包括的な芸術作品の理解を定式化するタスクを提案する。フォーマルな分析研究を支援するために,約19kの絵画画像と50kの分析段落を備えた大規模データセットPaintingFormを収集した。さらに我々は,LLaVAアーキテクチャをベースとしたGalleryGPTと呼ばれる,絵画解析のための優れた大規模マルチモーダルモデルを導入する。我々は、モデルの性能を評価するために、複数のデータセットをまたいだフォーマルな分析生成とゼロショット実験を行う。その結果,強力なベースラインLMMと比較して優れた性能向上を示し,アート解析と一般化の優れた能力を示した。 https://github.com/steven640pixel/GalleryGPT。

関連論文リスト

Bridging Cognitive Gap: Hierarchical Description Learning for Artistic Image Aesthetics Assessment [51.40989269202702]
審美的品質評価タスクは,AIGCの定量的評価システムの開発に不可欠である。本研究では,記述生成による美的次元の分離を図った芸術的画像の美的評価フレームワークであるArtQuantを提案する。提案手法は,従来のトレーニングの33%しか必要とせず,いくつかのデータセット上での最先端のパフォーマンスを実現する。
論文参考訳（メタデータ） (2025-12-29T12:18:26Z)
The Photographer Eye: Teaching Multimodal Large Language Models to Understand Image Aesthetics like Photographers [82.99499130882576]
写真家でキュレーターのSzarkowskiは、一般的な視覚的理解と美的理解との間にある顕著なギャップの1つを洞察的に明らかにした。プロの写真家と愛好家の間で広範囲にわたる議論から得られた新しいデータセットPhotoCritiqueを提示する。また,複数の視点から画像美学を理解するために,言語誘導型多視点視覚融合機構を備えた新しいモデルPhotoEyeを提案する。
論文参考訳（メタデータ） (2025-09-23T02:59:41Z)
Vision Generalist Model: A Survey [87.49797517847132]
本稿では、ビジョンジェネラリストモデルの概要を概観し、その分野におけるその特性と能力について考察する。関連ドメインへの簡単な探索を行い、相互接続と潜在的なシナジーに光を当てます。
論文参考訳（メタデータ） (2025-06-11T17:23:41Z)
A Critical Assessment of Modern Generative Models' Ability to Replicate Artistic Styles [0.0]
本稿では,現代生成モデルのスタイル再現能力を批判的に評価する。これらのモデルは,構造的整合性と構成的バランスを維持しつつ,従来の芸術様式をいかに効果的に再現するかを検討する。この分析は、過去の芸術スタイルを模倣したAI生成作品の大規模なデータセットに基づいている。
論文参考訳（メタデータ） (2025-02-21T07:00:06Z)
CognArtive: Large Language Models for Automating Art Analysis and Decoding Aesthetic Elements [1.0579965347526206]
芸術は普遍言語であり、様々な方法で解釈できる。大規模言語モデル (LLM) とマルチモーダル大規模言語モデル (MLLM) の可用性は,これらのモデルがアートワークの評価と解釈にどのように使用できるのかという疑問を提起する。
論文参考訳（メタデータ） (2025-02-04T18:08:23Z)
Understanding Museum Exhibits using Vision-Language Reasoning [52.35301212718003]
博物館は、様々なエポック、文明、地域の文化遺産や歴史的遺物の保管所として機能している。ドメイン固有モデルは、インタラクティブなクエリ解決と歴史的洞察を得るために不可欠である。世界中の展示品に対して,65万枚の画像と2億枚の質問回答ペアの大規模なデータセットを収集し,キュレートする。
論文参考訳（メタデータ） (2024-12-02T10:54:31Z)
APDDv2: Aesthetics of Paintings and Drawings Dataset with Artist Labeled Scores and Comments [45.57709215036539]
Aesthetics Paintings and Drawings dataset (APDD)は,24の異なる芸術カテゴリーと10の美的属性を含む最初の総合的な絵画コレクションである。 APDDv2は画像コーパスを拡張し、アノテーションの品質を改善し、詳細な言語コメントを特徴としている。本稿では,ArtCLIP(Art Assessment Network for Specific Painting Styles)の改訂版について紹介する。
論文参考訳（メタデータ） (2024-11-13T11:46:42Z)
KALE: An Artwork Image Captioning System Augmented with Heterogeneous Graph [24.586916324061168]
本稿では,アートワーク開発のための知識付加型視覚言語モデルを提案する。 KALEはメタデータを2つの方法で組み込む: 第一に直接テキスト入力、第二にマルチモーダルなヘテロジニアス知識グラフである。実験結果から,KALEは複数のアートデータセットにまたがる既存の最先端の作業に対して高い性能を発揮することが示された。
論文参考訳（メタデータ） (2024-09-17T06:39:18Z)
Have Large Vision-Language Models Mastered Art History? [3.790400719319821]
VLM(Vision-Language Models)が絵画のスタイル、作者、制作日を分類できるかどうかを検証する。美術史家たちは長い間、芸術のユニークな側面を研究してきたが、スタイル予測はその分野の重要な要素であった。
論文参考訳（メタデータ） (2024-09-05T13:33:57Z)
MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding [59.41495657570397]
本稿では,72の科学分野をカバーするNature Communicationsの記事からまとめられた包括的データセットについて述べる。 2つのベンチマークタスク(図のキャプションと複数選択)で19のプロプライエタリモデルとオープンソースモデルを評価し,人手による注釈を行った。タスク固有データを用いた細調整Qwen2-VL-7Bは、GPT-4oや人間の専門家でさえも、マルチチョイス評価において優れた性能を示した。
論文参考訳（メタデータ） (2024-07-06T00:40:53Z)
GPT4Image: Can Large Pre-trained Models Help Vision Models on Perception Tasks? [51.22096780511165]
本稿では,大規模な事前学習モデルから抽出した知識を利用して,CNN や ViT などのモデルが拡張表現を学習するのを支援する新しい学習パラダイムを提案する。我々は、詳細な記述を事前訓練されたエンコーダに入力し、画像の内容をエンコードするリッチなセマンティック情報でテキスト埋め込みを抽出する。
論文参考訳（メタデータ） (2023-06-01T14:02:45Z)
Synergy of Machine and Deep Learning Models for Multi-Painter Recognition [0.0]
我々は,62名のアーティストを含む絵画認識タスクのための大規模データセットを新たに導入し,良好な結果を得た。 RegNetは、機能をエクスポートする上で、SVMは、最大85%のパフォーマンスを持つ画家に基づいて、イメージの最高の分類を行う。
論文参考訳（メタデータ） (2023-04-28T11:34:53Z)
Towards Artistic Image Aesthetics Assessment: a Large-scale Dataset and a New Method [64.40494830113286]
まず、Boldbrush Artistic Image dataset (BAID)という大規模なAIAAデータセットを紹介します。そこで我々は,芸術的イメージを評価するために,スタイル特異的で汎用的な美的情報を効果的に抽出し,活用する新たな手法であるSAANを提案する。実験により,提案手法は提案したBAIDデータセット上で既存のIAA手法よりも優れていることが示された。
論文参考訳（メタデータ） (2023-03-27T12:59:15Z)
Holistic Visual-Textual Sentiment Analysis with Prior Models [64.48229009396186]
本稿では,頑健な視覚・テキスト感情分析を実現するための総合的手法を提案する。提案手法は,(1)感情分析のためのデータから特徴を直接学習する視覚テキストブランチ,(2)選択された意味的特徴を抽出する事前学習された「専門家」エンコーダを備えた視覚専門家ブランチ,(3)暗黙的に視覚テキスト対応をモデル化するCLIPブランチ,(4)多モード特徴を融合して感情予測を行うBERTに基づくマルチモーダル特徴融合ネットワークの4つの部分から構成される。
論文参考訳（メタデータ） (2022-11-23T14:40:51Z)
Automatic Image Content Extraction: Operationalizing Machine Learning in Humanistic Photographic Studies of Large Visual Archives [81.88384269259706]
本稿では,機械学習による大規模画像アーカイブの検索と解析のための自動画像コンテンツ抽出フレームワークを提案する。提案する枠組みは、人文科学と社会科学のいくつかの分野に適用できる。
論文参考訳（メタデータ） (2022-04-05T12:19:24Z)
Graph Neural Networks for Knowledge Enhanced Visual Representation of Paintings [14.89186519385364]
ArtSAGENetは、グラフニューラルネットワーク(GNN)と畳み込みニューラルネットワーク(CNN)を統合する新しいアーキテクチャである。提案したArtSAGENetは,アーティストとアートワーク間の重要な依存関係をキャプチャし,エンコードする。本研究は美術品の分析とキュレーションにビジュアルコンテンツとセマンティクスを統合する大きな可能性を秘めている。
論文参考訳（メタデータ） (2021-05-17T23:05:36Z)
Learning Portrait Style Representations [34.59633886057044]
高レベル特性を取り入れたニューラルネットワークアーキテクチャによって学習されたスタイル表現について検討する。美術史家によって注釈付けされた三重奏曲をスタイル類似性の監督として取り入れることで,学習スタイルの特徴の変化を見いだす。また,計算解析用に用意された肖像画の大規模データセットを初めて提示する。
論文参考訳（メタデータ） (2020-12-08T01:36:45Z)
Understanding Compositional Structures in Art Historical Images using Pose and Gaze Priors [20.98603643788824]
画像合成は、アーティストとそのアートワークを研究するために、画像内の相互作用を分析するのに有用である。本研究では,既存の機械学習技術を用いて,このプロセスの自動化を試みる。本手法は, (a) 絵画のアクション領域とアクションラインの検出, (b) 前景と背景のポーズに基づくセグメンテーションの2つの中心的なテーマに焦点を当てる。
論文参考訳（メタデータ） (2020-09-08T15:01:56Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。