論文の概要: ExpArt-KG: Artwork Image Description Generation through Iterative Exploration of Knowledge Graphs
- arxiv url: http://arxiv.org/abs/2609.00629v1
- Date: Tue, 01 Sep 2026 03:08:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.263542
- Title: ExpArt-KG: Artwork Image Description Generation through Iterative Exploration of Knowledge Graphs
- Title(参考訳): ExpArt-KG:知識グラフの反復探索によるアートワーク画像記述生成
- Authors: Yuta Kato, Shintaro Ozaki, Kazuki Hayashi, Yusuke Sakai, Hidetaka Kamigaito, Katsuhiko Hayashi, Taro Watanabe,
- Abstract要約: 検索強化生成(RAG)を用いた知識グラフからの事実情報を活用したフレームワークを提案する。
具体的には,回答生成と知識グラフ検索を交互に行い,正解判定を用いて探索を制御する。
本研究では, アートワークの詳細な説明のレベルを向上し, 外部知識の検索コストを低減できることを実験的に示す。
- 参考スコア(独自算出の注目度): 51.31488026676001
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Vision-Language Models (LVLMs) achieve strong performance on image-grounded text generation and visual question answering. However, it remains difficult for them to comprehensively and accurately describe the factual relations among the entities and concepts associated with the objects depicted in an image. In this work, we propose a framework that efficiently exploits factual information from a knowledge graph via retrieval-augmented generation (RAG), with the goal of enabling LVLMs to generate detailed and accurate image explanations. Specifically, our method alternates between answer generation and knowledge-graph retrieval, and controls the search using a correctness judgment, thereby acquiring the necessary and sufficient factual information efficiently. We also construct a knowledge graph for the artwork domain (ExpArt-KG), in which the correspondence between images and entities is unambiguous. Applying the proposed method to this knowledge graph, we show experimentally that it improves the level of detail of artwork explanations and reduces the retrieval cost of external knowledge while maintaining generation quality comparable to that of iterating a fixed number of times.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は,画像付きテキスト生成と視覚的質問応答において高い性能を実現する。
しかし、画像に描かれた物体に関連付けられた実体や概念の事実関係を包括的かつ正確に記述することは依然として困難である。
本研究では,LVLMが詳細かつ正確な画像説明を生成することを目的として,知識グラフからの事実情報を検索拡張生成(RAG)によって効率的に活用するフレームワークを提案する。
具体的には、回答生成と知識グラフ検索を交互に行い、正当性判定を用いて探索を制御し、必要な情報と十分な事実情報を効率的に取得する。
また、画像と実体の対応が曖昧であるアート領域(ExpArt-KG)の知識グラフを構築した。
提案手法を知識グラフに適用することにより,一定回数の繰り返しに匹敵する生成品質を維持しつつ,図面説明の細部レベルを向上し,外部知識の検索コストを低減できることを実験的に示す。
関連論文リスト
- CoVis: A Collaborative Framework for Fine-grained Graphic Visual Understanding [0.29127054707887967]
CoVisは、きめ細かい視覚的理解のための協調的なフレームワークである。
カスケード二重層セグメンテーションネットワークの設計と実装により、画像からできるだけ多くの知識を抽出する。
画像の視覚分析を生成し、より総合的な視点から画像の理解を支援する。
論文 参考訳(メタデータ) (2024-11-27T21:38:04Z) - Artwork Explanation in Large-scale Vision Language Models [32.645448509968226]
大規模視覚言語モデル(LVLM)は、画像と命令からテキストを出力し、テキスト生成と理解の高度な能力を示す。
そこで我々は,その評価データセットとメトリクスとともに,アートワークの説明生成タスクを提案する。
画像と作品名の両方から説明を生成することと、画像のみを用いて説明を生成することの2つの部分で構成されている。
以上の結果から,LVLMは言語情報と視覚情報の統合に苦慮するだけでなく,画像のみからの知識獲得にも限界があることが示唆された。
論文 参考訳(メタデータ) (2024-02-29T19:01:03Z) - KGrEaT: A Framework to Evaluate Knowledge Graphs via Downstream Tasks [1.8722948221596285]
KGrEaTは、分類、クラスタリング、レコメンデーションといった実際の下流タスクを通じて知識グラフの品質を推定するフレームワークである。
フレームワークは知識グラフを入力として、評価対象のデータセットに自動的にマップし、定義されたタスクのパフォーマンスメトリクスを計算する。
論文 参考訳(メタデータ) (2023-08-21T07:43:10Z) - Coarse-to-Fine Contrastive Learning in Image-Text-Graph Space for
Improved Vision-Language Compositionality [50.48859793121308]
対照的に訓練された視覚言語モデルは、視覚と言語表現学習において顕著な進歩を遂げた。
近年の研究では、対象、属性、関係性に対して構成的推論を行う能力に厳しい制限が強調されている。
論文 参考訳(メタデータ) (2023-05-23T08:28:38Z) - SGEITL: Scene Graph Enhanced Image-Text Learning for Visual Commonsense
Reasoning [61.57887011165744]
マルチモーダルトランスフォーマーはVisual Commonsense Reasoningのタスクにおいて大きな進歩を遂げた。
視覚的なシーングラフを常識的推論に組み込むためのScene Graph Enhanced Image-Text Learningフレームワークを提案する。
論文 参考訳(メタデータ) (2021-12-16T03:16:30Z) - Boosting Entity-aware Image Captioning with Multi-modal Knowledge Graph [96.95815946327079]
名前付きエンティティの長期分布により、名前付きエンティティと視覚的キューの関係を学習することは困難である。
本稿では、視覚オブジェクトと名前付きエンティティを関連付けるために、マルチモーダルな知識グラフを構築する新しいアプローチを提案する。
論文 参考訳(メタデータ) (2021-07-26T05:50:41Z) - Learning semantic Image attributes using Image recognition and knowledge
graph embeddings [0.3222802562733786]
本稿では,知識グラフ埋め込みモデルと認識された画像の属性を組み合わせることで,画像の意味的属性を学習するための共有学習手法を提案する。
提案されたアプローチは、大量のデータから学習するフレームワークと、新しい知識を推論するために限定的な述語を使用するフレームワークのギャップを埋めるためのステップである。
論文 参考訳(メタデータ) (2020-09-12T15:18:48Z) - ENT-DESC: Entity Description Generation by Exploring Knowledge Graph [53.03778194567752]
実際には、出力記述が最も重要な知識のみをカバーするため、入力知識は十分以上である可能性がある。
我々は、KG-to-textにおけるこのような実践的なシナリオの研究を容易にするために、大規模で挑戦的なデータセットを導入する。
本稿では,元のグラフ情報をより包括的に表現できるマルチグラフ構造を提案する。
論文 参考訳(メタデータ) (2020-04-30T14:16:19Z) - Exploiting Structured Knowledge in Text via Graph-Guided Representation
Learning [73.0598186896953]
本稿では、知識グラフからのガイダンスを用いて、生テキスト上で学習する2つの自己教師型タスクを提案する。
エンティティレベルのマスキング言語モデルに基づいて、最初のコントリビューションはエンティティマスキングスキームです。
既存のパラダイムとは対照的に,本手法では事前学習時にのみ,知識グラフを暗黙的に使用する。
論文 参考訳(メタデータ) (2020-04-29T14:22:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。