論文の概要: ViSR-KGC: Visual Subgraph Reasoning with Vision-Language Models for Multimodal Knowledge Graph Completion
- arxiv url: http://arxiv.org/abs/2608.05833v2
- Date: Sun, 09 Aug 2026 07:28:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 13:55:18.70257
- Title: ViSR-KGC: Visual Subgraph Reasoning with Vision-Language Models for Multimodal Knowledge Graph Completion
- Title(参考訳): ViSR-KGC:マルチモーダル知識グラフ補完のための視覚言語モデルを用いたビジュアルサブグラフ推論
- Authors: Jiafan Li, Mengxue Yang, Jiaqi Zhu, Liang Chang, Ying Li, Hongan Wang,
- Abstract要約: 知識グラフ補完のためのビジュアルサブグラフ推論手法ViSR-KGCを提案する。
セマンティックな相関を捉えるために3つの補完機能を統合する。
学習したマルチモーダル埋め込みに基づいて,本フレームワークはまず,コンパクトでクエリ対応のサブグラフを抽出する。
- 参考スコア(独自算出の注目度): 13.875849657353292
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Knowledge graph completion (KGC) aims to infer missing entities or relations from incomplete graph structures, and has evolved into multimodal knowledge graph completion (MMKGC), where entities are associated with multiple modalities such as text and images. Traditional representation learning approaches follow the embedding-based paradigm and may struggle when relation-specific evidence is limited. Meanwhile, LLM-based reasoning methods typically linearize graph structures into textual prompts, which obscures structural topology and neglects vital visual information. While vision-language models (VLMs) excel at multimodal reasoning, they cannot natively interpret structured graph topology, particularly when it comes to knowledge graphs where nodes and edges carry complex semantics. To bridge this gap, we propose ViSR-KGC, a visual subgraph reasoning approach for KGC. It integrates three complementary capabilities to capture semantic correlations: identifying global topology dependencies via representation learning, analyzing local multimodal evidence using VLMs, and providing necessary commonsense knowledge inherent in pre-trained models. Based on learned multimodal embeddings, our framework first extracts a compact and query-aware subgraph from the MMKG. Then, this subgraph is transformed into a visually interpretable image using a layout strategy selected through empirical comparison. Finally, the visualized subgraph, entity images, textual descriptions, and candidate answers are combined into a unified prompt, enabling the VLM to infer the missing entity.
- Abstract(参考訳): 知識グラフ補完(KGC)は、不完全なグラフ構造から欠落したエンティティや関係を推測することを目的としており、テキストや画像などの複数のモダリティに関連付けられたマルチモーダル知識グラフ補完(MMKGC)へと進化してきた。
従来の表現学習アプローチは埋め込みに基づくパラダイムに従っており、関係性固有の証拠が限られている場合に苦労することがある。
一方、LLMに基づく推論手法は、通常、グラフ構造をテキストプロンプトに線形化し、構造トポロジを曖昧にし、重要な視覚情報を無視する。
視覚言語モデル(VLM)はマルチモーダル推論において優れているが、特にノードとエッジが複雑な意味を持つ知識グラフの場合、構造化グラフトポロジーを自然に解釈することはできない。
このギャップを埋めるために,KGCの視覚的部分グラフ推論手法であるViSR-KGCを提案する。
表現学習によるグローバルトポロジの依存関係の同定、VLMを用いた局所的マルチモーダルエビデンスの分析、事前訓練されたモデル固有のコモンセンス知識の提供、という3つの補完的機能を統合する。
学習したマルチモーダル埋め込みに基づいて,本フレームワークはまずMMKGからコンパクトでクエリ対応のサブグラフを抽出する。
そして、このサブグラフを、経験的比較により選択されたレイアウト戦略を用いて、視覚的に解釈可能な画像に変換する。
最後に、可視化されたサブグラフ、エンティティイメージ、テキスト記述、および候補回答を統一的なプロンプトに結合し、VLMが行方不明のエンティティを推測できるようにする。
関連論文リスト
- One Model, Many Graphs: Learning over Attributed Graphs across Heterogeneous Modalities with Vision-Language Models [11.461784355974254]
OMG-VLM(One Model, Many Graphs with Vision-Language Models)は、不均一なモダリティスキーマをまたいだ属性付きグラフを学習するための統一的なフレームワークである。
OMG-VLMは、属性付きグラフ学習タスクにおいて、最先端のGNNとLLMベースのベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-07-21T14:18:25Z) - G-reasoner: Foundation Models for Unified Reasoning over Graph-structured Knowledge [88.82814893945077]
大規模言語モデル(LLM)は複雑な推論において優れているが、静的かつ不完全なパラメトリック知識によって制限される。
最近のグラフ強化RAG (GraphRAG) は、このギャップを補足したグラフを構築し、LLMがそれらを推論できるようにする。
G-reasonerは、様々なグラフ構造化知識を推論するためにグラフと言語基盤モデルを統合した統合フレームワークである。
論文 参考訳(メタデータ) (2025-09-29T04:38:12Z) - MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs [6.165053219836395]
本稿では,シーングラフを通して視覚コンテンツを洗練し,マルチモーダルな知識グラフを構築するMMGraphRAGを提案する。
スペクトルクラスタリングを用いてクロスモーダルなエンティティリンクを実現し、推論経路に沿ってコンテキストを取得して生成プロセスを導く。
実験結果から,MMGraphRAGはDocBenchとMMLongBenchのデータセット上で最先端の性能を実現することがわかった。
論文 参考訳(メタデータ) (2025-07-28T13:16:23Z) - Graph-to-Vision: Multi-graph Understanding and Reasoning using Vision-Language Models [10.813015912529936]
VLM(Vision-Language Models)のマルチグラフ推論能力の評価と向上を目的とした,初の総合ベンチマークを導入する。
本ベンチマークでは,4つの共通グラフ型(知識グラフ,フローチャート,マインドマップ,ルートマップ)を網羅し,同種グラフ群と異種グラフ群をサポートする。
グラフ解析,推論整合性,命令追従精度を評価する多次元スコアリングフレームワークを用いて,最先端のVLMを評価した。
論文 参考訳(メタデータ) (2025-03-27T12:20:37Z) - Graph Learning in the Era of LLMs: A Survey from the Perspective of Data, Models, and Tasks [25.720233631885726]
グラフニューラルネットワーク(GNN)とLarge Language Models(LLM)の統合は、有望な技術パラダイムとして現れている。
データ品質を根本的に向上させるために、リッチなセマンティックコンテキストを持つグラフ記述テキストを活用します。
この研究は、グラフ学習方法論の進歩を目指す研究者や実践者にとって、基礎的な参考となる。
論文 参考訳(メタデータ) (2024-12-17T01:41:17Z) - Exploring Graph Structure Comprehension Ability of Multimodal Large Language Models: Case Studies [7.067145619709089]
本研究では,グラフの可視化が大規模言語モデル(LLM)の性能に与える影響について検討する。
本実験は,純粋テキストグラフ表現に対するマルチモーダルアプローチの有効性を比較した。
論文 参考訳(メタデータ) (2024-09-13T14:26:58Z) - GraphEdit: Large Language Models for Graph Structure Learning [14.16155596597421]
グラフ構造学習(GSL)は、グラフ構造データ中のノード間の固有の依存関係と相互作用をキャプチャすることに焦点を当てている。
既存のGSL法は、監督信号として明示的なグラフ構造情報に大きく依存している。
グラフ構造化データの複雑なノード関係を学習するために,大規模言語モデル(LLM)を利用したグラフ編集を提案する。
論文 参考訳(メタデータ) (2024-02-23T08:29:42Z) - Coarse-to-Fine Contrastive Learning in Image-Text-Graph Space for
Improved Vision-Language Compositionality [50.48859793121308]
対照的に訓練された視覚言語モデルは、視覚と言語表現学習において顕著な進歩を遂げた。
近年の研究では、対象、属性、関係性に対して構成的推論を行う能力に厳しい制限が強調されている。
論文 参考訳(メタデータ) (2023-05-23T08:28:38Z) - Learning the Implicit Semantic Representation on Graph-Structured Data [57.670106959061634]
グラフ畳み込みネットワークにおける既存の表現学習手法は主に、各ノードの近傍を知覚全体として記述することで設計される。
本稿では,グラフの潜在意味パスを学習することで暗黙的な意味を探索する意味グラフ畳み込みネットワーク(sgcn)を提案する。
論文 参考訳(メタデータ) (2021-01-16T16:18:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。