論文の概要: Dual-Path LLM Reasoning for Multimodal Few-Shot Knowledge Graph Completion
- arxiv url: http://arxiv.org/abs/2607.26909v1
- Date: Wed, 29 Jul 2026 13:40:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.691765
- Title: Dual-Path LLM Reasoning for Multimodal Few-Shot Knowledge Graph Completion
- Title(参考訳): マルチモーダルFew-Shot知識グラフ補完のためのデュアルパスLLM推論
- Abstract要約: マルチモーダル情報とLLM(Large Language Model)から派生した先行言語は、スパース関係のコンテキストを豊かにすることができる。
DuPLeRは、マルチモーダル型の先行と現実的なサポート構造を組み合わせることで、キャリブレーションされた関係グラフを構築する。
2つのマルチモーダルKG(MMKG)ベンチマークの8つのインダクティブ変種に対する実験は、DuPLeRがデータスカースKGCシナリオで堅牢な性能を達成することを示す。
- 参考スコア(独自算出の注目度): 21.217226429970324
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Knowledge graph completion (KGC) aims to infer missing facts in knowledge graphs (KGs), thereby improving their completeness and supporting downstream intelligent applications. However, emerging entities and relations in real-world deployments make inductive KGC difficult, especially under few-shot and zero-shot settings. Multimodal information and Large Language Model (LLM)-derived priors can enrich sparse relational contexts, but they may also introduce noisy or hallucinated evidence. To address these issues, we propose DuPLeR, a \textbf{Du}al-\textbf{P}ath \textbf{L}LM \textbf{R}easoning framework for multimodal few-shot KGC. DuPLeR builds a calibrated relation graph by combining multimodal LLM-derived type priors with factual support structures, and performs dual-level structural reasoning over the refined relation topology. Moreover, a dual-pathway multimodal enhancement module regulates message passing with query-relevant multimodal signals and supplements entity representations after graph propagation. Experiments on eight inductive variants of two multimodal KG (MMKG) benchmarks show that DuPLeR achieves robust performance in data-scarce KGC scenarios.
- Abstract(参考訳): 知識グラフ補完(KGC)は、知識グラフ(KG)の欠落した事実を推測し、その完全性を改善し、下流のインテリジェントアプリケーションをサポートすることを目的としている。
しかし、現実のデプロイメントにおける新しいエンティティやリレーションシップは、特に少数ショットとゼロショット設定下では、インダクティブなKGCを難しくする。
マルチモーダル情報とLLM(Large Language Model)から派生した先行言語は、疎結合の文脈を豊かにすることができるが、ノイズや幻覚的な証拠も導入できる。
これらの問題に対処するため,マルチモーダルショットKGCのためのDuPLeR, a \textbf{Du}al-\textbf{P}ath \textbf{L}LM \textbf{R}easoning frameworkを提案する。
DuPLeR は,マルチモーダル LLM 派生型とファクトサポート構造を組み合わせたキャリブレーション付き関係グラフを構築し,洗練された関係トポロジに対する二重レベル構造推論を行う。
さらに、デュアルパスウェイマルチモーダル拡張モジュールは、クエリ関連マルチモーダル信号によるメッセージパッシングを規制し、グラフ伝搬後のエンティティ表現を補完する。
2つのマルチモーダルKG(MMKG)ベンチマークの8つのインダクティブ変種に対する実験は、DuPLeRがデータスカースKGCシナリオで堅牢な性能を達成することを示す。
関連論文リスト
- DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation [23.80343378702536]
MM-RAG(Multimodal Retrieval-Augmented Generation)は有望な結果を示したが、それでも複雑なマルチホップ推論タスクに苦慮している。
マルチモーダルRAGのためのマクロ推論とマイクロマッチンググラフからなる分離アーキテクチャを導入するデュアル層フレームワークであるDualG-MRAGを提案する。
論文 参考訳(メタデータ) (2026-07-30T17:40:05Z) - Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning [65.15766304205657]
In-context Learning (ICL) は、大規模なモデルをいくつかの例を使ってタスクに適応させるが、視覚言語モデル(VLM)への拡張は脆弱である。
我々の分析によると、基本的な限界は帰納的ギャップにあり、モデルはしばしば欠陥のある推論から正しい答えを導き出す。
帰納的帰納的プロセスとしてマルチモーダル ICL を再構成する枠組みを導入する。
論文 参考訳(メタデータ) (2026-05-04T09:18:19Z) - PLUME: Latent Reasoning Based Universal Multimodal Embedding [52.35354073629127]
ユニバーサルマルチモーダル埋め込み(UME)は、異種入力を単一のモデルで共有検索空間にマッピングする。
最近のアプローチでは、埋め込みを抽出する前に明確なチェーン・オブ・シント(CoT)論理を生成することにより、UMEを改善している。
PLUMEは,言語化されたCoTを連続的潜伏状態の短時間の自己回帰ロールアウトに置き換えることで,UMEを進化させる潜在的推論フレームワークである。
論文 参考訳(メタデータ) (2026-04-02T14:04:53Z) - Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings [44.77164359074224]
マルチモーダル大規模言語モデル(MLLM)は、ユニバーサル・マルチモーダル・エンベディング(UME)の進展に欠かせないものとなっている。
近年の研究では、生成的連鎖(CoT)推論を取り入れることで、タスク固有の表現が大幅に向上することが示されている。
本稿では,Embedder-Guided Reinforcement Learning (EG-RL)を統合した推論駆動型UMEフレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-14T15:35:03Z) - Toward Effective Multimodal Graph Foundation Model: A Divide-and-Conquer Based Approach [42.970648490410504]
MGFM(Multimodal Graph Foundation Models)は、Multimodal-Attributed Graphs(MAG)におけるリッチなマルチモーダル情報の活用を可能にする。
本稿では,異なる粒度にまたがるモダリティの相互作用とアライメントを分離するために,Divide-and-Conquer戦略を用いた新しいフレームワークPLANETを提案する。
PLANETは,様々なグラフ中心およびマルチモーダル生成タスクにおいて,最先端のベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2026-02-04T01:05:12Z) - MMRAG-RFT: Two-stage Reinforcement Fine-tuning for Explainable Multi-modal Retrieval-augmented Generation [31.90681057778075]
MMRAG(Multi-modal Retrieval-Augmented Generation)は、外部のマルチモーダル知識を統合することで、信頼性の高い生成を可能にする。
既存のMMRAG法は、検索および応答生成の背後にある推論ロジックを明らかにすることができない。
論文 参考訳(メタデータ) (2025-12-19T03:19:54Z) - Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images [58.553448128258566]
本稿では,大規模高品質データと能力向上手法の二重ギャップを橋渡しする。
我々は、64Kの高品質なマルチモーダル命令サンプルからなるデータセットSTAR-64Kを導入し、5つのオープンソースMLLMに対して実験を行う。
論文 参考訳(メタデータ) (2025-10-22T02:23:40Z) - FindRec: Stein-Guided Entropic Flow for Multi-Modal Sequential Recommendation [57.577843653775]
textbfFindRec (textbfFlexible unified textbfinformation textbfdisentanglement for multi-modal sequence textbfRecommendation)を提案する。
Stein kernel-based Integrated Information Coordination Module (IICM) は理論上、マルチモーダル特徴とIDストリーム間の分散一貫性を保証する。
マルチモーダル特徴を文脈的関連性に基づいて適応的にフィルタリング・結合するクロスモーダル・エキスパート・ルーティング機構。
論文 参考訳(メタデータ) (2025-07-07T04:09:45Z) - Learning Efficient and Generalizable Graph Retriever for Knowledge-Graph Question Answering [75.12322966980003]
大規模言語モデル(LLM)は、様々な領域にわたって強い帰納的推論能力を示している。
既存のRAGパイプラインのほとんどは非構造化テキストに依存しており、解釈可能性と構造化推論を制限する。
近年,知識グラフ解答のための知識グラフとLLMの統合について検討している。
KGQAにおける効率的なグラフ検索のための新しいフレームワークであるRAPLを提案する。
論文 参考訳(メタデータ) (2025-06-11T12:03:52Z) - DiffusionCom: Structure-Aware Multimodal Diffusion Model for Multimodal Knowledge Graph Completion [15.898786167134997]
マルチモーダル知識グラフ補完(DiffusionCom)のための構造認識型マルチモーダル拡散モデルを提案する。
DiffusionComはジェネレータの生成的損失と識別的損失の両方を用いて訓練され、特徴抽出器は識別的損失にのみ最適化される。
FB15k-237-IMGデータセットとWN18-IMGデータセットの実験は、DiffusionComが最先端モデルより優れていることを示した。
論文 参考訳(メタデータ) (2025-04-09T02:50:37Z) - Noise-powered Multi-modal Knowledge Graph Representation Framework [52.95468915728721]
マルチモーダル・プレトレーニングの台頭は、統合されたマルチモーダル知識グラフ表現学習フレームワークの必要性を強調している。
モードレベルのノイズマスキングを備えたトランスフォーマーアーキテクチャを用いた新しいSNAG手法を提案する。
提案手法は10個のデータセットにまたがってSOTA性能を実現し,その汎用性を実証する。
論文 参考訳(メタデータ) (2024-03-11T15:48:43Z) - Do as I can, not as I get [46.21061496634747]
本稿では、シミュレーションデータ環境から貴重な情報をマイニングするためのTMRモデルを提案する。
私たちはこの論文の提出を完了するつもりです。
論文 参考訳(メタデータ) (2023-06-17T13:23:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。