論文の概要: Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2607.05716v1
- Date: Tue, 07 Jul 2026 01:00:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.357377
- Title: Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models
- Title(参考訳): Scene Graph Thinking:マルチモーダル大言語モデルのための構造化ビジュアル推論の強化
- Authors: Zhiwei Yang, Yuanchen Wu, Nan Zhang, Yucong Meng, Ke Yan, Shouhong Ding,
- Abstract要約: シーングラフ思考(Scene Graph Thinking, SaGe)は、明示的なシーングラフ表現を通じて、きめ細かな、構造化された視覚的推論を可能にする新しいパラダイムである。
シーングラフからの推論トレースをサンプリングすることにより,120Kの高品質なトレーニングデータを構築する。
キュレートされたデータとグラフ整合トレーニングにより、我々のアプローチは8つのマルチモーダルベンチマークで大幅に改善される。
- 参考スコア(独自算出の注目度): 46.09809083890632
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) have demonstrated strong perception and reasoning capabilities. However, most existing models focus on isolated objects and neglect structured relationships for efficient target navigation, limiting their performance on visually intensive tasks. To address this challenge, we introduce Scene Graph Thinking (SaGe), a novel paradigm that enables fine-grained and structured visual reasoning through explicit scene-graph representations. Specifically, we first introduce an automated data engine that converts flat image-text corpora into structured scene graphs, where hierarchical entities constitute the nodes and diverse visual relations define the edges. Building upon this, we construct 120K high-quality training data by sampling reasoning traces from scene graphs. Then, two-stage graph-aligned post-training paradigms are introduced, where supervised fine-tuning internalizes MLLMs with structured reasoning, and subsequent reinforcement fine-tuning proposes node-as-proxy graph rewards to consolidate efficient graph exploration. With curated data and graph-aligned training, our approach achieves significant improvements across eight multimodal benchmarks, demonstrating strong effectiveness on fine-grained perception and reasoning tasks. Code is available at https://github.com/zwyang6/SaGe.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、強い知覚と推論能力を示す。
しかし、既存のモデルのほとんどは、分離されたオブジェクトにフォーカスし、効率的なターゲットナビゲーションのために構造化された関係を無視し、視覚的に集中したタスクのパフォーマンスを制限する。
この課題に対処するために,Scene Graph Thinking (SaGe)を紹介した。
具体的には、まず、フラットな画像テキストコーパスを構造化されたシーングラフに変換する自動データエンジンを導入し、階層的なエンティティがノードを構成し、多様な視覚的関係がエッジを定義する。
そこで我々は,シーングラフからの推論トレースをサンプリングすることにより,120Kの高品質なトレーニングデータを構築した。
次に、2段階のグラフアライメント後学習パラダイムを導入し、教師付き微調整によりMLLMを内部化し、その後の強化微調整では、効率的なグラフ探索を統合するためにノード・アズ・プロキシグラフ報酬を提案する。
キュレートされたデータとグラフ整合性トレーニングにより、8つのマルチモーダルベンチマーク間で大幅な改善が達成され、きめ細かい知覚と推論タスクに強い効果が示された。
コードはhttps://github.com/zwyang6/SaGeで入手できる。
関連論文リスト
- Edge-Aware Curvature Modeling for Graph Understanding in Large Language Models [22.713901071316915]
グラフ対応大規模言語モデル(LLM)は、グラフ構造化データとテキスト情報を共同でモデル化する有望な機能を示している。
大規模言語モデルのための曲線拡張グラフ表現のCureLLMフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-04T12:12:34Z) - Semantic Generative Tuning for Unified Multimodal Models [62.18894352635965]
統一マルチモーダルモデル(UMM)は、単一のアーキテクチャ内で視覚的理解と視覚的生成を統合する。
訓練パラダイムは 独立して テキスト信号を通して 理解を最適化する 密集したピクセルの目的を通して 生成する
本研究は,UMMの分離を橋渡しするための生成プロキシとして階層的視覚タスクを定式化する,生成後学習に関する最初の体系的な研究である。
論文 参考訳(メタデータ) (2026-05-18T17:46:46Z) - RAG-GFM: Overcoming In-Memory Bottlenecks in Graph Foundation Models via Retrieval-Augmented Generation [27.59455285600957]
Graph Foundation Models (GFMs) はグラフ学習のフロンティアとして登場し、さまざまなタスク間で伝達可能な表現を提供することが期待されている。
本稿では,パラメータから知識をオフロードする検索型生成支援グラフ基礎モデルであるRAG-GFMを提案する。
RAG-GFMは、クロスドメインノードとグラフ分類の両方において、13の最先端のベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-01-21T16:02:43Z) - Can Graph Neural Networks Learn Language with Extremely Weak Text Supervision? [62.12375949429938]
本稿では,事前学習したグラフニューラルネットワークを下流タスクやデータに適用するためのマルチモーダル・プロンプト学習パラダイムを提案する。
我々の新しいパラダイムは、グラフプロンプトとテキストプロンプトの両方を同時に学習することで、Large Language Models(LLM)と直接同じ空間にグラフを埋め込む。
私たちは、GNNを極めて弱いテキスト管理で見えないクラスに一般化できるCLIPスタイルのゼロショット分類プロトタイプを構築した。
論文 参考訳(メタデータ) (2024-12-11T08:03:35Z) - Towards Graph Foundation Models: Training on Knowledge Graphs Enables Transferability to General Graphs [26.477872205199667]
知識グラフをトレーニングするために設計された統合グラフ推論フレームワークであるSCRを紹介する。
本稿では,従来のKG推論における意味的分離に対処する新しいメカニズムであるセマンティックコンディショニングメッセージパッシングを提案する。
以上の結果から,既存の基礎モデルよりも大幅な性能向上が見られた。
論文 参考訳(メタデータ) (2024-10-16T14:26:08Z) - GraphGPT: Graph Instruction Tuning for Large Language Models [27.036935149004726]
グラフニューラルネットワーク(GNN)は、グラフ構造を理解するために進化してきた。
堅牢性を高めるために、自己教師付き学習(SSL)はデータ拡張の重要なツールとなっている。
本研究は,ゼロショット学習環境におけるグラフモデルの一般化を推し進めることによって,この問題に対処する。
論文 参考訳(メタデータ) (2023-10-19T06:17:46Z) - Structure-CLIP: Towards Scene Graph Knowledge to Enhance Multi-modal
Structured Representations [70.41385310930846]
マルチモーダルな構造表現を強化するためのエンドツーエンドフレームワークであるStructure-CLIPを提案する。
シーングラフを用いてセマンティックなネガティブな例の構築をガイドし、その結果、構造化された表現の学習に重点を置いている。
知識エンハンス(KEE)は、SGKを入力として活用し、構造化表現をさらに強化するために提案される。
論文 参考訳(メタデータ) (2023-05-06T03:57:05Z) - Scene Graph Modification as Incremental Structure Expanding [61.84291817776118]
本研究では,既存のシーングラフを自然言語クエリに基づいて更新する方法を学習するために,シーングラフ修正(SGM)に注目した。
インクリメンタル構造拡張(ISE)の導入によるグラフ拡張タスクとしてのSGM
既存のデータセットよりも複雑なクエリと大きなシーングラフを含む、挑戦的なデータセットを構築します。
論文 参考訳(メタデータ) (2022-09-15T16:26:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。