論文の概要: SmoGVLM: A Small, Graph-enhanced Vision-Language Model
- arxiv url: http://arxiv.org/abs/2604.16517v1
- Date: Wed, 15 Apr 2026 13:44:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.046442
- Title: SmoGVLM: A Small, Graph-enhanced Vision-Language Model
- Title(参考訳): SmoGVLM:小さなグラフ拡張ビジョンランゲージモデル
- Authors: Debjyoti Mondal, Rituraj Singh, Subhadarshi Panda,
- Abstract要約: 大規模視覚言語モデル (VLM) は多モーダルなタスクにおいて高い性能を達成するが、しばしば幻覚や知識集約的推論の基盤の不足に悩まされる。
グラフニューラルネットワークを用いて,構造化知識を視覚的・テキスト的モダリティと統合したグラフ強化VLMであるSmoGVLMを提案する。
その結果、我々のアプローチを用いてトレーニングすると、小さなモデルで16.24%のパフォーマンス向上を実現し、より大きなモデルを上回る結果が得られた。
- 参考スコア(独自算出の注目度): 5.515462419076738
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large vision-language models (VLMs) achieve strong performance on multimodal tasks but often suffer from hallucination and poor grounding in knowledge-intensive reasoning. We propose SmoGVLM, a small, graph-enhanced VLM that integrates structured knowledge with visual and textual modalities, using Graph Neural Networks. We investigate the effects of our method across a range of model sizes, from tiny (1.3B) to large (13B) models. Our results demonstrate that, when trained using our approach, a small model can achieve performance gains upto 16.24%, and surpass its larger counterparts, outperforming larger VLMs and strong fine-tuned baselines. These results highlight the potential of structured knowledge augmentation for efficient, smaller-scale multimodal reasoning systems.
- Abstract(参考訳): 大規模視覚言語モデル (VLM) は多モーダルなタスクにおいて高い性能を達成するが、しばしば幻覚や知識集約的推論の基盤の不足に悩まされる。
グラフニューラルネットワークを用いて,構造化知識を視覚的・テキスト的モダリティと統合したグラフ強化VLMであるSmoGVLMを提案する。
提案手法は, 小型 (1.3B) モデルから大型 (13B) モデルまで, モデルサイズにまたがる影響について検討した。
提案手法を用いてトレーニングすると,小型モデルは最大16.24%の性能向上を達成でき,より大きなVLMよりも優れた性能を示し,高精細なベースラインも高い結果を得た。
これらの結果は,効率的なマルチモーダル推論システムのための構造化知識増強の可能性を強調している。
関連論文リスト
- OCC-MLLM-Alpha:Empowering Multi-modal Large Language Model for the Understanding of Occluded Objects with Self-Supervised Test-Time Learning [3.544352024775253]
マルチモーダルな大規模言語フレームワークと3次元生成をサポートする自己教師型学習戦略を導入する。
最初の結果は、最先端のVLMモデルと比較して16.92%改善したことを示している。
論文 参考訳(メタデータ) (2024-10-02T06:52:39Z) - MMEvol: Empowering Multimodal Large Language Models with Evol-Instruct [148.39859547619156]
我々は,新しいマルチモーダル命令データ進化フレームワークであるMMEvolを提案する。
MMEvolは、きめ細かい知覚、認知的推論、相互作用の進化の洗練された組み合わせによって、データ品質を反復的に改善する。
提案手法は,9つのタスクにおいて,最先端モデルに比べて有意に少ない精度でSOTA(State-of-the-art)性能を実現する。
論文 参考訳(メタデータ) (2024-09-09T17:44:00Z) - Multi-modal Auto-regressive Modeling via Visual Words [96.25078866446053]
本稿では,視覚的特徴を大規模多モードモデルの語彙上の確率分布にマッピングする視覚トークンの概念を提案する。
さらに、LMM内の意味空間における視覚的特徴の分布と、視覚情報を表現するためにテキスト埋め込みを使用することの可能性について検討する。
論文 参考訳(メタデータ) (2024-03-12T14:58:52Z) - Scaling Vision-Language Models with Sparse Mixture of Experts [128.0882767889029]
提案手法は, 等価計算コストの高密度モデルに対して, 様々なベンチマークにおいて, 最先端性能を実現することができることを示す。
我々の研究は、MoEモデルのトレーニングの安定化、モデル解釈可能性に対するMoEの影響の理解、ビジョン言語モデルをスケールする際の計算性能間のトレードオフのバランスに関する貴重な洞察を提供する。
論文 参考訳(メタデータ) (2023-03-13T16:00:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。