論文の概要: Multi-hop Relational Contrastive Learning: Extending Spatial Contrastive Pre-training Beyond Pairwise Relations
- arxiv url: http://arxiv.org/abs/2605.16456v1
- Date: Fri, 15 May 2026 05:33:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:46.489511
- Title: Multi-hop Relational Contrastive Learning: Extending Spatial Contrastive Pre-training Beyond Pairwise Relations
- Title(参考訳): マルチホップ・リレーショナル・コントラシティブ・ラーニング:空間的コントラシティブ・プレトレーニングをペアワイズ・リレーショナルを超えて拡張する
- Authors: Sheikh Tanvir Ahmed, Md. Tanvir Raihan,
- Abstract要約: 本研究では,空間的コントラスト学習をグラフ構造化シーン表現に拡張するフレームワークを開発する。
マルチレベルのコントラスト対象ノード、エッジ、マルチホップパスを定義し、オブジェクトセマンティクス全体にわたって安定なサブセットを奨励する。
GQAでは、MRCLは応答性のあるコンテンツ検索を改善する空間認識表現を生成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Understanding how objects relate to each other in space is fundamental to scene understanding, yet most contrastive pre-training approaches only model pairwise relationships, leaving richer compositional and multi-hop interactions largely unexplored. We introduce Multi-Hop Relational Contrastive Learning (MRCL), a framework that extends spatial contrastive learning to graph-structured scene representations. By tracing k-hop paths through scene graphs built from detected objects, MRCL captures implicit spatial dependencies that go well beyond what direct object pairs can express. We define a multi-level contrastive objective spanning nodes, edges, and multi-hop paths, encouraging embeddings that remain stable across object semantics while staying responsive to spatial layout. On a GQA subset, MRCL produces spatially-aware representations that improve content-based graph retrieval (NDCG@5 = 0.748) and consistently benefit downstream tasks, including spatial relationship recognition and graph-based question answering. Together, these results suggest that multi-hop relational supervision offers substantially richer structural guidance than pairwise-only methods, leading to visual representations that are more robust, compositional, and geometry-aware.
- Abstract(参考訳): 空間におけるオブジェクトの相互関係を理解することはシーン理解の基本であるが、最も対照的な事前学習アプローチはペアワイズ関係をモデル化することのみであり、よりリッチな構成とマルチホップ相互作用はほとんど探索されていない。
本稿では,空間的コントラスト学習をグラフ構造化シーン表現に拡張するフレームワークであるMulti-Hop Relational Contrastive Learning(MRCL)を紹介する。
検出されたオブジェクトから構築されたシーングラフを通してk-hopパスをトレースすることにより、MRCLは、直接オブジェクトペアが表現できるものを超えて、暗黙の空間的依存関係をキャプチャする。
我々は、ノード、エッジ、マルチホップパスにまたがるマルチレベルのコントラスト目的を定義し、空間配置に応答しながら、オブジェクトセマンティクス全体にわたって安定な埋め込みを奨励する。
GQAサブセットでは、MRCLは、コンテンツベースのグラフ検索を改善する空間認識表現(NDCG@5 = 0.748)を生成し、空間的関係認識やグラフベースの質問応答など、下流タスクに一貫した利益をもたらす。
これらの結果から,マルチホップ・リレーショナル・インテリジェンスにより,ペアワイズのみの手法よりも構造的ガイダンスが大幅に向上し,より堅牢で構成的,幾何学的な視覚的表現がもたらされることが示唆された。
関連論文リスト
- Learning to Perceive "Where": Spatial Pretext Tasks for Robust Self-Supervised Learning [17.753167530453997]
空間認識型プレテキスト回帰タスクである空間予測を導入し、同じ画像から一対の非絡み合ったローカルビュー間の相対的な位置とスケールを予測する。
連続幾何学空間における部分対部分関係をモデル化することにより、SPは表現がきめ細かい空間依存を捉えることを奨励する。
実験では、画像認識、きめ細かな分類、セマンティックセグメンテーション、深さ推定、および物体認識におけるアウト・オブ・ディストリビューションの大幅な向上が示されている。
論文 参考訳(メタデータ) (2026-05-11T04:15:34Z) - PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation [58.1914505657064]
本稿では,クラスレベルのセマンティクスと空間コンテキスト間の知識干渉の課題を軽減するために,単純な並列コストアグリゲーション(PCA-Seg)パラダイムを提案する。
8つのベンチマークの実験では、PCA-Segの各並列ブロックは0.35万のパラメータしか追加せず、最先端のOSPS性能を実現している。
論文 参考訳(メタデータ) (2026-03-18T09:26:43Z) - Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning [27.511627003202538]
伝統的なシーングラフは主に空間的関係に焦点を当て、視覚シーンにおける複雑な相互作用を推論する視覚言語モデル(VLM)の能力を制限する。
本稿では,(1) 従来の検出・構築手法は,非集中的かつ文脈的に無関係な関係集合を生成し,(2) 既存の手法では,新しい場面に起因した相互作用を一般化するための永続記憶の形成に失敗する,という2つの課題に対処する。
本稿では,3つの相補的なコンポーネントを通してVLMの相互作用推論を強化するフレームワークであるISGRを提案する。
論文 参考訳(メタデータ) (2025-05-14T04:04:23Z) - Enhancing Graph Contrastive Learning with Reliable and Informative Augmentation for Recommendation [84.45144851024257]
離散コードによるより強力な協調情報を用いて、コントラスト的なビューを構築することにより、グラフのコントラスト学習を強化することを目的とした、新しいフレームワークを提案する。
中心となる考え方は、ユーザとアイテムを協調情報に富んだ離散コードにマッピングし、信頼性と情報に富んだコントラッシブなビュー生成を可能にすることである。
論文 参考訳(メタデータ) (2024-09-09T14:04:17Z) - Modelling Neighbor Relation in Joint Space-Time Graph for Video
Correspondence Learning [53.74240452117145]
本稿では、ラベルなしビデオから信頼できる視覚対応を学習するための自己教師付き手法を提案する。
接続時空間グラフでは,ノードがフレームからサンプリングされたグリッドパッチであり,2種類のエッジによってリンクされる。
学習した表現は、様々な視覚的タスクにおいて最先端の自己監督手法よりも優れています。
論文 参考訳(メタデータ) (2021-09-28T05:40:01Z) - Bidirectional Graph Reasoning Network for Panoptic Segmentation [126.06251745669107]
本稿では,BGRNet(Bidirectional Graph Reasoning Network)を導入し,前景物と背景物間のモジュラー内およびモジュラー間関係について検討する。
BGRNetはまず、インスタンスとセマンティックセグメンテーションの両方でイメージ固有のグラフを構築し、提案レベルとクラスレベルで柔軟な推論を可能にする。
論文 参考訳(メタデータ) (2020-04-14T02:32:10Z) - Cascaded Human-Object Interaction Recognition [175.60439054047043]
マルチステージで粗大なHOI理解のためのカスケードアーキテクチャを提案する。
各段階で、インスタンスローカライゼーションネットワークは、HOI提案を段階的に洗練し、インタラクション認識ネットワークにフィードする。
慎重に設計された人間中心の関係機能により、これらの2つのモジュールは効果的な相互作用理解に向けて協調的に機能する。
論文 参考訳(メタデータ) (2020-03-09T17:05:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。