論文の概要: Revisiting Weakly-Supervised Video Scene Graph Generation via Pair Affinity Learning
- arxiv url: http://arxiv.org/abs/2603.21559v1
- Date: Mon, 23 Mar 2026 04:28:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.482609
- Title: Revisiting Weakly-Supervised Video Scene Graph Generation via Pair Affinity Learning
- Title(参考訳): ペア親和性学習による微弱に監督された映像シーングラフ生成の再検討
- Authors: Minseok Kang, Minhyeok Lee, Minjung Kim, Jungho Lee, Donghyeong Kim, Sungmin Woo, Inseok Jeon, Sangyoun Lee,
- Abstract要約: 弱教師付きビデオシーングラフ生成 (WS-VSGG) は、ボックスアノテーションを行わずにビデオコンテンツを構造化されたリレーショナルトリガにパースすることを目的としている。
対象-対象対間の相互作用の可能性を推定する学習可能なペア親和性を導入する。
当社のアプローチは、さまざまなベースラインとバックボーンにわたって大幅に改善され、最先端のWS-VSGGパフォーマンスを実現しています。
- 参考スコア(独自算出の注目度): 33.42009265471664
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Weakly-supervised video scene graph generation (WS-VSGG) aims to parse video content into structured relational triplets without bounding box annotations and with only sparse temporal labeling, significantly reducing annotation costs. Without ground-truth bounding boxes, these methods rely on off-the-shelf detectors to generate object proposals, yet largely overlook a fundamental discrepancy from fullysupervised pipelines. Fully-supervised detectors implicitly filter out noninteractive objects, while off-the-shelf detectors indiscriminately detect all visible objects, overwhelming relation models with noisy pairs.We address this by introducing a learnable pair affinity that estimates the likelihood of interaction between subject-object pairs. Through Pair Affinity Learning and Scoring (PALS), pair affinity is incorporated into inferencetime ranking and further integrated into contextual reasoning through Pair Affinity Modulation (PAM), enabling the model to suppress noninteractive pairs and focus on relationally meaningful ones. To provide cleaner supervision for pair affinity learning, we further propose Relation- Aware Matching (RAM), which leverages vision-language grounding to resolve class-level ambiguity in pseudo-label generation. Extensive experiments on Action Genome demonstrate that our approach consistently yields substantial improvements across different baselines and backbones, achieving state-of-the-art WS-VSGG performance.
- Abstract(参考訳): 弱教師付きビデオシーングラフ生成 (WS-VSGG) は、ボックスアノテーションを拘束することなくビデオコンテンツを構造化されたリレーショナルトリガにパースすることを目的としている。
地道な境界ボックスがなければ、これらの手法は対象の提案を生成するためにオフ・ザ・シェルフ検出器に依存するが、完全に教師されたパイプラインとの根本的な相違をほとんど見落としている。
完全教師付き検出器は暗黙的に非相互作用物体をフィルタリングするが、オフ・ザ・シェルフ検出器は無差別に全ての可視物体を検知する。
Pair Affinity Learning and Scoring (PALS) を通じて、ペア親和性は推論時間ランキングに組み込まれ、さらにペア親和性変調(PAM)を通じてコンテキスト推論に統合され、非相互作用的ペアを抑え、関係的に意味のあるペアに集中することができる。
ペア親和性学習のためのよりクリーンな監視方法として,視覚言語接地を利用して擬似ラベル生成におけるクラスレベルの曖昧さを解決するリレーショナル・アウェア・マッチング(RAM)を提案する。
Action Genomeに関する大規模な実験は、我々のアプローチが一貫して異なるベースラインとバックボーンにわたって実質的な改善をもたらし、最先端のWS-VSGG性能を達成することを実証している。
関連論文リスト
- Interaction-Centric Knowledge Infusion and Transfer for Open-Vocabulary Scene Graph Generation [20.867572814544836]
オープン語彙シーングラフ生成(OVSGG)は、新しいオブジェクトを認識し、予め定義された関係カテゴリを超えて従来のSGGを拡張する。
我々は、これらのミスマッチを最小限に抑えるために、インタラクション駆動のパラダイムでtextbfACtion-textbfCentric end-to-end OVSGG framework(textbfACC)を提案する。
論文 参考訳(メタデータ) (2025-11-08T08:59:09Z) - Imputation-free and Alignment-free: Incomplete Multi-view Clustering Driven by Consensus Semantic Learning [65.75756724642932]
不完全なマルチビュークラスタリングでは、欠落したデータがビュー内のプロトタイプシフトとビュー間のセマンティック不整合を誘導する。
コンセンサスセマンティクス学習(FreeCSL)のためのIMVCフレームワークを提案する。
FreeCSLは、最先端の競合他社と比較して、IMVCタスクの信頼性と堅牢な割り当てを実現している。
論文 参考訳(メタデータ) (2025-05-16T12:37:10Z) - CoSD: Collaborative Stance Detection with Contrastive Heterogeneous Topic Graph Learning [18.75039816544345]
我々はCoSD(CoSD)と呼ばれる新しい協調姿勢検出フレームワークを提案する。
CoSDは、テキスト、トピック、スタンスラベル間のトピック認識のセマンティクスと協調的なシグナルを学ぶ。
2つのベンチマークデータセットの実験では、CoSDの最先端検出性能が示されている。
論文 参考訳(メタデータ) (2024-04-26T02:04:05Z) - Unified Visual Relationship Detection with Vision and Language Models [89.77838890788638]
この研究は、複数のデータセットからラベル空間の結合を予測する単一の視覚的関係検出器のトレーニングに焦点を当てている。
視覚と言語モデルを活用した統合視覚関係検出のための新しいボトムアップ手法UniVRDを提案する。
人物体間相互作用検出とシーングラフ生成の双方による実験結果から,本モデルの競合性能が示された。
論文 参考訳(メタデータ) (2023-03-16T00:06:28Z) - Stacked Hybrid-Attention and Group Collaborative Learning for Unbiased
Scene Graph Generation [62.96628432641806]
Scene Graph Generationは、まず与えられた画像内の視覚的コンテンツをエンコードし、次にそれらをコンパクトな要約グラフに解析することを目的としている。
まず,モーダル内改良とモーダル間相互作用を容易にする新しいスタック型ハイブリッド・アテンションネットワークを提案する。
次に、デコーダを最適化するための革新的なグループ協調学習戦略を考案する。
論文 参考訳(メタデータ) (2022-03-18T09:14:13Z) - Modelling Neighbor Relation in Joint Space-Time Graph for Video
Correspondence Learning [53.74240452117145]
本稿では、ラベルなしビデオから信頼できる視覚対応を学習するための自己教師付き手法を提案する。
接続時空間グラフでは,ノードがフレームからサンプリングされたグリッドパッチであり,2種類のエッジによってリンクされる。
学習した表現は、様々な視覚的タスクにおいて最先端の自己監督手法よりも優れています。
論文 参考訳(メタデータ) (2021-09-28T05:40:01Z) - A Graph-based Interactive Reasoning for Human-Object Interaction
Detection [71.50535113279551]
本稿では,HOIを推論するインタラクティブグラフ(Interactive Graph, in-Graph)という,グラフに基づくインタラクティブ推論モデルを提案する。
In-GraphNet と呼ばれる HOI を検出するための新しいフレームワークを構築した。
私たちのフレームワークはエンドツーエンドのトレーニングが可能で、人間のポーズのような高価なアノテーションはありません。
論文 参考訳(メタデータ) (2020-07-14T09:29:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。