論文の概要: Dual-Correlation Hypergraph Network for Unaligned RGBT Video Object Detection and A Large-scale Benchmark
- arxiv url: http://arxiv.org/abs/2607.08191v1
- Date: Thu, 09 Jul 2026 07:46:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.447228
- Title: Dual-Correlation Hypergraph Network for Unaligned RGBT Video Object Detection and A Large-scale Benchmark
- Title(参考訳): 不整合RGBTビデオオブジェクト検出のためのデュアル相関ハイパーグラフネットワークと大規模ベンチマーク
- Abstract要約: RGB-Thermal (RGBT) Video Object Detection (VOD) は大きな注目を集めている。
しかし、通常、RGBT画像対の間に空間的不整合が存在する。
本稿では,高次元補完情報をキャプチャするDHNetを提案する。
- 参考スコア(独自算出の注目度): 20.310134152773298
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: RGB-Thermal (RGBT) Video Object Detection (VOD) has gained significant traction due to its ability to overcome the limitations of conventional RGB-based VOD under challenging conditions. However, spatial misalignment commonly exists between RGBT image pairs. To address this, we propose a Dual-Correlation Hypergraph Network (DHNet) that captures high-dimensional complementary information by explicitly modeling two types of correlations: temporal correlation across consecutive frames and spatial correlation from cross-modal features. Specifically, we first design a Patch-based Spatial Alignment Module (PSAM) to sequentially align the multimodal features at the local region level. Subsequently, we introduce a Dual Hypergraph Fusion Module (DHFM), which constructs separate temporal and multimodal hypergraphs to enhance object discriminability through dual-correlation learning. Furthermore, the field currently lacks a large-scale, scene-diverse benchmark dataset for comprehensive evaluation. To address this gap, we construct DVT-VOD1000, a large-scale RGBT VOD dataset containing 1,000 video sequences with 103,464 RGBT image pairs. The dataset covers diverse scenarios, including campuses, parks, transportation, rural areas, night scenes, rain, and snow. Comprehensive experiments on VT-VOD50 and our DVT-VOD1000 demonstrate that DHNet achieves state-of-the-art detection accuracy. The dataset and source code will be made publicly available on https://github.com/tzz-ahu/ to support academic research.
- Abstract(参考訳): RGB-Thermal (RGBT) Video Object Detection (VOD) は、従来のRGBベースのVODの限界を克服できるため、大きな注目を集めている。
しかし、通常、RGBT画像対の間に空間的不整合が存在する。
そこで本研究では,2種類の相関関係を明示的にモデル化することにより,高次元補完情報を捕捉する2次元相関ハイパーグラフネットワーク(DHNet)を提案する。
具体的には、まずPatchベースの空間アライメントモジュール(Spatial Alignment Module, PSAM)を設計し、局所領域レベルでマルチモーダル特徴を逐次整列させる。
次にDHFM(Dual Hypergraph Fusion Module)を導入し,2重相関学習による物体識別性を高めるために,時間的・マルチモーダルなハイパーグラフを別々に構築する。
さらに、このフィールドは、包括的な評価のための大規模でシーンの異なるベンチマークデータセットを欠いている。
このギャップに対処するため、DVT-VOD1000という大規模なRGBT VODデータセットを構築し、103,464のRGBT画像ペアで1000の動画シーケンスを含む。
このデータセットはキャンパス、公園、交通機関、田園部、夜景、雨、雪など様々なシナリオをカバーしている。
VT-VOD50とDVT-VOD1000の総合的な実験により、DHNetが最先端検出精度を達成することを示した。
データセットとソースコードは、学術研究をサポートするためにhttps://github.com/tzz-ahu/で公開される。
関連論文リスト
- Multimodal Spatio-temporal Graph Learning for Alignment-free RGBT Video Object Detection [13.682115079677466]
RGB-Thermal Video Object Detection (RGBT VOD)は、従来のRGBベースのVODの照明条件の制限に対処することができる。
本稿では,アライメントフリーなRGBTVOD問題に対するマルチモーダル時空間グラフ学習ネットワーク(MSGNet)を提案する。
論文 参考訳(メタデータ) (2025-04-16T05:32:59Z) - Alignment-Free RGB-T Salient Object Detection: A Large-scale Dataset and Progressive Correlation Network [17.777510689748173]
UVT20Kという大規模かつ高多様性なRGB-T SODデータセットを構築し,2万枚の画像ペア,407シーン,1256個のオブジェクトカテゴリからなる。
さらなる研究を支援するために、UVT20Kの各サンプルには、サリエンシマスク、スクリブル、バウンダリ、チャレンジ属性を含む、包括的な真実のセットが注釈付けされている。
さらに,非整合画像ペアにおける正確な予測を実現するために,明示的なアライメントに基づいてモーダル間相関とモーダル内相関をモデル化するプログレッシブ相関ネットワーク(PCNet)を提案する。
論文 参考訳(メタデータ) (2024-12-19T06:52:12Z) - Mixture of Scale Experts for Alignment-free RGBT Video Object Detection and A Unified Benchmark [5.068440399797739]
既存のRGB-Thermal Video Object Detection (RGBT VOD) 法は、画像ペアの手動アライメントに依存している。
我々はMixture of Scale Experts Network(MSENet)と呼ばれる新しいフレームワークを提案する。
MSENetは、異なる知覚スケールで訓練された複数の専門家を統合し、RGBと熱画像のペア間のスケールの差異をキャプチャすることを可能にする。
論文 参考訳(メタデータ) (2024-10-16T01:06:12Z) - ViDSOD-100: A New Dataset and a Baseline Model for RGB-D Video Salient Object Detection [51.16181295385818]
まず、注釈付きRGB-D video SODOD(DSOD-100)データセットを収集し、合計9,362フレーム内に100の動画を含む。
各ビデオのフレームはすべて、高品質なサリエンシアノテーションに手動で注釈付けされる。
本稿では,RGB-Dサリアンオブジェクト検出のための新しいベースラインモデル,attentive triple-fusion network (ATF-Net)を提案する。
論文 参考訳(メタデータ) (2024-06-18T12:09:43Z) - CRSOT: Cross-Resolution Object Tracking using Unaligned Frame and Event
Cameras [43.699819213559515]
既存のRGB-DVSトラッキング用のデータセットは、DVS346カメラで収集される。
我々は、特別に構築されたデータ取得システムを用いて収集された、最初の不整合フレームイベントデータセットCRSOTを構築した。
ゆるやかなRGBイベントデータを用いても、ロバストなトラッキングを実現することのできる、新しい非整列オブジェクト追跡フレームワークを提案する。
論文 参考訳(メタデータ) (2024-01-05T14:20:22Z) - Visible-Thermal UAV Tracking: A Large-Scale Benchmark and New Baseline [80.13652104204691]
本稿では,可視熱UAV追跡(VTUAV)のための高多様性の大規模ベンチマークを構築する。
本稿では, フレームレベルの属性を, チャレンジ固有のトラッカーの可能性を利用するための粗粒度属性アノテーションを提案する。
さらに,様々なレベルでRGB-Tデータを融合するHMFT(Hierarchical Multi-modal Fusion Tracker)という新しいRGB-Tベースラインを設計する。
論文 参考訳(メタデータ) (2022-04-08T15:22:33Z) - RGB-D Saliency Detection via Cascaded Mutual Information Minimization [122.8879596830581]
既存のRGB-Dサリエンシ検出モデルは、RGBと深さを効果的にマルチモーダル学習を実現するために明示的に奨励するものではない。
本稿では,RGB画像と深度データ間のマルチモーダル情報を「明示的」にモデル化するために,相互情報最小化による新しい多段階学習フレームワークを提案する。
論文 参考訳(メタデータ) (2021-09-15T12:31:27Z) - Learning Multi-Granular Hypergraphs for Video-Based Person
Re-Identification [110.52328716130022]
ビデオベースの人物識別(re-ID)はコンピュータビジョンにおいて重要な研究課題である。
MGH(Multi-Granular Hypergraph)という新しいグラフベースのフレームワークを提案する。
MARSの90.0%のトップ-1精度はMGHを用いて達成され、最先端のスキームよりも優れていた。
論文 参考訳(メタデータ) (2021-04-30T11:20:02Z) - Spatial-Temporal Correlation and Topology Learning for Person
Re-Identification in Videos [78.45050529204701]
クロススケール空間時空間相関をモデル化し, 識別的, 堅牢な表現を追求する新しい枠組みを提案する。
CTLはCNNバックボーンとキーポイント推定器を使用して人体から意味的局所的特徴を抽出する。
グローバルな文脈情報と人体の物理的接続の両方を考慮して、多スケールグラフを構築するためのコンテキスト強化トポロジーを探求する。
論文 参考訳(メタデータ) (2021-04-15T14:32:12Z) - Bi-directional Cross-Modality Feature Propagation with
Separation-and-Aggregation Gate for RGB-D Semantic Segmentation [59.94819184452694]
深度情報はRGBD画像のセマンティックセグメンテーションにおいて有用であることが証明されている。
既存のほとんどの研究は、深度測定がRGBピクセルと正確で整合していると仮定し、問題をモーダルな特徴融合としてモデル化している。
本稿では,RGB特徴量応答を効果的に再検討するだけでなく,複数の段階を通して正確な深度情報を抽出し,代わりに2つの補正表現を集約する,統一的で効率的なクロスモダリティガイドを提案する。
論文 参考訳(メタデータ) (2020-07-17T18:35:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。