論文の概要: Depth-Guided Video Object Counting in Crowded Scenes
- arxiv url: http://arxiv.org/abs/2608.06236v1
- Date: Thu, 06 Aug 2026 16:24:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.790957
- Title: Depth-Guided Video Object Counting in Crowded Scenes
- Title(参考訳): 群衆シーンにおける奥行き誘導ビデオオブジェクトカウント
- Abstract要約: 我々の主な目的は、混雑したシーンにおけるビデオオブジェクトのカウントを前進させることである。
既存の方法はRGB情報に依存しており、混み合った状況下での識別能力を制限する。
本稿では,一般的な後処理パイプラインとともにDG-Det(Depth-Guided Detector)を提案する。
- 参考スコア(独自算出の注目度): 43.4833789306685
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Our primary objective is to advance video object counting in crowded scenes, aiming to robustly count all instances of a target category based on given text or visual prompts. Existing methods rely on RGB information, limiting their discriminative ability in crowded and occluded conditions. To address this, we propose a Depth-Guided Detector (DG-Det) along with a general post-processing pipeline. By integrating depth cues with multi-scale RGB-D cross-attention and explicit occlusion prediction, our method enhances spatial understanding and achieves robust detection in crowded and occluded scenes. Furthermore, we introduce a unified de-duplication framework to eliminate cross-frame redundant counting. To facilitate future research, we also release a new RGB-D Video Object Counting dataset featuring depth information and multiple object categories persequence. Extensive experiments demonstrate that our method achieves a 62.01\% reduction in MAE compared to existing baselines, and also produces consistent improvements in RMSE. We provide the source code at https://github.com/streamer-AP/DG-Net and the dataset at https://huggingface.co/datasets/aerospace123/RGBD-VideoCount.
- Abstract(参考訳): 我々の主な目的は,対象とするカテゴリのすべてのインスタンスを,与えられたテキストや視覚的プロンプトに基づいて確実にカウントすることを目的として,混雑したシーンにおける映像オブジェクトのカウントを前進させることである。
既存の方法はRGB情報に依存しており、混み合った状況下での識別能力を制限する。
これを解決するために、一般的な後処理パイプラインと共にDG-Det(Depth-Guided Detector)を提案する。
マルチスケールのRGB-Dクロスアテンションと明示的なオクルージョン予測を併用することにより,空間的理解を高め,混み合ったシーンにおいてロバストな検出を実現する。
さらに、クロスフレームの冗長カウントをなくすために、統合された重複解消フレームワークを導入する。
今後の研究を容易にするため,深度情報と複数の対象カテゴリからなるRGB-Dビデオオブジェクトカウントデータセットを新たにリリースした。
その結果,本手法は既存のベースラインに比べて62.01\%のMAE削減を実現し,RMSEを一貫した改善を実現した。
ソースコードはhttps://github.com/streamer-AP/DG-Netで、データセットはhttps://huggingface.co/datasets/aerospace123/RGBD-VideoCountで提供します。
関連論文リスト
- NAIMA: Semantics Aware RGB Guided Depth Super-Resolution [50.15623093332659]
ガイドド・ディープ・スーパーレゾリューション(GDSR)は、低解像度の深度マップと高解像度のRGB画像に頼って、より微細な構造を復元するマルチモーダルな深度マップ・スーパーレゾリューションのアプローチである。
本稿では,事前学習された視覚変換器トークンの埋め込みから生成される,グローバルな文脈的セマンティックプリエントを導入するソリューションを提案する。
論文 参考訳(メタデータ) (2026-04-06T04:14:59Z) - Embodied Crowd Counting [86.10533153162476]
Embodied Crowd Counting (ECC)は、大規模なシーンと大規模なオブジェクト量を可能にする対話型シミュレータである。
現実的な群集分布を近似した事前確率分布を導入して群集を生成する。
この方法はMLLM駆動の粗大な航法機構を含み、Z軸探索を活発に行うことができる。
論文 参考訳(メタデータ) (2025-03-11T12:23:34Z) - Depth-Assisted Network for Indiscernible Marine Object Counting with Adaptive Motion-Differentiated Feature Encoding [2.3552699229345264]
識別不能な海洋生物の数え方は、水中のシーンの視認性に制限があるなど、多くの課題に遭遇する。
我々は50の動画からなる新しいデータセットを開発し、そこから800のフレームを抽出し、約40のポイントワイドオブジェクトラベルで注釈付けした。
このデータセットは、認識不能な海洋生物が周囲と複雑に統合された実際の水中環境を正確に表現する。
論文 参考訳(メタデータ) (2025-03-11T08:08:04Z) - Depth Attention for Robust RGB Tracking [21.897255266278275]
本稿では,RGBビデオシーケンスにおける動きのぼかしの影響や視界外なターゲット追跡の課題に対処するために,単眼深度推定を利用した新しいフレームワークを提案する。
我々の知識を最大限に活用するために、我々は最初に深度注意機構を提案し、深度情報と美術追跡アルゴリズムの状態をシームレスに統合するシンプルなフレームワークを定式化した。
論文 参考訳(メタデータ) (2024-10-27T09:47:47Z) - Depth-Guided Semi-Supervised Instance Segmentation [62.80063539262021]
Semi-Supervised Instance (SSIS)は、トレーニング中にラベルなしデータの量を活用することを目的としている。
従来のフレームワークは主に、ラベルなし画像のRGB情報を利用して擬似ラベルを生成する。
この制限を克服するために、Depth-Guided (DG)フレームワークを導入します。
論文 参考訳(メタデータ) (2024-06-25T09:36:50Z) - ViDSOD-100: A New Dataset and a Baseline Model for RGB-D Video Salient Object Detection [51.16181295385818]
まず、注釈付きRGB-D video SODOD(DSOD-100)データセットを収集し、合計9,362フレーム内に100の動画を含む。
各ビデオのフレームはすべて、高品質なサリエンシアノテーションに手動で注釈付けされる。
本稿では,RGB-Dサリアンオブジェクト検出のための新しいベースラインモデル,attentive triple-fusion network (ATF-Net)を提案する。
論文 参考訳(メタデータ) (2024-06-18T12:09:43Z) - ViDaS Video Depth-aware Saliency Network [40.08270905030302]
両ストリームの完全な畳み込みビデオ,Depth-Aware Saliency ネットワークである ViDaS を紹介する。
ビデオのサリエンシ予測を通じて、注目度モデリングの問題に対処する。
ネットワークは2つのビジュアルストリームで構成され、1つはRGBフレーム用、もう1つは奥行きフレーム用である。
エンドツーエンドでトレーニングされ、アイトラッキングデータを備えたさまざまなデータベースで評価される。
論文 参考訳(メタデータ) (2023-05-19T15:04:49Z) - Glitch in the Matrix: A Large Scale Benchmark for Content Driven
Audio-Visual Forgery Detection and Localization [20.46053083071752]
新しいデータセットであるLocalized Visual DeepFake (LAV-DF) の提案とベンチマークを行う。
LAV-DFは、戦略的コンテンツ駆動型オーディオ、ビジュアルおよびオーディオ視覚操作で構成されている。
提案するベースライン手法であるBundary Aware Temporal Forgery Detection (BA-TFD)は3次元畳み込みニューラルネットワークに基づくアーキテクチャである。
論文 参考訳(メタデータ) (2023-05-03T08:48:45Z) - Is Depth Really Necessary for Salient Object Detection? [50.10888549190576]
本稿では,RGB情報のみを推論の入力とする統合深度認識フレームワークの実現に向けた最初の試みを行う。
5つの公開RGB SODベンチマークの最先端のパフォーマンスを上回るだけでなく、5つのベンチマークのRGBDベースのメソッドを大きく上回っている。
論文 参考訳(メタデータ) (2020-05-30T13:40:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。