論文の概要: PFM-VEPAR: Prompting Foundation Models for RGB-Event Camera based Pedestrian Attribute Recognition
- arxiv url: http://arxiv.org/abs/2603.19565v1
- Date: Fri, 20 Mar 2026 02:12:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:38.942141
- Title: PFM-VEPAR: Prompting Foundation Models for RGB-Event Camera based Pedestrian Attribute Recognition
- Title(参考訳): PFM-VEPAR:RGBイベントカメラを用いた歩行者属性認識のための基礎モデル
- Authors: Minghe Xu, Rouying Wu, ChiaWei Chu, Xiao Wang, Yu Li,
- Abstract要約: イベントベースの歩行者認識(PAR)は、ローライトおよびモーションブルーシナリオにおけるRGBカメラの強化にモーションキューを活用する。
本稿では,離散コサイン変換(DCT)と逆DCT(IDCT)をイベントデータに適用するためのイベントプロンプタを提案する。
現代のホップフィールドネットワークと組み合わさって、豊富な事前知識を提供するように設計された外部メモリバンクは、連想型メモリ拡張表現学習を可能にする。
- 参考スコア(独自算出の注目度): 8.09519291579794
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Event-based pedestrian attribute recognition (PAR) leverages motion cues to enhance RGB cameras in low-light and motion-blur scenarios, enabling more accurate inference of attributes like age and emotion. However, existing two-stream multimodal fusion methods introduce significant computational overhead and neglect the valuable guidance from contextual samples. To address these limitations, this paper proposes an Event Prompter. Discarding the computationally expensive auxiliary backbone, this module directly applies extremely lightweight and efficient Discrete Cosine Transform (DCT) and Inverse DCT (IDCT) operations to the event data. This design extracts frequency-domain event features at a minimal computational cost, thereby effectively augmenting the RGB branch. Furthermore, an external memory bank designed to provide rich prior knowledge, combined with modern Hopfield networks, enables associative memory-augmented representation learning. This mechanism effectively mines and leverages global relational knowledge across different samples. Finally, a cross-attention mechanism fuses the RGB and event modalities, followed by feed-forward networks for attribute prediction. Extensive experiments on multiple benchmark datasets fully validate the effectiveness of the proposed RGB-Event PAR framework. The source code of this paper will be released on https://github.com/Event-AHU/OpenPAR
- Abstract(参考訳): イベントベースの歩行者属性認識(PAR)は、動きの手がかりを利用して、低照度およびモーションブルーのシナリオにおけるRGBカメラを強化し、年齢や感情などの属性のより正確な推測を可能にする。
しかし、既存の2ストリームマルチモーダル融合法では計算オーバーヘッドが大きくなり、文脈サンプルからの貴重なガイダンスは無視される。
これらの制限に対処するため、この記事ではEvent Prompterを提案する。
このモジュールは計算コストのかかる補助バックボーンを識別し、非常に軽量で効率的な離散コサイン変換(DCT)と逆DCT(IDCT)の操作をイベントデータに直接適用する。
この設計では、周波数領域のイベント特徴を最小の計算コストで抽出し、RGBブランチを効果的に増強する。
さらに、最近のホップフィールドネットワークと組み合わさって、豊富な事前知識を提供するように設計された外部メモリバンクは、連想型メモリ拡張表現学習を可能にする。
このメカニズムは、異なるサンプルにわたるグローバルリレーショナル知識を効果的にマイニングし、活用する。
最後に、クロスアテンション機構はRGBとイベントモダリティを融合し、その後属性予測のためのフィードフォワードネットワークが続く。
複数のベンチマークデータセットに対する大規模な実験は、提案したRGB-Event PARフレームワークの有効性を十分に検証している。
この論文のソースコードはhttps://github.com/Event-AHU/OpenPARで公開される。
関連論文リスト
- Decoupling Amplitude and Phase Attention in Frequency Domain for RGB-Event based Visual Object Tracking [51.31378940976401]
既存のRGB-Eventトラッキングアプローチでは、イベントカメラのユニークな利点を完全に活用できない。
本稿では,周波数領域の早期融合を実現する新しい追跡フレームワークを提案する。
FE108, FELT, COESOTなど, 広く使用されている3つのRGB-Event追跡ベンチマークデータセットの実験により, 提案手法の性能と効率を実証した。
論文 参考訳(メタデータ) (2026-01-03T01:10:17Z) - HyPSAM: Hybrid Prompt-driven Segment Anything Model for RGB-Thermal Salient Object Detection [75.406055413928]
RGB-T SODのための新しいプロンプト駆動セグメントモデル(HyPSAM)を提案する。
DFNetは動的畳み込みとマルチブランチデコーディングを使用して、適応的な相互モダリティ相互作用を促進する。
3つの公開データセットの実験により,本手法が最先端の性能を達成することを示す。
論文 参考訳(メタデータ) (2025-09-23T07:32:11Z) - Learning Flow-Guided Registration for RGB-Event Semantic Segmentation [22.996619370156584]
イベントカメラは、RGBセンサーを補完するマイクロ秒レベルのモーションキューをキャプチャする。
RGB-Eventセグメンテーションを融合から登録に再キャストする。
非対称なモーダル間の対応を適応的にマッチングする新しいフロー誘導双方向フレームワークであるBRENetを提案する。
論文 参考訳(メタデータ) (2025-05-02T19:19:58Z) - RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Framework [20.19599141770658]
既存の歩行者属性認識法は一般にRGBフレームカメラに基づいて開発されている。
本稿では,低照度,高速,低消費電力のイベントカメラの利点から着想を得たマルチモーダルなRGB-Event属性認識タスクを提案する。
具体的には,大規模な歩行者属性認識データセットであるEventPARを紹介する。
論文 参考訳(メタデータ) (2025-04-14T09:22:16Z) - VELoRA: A Low-Rank Adaptation Approach for Efficient RGB-Event based Recognition [54.27379947727035]
本稿では,RGBイベントに基づく分類のために,事前学習した基盤視覚モデルに適応するための新しいPEFT戦略を提案する。
また、2重モードのフレーム差は、フレーム差バックボーンネットワークを介してモーションキューをキャプチャすると考えられている。
ソースコードと事前トレーニングされたモデルはurlhttps://github.com/Event-AHU/VELoRAでリリースされる。
論文 参考訳(メタデータ) (2024-12-28T07:38:23Z) - SSTFormer: Bridging Spiking Neural Network and Memory Support Transformer for Frame-Event based Recognition [40.107228252231515]
本稿では,RGBフレームとイベントストリームを同時に融合してパターンを認識することを提案する。
RGB-Eventベースの分類データセットが不足しているため、大規模なPokerEventデータセットも提案する。
論文 参考訳(メタデータ) (2023-08-08T16:15:35Z) - Self-Supervised Representation Learning for RGB-D Salient Object
Detection [93.17479956795862]
我々は、自己教師付き表現学習を用いて、クロスモーダルオートエンコーダと深さ-輪郭推定という2つのプレテキストタスクを設計する。
我々のプレテキストタスクは、ネットワークがリッチなセマンティックコンテキストをキャプチャする事前トレーニングを実行するのに、少数のRGB-Dデータセットしか必要としない。
RGB-D SODにおけるクロスモーダル核融合の固有の問題として,マルチパス核融合モジュールを提案する。
論文 参考訳(メタデータ) (2021-01-29T09:16:06Z) - Bi-directional Cross-Modality Feature Propagation with
Separation-and-Aggregation Gate for RGB-D Semantic Segmentation [59.94819184452694]
深度情報はRGBD画像のセマンティックセグメンテーションにおいて有用であることが証明されている。
既存のほとんどの研究は、深度測定がRGBピクセルと正確で整合していると仮定し、問題をモーダルな特徴融合としてモデル化している。
本稿では,RGB特徴量応答を効果的に再検討するだけでなく,複数の段階を通して正確な深度情報を抽出し,代わりに2つの補正表現を集約する,統一的で効率的なクロスモダリティガイドを提案する。
論文 参考訳(メタデータ) (2020-07-17T18:35:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。