論文の概要: RegisterBridgeMM: A Register-Centric Framework for RGB-Infrared Object Detection
- arxiv url: http://arxiv.org/abs/2608.04833v1
- Date: Wed, 05 Aug 2026 13:34:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.941633
- Title: RegisterBridgeMM: A Register-Centric Framework for RGB-Infrared Object Detection
- Title(参考訳): RegisterBridgeMM:RGB赤外線オブジェクト検出のためのレジスタ中心フレームワーク
- Authors: Zian Wang, Hangchuan Liang, Yuehua Chen, Changchun Li, Chaoyi Guo, Mingzhe Liu, Fangming Gu,
- Abstract要約: 既存のRGB-IR融合法は、より軽量だがより制約のある適応機構に対して、表現力のあるパッチレベルの相互作用を交換することが多い。
本稿では,3段階のレジスタライフサイクルとして構成されたレジスタ経由の融合フレームワークである RegisterBridgeMM を提案する。
このレジスタパスは、事前訓練されたパッチ表現を保持しながら、密集したパッチ対パッチ間の相互作用を避ける。
- 参考スコア(独自算出の注目度): 11.920316291237382
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: RGB-infrared (RGB-IR) object detection benefits from complementary visible and thermal cues, but effective fusion remains challenging under illumination changes, weather variation, and cluttered scenes. Existing RGB-IR fusion methods often trade expressive patch-level interaction for lighter but more constrained adaptation mechanisms. We empirically observe that pretrained register tokens contain both modality-shared and modality-specific information on paired RGB-IR inputs, suggesting that they can serve as a compact substrate for cross-modal communication. Building on this observation, we propose RegisterBridgeMM, a register-mediated fusion framework organized as a three-stage register lifecycle. Aggregate preserves per-modality register summarization inherited from pretraining; Bridge performs bidirectional register-to-patch reading with consensus-residual regulation; and Project translates the resulting register summary into spatially adaptive calibration of patch features. This register pathway avoids dense patch-to-patch cross-modal interaction while preserving the pretrained patch representation. With both backbone streams frozen, RegisterBridgeMM achieves the highest mAP50-95 among the evaluated methods on all four benchmarks: LLVIP, M3FD, DroneVehicle, and FLIR-Aligned.
- Abstract(参考訳): RGB赤外線(RGB-IR)オブジェクト検出は、相補的な可視的および熱的手がかりの恩恵を受けるが、照明の変化、天候の変化、散在するシーンにおいて効果的な融合は依然として困難である。
既存のRGB-IR融合法は、より軽量だがより制約のある適応機構に対して、表現力のあるパッチレベルの相互作用を交換することが多い。
予め訓練したレジスタトークンは、ペアリングされたRGB-IR入力のモダリティ共有情報とモダリティ固有情報の両方を含むことを実証的に観察し、クロスモーダル通信のためのコンパクトな基板として機能することが示唆された。
この観測に基づいて,3段階のレジスタライフサイクルとして構成されたレジスタを介する融合フレームワークである RegisterBridgeMM を提案する。
Aggregateは、事前訓練から継承したモダリティごとのレジスタの要約を保存し、Bridgeはコンセンサス・残留規制付き双方向のレジスタ・トゥ・パッチ読取を行い、Projectは得られたレジスタの要約を、空間適応的なパッチ特徴のキャリブレーションに変換する。
このレジスタパスは、事前訓練されたパッチ表現を保持しながら、密集したパッチ対パッチ間の相互作用を避ける。
両バックボーンストリームの凍結により、Re RegisterBridgeMMは、LLVIP、M3FD、DroneVehicle、FLIR-Alignedの4つのベンチマークで評価されたメソッドの中で、最も高いmAP50-95を達成する。
関連論文リスト
- Bridging the RGB-IR Gap: Consensus and Discrepancy Modeling for Text-Guided Multispectral Detection [45.62297680190076]
マルチスペクトルオブジェクト検出のためのバイサポートモデリングを用いたセマンティックブリッジ融合フレームワークを提案する。
具体的には、テキストを共有セマンティックブリッジとして使用して、RGBおよびIR応答を統一されたカテゴリ条件下で整列させる。
RGB-IR相互作用の証拠を正規のコンセンサス支援と相補的な相補的な相補性支援に定式化する。
論文 参考訳(メタデータ) (2026-04-13T09:41:01Z) - PFM-VEPAR: Prompting Foundation Models for RGB-Event Camera based Pedestrian Attribute Recognition [8.09519291579794]
イベントベースの歩行者認識(PAR)は、ローライトおよびモーションブルーシナリオにおけるRGBカメラの強化にモーションキューを活用する。
本稿では,離散コサイン変換(DCT)と逆DCT(IDCT)をイベントデータに適用するためのイベントプロンプタを提案する。
現代のホップフィールドネットワークと組み合わさって、豊富な事前知識を提供するように設計された外部メモリバンクは、連想型メモリ拡張表現学習を可能にする。
論文 参考訳(メタデータ) (2026-03-20T02:12:43Z) - RTFDNet: Fusion-Decoupling for Robust RGB-T Segmentation [0.2578242050187029]
RGB-Thermal (RGB-T)セマンティックセマンティックセグメンテーションは、低照度環境で動作するロボットシステムに不可欠である。
伝統的なアプローチは、しばしばモダリティバランスを過度に強調し、センサー信号が部分的に欠如している場合に、頑丈さや厳しい性能が制限される。
論文 参考訳(メタデータ) (2026-03-10T03:40:26Z) - SwiTrack: Tri-State Switch for Cross-Modal Object Tracking [74.15663758681849]
クロスモーダルオブジェクトトラッキング(CMOT)は、ビデオストリームが異なるモード間で切り替える間、ターゲットの一貫性を維持する新しいタスクである。
SwiTrackは3つの特別なストリームを配置することでCMOTを再定義する新しいステートスイッチングフレームワークである。
論文 参考訳(メタデータ) (2025-11-20T10:52:54Z) - Learning Frequency and Memory-Aware Prompts for Multi-Modal Object Tracking [74.15663758681849]
凍結したRGBトラッカーに軽量なプロンプトを注入するデュアルアダプタフレームワークであるLearning Frequency and Memory-Aware Promptsを紹介する。
周波数誘導型ビジュアルアダプタは、相補的なキューをモダリティ間で適応的に転送する。
短い、長い、永続的なメモリストアを持つマルチレベルメモリアダプタは、信頼できる時間的コンテキストを格納し、更新し、取得する。
論文 参考訳(メタデータ) (2025-06-30T15:38:26Z) - Learning Flow-Guided Registration for RGB-Event Semantic Segmentation [22.996619370156584]
イベントカメラは、RGBセンサーを補完するマイクロ秒レベルのモーションキューをキャプチャする。
RGB-Eventセグメンテーションを融合から登録に再キャストする。
非対称なモーダル間の対応を適応的にマッチングする新しいフロー誘導双方向フレームワークであるBRENetを提案する。
論文 参考訳(メタデータ) (2025-05-02T19:19:58Z) - Breaking Modality Disparity: Harmonized Representation for Infrared and
Visible Image Registration [66.33746403815283]
シーン適応型赤外線と可視画像の登録を提案する。
我々は、異なる平面間の変形をシミュレートするためにホモグラフィーを用いる。
我々は、まず、赤外線と可視画像のデータセットが不一致であることを示す。
論文 参考訳(メタデータ) (2023-04-12T06:49:56Z) - Dual Swin-Transformer based Mutual Interactive Network for RGB-D Salient
Object Detection [67.33924278729903]
本研究では,Dual Swin-Transformerを用いたMutual Interactive Networkを提案する。
視覚入力における長距離依存をモデル化するために,RGBと奥行きモードの両方の機能抽出器としてSwin-Transformerを採用している。
5つの標準RGB-D SODベンチマークデータセットに関する総合的な実験は、提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2022-06-07T08:35:41Z) - Skeleton Sequence and RGB Frame Based Multi-Modality Feature Fusion
Network for Action Recognition [19.86981250339247]
行動認識はコンピュータビジョンにおいて、視覚システムにおける幅広い応用のための熱い話題となっている。
以前のアプローチでは、骨格配列とRGBビデオのモダリティを融合することで改善されている。
骨格列とRGBフレームのモダリティを組み合わせたマルチモーダル特徴融合ネットワークを提案する。
論文 参考訳(メタデータ) (2022-02-23T09:29:53Z) - Bi-directional Cross-Modality Feature Propagation with
Separation-and-Aggregation Gate for RGB-D Semantic Segmentation [59.94819184452694]
深度情報はRGBD画像のセマンティックセグメンテーションにおいて有用であることが証明されている。
既存のほとんどの研究は、深度測定がRGBピクセルと正確で整合していると仮定し、問題をモーダルな特徴融合としてモデル化している。
本稿では,RGB特徴量応答を効果的に再検討するだけでなく,複数の段階を通して正確な深度情報を抽出し,代わりに2つの補正表現を集約する,統一的で効率的なクロスモダリティガイドを提案する。
論文 参考訳(メタデータ) (2020-07-17T18:35:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。