論文の概要: Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing
- arxiv url: http://arxiv.org/abs/2607.09143v1
- Date: Fri, 10 Jul 2026 06:52:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.802523
- Title: Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing
- Title(参考訳): 光と時間を織る:高密度RGBイベント解析のための統一高調波幾何表現学習
- Abstract要約: 我々は、専用のRGB-Event解析用に特別に設計された最初の統一バックボーンであるEvitaを紹介する。
深いモーダルなシナジーを達成するため、Evitaはすべてのエンコーダ層に直接固有のコラーニングモジュール群を組み込む。
Evitaは、リアルタイムマルチモーダル認識において、より優れた精度とレイテンシのトレードオフを提供しながら、新しい最先端メトリクスを確立する。
- 参考スコア(独自算出の注目度): 55.13802890769086
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fusing standard RGB frames with asynchronous event streams has emerged as a definitive paradigm for robust perception in degraded environments. Although unified backbones have recently gained traction in multi-modal vision, adapting them to the RGB-Event domain remains fundamentally challenging. Existing architectures either resort to decoupled dual encoders that double computational overhead, or adopt generic unified designs that fail to resolve implicit geometric parallax and cross-spectral aliasing under the extreme representational divide between dense intensity grids and sparse kinematic spikes. To transcend these bottlenecks, we present Evita, the first unified backbone specifically engineered for dedicated dense RGB-Event parsing. To achieve profound modal synergy, Evita explicitly embeds a suite of intrinsic co-learning modules directly into every encoder layer. Specifically, it features Geometric Parallax Rectification for adaptive spatial alignment, Harmonic Spectral Resonance for texture transfer exclusively in the complex frequency domain, and Transient Global Routing for event-driven asymmetric attention. To guarantee robust feature extraction against spatial misalignments and decouple representations from specific event encodings, we construct N-ImageNetV2 alongside a stochastic event representation mixing pretraining protocol, empowering the network to seamlessly accommodate arbitrary event formats in downstream tasks. Extensive evaluations across the DELIVER, DDD17, and DSEC benchmarks confirm that Evita establishes new state-of-the-art metrics while delivering a superior accuracy-latency trade-off for real-time multimodal perception.The code are publicly available at: https://github.com/chaineypung/Evita.
- Abstract(参考訳): 非同期イベントストリームで標準のRGBフレームを再利用することは、劣化した環境での堅牢な認識のための決定的なパラダイムとして現れました。
統合されたバックボーンは、最近マルチモーダルなビジョンで勢いを増しているが、RGB-Eventドメインにそれらを適用することは、基本的には困難である。
既存のアーキテクチャでは、計算オーバーヘッドが2倍になる二重エンコーダを分離するか、あるいは高密度グリッドとスパースキネマティックスパイクの間の極端に表現的な分割の下で暗黙の幾何学的パララックスとクロススペクトルエイリアスを解決できない汎用的な統一設計を採用する。
これらのボトルネックを克服するために、私たちは、専用のRGB-Event解析用に特別に設計された最初の統一バックボーンであるEvitaを紹介します。
深いモーダルなシナジーを達成するため、Evitaは固有のコラーニングモジュールのスイートをすべてのエンコーダ層に直接埋め込む。
具体的には、適応空間アライメントのための幾何学的パララックス整流、複雑な周波数領域にのみテクスチャ転送のための高調波スペクトル共鳴、イベント駆動非対称注意のための過渡的グローバルルーティングを特徴とする。
空間的不整合に対するロバストな特徴抽出と特定のイベントエンコーディングからの表現の分離を保証するため,N-ImageNetV2を確率的イベント表現混合プレトレーニングプロトコルとともに構築し,ダウンストリームタスクにおける任意のイベントフォーマットをシームレスに調整することを可能にする。
DELIVER、DDD17、DSECベンチマーク全体にわたる広範な評価により、Evitaは、リアルタイムマルチモーダル知覚において優れた精度とレイテンシのトレードオフを提供しながら、新しい最先端メトリクスを確立していることが確認された。コードは、https://github.com/chaineypung/Evitaで公開されている。
関連論文リスト
- Active Adversarial Perturbation-driven Associative Memory Retrieval for RGB-Event Visual Object Tracking [58.338848435042536]
RGB-Eventトラッキングは、イベントセンサからRGB外観テクスチャと高密度時間運動キューを融合することにより、ローカライズを改善する。
現実世界のシーンは、従来のマルチモーダル融合を妨げる多様な構造的な信号劣化に悩まされる。
本稿では,RGBイベント追跡に適した階層的摂動・検索フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-24T23:34:06Z) - Spatial Orthogonal Refinement for Robust RGB-Event Visual Object Tracking [8.019596736149834]
空間直交微細化(SOR)に基づくロバストなRGBイベント追跡のためのフレームワークであるSOR-Trackを提案する。
大規模なFE108ベンチマークの実験は、SOR-Trackが既存のフュージョンベースのトラッカーを一貫して上回っていることを示している。
その単純さにもかかわらず、提案手法はマルチモーダルな特徴アライメントとテクスチャの整合に対する原理的かつ物理的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-03-29T23:54:31Z) - RTFDNet: Fusion-Decoupling for Robust RGB-T Segmentation [0.2578242050187029]
RGB-Thermal (RGB-T)セマンティックセマンティックセグメンテーションは、低照度環境で動作するロボットシステムに不可欠である。
伝統的なアプローチは、しばしばモダリティバランスを過度に強調し、センサー信号が部分的に欠如している場合に、頑丈さや厳しい性能が制限される。
論文 参考訳(メタデータ) (2026-03-10T03:40:26Z) - PEPR: Privileged Event-based Predictive Regularization for Domain Generalization [19.185122873391517]
本稿では,厳密な単一モダリティRGBモデルをトレーニングするための特権情報(LUPI)パラダイムを用いた学習環境下でのクロスモーダルフレームワークを提案する。
イベントカメラを特権情報のソースとして利用し、トレーニング中にのみ利用可能です。
RGBエンコーダをPEPRでトレーニングし、イベントベースの潜伏特性を予測し、意味豊かさを犠牲にすることなくロバスト性を蒸留する。
論文 参考訳(メタデータ) (2026-02-04T14:10:36Z) - Decoupling Amplitude and Phase Attention in Frequency Domain for RGB-Event based Visual Object Tracking [51.31378940976401]
既存のRGB-Eventトラッキングアプローチでは、イベントカメラのユニークな利点を完全に活用できない。
本稿では,周波数領域の早期融合を実現する新しい追跡フレームワークを提案する。
FE108, FELT, COESOTなど, 広く使用されている3つのRGB-Event追跡ベンチマークデータセットの実験により, 提案手法の性能と効率を実証した。
論文 参考訳(メタデータ) (2026-01-03T01:10:17Z) - Bidirectional Feature-aligned Motion Transformation for Efficient Dynamic Point Cloud Compression [97.66080040613726]
特徴空間における動きを暗黙的にモデル化する双方向特徴整合運動変換(Bi-FMT)フレームワークを提案する。
Bi-FMTは、時間的に一貫した潜在表現を生成するために、過去と将来の両方のフレームで機能を調整する。
圧縮効率とランタイムの両方において, Bi-FMT が D-DPCC と AdaDPCC を上回っていることを示す。
論文 参考訳(メタデータ) (2025-09-18T03:51:06Z) - Learning Flow-Guided Registration for RGB-Event Semantic Segmentation [22.996619370156584]
イベントカメラは、RGBセンサーを補完するマイクロ秒レベルのモーションキューをキャプチャする。
RGB-Eventセグメンテーションを融合から登録に再キャストする。
非対称なモーダル間の対応を適応的にマッチングする新しいフロー誘導双方向フレームワークであるBRENetを提案する。
論文 参考訳(メタデータ) (2025-05-02T19:19:58Z) - FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion [92.4205087439928]
画像強調共同深度推定法は、頑健な知覚に相補的なモダリティを利用するが、一般化可能性の課題に直面している。
自己監督型転送(PST)と周波数デカップリング型フュージョンモジュール(FreDF)を提案する。
PSTは、画像基盤モデルとの遅延空間アライメントによるクロスモーダルな知識伝達を確立し、データ不足を効果的に軽減する。
FreDFは、低周波構造成分から高周波エッジ特性を明示的に分離し、モード比周波数ミスマッチを解消する。
この組み合わせのアプローチにより、FUSEはターゲットデータセットに対する軽量デコーダ適応のみを必要とするユニバーサルなイメージイベントを構築することができる。
論文 参考訳(メタデータ) (2025-03-25T15:04:53Z) - Bi-directional Cross-Modality Feature Propagation with
Separation-and-Aggregation Gate for RGB-D Semantic Segmentation [59.94819184452694]
深度情報はRGBD画像のセマンティックセグメンテーションにおいて有用であることが証明されている。
既存のほとんどの研究は、深度測定がRGBピクセルと正確で整合していると仮定し、問題をモーダルな特徴融合としてモデル化している。
本稿では,RGB特徴量応答を効果的に再検討するだけでなく,複数の段階を通して正確な深度情報を抽出し,代わりに2つの補正表現を集約する,統一的で効率的なクロスモダリティガイドを提案する。
論文 参考訳(メタデータ) (2020-07-17T18:35:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。