論文の概要: Mixture of Enhanced-View Experts for Multi-Query Vehicle ReID and A Large-Scale Benchmark
- arxiv url: http://arxiv.org/abs/2607.08085v1
- Date: Thu, 09 Jul 2026 03:41:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.406364
- Title: Mixture of Enhanced-View Experts for Multi-Query Vehicle ReID and A Large-Scale Benchmark
- Title(参考訳): マルチクエリ自動車ReIDと大規模ベンチマークのための拡張ビューエキスパートの混在
- Authors: Aihua Zheng, Jie Zhen, Chenglong Li, Jiaxiang Wang, Jin Tang,
- Abstract要約: マルチクエリ車両ReIDは、多様なビューからの補完情報を活用して、堅牢な特徴学習を実現する。
本研究は,EV-MoE(Mixture of Enhanced-View Experts)と呼ばれる新しい手法を提案する。
特に、ビュー固有の機能拡張サブモジュール(VFEM)と動的マルチビュー融合サブモジュール(DMFM)の2つの部分からなる拡張ビューエキスパートモジュールを設計する。
- 参考スコア(独自算出の注目度): 24.421311632428043
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-query vehicle ReID aims to leverage complementary information from diverse views for robust feature learning. However, current methods suffer from simplistic feature fusion and thus easily ignores some important view information and cross-view relationships. To handle these problems, this work presents a novel approach called Mixture of Enhanced-View Experts (EV-MoE), which enhances the feature representation of each view and efficiently integrate the view-specific enhanced features by MoE, for robust multi-query ReID. In particular, we design a mixture of enhanced-view experts module, which consists of two parts including view-specific feature enhancement sub-Module (VFEM) and dynamic multi-view fusion sub-Module (DMFM). Moreover, we further introduce Multi-view Alignment Loss (MAL), which aligns features through bidirectional crossview contrastive learning and reconstruction constraints, addressing the challenges of consistency between multi-query features and single-image features. In addition, to evaluate multi-query ReID in real-world environments, we collect LCRI-1K, a largescale vehicle ReID dataset with 1,090 identities, 107,805 images, across 23,637 cameras, where each vehicle appears in an average of 67.5 cameras, providing a comprehensive benchmark to test the robustness in complex environments. Extensive experiments demonstrate the robustness of CAFNet in addressing the multiquery vehicle ReID problem. The code is available at https: //github.com/xiaozhen28/CAFNet.
- Abstract(参考訳): マルチクエリ車両ReIDは、多様なビューからの補完情報を活用して、堅牢な特徴学習を実現する。
しかし,現在の手法は簡易な特徴融合に悩まされており,重要なビュー情報や相互参照関係は容易に無視できる。
このような問題に対処するため,本研究では,複数クエリの堅牢なReIDを実現するために,各ビューの特徴表現を強化し,MoEによるビュー固有の拡張機能を効率的に統合する,Mixture of Enhanced-View Experts (EV-MoE) という新しいアプローチを提案する。
具体的には、ビュー固有の機能拡張サブモジュール(VFEM)と動的マルチビュー融合サブモジュール(DMFM)の2つの部分からなる拡張ビューエキスパートモジュールを設計する。
さらに,マルチビュー・アライメント・ロス(MAL)を導入し,双方向のクロスビュー・コントラッシブ・ラーニングと再構成制約によって特徴を整列させ,マルチクエリ機能と単一イメージ機能との整合性の課題に対処する。
さらに、実環境におけるマルチクエリReIDを評価するために、LCRI-1Kという、1,090のID、107,805イメージを持つ大規模車両ReIDデータセットを23,637台のカメラで収集し、各車両が平均67.5台のカメラに出現し、複雑な環境におけるロバスト性をテストするための総合的なベンチマークを提供する。
大規模な実験は、マルチクエリー車両のReID問題に対処する際のCAFNetの堅牢性を示す。
コードはhttps: //github.com/xiaozhen28/CAFNetで入手できる。
関連論文リスト
- Multi-view feature High-order Fusion for Space Weak Object Detection and Segmentation [12.123374796487155]
簡単なマルチビューアテンションを開発し、その出力をマルチビューの特徴として扱う。
また、弱い物体のより正確でリッチな特徴を集約するマルチビュー高次融合法(MHF)を提案する。
論文 参考訳(メタデータ) (2026-06-13T05:11:57Z) - Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models [79.59567114769513]
複数の画像に対して自由かつ正確なグラウンド化を行うことができる最初のマルチイメージグラウンドモデルであるMigicianを紹介する。
我々のモデルは、より優れたマルチイメージグラウンド機能を実現し、最高のMLLMを24.94%上回り、さらに大きな70Bモデルを超えた。
論文 参考訳(メタデータ) (2025-01-10T07:56:23Z) - SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection [79.58755811919366]
本稿では,リモートセンシングのためのマルチモーダルデータセットとマルチタスクオブジェクト検出(M2Det)という新しいタスクを提案する。
水平方向または指向方向の物体を、あらゆるセンサーから正確に検出するように設計されている。
この課題は、1)マルチモーダルモデリングの管理に関わるトレードオフ、2)マルチタスク最適化の複雑さに起因する。
論文 参考訳(メタデータ) (2024-12-30T02:47:51Z) - DeMo: Decoupled Feature-Based Mixture of Experts for Multi-Modal Object Re-Identification [25.781336502845395]
マルチモーダルオブジェクトReIDentificationは、複数のモーダルから補完情報を組み合わせることで、特定のオブジェクトを検索することを目的としている。
本稿では,マルチモーダルオブジェクトReIDのためのDeMoと呼ばれる新しい特徴学習フレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-14T02:36:56Z) - Multi-Level Feature Fusion Network for Lightweight Stereo Image Super-Resolution [12.066710423371559]
軽量ステレオ画像超解像(MFFSSR)のための効率的なマルチレベル特徴融合ネットワークを提案する。
MFFSSRは、ハイブリットアテンション特徴抽出ブロック(HAFEB)を使用して、マルチレベルなイントラビュー特徴を抽出する。
より少ないパラメータで優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-05-09T02:01:51Z) - Multi-view Aggregation Network for Dichotomous Image Segmentation [76.75904424539543]
Dichotomous Image (DIS) は近年,高解像度自然画像からの高精度物体分割に向けて出現している。
既存の手法は、グローバルなローカライゼーションと局所的な洗練を徐々に完了させるために、退屈な複数のエンコーダ・デコーダストリームとステージに依存している。
これに触発されて、我々は多視点オブジェクト認識問題としてdisをモデル化し、擬似多視点アグリゲーションネットワーク(MVANet)を提供する。
一般的なdis-5Kデータセットの実験では、我々のMVANetは精度と速度の両方で最先端の手法を大きく上回っている。
論文 参考訳(メタデータ) (2024-04-11T03:00:00Z) - DAMSDet: Dynamic Adaptive Multispectral Detection Transformer with
Competitive Query Selection and Adaptive Feature Fusion [82.2425759608975]
赤外可視物体検出は、赤外画像と可視画像の相補的情報を融合することにより、フルデイ物体検出の堅牢化を目指している。
本稿では,この2つの課題に対処する動的適応型マルチスペクトル検出変換器(DAMSDet)を提案する。
4つの公開データセットの実験は、他の最先端の手法と比較して大幅に改善されている。
論文 参考訳(メタデータ) (2024-03-01T07:03:27Z) - Bi-directional Adapter for Multi-modal Tracking [67.01179868400229]
汎用の双方向アダプタを用いたマルチモーダル視覚プロンプト追跡モデルを提案する。
我々は、モーダリティ固有の情報をあるモーダリティから別のモーダリティへ転送するための、シンプルだが効果的なライト・フィーチャー・アダプタを開発した。
本モデルでは,完全微調整法と素早い学習法の両方と比較して,追跡性能が優れている。
論文 参考訳(メタデータ) (2023-12-17T05:27:31Z) - SCA-PVNet: Self-and-Cross Attention Based Aggregation of Point Cloud and
Multi-View for 3D Object Retrieval [8.74845857766369]
大規模データセットを用いた多モード3Dオブジェクト検索はめったに行われない。
本稿では,3次元オブジェクト検索のための点群と多視点画像の自己・横断的アグリゲーションを提案する。
論文 参考訳(メタデータ) (2023-07-20T05:46:32Z) - Multi-query Vehicle Re-identification: Viewpoint-conditioned Network,
Unified Dataset and New Metric [30.344288906037345]
マルチクエリー車両Re-IDと呼ばれる,より現実的でアクセスしやすいタスクを提案する。
我々は、異なる車両視点からの補完情報を適応的に組み合わせた、新しい視点条件付きネットワーク(VCNet)を設計する。
次に、実生活の交通監視システムから6142台のカメラで撮影された、統一されたベンチマークデータセットを作成します。
第3に,クロスシーン認識能力を測定する平均クロスシーン精度(mCSP)と呼ばれる新しい評価指標を設計する。
論文 参考訳(メタデータ) (2023-05-25T06:22:03Z) - Multi-modal Gated Mixture of Local-to-Global Experts for Dynamic Image
Fusion [59.19469551774703]
赤外線と可視画像の融合は,複数の情報源からの包括的情報を統合して,様々な作業において優れた性能を実現することを目的としている。
局所-言語の専門家によるマルチモーダルゲート混合を用いた動的画像融合フレームワークを提案する。
本モデルは,Mixture of Local Experts (MoLE) とMixture of Global Experts (MoGE) から構成される。
論文 参考訳(メタデータ) (2023-02-02T20:06:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。