論文の概要: Spatial-Temporal Expert Learning for Video-based Person Re-identification
- arxiv url: http://arxiv.org/abs/2607.01353v1
- Date: Wed, 01 Jul 2026 18:11:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.549471
- Title: Spatial-Temporal Expert Learning for Video-based Person Re-identification
- Title(参考訳): 映像に基づく人物再識別のための空間時間エキスパート学習
- Authors: Xiaofei Hui, Pengfei Wang, Evan Ling, Dezhao Huang, Keng Teck Ma, Minhoe Hur, Jun Liu,
- Abstract要約: ビデオベースの人物再識別(Re-ID)は、ギャラリーのビデオクリップからクエリビデオクリップ内の同一人物を検索することを目的としている。
本稿では,新たな入力認識型拡張可能なエキスパートモジュールにより,詳細な情報を探究する能力を高めることを提案する。
- 参考スコア(独自算出の注目度): 14.173320501394864
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video-based person re-identification (Re-ID) aims to retrieve the same identity in the query video clips from the gallery video clips. To solve this problem, exploiting fine-grained features is of great importance, especially when discriminating identities that are similar in appearance. In this paper, we propose to enhance the ability to explore fine-grained information with a novel input-aware extendable expert module. Instead of updating the network parameters with every sample in the dataset, we aim to train the experts within specific subsets that only contain similar samples and promote their ability to exploit fine-grained information within these similar samples. To achieve this goal, we incorporate two mechanisms in this module: input-aware expert selection mechanism and spatial-temporal selection mechanism. The first mechanism dynamically activates a set of experts on subsets of similar samples, pushing the experts to exploit subtle differences between these similar samples, while the second one further increases their sensitivity to the fine-grained differences in spatial and temporal aspects and allows the experts to dynamically utilize them for different input samples. In addition, to facilitate the expert module, we design an extendable scheme that allows the module to flexibly add new experts when necessary. As a result, our method achieves outstanding performance on two large-scale datasets.
- Abstract(参考訳): ビデオベースの人物再識別(Re-ID)は、ギャラリーのビデオクリップからクエリビデオクリップ内の同一人物を検索することを目的としている。
この問題を解決するためには、特に外観に類似したアイデンティティを識別する場合に、きめ細かい特徴を活用することが非常に重要である。
本稿では,新しい入力対応拡張可能なエキスパートモジュールを用いて,詳細な情報を探究する能力を高めることを提案する。
データセット内のすべてのサンプルでネットワークパラメータを更新する代わりに、類似したサンプルのみを含む特定のサブセット内のエキスパートを訓練し、これらの類似したサンプル内で詳細な情報を活用する能力を促進することを目的としています。
この目的を達成するために,本モジュールには,入力認識専門家選択機構と時空間選択機構という2つのメカニズムが組み込まれている。
第1のメカニズムは、類似サンプルのサブセットに関する専門家の集合を動的に活性化し、専門家にこれらの類似サンプルの微妙な違いを利用させ、第2のメカニズムは、空間的および時間的側面の細かい相違に対する感受性を高め、専門家が異なる入力サンプルに対してそれらを動的に利用できるようにする。
さらに,エキスパートモジュールを容易にするために,必要に応じてフレキシブルに新たなエキスパートを追加できる拡張可能なスキームを設計する。
その結果,本手法は2つの大規模データセットに対して優れた性能を示すことができた。
関連論文リスト
- HAMoBE: Hierarchical and Adaptive Mixture of Biometric Experts for Video-based Person ReID [14.923830228090246]
バイオメトリックエキスパートの階層的・適応的混合(HAMoBE)フレームワークを提案する。
HamoBEは、キーバイオメトリックの特徴を独立してモデル化することで、人間の知覚機構を模倣する。
私たちのアプローチは、大幅なパフォーマンス向上をもたらします。
論文 参考訳(メタデータ) (2025-08-07T05:34:14Z) - RouteMark: A Fingerprint for Intellectual Property Attribution in Routing-based Model Merging [69.2230254959204]
我々は,統合されたMoEモデルにおけるIP保護のためのフレームワークであるRouteMarkを提案する。
我々の重要な洞察は、タスク固有の専門家は、探索入力の下で安定かつ独特なルーティング行動を示すことである。
属性と改ざん検出のために,類似性に基づくマッチングアルゴリズムを導入する。
論文 参考訳(メタデータ) (2025-08-03T14:51:58Z) - LCM-Lookahead for Encoder-based Text-to-Image Personalization [82.56471486184252]
我々は,テキスト・ツー・イメージ・モデルのパーソナライズを導くために,ショートカット・メカニズムを利用する可能性を探る。
エンコーダをベースとしたパーソナライズ手法に焦点をあてて、ルックアヘッドのアイデンティティ損失を調整することで、より高いアイデンティティの忠実性を達成できることを実証する。
論文 参考訳(メタデータ) (2024-04-04T17:43:06Z) - Exploring Fine-Grained Representation and Recomposition for Cloth-Changing Person Re-Identification [78.52704557647438]
補助的なアノテーションやデータなしに両方の制約に対処するために,新しいFIne-fine Representation and Recomposition (FIRe$2$) フレームワークを提案する。
FIRe$2$は、広く使われている5つのRe-IDベンチマークで最先端のパフォーマンスを実現することができる。
論文 参考訳(メタデータ) (2023-08-21T12:59:48Z) - Semantic Prompt for Few-Shot Image Recognition [76.68959583129335]
本稿では,数ショット学習のための新しいセマンティック・プロンプト(SP)手法を提案する。
提案手法は,1ショットの学習精度を平均3.67%向上させることにより,有望な結果が得られる。
論文 参考訳(メタデータ) (2023-03-24T16:32:19Z) - Multi-Stage Spatio-Temporal Aggregation Transformer for Video Person
Re-identification [78.08536797239893]
本稿では,2つの新しいプロキシ埋め込みモジュールを設計したMSTAT(Multi-Stage Space-Temporal Aggregation Transformer)を提案する。
MSTATは、属性関連、アイデンティティ関連、および属性関連情報をビデオクリップからエンコードする3つのステージから構成される。
MSTATは様々な標準ベンチマークで最先端の精度を達成できることを示す。
論文 参考訳(メタデータ) (2023-01-02T05:17:31Z) - Diversified Dynamic Routing for Vision Tasks [36.199659460868496]
本稿では,各レイヤが専門家の集合で構成された新しいアーキテクチャを提案する。
本手法では,データのパーティショニングに関する課題を解決するために,モデルを明示的に訓練する。
都市景観のセマンティックセグメンテーションとMS-COCOのオブジェクト検出とインスタンスセグメンテーションについていくつかの実験を行った。
論文 参考訳(メタデータ) (2022-09-26T23:27:51Z) - MIST: Multiple Instance Self-Training Framework for Video Anomaly
Detection [76.80153360498797]
タスク固有の識別表現を効率的に洗練するためのマルチインスタンス自己学習フレームワーク(MIST)を開発した。
mistは1)スパース連続サンプリング戦略を適用し,より信頼性の高いクリップレベル擬似ラベルを生成するマルチインスタンス擬似ラベル生成器,2)自己誘導型注意強調特徴エンコーダで構成される。
本手法は,上海技術におけるフレームレベルのAUC 94.83%の取得において,既存の教師付きおよび弱教師付き手法と同等あるいはそれ以上に機能する。
論文 参考訳(メタデータ) (2021-04-04T15:47:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。