論文の概要: Multi-Modal Object Re-Identification with Prompt-S6 and Semantic-Aware Knowledge Guidance
- arxiv url: http://arxiv.org/abs/2607.23451v1
- Date: Sun, 26 Jul 2026 04:29:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.107016
- Title: Multi-Modal Object Re-Identification with Prompt-S6 and Semantic-Aware Knowledge Guidance
- Title(参考訳): Prompt-S6とSemantic-Aware Knowledge Guidanceを用いたマルチモーダルオブジェクト再同定
- Authors: Weixiang Zhou, Jiabei Zuo, Yuhao Wang, Cong Wang, Huchuan Lu, Zhixun Su,
- Abstract要約: PRISMは、Prompt-S6 (PS6)とセマンティック・アウェア・ナレッジ・ガイダンスに基づいて構築された、新しいマルチモーダルオブジェクトReIDフレームワークである。
PS6は、効率的な相互モーダル相互作用を実現しつつ、Mambaの線形複雑性と強いシーケンスモデリング能力を維持している。
提案したモジュールにより、PRISMは複雑なシナリオ下でより堅牢なマルチモーダル表現を生成する。
- 参考スコア(独自算出の注目度): 48.70189792908997
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-modal object Re-Identification (ReID) aims to retrieve specific objects by integrating complementary information from multiple modalities. However, existing multi-modal ReID methods do not effectively address background interference suppression or achieve tri-modal alignment, instead focusing on pairwise feature fusion. Moreover, many current aggregation approaches suffer from high computational complexity. To address these limitations, we propose PRISM, a novel multi-modal ReID framework built upon Prompt-S6 (PS6) and semantic-aware knowledge guidance. PS6 maintains the linear complexity and strong sequence modeling capability of Mamba while enabling efficient cross-modal interaction. Leveraging these advantages, we design two key components: Semantic-Driven Token Pruning (SDTP) and Progressive Fusion Network (PFN). Parsing semantic priors from the segmentation foundation models, the SDTP then leverages these priors and applies dynamic token pruning to suppress background noise and refine feature representations. The PFN progressively aggregates multi-modal features to achieve tri-modal alignment and fully exploit modality complementarity. With the proposed modules, PRISM generates more robust multi-modal representations under complex scenarios. Extensive experiments on four multi-modal object ReID benchmarks demonstrate the effectiveness and efficiency of our approach. The source code is available at https://github.com/zw-absin/PRISM.
- Abstract(参考訳): マルチモーダルオブジェクト再識別(ReID)は、複数のモーダルから補完情報を統合することで、特定のオブジェクトを検索することを目的としている。
しかし、既存のマルチモーダルReID法は、背景干渉抑制やトリモーダルアライメントを効果的に解決せず、ペアワイズ機能融合に重点を置いている。
さらに、現在のアグリゲーションアプローチの多くは、高い計算複雑性に悩まされている。
これらの制約に対処するため,PRISM は Prompt-S6 (PS6) 上に構築された新しいマルチモーダル ReID フレームワークであり,セマンティック・アウェア・ナレッジ・ガイダンスである。
PS6は、効率的な相互モーダル相互作用を実現しつつ、Mambaの線形複雑性と強いシーケンスモデリング能力を維持している。
これらの利点を生かして、セマンティック・ドリブン・トークン・プルーニング(SDTP)とプログレッシブ・フュージョン・ネットワーク(PFN)という2つの重要なコンポーネントを設計する。
セグメンテーション基盤モデルからセグメンテーション先行を解析すると、SDTPはこれらの先行情報を活用し、動的トークンプルーニングを適用してバックグラウンドノイズを抑え、特徴表現を洗練させる。
PFNは徐々に多モーダルな特徴を集約し、三モーダルなアライメントを達成し、モーダルな相補性を完全に活用する。
提案したモジュールにより、PRISMは複雑なシナリオ下でより堅牢なマルチモーダル表現を生成する。
4つのマルチモーダルオブジェクトReIDベンチマークの大規模な実験は、我々のアプローチの有効性と効率を実証している。
ソースコードはhttps://github.com/zw-absin/PRISM.comで入手できる。
関連論文リスト
- Progressive Semantic Residual Quantization for Multimodal-Joint Interest Modeling in Music Recommendation [6.790539226766362]
本稿では,2段階の新たなマルチモーダルレコメンデーションフレームワークを提案する。
最初の段階では、モーダル固有およびモーダルジョイントのセマンティックIDを生成する。
第2段階では、ユーザのマルチモーダルな関心をモデル化するために、マルチコードブックのクロスアテンションネットワークが設計されている。
論文 参考訳(メタデータ) (2025-08-28T02:16:57Z) - FindRec: Stein-Guided Entropic Flow for Multi-Modal Sequential Recommendation [57.577843653775]
textbfFindRec (textbfFlexible unified textbfinformation textbfdisentanglement for multi-modal sequence textbfRecommendation)を提案する。
Stein kernel-based Integrated Information Coordination Module (IICM) は理論上、マルチモーダル特徴とIDストリーム間の分散一貫性を保証する。
マルチモーダル特徴を文脈的関連性に基づいて適応的にフィルタリング・結合するクロスモーダル・エキスパート・ルーティング機構。
論文 参考訳(メタデータ) (2025-07-07T04:09:45Z) - IDEA: Inverted Text with Cooperative Deformable Aggregation for Multi-modal Object Re-Identification [60.38841251693781]
本稿では,ロバストなマルチモーダルオブジェクトReIDを生成する新しいフレームワークを提案する。
我々のフレームワークは、多モーダル情報と逆テキストからのセマンティックガイダンスを統合するために、Modal PrefixesとInverseNetを使用している。
3つのマルチモーダルオブジェクトReIDベンチマーク実験により,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2025-03-13T13:00:31Z) - MambaPro: Multi-Modal Object Re-Identification with Mamba Aggregation and Synergistic Prompt [60.10555128510744]
ReID(Multi-modal object Re-IDentification)は、異なるモダリティから補完的な画像情報を活用することで、特定のオブジェクトを検索することを目的としている。
近年、CLIPのような大規模事前学習モデルでは、従来のシングルモーダルオブジェクトReIDタスクで顕著なパフォーマンスを示している。
マルチモーダルオブジェクトReIDのための新しいフレームワークであるMambaProを紹介する。
論文 参考訳(メタデータ) (2024-12-14T06:33:53Z) - Adapting Segment Anything Model to Multi-modal Salient Object Detection with Semantic Feature Fusion Guidance [15.435695491233982]
マルチモーダル・サリアン・オブジェクト検出(SOD)のためのSegment Anything Model(SAM)の強力な特徴表現とゼロショット一般化能力を探求し活用するための新しいフレームワークを提案する。
アンダーラインSAMとサブラインマンティックファウンダリナールファウンダリナールグダンクンダリナール(サマン)を併用して開発する。
画像エンコーダでは,マルチモーダルSAMをマルチモーダル情報に適用するためのマルチモーダルアダプタが提案されている。
論文 参考訳(メタデータ) (2024-08-27T13:47:31Z) - Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification [64.36210786350568]
マルチモーダルオブジェクトReIDのための視覚変換器から多様なトークンを選択するための,textbfEDITORという新しい学習フレームワークを提案する。
我々のフレームワークはマルチモーダルオブジェクトReIDに対してより差別的な機能を生成することができる。
論文 参考訳(メタデータ) (2024-03-15T12:44:35Z) - Unified Multi-modal Unsupervised Representation Learning for
Skeleton-based Action Understanding [62.70450216120704]
教師なしの事前訓練は骨格に基づく行動理解において大きな成功を収めた。
我々はUmURLと呼ばれる統一マルチモーダル非教師なし表現学習フレームワークを提案する。
UmURLは効率的な早期融合戦略を利用して、マルチモーダル機能を単一ストリームで共同でエンコードする。
論文 参考訳(メタデータ) (2023-11-06T13:56:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。