論文の概要: TRIM-ReID: Duplication-Aware Token Reduction and Modality-Aligned Interaction for Multi-Modal Object Re-Identification
- arxiv url: http://arxiv.org/abs/2610.04361v1
- Date: Sat, 03 Oct 2026 07:58:23 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:14:27.734766
- Title: TRIM-ReID: Duplication-Aware Token Reduction and Modality-Aligned Interaction for Multi-Modal Object Re-Identification
- Title(参考訳): TRIM-ReID:マルチモーダルオブジェクト再同定のための重複対応トークンの削減とモダリティ対応インタラクション
- Abstract要約: マルチモーダルオブジェクト再同定は、補完的なRGB、近赤外(NIR)、熱赤外(TIR)観測を利用して対象オブジェクトを検索する。
既存の手法では、グローバルな画像テキストアライメントに最適化されたビジュアルエンコーダと、学習された重要度スコアを用いたトークンを選択するのが一般的である。
本稿では,高密度特徴抽出,モダル内トークン低減,モーダル間相互作用を統一するコンパクトなフレームワークを提案する。
- 参考スコア(独自算出の注目度): 4.97861272092888
- License:
- Abstract: Multi-modal object re-identification exploits complementary RGB, near-infrared (NIR), and thermal-infrared (TIR) observations to retrieve target objects. However, existing methods commonly employ visual encoders optimized for global image-text alignment and select tokens using learned importance scores. Such designs fail to preserve fine-grained identity cues or explicitly account for token redundancy, resulting in underrepresented local evidence and duplicated tokens that lead to noisy and costly cross-modal interaction. To address this gap, we propose TRIM-ReID, a compact framework that unifies dense feature extraction, intra-modal token reduction, and inter-modal aligned interaction. Specifically, semantically rich and spatially coherent patch features are extracted by Dense Identity Representation (DIR), which leverages DINOv3 to preserve fine-grained identity information. We then introduce Token Diversity Mining (TDM) to identify complementary local evidence and construct compact modality-specific token sets by suppressing repetitive patches while preserving informative diversity. Retained tokens are subsequently fused by Modal Relational Interaction (MRI) to enable effective information exchange across modalities, while a triangular alignment loss explicitly regularizes their joint relationships to maintain cross-modal semantic consistency under independent token selection. Extensive experiments on RGBNT201, RGBNT100, and MSVR310 demonstrate that TRIM-ReID achieves state-of-the-art performance.
- Abstract(参考訳): マルチモーダルオブジェクト再識別は、補完的なRGB、近赤外(NIR)、熱赤外(TIR)観測を利用して対象オブジェクトを検索する。
しかし、既存の手法では、グローバルな画像テキストアライメントに最適化されたビジュアルエンコーダと、学習された重要度スコアを用いたトークンを選択するのが一般的である。
このような設計は、きめ細かいアイデンティティの手がかりを保存できなかったり、トークンの冗長性を明示的に説明できなかったり、不明瞭なローカルエビデンスと重複したトークンがノイズとコストのかかるクロスモーダルな相互作用をもたらす結果となった。
このギャップに対処するために,高密度特徴抽出,モダル内トークン削減,モーダル間相互作用を統一するコンパクトなフレームワークであるTRIM-ReIDを提案する。
具体的には、Dense Identity Representation (DIR)によって意味的にリッチで空間的に整合したパッチの特徴を抽出し、DINOv3を利用してきめ細かなアイデンティティ情報を保存している。
次に,情報多様性を保ちながら反復パッチを抑えることで,補完的な局所的証拠を識別し,コンパクトなモダリティ固有のトークンセットを構築するために,Token Diversity Mining(TDM)を導入する。
残されるトークンはその後、モーダルリレーショナル・インタラクション(MRI)によって融合され、モダリティ間の効果的な情報交換が可能となる。
RGBNT201、RGBNT100、MSVR310の大規模な実験は、TRIM-ReIDが最先端のパフォーマンスを達成することを示した。
関連論文リスト
- Semantic Modality Compensation for Unsupervised Visible-Infrared Person Re-identification under Unpaired Settings [5.822080383967553]
未経験学習では、モダリティ間の同一性対応はしばしば不完全である。
モーダルスタイルからアイデンティティ意味を分離するプロンプト合成に基づくフレームワークを提案する。
SMCは一貫して最先端の手法を上回っている。
論文 参考訳(メタデータ) (2026-09-28T04:40:10Z) - BIT: Matching-based Bi-directional Interaction Transformation Network for Visible-Infrared Person Re-Identification [10.46214498539271]
双方向相互作用変換(BIT)と呼ばれる新しいネットワークを提案する。
BITは、可視光対と赤外線対の相互作用を明示的にモデル化するマッチングベースの戦略を採用している。
我々の知る限りでは、VI-ReIDにこのようなペアワイズマッチング駆動インタラクションを導入するのはBITが初めてである。
論文 参考訳(メタデータ) (2026-03-15T06:33:00Z) - STMI: Segmentation-Guided Token Modulation with Cross-Modal Hypergraph Interaction for Multi-Modal Object Re-Identification [14.549172375231729]
3つの主要コンポーネントからなる新しいマルチモーダル学習フレームワークSTMIを提案する。
マルチモーダルReIDシナリオにおけるSTMIフレームワークの有効性とロバスト性を実証する。
論文 参考訳(メタデータ) (2026-02-28T15:07:10Z) - Identity Clue Refinement and Enhancement for Visible-Infrared Person Re-Identification [20.544872117860915]
Visible-Infrared Person Re-Identification (VI-ReID) は、重要なモダリティの相違による、異種間マッチングの課題である。
本稿では,モダリティ固有の属性に固有の暗黙的な識別的知識をマイニングし,活用するために,ICRE(Identity Clue Refinement and Enhancement)ネットワークを提案する。
論文 参考訳(メタデータ) (2025-12-04T07:13:38Z) - Magic Tokens: Select Diverse Tokens for Multi-modal Object Re-Identification [64.36210786350568]
マルチモーダルオブジェクトReIDのための視覚変換器から多様なトークンを選択するための,textbfEDITORという新しい学習フレームワークを提案する。
我々のフレームワークはマルチモーダルオブジェクトReIDに対してより差別的な機能を生成することができる。
論文 参考訳(メタデータ) (2024-03-15T12:44:35Z) - Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation [63.15257949821558]
Referring Remote Sensing Image (RRSIS)は、コンピュータビジョンと自然言語処理を組み合わせた新しい課題である。
従来の参照画像(RIS)アプローチは、空中画像に見られる複雑な空間スケールと向きによって妨げられている。
本稿ではRMSIN(Rotated Multi-Scale Interaction Network)を紹介する。
論文 参考訳(メタデータ) (2023-12-19T08:14:14Z) - Learning Cross-modality Information Bottleneck Representation for
Heterogeneous Person Re-Identification [61.49219876388174]
Visible-Infrared person re-identification (VI-ReID)は、インテリジェントビデオ監視において重要かつ困難な課題である。
既存の手法は主に共有特徴空間の学習に重点を置いており、可視光と赤外光の相違を減らす。
本稿では,新しい相互情報・モダリティコンセンサスネットワーク,すなわちCMInfoNetを提案し,モダリティ不変な同一性の特徴を抽出する。
論文 参考訳(メタデータ) (2023-08-29T06:55:42Z) - CLIP-Driven Fine-grained Text-Image Person Re-identification [50.94827165464813]
TIReIDは、候補画像のプールから与えられたテキストクエリに対応する画像を取得することを目的としている。
TIReIDにおけるCLIPの強力な知識をフル活用するための,CLIP駆動のきめ細かい情報抽出フレームワーク(CFine)を提案する。
論文 参考訳(メタデータ) (2022-10-19T03:43:12Z) - CMTR: Cross-modality Transformer for Visible-infrared Person
Re-identification [38.96033760300123]
可視赤外人物再識別のための相互モダリティトランスフォーマー法(CMTR)
我々は,モダリティの情報をエンコードするために,トークン埋め込みと融合した新しいモダリティ埋め込みを設計する。
提案するCMTRモデルの性能は,既存のCNN方式をはるかに上回っている。
論文 参考訳(メタデータ) (2021-10-18T03:12:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。