論文の概要: Multimodal LLM-Empowered Re-Ranking for Generalizable Person Re-Identification
- arxiv url: http://arxiv.org/abs/2606.16161v1
- Date: Mon, 15 Jun 2026 03:21:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:34.053852
- Title: Multimodal LLM-Empowered Re-Ranking for Generalizable Person Re-Identification
- Title(参考訳): 一般化可能な人物再同定のためのマルチモーダルLDMを用いた再学習
- Authors: Jiachen Li, Xiaojin Gong,
- Abstract要約: Domain Generalizable (DG) person re-identification (Re-ID)は、目に見えない現実世界のシナリオへの展開の可能性から、研究の関心が高まっている。
既存のほとんどのアプローチは、ドメイン一般化可能なエンコーダのトレーニングに重点を置いてDG Re-IDに対処するが、推論段階における改善の可能性を無視する。
本研究は、DG Re-IDを強化するために推論の再ランクを改善する代替方向を探究する。
- 参考スコア(独自算出の注目度): 14.03857911886461
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Domain Generalizable (DG) person re-identification (Re-ID) has attracted growing research interest due to its potential for deployment in unseen real-world scenarios. Most existing approaches address DG Re-ID by focusing on training domain-generalizable encoders but ignore the possible refinements in inference stage. In contrast, this work explores an alternative direction which improves inference re-ranking to enhance DG Re-ID. Conventional re-ranking methods typically rely on neighborhood-based distances to refine the initial ranking list, inherently depending on features produced by the Re-ID encoder. However, they deteriorate on target domains since the encoder lacks sufficient generalizability to produce reliable feature distances on unseen scenarios. Inspired by the remarkable generalization capabilities of recent Multimodal Large Language Models (MLLMs), we propose an MLLM-empowered distance metric to improve re-ranking in DG Re-ID. Specifically, we first adapt an MLLM to Re-ID data through supervised fine-tuning, which incorporates a domain-agnostic prompt and a query-candidate hard mining scheme. Then, the adapted MLLM is employed to compute a $μ$-distance during inference, which is robust to domain gap and significantly enhances subsequent re-ranking performance. Our approach is model-agnostic and can be seamlessly integrated into previous re-ranking frameworks. Extensive experiments demonstrate that our approach consistently yields substantial performance improvements across multiple DG Re-ID benchmarks. The code of this work will be released at https://github.com/RikoLi/MUSE soon.
- Abstract(参考訳): Domain Generalizable (DG) person re-identification (Re-ID)は、目に見えない現実世界のシナリオへの展開の可能性から、研究の関心が高まっている。
既存のほとんどのアプローチは、ドメイン一般化可能なエンコーダのトレーニングに重点を置いてDG Re-IDに対処するが、推論段階における改善の可能性を無視する。
対照的に、この研究は、DG Re-IDを強化するために推論の再ランクを改善する代替方向を探究する。
従来のリグレード方式は、Re-IDエンコーダが生成する特徴に依存して、初期ランキングリストを洗練させるために、地域ベースの距離に依存するのが一般的である。
しかし、エンコーダは未知のシナリオで信頼性の高い特徴距離を生成するのに十分な一般化性がないため、ターゲット領域では劣化する。
近年のMLLM(Multimodal Large Language Models)の顕著な一般化機能に着想を得て,DG Re-IDにおける再ランク付けを改善するため,MLLMを用いた距離測定法を提案する。
具体的には、まずMLLMを教師付き微調整によりRe-IDデータに適用し、ドメインに依存しないプロンプトとクエリ候補のハードマイニングスキームを組み込む。
次に、適用されたMLLMを用いて、推論中に$μ$-distanceを計算し、ドメインギャップに対して堅牢で、その後の再ランク性能を大幅に向上させる。
私たちのアプローチはモデルに依存しないので、以前の再分類フレームワークにシームレスに統合することができます。
大規模な実験により,複数のDG Re-IDベンチマークで高い性能向上が得られた。
この作業のコードは、https://github.com/RikoLi/MUSEで間もなく公開される。
関連論文リスト
- General-Reasoner: Advancing LLM Reasoning Across All Domains [64.70599911897595]
強化学習(RL)は近年,大規模言語モデル(LLM)の推論能力の向上に強い可能性を示している。
本稿では,多分野にわたるLSM推論能力の向上を目的とした,新たなトレーニングパラダイムであるGeneral-Reasonerを提案する。
私たちは一連のモデルをトレーニングし、物理学、化学、金融、電子工学など幅広い分野をカバーする幅広いデータセットでそれらを評価します。
論文 参考訳(メタデータ) (2025-05-20T17:41:33Z) - Aligned Divergent Pathways for Omni-Domain Generalized Person Re-Identification [30.208890289394994]
Person ReIDは、完全に監督され、ドメインが一般化された Person R e ID において著しく進歩している。
本稿では,Omni-Domain Generalization Person ReID(ODG-ReID)を提案する。
提案手法は,ベースアーキテクチャを元のバックボーンのテールをコピーしてマルチブランチ構造に変換する。
論文 参考訳(メタデータ) (2024-10-11T02:36:11Z) - A Unified Deep Semantic Expansion Framework for Domain-Generalized Person Re-identification [30.208890289394994]
本研究は、より実用的なドメイン一般化人再識別(DG-ReID)問題に焦点を当てる。
DG-ReIDにおける有望な研究方向の1つは、暗黙的な深い意味的特徴拡張の利用である。
我々は,DeXなどの暗黙的な深い意味的特徴拡張手法が,大規模な評価ベンチマークにおいてその潜在能力を最大限に発揮できないことを示す。
我々は暗黙的・明示的な意味的特徴拡張技術を統合する新しいフレームワークであるUnified Deep Semantic Expansionを提案する。
論文 参考訳(メタデータ) (2024-10-11T02:15:15Z) - Deep Multimodal Fusion for Generalizable Person Re-identification [15.250738959921872]
DMF(ディープ・マルチモーダル・フュージョン)は、個人再識別タスクの一般的なシナリオのためのディープ・マルチモーダル・フュージョン・ネットワークである。
事前学習段階における特徴表現学習を支援するために、リッチな意味知識が導入される。
実世界の分散アライメントのための事前訓練されたモデルを微調整するために、現実的なデータセットが採用されている。
論文 参考訳(メタデータ) (2022-11-02T07:42:48Z) - META: Mimicking Embedding via oThers' Aggregation for Generalizable
Person Re-identification [68.39849081353704]
Domain Generalizable (DG) Person Re-identification (ReID)は、トレーニング時に対象のドメインデータにアクセスすることなく、見えないドメインをまたいでテストすることを目的としている。
本稿では,DG ReID のための OThers' Aggregation (META) を用いた Mimicking Embedding という新しい手法を提案する。
論文 参考訳(メタデータ) (2021-12-16T08:06:50Z) - Multi-Domain Adversarial Feature Generalization for Person
Re-Identification [52.835955258959785]
マルチデータセット特徴一般化ネットワーク(MMFA-AAE)を提案する。
複数のラベル付きデータセットから普遍的なドメイン不変の特徴表現を学習し、それを見えないカメラシステムに一般化することができる。
また、最先端の教師付き手法や教師なしのドメイン適応手法を大きなマージンで超えている。
論文 参考訳(メタデータ) (2020-11-25T08:03:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。