論文の概要: Who Remains, What Changes: Identity Anchored Composed Gait Retrieval
- arxiv url: http://arxiv.org/abs/2608.26632v1
- Date: Thu, 27 Aug 2026 05:41:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.249119
- Title: Who Remains, What Changes: Identity Anchored Composed Gait Retrieval
- Title(参考訳): 誰が残るのか: アイデンティティアンコレートされたゲイト検索
- Authors: Jingchen Fei, Zengbin Wang, Yukun Liu, Muyi Sun, Shibiao Xu, Man Zhang,
- Abstract要約: 本稿では、参照シーケンスと自然言語修正クエリに基づいて目標歩行シーケンスを検索する新しいタスクであるComposeed Gait Retrieval(CoGR)を紹介する。
このタスクに既存のデータセットが存在しないことを解決するため、大規模な視覚言語モデル(VLM)を利用した自動アノテーションパイプラインを設計する。
これに基づいて,汎用的な合成検索が指示に従うが,誤った人物を返す場合に生じるアイデンティティのドリフトを防止するために設計された,アイデンティティアンコレートな合成フレームワークであるComposeGaitを提案する。
- 参考スコア(独自算出の注目度): 26.227377356360506
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Gait recognition has achieved remarkable progress, yet existing methods remain confined to rigid visual matching and often overlook the potential of natural language instructions for interactive retrieval. In this paper, we introduce Composed Gait Retrieval (CoGR), a novel task that retrieves a target gait sequence based on a reference sequence and a natural language modification query. To address the absence of existing datasets for this task, we design an automated annotation pipeline powered by large vision-language models (VLMs) to construct the first gait-language datasets: Language-Augmented CCPG and Language-Augmented CASIA-B. Building on this, we propose ComposeGait, an identity-anchored composition framework designed to prevent the identity drift that arises when generic composed retrieval follows the instruction but returns the wrong person. Its Part-aware Identity Adapter (PIA) aggregates multi-frame, part-aware identity evidence into a sample-specific ID token. We inject the ID tokens into both branches of a shared Q-Former to preserve identity, while excluding the ID-token outputs from the final retrieval embeddings. Joint identity and task-adapted composed-retrieval objectives optimize this space end to end. We evaluate ComposeGait on both benchmarks and show that it achieves the best R@1 among the compared methods, reaching 72.38% on Language-Augmented CCPG and 83.61% on Language-Augmented CASIA-B. These results establish ComposeGait as a strong baseline for CoGR. The datasets and code will be made publicly available.
- Abstract(参考訳): 歩行認識は目覚ましい進歩を遂げているが、既存の手法は厳密な視覚マッチングに限られており、対話的検索のための自然言語命令の可能性を見落としていることが多い。
本稿では、参照シーケンスと自然言語修正クエリに基づいて目標歩行シーケンスを検索する新しいタスクであるComposeed Gait Retrieval(CoGR)を紹介する。
このタスクに既存のデータセットが存在しないことを解決するため、我々は大規模な視覚言語モデル(VLM)を利用した自動アノテーションパイプラインを設計し、最初の歩行言語データセットであるLanguage-Augmented CCPGとLanguage-Augmented CASIA-Bを構築した。
これに基づいて,汎用的な合成検索が指示に従うが,誤った人物を返す場合に生じるアイデンティティのドリフトを防止するために設計された,アイデンティティアンコレッドな合成フレームワークであるComposeGaitを提案する。
そのPart-aware Identity Adapter (PIA)は、多フレームのPart-aware Identity evidenceをサンプル固有のIDトークンに集約する。
共有Q-Formerの両ブランチにIDトークンを注入してIDを保存し、最終的な検索埋め込みからのIDトークン出力を除外する。
共同アイデンティティとタスク適応型合成検索目的は、この空間の終端を最適化する。
両ベンチマークでComposeGaitを評価し,言語拡張CCPGでは72.38%,言語拡張CASIA-Bでは83.61%に達した。
これらの結果はCoGRの強力なベースラインとしてComposeGaitを確立した。
データセットとコードは公開されます。
関連論文リスト
- TopoGR: Revealing and Preserving Latent Structure of Semantic ID in Generative Recommendation [25.345503799250476]
TopoGRはBit-decomposable Semantic ID(バイナリSID)に基づくトポロジー保存型生成レコメンデーションフレームワークである
TopoGRは、レコメンデーションパフォーマンスにおいて、既存の最先端のベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-07-28T02:45:33Z) - Beyond Semantic IDs: Encoding Business-Value Ranking into Document Identifiers for Generative Retrieval [28.485766948414206]
Generative Retrieval (GR) は、シーケンシャル・ツー・シーケンス生成タスクとして検索を定式化し、各ドキュメントにドキュメント識別子(DocID)を割り当て、自動回帰復号による検索を行う。
離散表現学習に基づく既存のスキームは、固有の衝突問題に悩まされる。
本稿では、DocIDをセマンティッククラスタリングとビジネス価値ランキングに分離し、衝突のない識別子を生成するCRID(Cluster-Ranked Identifier)を提案する。
論文 参考訳(メタデータ) (2026-07-13T10:57:20Z) - Conditional Memory Enhanced Item Representation for Generative Recommendation [46.59623438612085]
ジェネレーティブレコメンデーション(GR)は,セマンティック識別子(SID)の自動生成によって対象項目を予測する,有望なパラダイムとして登場した。
ほとんどのGRメソッドは量子化表現生成パイプラインに従い、まず各項目にSIDを割り当て、次にSID-token埋め込みから入力表現を構築し、最後に自動回帰生成によってターゲットのSIDを予測する。
コンディショナルメモリ拡張アイテム表現フレームワークであるCometIRを提案する。このフレームワークは、アイテム認識入力へのSIDトークンの埋め込みを再構築し、SID復号時にトークンの粒度を復元する。
論文 参考訳(メタデータ) (2026-05-12T02:56:59Z) - ZeroGR: A Generalizable and Scalable Framework for Zero-Shot Generative Retrieval [125.19156877994612]
生成検索(GR)は、情報検索(IR)を文書識別子(ドシデント)の生成としてフレーミングすることによって再構成する
我々は、自然言語命令を利用して幅広いIRタスクにわたってGRを拡張するゼロショット生成検索フレームワークであるtextscZeroGRを提案する。
具体的には、textscZeroGRは、3つのキーコンポーネントで構成されている: (i)不均一な文書を意味的に意味のあるドシデントに統一するLMベースのドシデントジェネレータ; (ii)自然言語タスク記述から様々なタイプのクエリを生成し、拡張する命令チューニングクエリジェネレータ。
論文 参考訳(メタデータ) (2025-10-12T03:04:24Z) - SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs [70.79124435220695]
セマンティック強化型Cross-mOdal Retrievalフレームワーク(SemCORE)を提案する。
まず,自然言語の理解と生成に最適化された生成モデルとターゲット識別子を効果的に整合させる構造化自然言語識別器(SID)を構築した。
次に、粒度の細かいターゲット識別を可能にするジェネレーティブ・セマンティック・検証(GSV)戦略を導入する。
論文 参考訳(メタデータ) (2025-04-17T17:59:27Z) - Knowledge Graph Completion with Relation-Aware Anchor Enhancement [50.50944396454757]
関係認識型アンカー強化知識グラフ補完法(RAA-KGC)を提案する。
まず、ヘッダーのリレーショナル・アウェア・エリア内でアンカー・エンティティを生成します。
次に、アンカーの近傍に埋め込まれたクエリを引っ張ることで、ターゲットのエンティティマッチングに対してより差別的になるように調整する。
論文 参考訳(メタデータ) (2025-04-08T15:22:08Z) - Order-agnostic Identifier for Large Language Model-based Generative Recommendation [94.37662915542603]
アイテムは、ユーザ履歴をエンコードし、次のアイテムを生成するために、LLM(Large Language Models)の識別子に割り当てられる。
既存のアプローチでは、トークンシーケンス識別子を使用して、アイテムを個別のトークンシーケンスとして表現するか、IDまたはセマンティック埋め込みを使用して単一トークン識別子を使用する。
本稿では,セマンティック・トークンライザを利用するSETRecを提案する。
論文 参考訳(メタデータ) (2025-02-15T15:25:38Z) - CART: A Generative Cross-Modal Retrieval Framework with Coarse-To-Fine Semantic Modeling [53.97609687516371]
クロスモーダル検索は、異なるモーダルデータの相互作用を通じて、クエリと意味的に関連するインスタンスを検索することを目的としている。
従来のソリューションでは、クエリと候補の間のスコアを明示的に計算するために、シングルトウワーまたはデュアルトウワーのフレームワークを使用している。
粗大なセマンティックモデリングに基づく生成的クロスモーダル検索フレームワーク(CART)を提案する。
論文 参考訳(メタデータ) (2024-06-25T12:47:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。