論文の概要: Parameter-Efficient Vision-Language Adaptation with Continuous Metadata Conditioning for Animal Re-Identification
- arxiv url: http://arxiv.org/abs/2607.09443v1
- Date: Fri, 10 Jul 2026 14:15:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.859379
- Title: Parameter-Efficient Vision-Language Adaptation with Continuous Metadata Conditioning for Animal Re-Identification
- Title(参考訳): 動物再同定のための連続メタデータ条件付きパラメータ効率の良いビジョンランゲージ適応
- Authors: Anil Osman Tur, Tonje Knutsen Sordalen, Kim Tallaksen Halvorsen, Cigdem Beyan,
- Abstract要約: 長期の動物再同定(ReID)は、段階的な形態的変化と季節変化に対して頑健でなければならない。
本稿では,動物ReIDのためのパラメータ効率の高いCLIP適応フレームワークを提案し,メタデータ条件を連続的に設定する機構を提案する。
- 参考スコア(独自算出の注目度): 2.7065664375961274
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Long-term animal re-identification (ReID) must remain robust to gradual morphological evolution and seasonal appearance shifts. Although recent vision-language models provide strong pretrained visual representations, adapting them to longitudinal ecological settings remains challenging, particularly under identity and temporal distribution shifts. We present a parameter-efficient CLIP adaptation framework for animal ReID and introduce a continuous metadata-conditioning mechanism that incorporates numerical attributes directly into the prompt representation during training. While low-rank visual adaptation, prompt-based supervision, and cross-modal alignment provide the adaptation framework, the proposed metadata-conditioning strategy constitutes the primary methodological contribution. By preserving the continuous structure of numerical metadata rather than discretizing it into textual categories, the proposed approach enables smooth modulation of the embedding space during training while maintaining a purely visual inference pipeline. Experiments on a seven-year longitudinal fish dataset and multiple wildlife benchmarks demonstrate improved performance under closed-set, open-set, and time-aware evaluation protocols. The results demonstrate that continuous metadata conditioning improves robustness to longitudinal appearance variation and temporal distribution shifts, while parameter-efficient adaptation enables a purely visual inference pipeline without requiring metadata at test time. Code and evaluation splits can be found at: https://github.com/AnilOsmanTur/MetaPrompt-ReID.
- Abstract(参考訳): 長期の動物再同定(ReID)は、段階的な形態的変化と季節変化に対して頑健でなければならない。
最近の視覚言語モデルは、強い事前訓練された視覚表現を提供するが、特にアイデンティティや時間的分布の変化の下では、それらを縦方向の環境に適応させることは困難である。
本稿では,動物ReIDのためのパラメータ効率の高いCLIP適応フレームワークを提案する。
低ランクな視覚適応、プロンプトベースの監視、モーダルアライメントは適応フレームワークを提供するが、提案したメタデータ条件付け戦略は主要な方法論的貢献を構成する。
数値メタデータの連続的な構造をテキストのカテゴリに分類するのではなく保存することにより,純粋に視覚的な推論パイプラインを維持しつつ,トレーニング中の埋め込み空間のスムーズな調整を可能にする。
閉鎖的,オープン,タイムアウェアな評価プロトコルによる7年間の魚種データセットと複数の野生生物のベンチマーク実験により,その性能が向上した。
その結果, 連続メタデータの条件付けにより, 経時変化や時間分布変化に対する堅牢性が向上し, パラメータ効率の適応により, テスト時にメタデータを必要とせずに, 純粋に視覚的な推論パイプラインを実現することができた。
コードと評価の分割は、https://github.com/AnilOsmanTur/MetaPrompt-ReIDで確認できる。
関連論文リスト
- Gait Recognition with Temporal Kolmogorov-Arnold Networks [24.11167872887211]
歩行認識は、個人をその特徴的な歩行パターンから識別する生体計測モダリティである。
これらの課題に対処するために、歩行認識のための時間的コルモゴロフ・アルノルドネットワーク(TKAN)を導入する。
提案モデルでは,固定エッジ重みを学習可能な1次元関数に置き換え,2レベルメモリ機構を組み込んだ。
論文 参考訳(メタデータ) (2026-04-11T02:28:26Z) - Patch-Level Tokenization with CNN Encoders and Attention for Improved Transformer Time-Series Forecasting [0.0]
本稿では,局所的時間的表現学習をグローバル依存モデルから分離する2段階予測フレームワークを提案する。
畳み込みニューラルネットワークは、固定長の時間的パッチで動作し、短距離時間的ダイナミクスと非線形特徴相互作用を抽出する。
その後、Transformerエンコーダがパッチ間の時間依存性をモデル化し、予測を生成する。
論文 参考訳(メタデータ) (2026-01-18T16:16:01Z) - EvoFormer: Learning Dynamic Graph-Level Representations with Structural and Temporal Bias Correction [16.798673711008906]
動的グラフレベルの埋め込みは、ネットワークの構造的進化を捉えることを目的としている。
既存の手法は、構造的訪問バイアスと急激な進化盲点という、2つの重要かつ未調査の課題に直面している。
動的グラフレベルの表現学習に適した進化対応トランスフォーマーフレームワークであるEvoFormerを提案する。
論文 参考訳(メタデータ) (2025-08-21T09:19:54Z) - MetaWild: A Multimodal Dataset for Animal Re-Identification with Environmental Metadata [12.66570183161988]
本稿では,既存の視覚言語モデル(VLM)に基づくAnimal ReID手法に組み込む軽量モジュールを提案する。
MetaWildの実験では、ベースラインReIDモデルとMFAを組み合わせることでメタデータを組み込むことで、パフォーマンスが一貫して向上することが示された。
論文 参考訳(メタデータ) (2025-01-23T04:14:59Z) - Revisiting Dynamic Evaluation: Online Adaptation for Large Language
Models [88.47454470043552]
我々は、動的評価(動的評価)としても知られる、テスト時の言語モデルのパラメータをオンラインで微調整する問題を考察する。
オンライン適応はパラメータを時間的に変化する状態に変換し、メモリを重み付けしたコンテキスト長拡張の形式を提供する。
論文 参考訳(メタデータ) (2024-03-03T14:03:48Z) - A Poisson-Gamma Dynamic Factor Model with Time-Varying Transition Dynamics [51.147876395589925]
非定常PGDSは、基礎となる遷移行列が時間とともに進化できるように提案されている。
後続シミュレーションを行うために, 完全共役かつ効率的なギブスサンプリング装置を開発した。
実験により,提案した非定常PGDSは,関連するモデルと比較して予測性能が向上することを示した。
論文 参考訳(メタデータ) (2024-02-26T04:39:01Z) - Fast-Slow Test-Time Adaptation for Online Vision-and-Language Navigation [67.18144414660681]
オンラインビジョン・アンド・ランゲージナビゲーション(VLN)のためのFSTTA(Fast-Slow Test-Time Adaptation)アプローチを提案する。
提案手法は,4つのベンチマークにおいて顕著な性能向上を実現する。
論文 参考訳(メタデータ) (2023-11-22T07:47:39Z) - Generalized Face Forgery Detection via Adaptive Learning for Pre-trained Vision Transformer [54.32283739486781]
適応学習パラダイムの下で,textbfForgery-aware textbfAdaptive textbfVision textbfTransformer(FA-ViT)を提案する。
FA-ViTは、クロスデータセット評価において、Celeb-DFおよびDFDCデータセット上で93.83%と78.32%のAUCスコアを達成する。
論文 参考訳(メタデータ) (2023-09-20T06:51:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。