論文の概要: Promptable Animal Pose Tracking Across Species
- arxiv url: http://arxiv.org/abs/2608.04995v1
- Date: Wed, 05 Aug 2026 16:04:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.980934
- Title: Promptable Animal Pose Tracking Across Species
- Title(参考訳): 絶滅危惧種を追尾する野生動物
- Authors: Le Li, Daniela Ivanova, Nicolas Pugeault,
- Abstract要約: 動物のポーズ推定と追跡は野生生物のモニタリングと保護研究にとって重要である。
大規模データセットでトレーニングされた視覚基盤モデルは,限られたラベル付きデータを用いて動物のポーズを追跡するのに有効であることを示す。
ビデオ中のユーザ選択キーポイントを追跡するために,教師なしと教師なしの2つのモデルを提案する。
- 参考スコア(独自算出の注目度): 6.856674886457795
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Animal pose estimation and tracking is important for wildlife monitoring and conservation research, and with limited expert time for labelling automated approaches are imperative. While human pose estimation and tracking has seen rapid progress thanks to large annotated datasets, animal pose remain challenging, due to large morphological and behavioural differences between species and limited annotated data. Existing approaches either optimise generic keypoint localisation from annotated datasets (such as APTv2) with poor generalisation, or track custom keypoints using visual tracking, at the cost of performance. In this paper, we demonstrate that vision foundation models trained on large datasets can be used effectively to track animal pose with limited labelled data. We propose two models, one unsupervised and the other supervised, to track user-selected keypoints in videos. The supervised approach delivers superior tracking accuracy by employing a keypoint prompt encoder to explicitly inject structural priors from a reference frame into feature matching. In parallel, the unsupervised route provides strong cross-species robustness by leveraging diverse foundation-model features for training-free correspondence matching. Extensive evaluation on challenging animal video benchmarks APTv2 and TigDog demonstrates that our framework achieves strong performance while maintaining an effective balance between accuracy and generalisation, offering a practical solution for real-world animal behaviour analysis and conservation applications.
- Abstract(参考訳): 動物のポーズ推定と追跡は野生生物のモニタリングと保護研究にとって重要であり、自動化アプローチのラベル付けに要する期間は限られている。
ヒトのポーズ推定と追跡は、大きなアノテートデータセットのおかげで急速に進歩しているが、種と限られたアノテートデータの間に大きな形態的・行動的な違いがあるため、動物のポーズは依然として困難である。
既存のアプローチでは、アノテーション付きデータセット(APTv2など)からの一般的なキーポイントのローカライゼーションを、一般化の貧弱さで最適化するか、視覚的トラッキングを使用してカスタムキーポイントをパフォーマンスの犠牲で追跡する。
本稿では,大規模なデータセットで訓練された視覚基盤モデルを用いて,限られたラベル付きデータを用いて動物のポーズを効果的に追跡できることを実証する。
ビデオ中のユーザ選択キーポイントを追跡するために,教師なしと教師なしの2つのモデルを提案する。
教師付きアプローチは、キーポイントプロンプトエンコーダを使用して、参照フレームから特徴マッチングに構造的事前を明示的に注入することで、より優れたトラッキング精度を提供する。
並行して、教師なし経路は、トレーニング不要の対応マッチングに多様な基礎モデル特徴を活用することにより、強力なクロススペックロバスト性を提供する。
APTv2 と TigDog による動物ビデオベンチマークの大規模評価は,本フレームワークが精度と一般化の効果的なバランスを維持しつつ高い性能を達成し,実世界の動物行動解析・保存の実践的ソリューションを提供することを示す。
関連論文リスト
- Benchmarking pig detection and tracking under diverse and challenging conditions [1.865175170209582]
オブジェクト検出のためのPigDetectと、マルチオブジェクト追跡のためのPigTrackの2つのデータセットをキュレートした。
対象物検出では,ランダムなサンプル画像のみを用いて達成可能なものよりも,困難なトレーニング画像により検出が向上することを示す。
マルチオブジェクト追跡において,SORTに基づく手法は,エンドツーエンドのトレーニング可能なモデルに比べて優れた検出性能が得られることを示した。
論文 参考訳(メタデータ) (2025-07-22T14:36:51Z) - Consistent multi-animal pose estimation in cattle using dynamic Kalman filter based tracking [0.0]
KeySORTは、トラックレットをバウンディングボックスフリーで構築するための適応カルマンフィルタであり、検出されたキーポイントの時間的一貫性を著しく向上する。
実験結果から,提案アルゴリズムは,精度の高い真理キーポイントの最大80%を検出できることがわかった。
論文 参考訳(メタデータ) (2025-03-13T15:15:54Z) - Self-Training with Pseudo-Label Scorer for Aspect Sentiment Quad Prediction [54.23208041792073]
Aspect Sentiment Quad Prediction (ASQP) は、与えられたレビューに対して全てのクワッド(アスペクト項、アスペクトカテゴリー、意見項、感情極性)を予測することを目的としている。
ASQPタスクにおける重要な課題はラベル付きデータの不足であり、既存のメソッドのパフォーマンスを制限している。
そこで我々は,擬似ラベルスコアラーを用いた自己学習フレームワークを提案し,レビューと擬似ラベルの一致をスコアラーが評価する。
論文 参考訳(メタデータ) (2024-06-26T05:30:21Z) - AnimalFormer: Multimodal Vision Framework for Behavior-based Precision Livestock Farming [0.0]
精密畜産のためのマルチモーダルビジョン・フレームワークを提案する。
我々は、GroundingDINO、HQSAM、ViTPoseモデルのパワーを利用する。
このスイートは、侵入的な動物タグ付けをすることなく、ビデオデータから包括的な行動分析を可能にする。
論文 参考訳(メタデータ) (2024-06-14T04:42:44Z) - RTracker: Recoverable Tracking via PN Tree Structured Memory [71.05904715104411]
本稿では,木構造メモリを用いてトラッカーと検出器を動的に関連付け,自己回復を可能にするRTrackerを提案する。
具体的には,正負と負のターゲットサンプルを時系列に保存し,維持する正負のツリー構造メモリを提案する。
我々の中核となる考え方は、正と負の目標カテゴリーの支持サンプルを用いて、目標損失の信頼性評価のための相対的距離に基づく基準を確立することである。
論文 参考訳(メタデータ) (2024-03-28T08:54:40Z) - APTv2: Benchmarking Animal Pose Estimation and Tracking with a
Large-scale Dataset and Beyond [27.50166679588048]
APTv2は動物のポーズ推定と追跡のための大規模ベンチマークのパイオニアである。
ビデオクリップは2,749本で、30種の動物から抽出・収集されている。
我々は,84,611種の動物インスタンスに対して高品質なキーポイントと追跡アノテーションを提供する。
論文 参考訳(メタデータ) (2023-12-25T04:49:49Z) - SuperAnimal pretrained pose estimation models for behavioral analysis [42.206265576708255]
行動の定量化は神経科学、獣医学、動物保護活動など様々な応用において重要である。
我々は、SuperAnimalと呼ばれる新しい手法で統一基盤モデルを開発するための一連の技術革新を提案する。
論文 参考訳(メタデータ) (2022-03-14T18:46:57Z) - Pretrained equivariant features improve unsupervised landmark discovery [69.02115180674885]
我々は、この課題を克服する2段階の教師なしアプローチを、強力なピクセルベースの特徴を初めて学習することによって定式化する。
本手法は,いくつかの難解なランドマーク検出データセットにおいて最先端の結果を生成する。
論文 参考訳(メタデータ) (2021-04-07T05:42:11Z) - Semi-Automatic Data Annotation guided by Feature Space Projection [117.9296191012968]
本稿では,適切な特徴空間投影と半教師付きラベル推定に基づく半自動データアノテーション手法を提案する。
MNISTデータセットとヒト腸内寄生虫の胎児不純物の有無による画像を用いて本手法の有効性を検証した。
この結果から,人間と機械の相補的能力を組み合わせた視覚分析ツールの付加価値が,より効果的な機械学習に有効であることが示唆された。
論文 参考訳(メタデータ) (2020-07-27T17:03:50Z) - Unsupervised Deep Representation Learning for Real-Time Tracking [137.69689503237893]
視覚追跡のための教師なし学習手法を提案する。
教師なし学習の動機は、ロバストなトラッカーが双方向トラッキングに有効であるべきだということです。
我々は,シームズ相関フィルタネットワーク上にフレームワークを構築し,教師なし学習を容易にするために,多フレーム検証方式とコスト感受性損失を提案する。
論文 参考訳(メタデータ) (2020-07-22T08:23:12Z) - TAO: A Large-Scale Benchmark for Tracking Any Object [95.87310116010185]
オブジェクトのデータセットの追跡は2,907本の高解像度ビデオで構成され、平均で30分の長さの多様な環境でキャプチャされる。
ビデオの任意の時点で移動するオブジェクトにアノテータにラベルを付け、ファクトラムの後に名前を付けるように求めます。
我々の語彙は、既存の追跡データセットと著しく大きく、質的に異なる。
論文 参考訳(メタデータ) (2020-05-20T21:07:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。