論文の概要: Benchmarking NACTI Species Recognition in Long-Tailed Regimes
- arxiv url: http://arxiv.org/abs/2607.18033v1
- Date: Mon, 20 Jul 2026 15:00:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.668766
- Title: Benchmarking NACTI Species Recognition in Long-Tailed Regimes
- Title(参考訳): 長周期レジームにおけるNACI種分類のベンチマーク
- Abstract要約: 我々は,種識別性能のベンチマークを行うために,ロングテール認識手法の評価を行った。
我々の構成は NACTI テストスプリットにおける最先端の 99.40% Top-1 の精度を達成する。
評価を3つの独立した還元バイアステストセットに拡張する。
- 参考スコア(独自算出の注目度): 7.060604438610721
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As with most ``in the wild'' collections of the natural world, the North America Camera Trap Images (NACTI) dataset exhibits long-tailed class imbalance, with the largest class covering over 50% of its 3.7M images. Building on the PyTorch Wildlife model, we systematically evaluate Long-Tail Recognition (LTR) methodologies to benchmark species recognition performance, including specialised loss functions and LTR-sensitive regularisation. Our optimised configuration achieves state-of-the-art 99.40% Top-1 accuracy on the NACTI test split, significantly outperforming standard baselines and previously reported top performances. To assess robustness under domain shifts (e.g., night-time captures, occlusion, motion-blur), we extend our evaluation across three independent reduced-bias test sets (including ENA-Detection, Caltech Camera Traps and Missouri Camera Traps). Across these out-of-distribution (OOD) evaluations, our LTR-enhanced model consistently demonstrates substantially stronger generalisation capabilities compared to standard cross-entropy approaches. However, qualitative and quantitative analyses underline that current LTR optimisations cannot fully overcome representational bottlenecks, resulting in catastrophic predictive breakdown for rare `Tail' classes under severe domain shift. For maximum reproducibility, all dataset splits, key code, and network weights are published with this paper at https://github.com/ZehuaLiuY/Species-Classification.
- Abstract(参考訳): 自然界の「野生」の多くのコレクションと同様に、北米カメラトラップ画像(NACTI)データセットは、長い尾のクラス不均衡を示し、最大のクラスは3.7M画像の50%以上をカバーしている。
我々は,PyTorch Wildlifeモデルに基づいて,LTR法を,特殊化損失関数やLTR感度正則化を含む種認識性能の指標として体系的に評価した。
我々の最適化された構成は、NACIテストスプリットにおける99.40%のTop-1精度を実現し、標準ベースラインを著しく上回り、これまで報告されたトップパフォーマンスを実現した。
ドメインシフト(例えば、夜間撮影、オクルージョン、モーションブルー)下でのロバスト性を評価するために、我々は3つの独立した縮小バイアステストセット(ENA-Detection、Caltech Camera Traps、ミズーリカメラトラプスを含む)で評価を拡張した。
これらのアウト・オブ・ディストリビューション(OOD)評価全体にわたって、我々のLTR強化モデルは、標準のクロスエントロピーアプローチに比べてはるかに強力な一般化能力を一貫して示している。
しかし、定性的かつ定量的な分析は、現在のLTR最適化が表現上のボトルネックを完全に克服できないことを明確に示しており、結果として、深刻なドメインシフトの下で希少な「Tail」クラスに対する破滅的な予測分解をもたらす。
最大再現性については、すべてのデータセット分割、キーコード、ネットワーク重み付けがhttps://github.com/ZehuaLiuY/Species-Classification.comで公開されている。
関連論文リスト
- Multi-Object Tracking Consistently Improves Wildlife Inference [4.13115026589334]
本研究では,野生生物分類モデルから推定された予測を増大させるため,カメラトラップデータの時間的特性を利用する。
我々は、連続するフレーム間で検出をリンクするために、複数の標準マルチオブジェクト追跡(MOT)モデルを採用する。
融合確率スコアは、ノイズによる誤分類をオーバーライドする単一のコンセンサスクラスラベル推定を生成する。
論文 参考訳(メタデータ) (2026-05-15T22:13:25Z) - Holistic Evaluation and Failure Diagnosis of AI Agents [0.2922148761619506]
本稿では,トップダウン診断とボトムアップスパンレベル評価を組み合わせた総合的エージェント評価フレームワークを提案する。
この分解は任意の長さのトレースにスケールし、各評定に対してスパンレベルの有理数を生成する。
TRAILベンチマークでは、我々のフレームワークはすべてのメトリクスで最先端の結果を得る。
論文 参考訳(メタデータ) (2026-05-14T14:12:39Z) - Long-tailed Species Recognition in the NACTI Wildlife Dataset [7.060604438610721]
North America Camera Trap Imagesデータセットは、非常に長い尾を持つクラスの不均衡を示しています。
NACTIテストデータの分割における最良の設定精度は99.40%である。
最大では、すべてのデータセットの分割、キーコード、および完全なネットワーク重みを公開します。
論文 参考訳(メタデータ) (2025-10-24T17:13:37Z) - Continual Action Quality Assessment via Adaptive Manifold-Aligned Graph Regularization [53.82400605816587]
アクション品質アセスメント(AQA)は、ビデオにおける人間の行動を定量化し、スポーツスコアリング、リハビリテーション、スキル評価の応用を支援する。
大きな課題は、現実世界のシナリオにおける品質分布の非定常的な性質にある。
本稿では,進化する分布を扱うための連続学習機能を備えた連続AQA(Continuous AQA)を紹介する。
論文 参考訳(メタデータ) (2025-10-08T10:09:47Z) - LR0.FM: Low-Res Benchmark and Improving Robustness for Zero-Shot Classification in Foundation Models [15.756916492766372]
視覚言語基礎モデル(FM)は、様々なタスクにまたがる顕著なゼロショットの一般化を示す。
しかし、現実のシナリオでは一般的な課題である低解像度/ピクセル化(LR)画像に対するロバスト性はいまだに未解明のままである。
66個のバックボーンと15個のデータセットにわたる10個のFM(s)のゼロショット分類性能に対する低解像度の影響を評価するベンチマークであるLR0.FMを紹介する。
論文 参考訳(メタデータ) (2025-02-06T10:40:42Z) - Benchmarking Zero-Shot Robustness of Multimodal Foundation Models: A Pilot Study [61.65123150513683]
CLIPのようなマルチモーダル基盤モデルは、最先端のゼロショット結果を生成する。
これらのモデルは、ImageNetでトレーニングされた教師付きモデルのパフォーマンスを一致させることで、ロバスト性ギャップを埋めることが報告されている。
CLIPは、ベンチマーク上の教師付きImageNetモデルと比較して、かなりの堅牢性低下をもたらすことを示す。
論文 参考訳(メタデータ) (2024-03-15T17:33:49Z) - TWINS: A Fine-Tuning Framework for Improved Transferability of
Adversarial Robustness and Generalization [89.54947228958494]
本稿では,様々な分類タスクにおいて,逆向きに事前訓練されたモデルの微調整に焦点を当てる。
本稿では,TWINS(Two-WIng NormliSation)ファインチューニングフレームワークを提案する。
TWINSは、一般化とロバスト性の両方の観点から、幅広い画像分類データセットに有効であることが示されている。
論文 参考訳(メタデータ) (2023-03-20T14:12:55Z) - Open-Set Recognition: A Good Closed-Set Classifier is All You Need [146.6814176602689]
分類器が「ゼロ・オブ・ア・ア・ア・ベ」決定を行う能力は、閉集合クラスにおける精度と高い相関関係があることが示される。
この相関を利用して、閉セット精度を向上させることにより、クロスエントロピーOSR'ベースライン'の性能を向上させる。
また、セマンティックノベルティを検出するタスクをより尊重する新しいベンチマークを構築した。
論文 参考訳(メタデータ) (2021-10-12T17:58:59Z) - Calibrating Class Activation Maps for Long-Tailed Visual Recognition [60.77124328049557]
本稿では,CNNの長期分布からネットワーク学習を改善するための2つの効果的な修正を提案する。
まず,ネットワーク分類器の学習と予測を改善するために,CAMC (Class Activation Map) モジュールを提案する。
第2に,長期化問題における表現学習における正規化分類器の利用について検討する。
論文 参考訳(メタデータ) (2021-08-29T05:45:03Z) - Solving Long-tailed Recognition with Deep Realistic Taxonomic Classifier [68.38233199030908]
ロングテール認識は、現実世界のシナリオにおける自然な非一様分散データに取り組む。
モダンは人口密度の高いクラスではうまく機能するが、そのパフォーマンスはテールクラスでは著しく低下する。
Deep-RTCは、リアリズムと階層的予測を組み合わせたロングテール問題の新しい解法として提案されている。
論文 参考訳(メタデータ) (2020-07-20T05:57:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。