論文の概要: SAGE: A sampling-aware global evaluation benchmark for species distribution modeling
- arxiv url: http://arxiv.org/abs/2609.31082v1
- Date: Fri, 25 Sep 2026 10:23:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.337173
- Title: SAGE: A sampling-aware global evaluation benchmark for species distribution modeling
- Title(参考訳): SAGE: 種分布モデリングのためのサンプリング対応グローバル評価ベンチマーク
- Abstract要約: 種分布モデル(SDM)は、種の観察と環境条件を結びつけ、それらの空間分布を推定する。
DeepSDMは何千もの種を共同でモデル化し、何億ものコミュニティ科学記録を作成した。
平均的な性能は、特に稀な種に対して、かなりの種レベルの変動を隠蔽する。
SAGEベンチマークは、トレーニング用GBIFレコードとsPlotOpen植生プロットを組み合わせることで、5771種の植物において存在・存在評価を行う。
- 参考スコア(独自算出の注目度): 17.75241418045877
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Knowing where species occur is fundamental for biodiversity research and conservation. Species distribution models (SDMs) link species observations to environmental conditions to estimate their spatial distribution. However, accuracy varies with the underlying data and models, making it essential to know for which species models can be trusted. Deep-learning-based SDMs ("DeepSDMs") now jointly model thousands of species, drawing on hundreds of millions of community-science records. At this scale, averaging performance hides substantial species-level variability, particularly for rare species, often of greatest conservation concern. Records are also strongly biased, making occurrence counts misleading. Accounting for these factors is essential for a reliable and informative evaluation of multi-species SDMs. Here, we introduce a Sampling-Aware Global Evaluation (SAGE) benchmark, combining GBIF records for training with sPlotOpen vegetation plots for presence-absence evaluation across 5771 plant species. We propose an evaluation framework that groups species based on two properties, sampling effort and relative prevalence, which describe how densely a species' range is sampled and how frequently the species is recorded. Evaluating single-species SDMs and multi-species DeepSDMs, we find that Random Forests and DeepSDMs perform best overall, but neither dominates: DeepSDMs outperform single-species SDMs for infrequently recorded species while offering no consistent advantage for well-sampled ones. Crucially, this advantage emerges only when established bias-correction practices, such as spatial thinning and reweighting, are carried over to the deep-learning setting. SAGE helps identify the species and data conditions for which a given approach is beneficial, thereby supporting the development of more transparent and ecologically credible SDMs. Data and code: https://earens.github.io/sage/
- Abstract(参考訳): 生物多様性の研究と保全には、種がどこで起こるかを知ることが不可欠である。
種分布モデル(SDM)は、種の観察と環境条件を結びつけ、それらの空間分布を推定する。
しかし、精度は基礎となるデータやモデルによって異なり、どの種が信頼できるかを知ることが不可欠である。
深層学習に基づくSDM("DeepSDMs")は現在、何千もの種を共同でモデル化し、数億のコミュニティサイエンス記録を描いている。
このスケールでは、平均的な性能は、特に希少種にとって、しばしば最大の保全上の懸念から、かなりの種レベルの変動を隠蔽する。
レコードにもバイアスが強く、発生回数を誤解させる。
複数種のSDMの信頼性および情報的評価には,これらの要因のアカウンティングが不可欠である。
本稿では,SAGE(Sampring-Aware Global Evaluation)ベンチマークを導入し,訓練用GBIFレコードとsPlotOpen植生プロットを組み合わせることにより,5771種の植物において存在・存在・存在評価を行う。
本研究では,2つの特性に基づいて種を分類する評価枠組みを提案する。
単種のSDMと多種のDeepSDMを評価すると、ランダムフォレストとDeepSDMは全体としては最高に機能するが、どちらも優位ではない。
重要なことに、この優位性は、空間的薄めや重み付けのような確立されたバイアス補正のプラクティスがディープラーニング環境に引き継がれる場合にのみ現れる。
SAGEは、特定のアプローチが有用である種やデータ条件を特定するのに役立ち、より透明で生態学的に信頼できるSDMの開発を支援する。
データとコード:https://earens.github.io/sage/
関連論文リスト
- CISO: Species Distribution Modeling Conditioned on Incomplete Species Observations [31.010868781061006]
種分布モデル(SDM)は、種の地理的分布を予測するために広く用いられている。
CSISは、不完全種観測に基づく種分布モデリングのための深層学習に基づく手法である。
我々は,異なる種群を表す3つのデータセットを用いたアプローチを実証した。植物のためのsOpen,鳥類のためのSatBird,蝶のためのSatButterfly。
論文 参考訳(メタデータ) (2025-08-08T21:15:12Z) - Heterogeneous graph neural networks for species distribution modeling [6.423278804632857]
グラフニューラルネットワーク(GNN)を用いた新しい存在のみの種分布モデル(SDM)を提案する。
本モデルでは, 種と位置を2つの異なるノード集合として扱い, 学習課題は, 位置と種をつなぐエッジとして検出記録を予測している。
SDMのベンチマークのためのNational Center for Ecological Analysis and Synthesis (NCEAS) によってコンパイルされた6領域データセット上で,本手法の可能性を評価する。
論文 参考訳(メタデータ) (2025-03-14T22:08:30Z) - Feedforward Few-shot Species Range Estimation [61.60698161072356]
特定の種が地球上でどこで発見できるかを知ることは、生態学の研究と保全に不可欠である。
正確な射程推定は 知られている全ての種の 比較的小さな割合でしか 利用できない
我々は、限られたデータから種の範囲を正確に推定するという課題に対処するために、数発の種範囲推定の新しいアプローチを概説する。
論文 参考訳(メタデータ) (2025-02-20T19:13:29Z) - Combining Observational Data and Language for Species Range Estimation [63.65684199946094]
我々は,数百万の市民科学種の観察とウィキペディアのテキスト記述を組み合わせた新しいアプローチを提案する。
我々のフレームワークは、場所、種、テキスト記述を共通空間にマッピングし、テキスト記述からゼロショット範囲の推定を可能にする。
また,本手法は観測データと組み合わせることで,少ないデータでより正確な距離推定を行うことができる。
論文 参考訳(メタデータ) (2024-10-14T17:22:55Z) - LD-SDM: Language-Driven Hierarchical Species Distribution Modeling [22.120764293663935]
本稿では,大規模言語モデルを用いて,テキストのプロンプトから分類学分類の潜在表現を抽出する。
これにより、追加の監督なしに、目に見えない種を含むあらゆる分類学的ランクの範囲をマップできる。
また,種分布モデルの評価に適した近接認識評価指標を提案する。
論文 参考訳(メタデータ) (2023-12-13T18:11:37Z) - SatBird: Bird Species Distribution Modeling with Remote Sensing and
Citizen Science Data [68.2366021016172]
本稿では,市民科学データベース eBird の観測データから得られたラベルを用いた,米国内の位置情報のサテライトデータセットである SatBird について述べる。
ケニアでは低データのレシエーションを表すデータセットも提供しています。
リモートセンシングタスクのためのSOTAモデルを含む、データセットのベースラインセットをベンチマークします。
論文 参考訳(メタデータ) (2023-11-02T02:00:27Z) - Spatial Implicit Neural Representations for Global-Scale Species Mapping [72.92028508757281]
ある種が観察された場所の集合を考えると、その種がどこにいても存在しないかを予測するためのモデルを構築することが目的である。
従来の手法は、新たな大規模クラウドソースデータセットを活用するのに苦労している。
本研究では,47k種の地理的範囲を同時に推定するために,空間入射ニューラル表現(SINR)を用いる。
論文 参考訳(メタデータ) (2023-06-05T03:36:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。