論文の概要: OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation
- arxiv url: http://arxiv.org/abs/2607.27278v2
- Date: Sun, 02 Aug 2026 06:02:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.059465
- Title: OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation
- Title(参考訳): OVEarth-Bench: オープン・ボキャブラリ・アース観測のためのカテゴリブレッドスとクエリ多様性の評価
- Authors: Kaiyu Li, Zepeng Xin, Zixuan Jiang, Jing Fu, Lanxuan Xue, Lingyu Zhang, Xiangyong Cao,
- Abstract要約: オープン語彙地球観測は、固定ラベルセットではなく、自然言語で指定された概念をローカライズすることを目的としている。
OVEarth-Benchは、カテゴリ幅とクエリ多様性の2つの方向に既存の評価を拡張している。
一般的な手法とEO特有の手法を幅広く評価する。
- 参考スコア(独自算出の注目度): 12.245477834565927
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Open-vocabulary Earth observation (EO) aims to localize geospatial concepts specified in natural language rather than a fixed label set. Existing benchmarks, however, usually cover narrow category vocabularies or limited query forms. To fill this gap, we introduce OVEarth-Bench, which extends existing evaluation in two directions: category breadth, through broad hierarchical category coverage with positive and negative expressions, and query diversity, through vocabulary, referring, and reasoning queries. The benchmark supports mask and box localization under a unified zero-shot protocol. We evaluate a broad set of general and EO-specific methods. The evaluation reveals that: (1) the performance of current methods remains limited, while broader category coverage yields more stable model rankings; (2) MLLM-based methods achieve the strongest overall performance; and (3) EO-specific methods generally underperform general models and rarely match the strongest methods. These findings provide guidance for future open-vocabulary EO method design and highlight the importance of developing more realistic, diverse, high-quality, and large-scale benchmarks for reliable evaluation. Our data and evaluation package are released at https://earth-insights.github.io/OVEarth-bench.
- Abstract(参考訳): EO(Open-vocabulary Earth Observation)は、固定ラベルセットではなく、自然言語で指定された地理空間概念をローカライズすることを目的としている。
しかし、既存のベンチマークは通常、狭いカテゴリの語彙や限られたクエリフォームをカバーする。
このギャップを埋めるために、OVEarth-Benchを導入し、カテゴリ幅、正と負の表現を持つ広範囲階層のカテゴリカバレッジ、クエリの多様性、語彙、参照、推論クエリの2つの方向に既存の評価を拡張した。
ベンチマークでは、マスクとボックスのローカライゼーションを統一されたゼロショットプロトコルでサポートしている。
一般的な手法とEO特有の手法を幅広く評価する。
評価の結果,(1) 従来の手法の性能は限定的であり,(2) より広範なカテゴリーのカバレッジはより安定したモデルランキングを得る,(2) MLLM に基づく手法は最も高い総合的な性能を達成する,(3) 一般的にはEO 固有の手法は性能が低く,最強の手法とほとんど一致しない,といった結果が得られた。
これらの知見は,将来的なオープン語彙EO手法設計の指針を提供し,信頼性評価のための,より現実的で多様性があり,高品質で大規模なベンチマークを開発することの重要性を強調している。
データと評価パッケージはhttps://earth-insights.github.io/OVEarth-bench.orgで公開されています。
関連論文リスト
- Uncovering Competency Gaps in Large Language Models and Their Benchmarks [11.572508874955659]
本稿では,スパースオートエンコーダ(SAE)を用いて,両方のギャップを自動的に発見する手法を提案する。
我々は、モデルが、サイコファンティックな振る舞いとは対照的な概念に一貫して劣っていることを発見した。
提案手法は,ベンチマークスコアの概念レベルの分解を可能にするため,評価のための表現的アプローチを提供する。
論文 参考訳(メタデータ) (2025-12-06T17:39:47Z) - SEOE: A Scalable and Reliable Semantic Evaluation Framework for Open Domain Event Detection [70.23196257213829]
オープンドメインイベント検出のためのスケーラブルで信頼性の高いセマンティックレベルの評価フレームワークを提案する。
提案フレームワークはまず,現在7つの主要ドメインをカバーする564のイベントタイプを含む,スケーラブルな評価ベンチマークを構築した。
次に,大言語モデル(LLM)を自動評価エージェントとして活用し,意味的類似ラベルのきめ細かい定義を取り入れた意味的F1スコアを計算する。
論文 参考訳(メタデータ) (2025-03-05T09:37:05Z) - GLEAN: Generalized Category Discovery with Diverse and Quality-Enhanced LLM Feedback [13.969403782532957]
Generalized Category Discovery (GCD)は、ラベルなしデータの既知のカテゴリと新しいカテゴリの両方を認識することを目的としている。
従来のGCD手法では、紛らわしいインスタンスのエラーの修正が困難であるなど、重大な課題に直面していた。
一般化されたカテゴリ発見のための統一的なフレームワークであるGLEANを提案する。
論文 参考訳(メタデータ) (2025-02-25T18:11:37Z) - A Close Look at Decomposition-based XAI-Methods for Transformer Language Models [12.51070801823624]
XAIアトリビューション手法は近年,トランスフォーマーアーキテクチャのために提案されている。
我々は最近提案された AttnLRP 変種を含むALTI-Logit 法と LRP 法を比較し拡張する。
言語モデルやコードに対する属性を評価するために、慎重に構築されたベンチマークデータセットを公開しています。
論文 参考訳(メタデータ) (2025-02-21T19:09:40Z) - Hierarchical Indexing for Retrieval-Augmented Opinion Summarization [60.5923941324953]
本稿では,抽出アプローチの帰属性と拡張性と,大規模言語モデル(LLM)の一貫性と拡散性を組み合わせた,教師なし抽象的意見要約手法を提案する。
我々の方法であるHIROは、意味的に整理された離散的な階層を通して文を経路にマッピングするインデックス構造を学習する。
推測時にインデックスを投入し、入力レビューから人気意見を含む文群を識別し、検索する。
論文 参考訳(メタデータ) (2024-03-01T10:38:07Z) - Entity Disambiguation with Entity Definitions [50.01142092276296]
ローカルモデルはEntity Disambiguation (ED)で最近驚くべきパフォーマンスを達成した
それまでの研究は、各候補者のテキスト表現として、ウィキペディアのタイトルのみを使うことに限られていた。
本稿では、この制限に対処し、より表現力のあるテキスト表現がそれを緩和できる範囲について検討する。
提案する6つのベンチマークのうち2つに新たな技術の現状を報告し,未知のパターンに対する一般化能力を強く改善する。
論文 参考訳(メタデータ) (2022-10-11T17:46:28Z) - UnifieR: A Unified Retriever for Large-Scale Retrieval [84.61239936314597]
大規模な検索は、クエリを与えられた巨大なコレクションから関連ドキュメントをリコールすることである。
事前学習型言語モデル(PLM)に基づく最近の検索手法は,高密度ベクターあるいはレキシコンに基づくパラダイムに大別することができる。
本論文では,高密度ベクトルとレキシコンに基づく検索を2つの表現能力を持つ1つのモデルで統合する学習フレームワークUnifieRを提案する。
論文 参考訳(メタデータ) (2022-05-23T11:01:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。