論文の概要: Geospatial Metadata Improves Discoverability by Connecting Datasets Across Scientific Disciplines
- arxiv url: http://arxiv.org/abs/2609.16498v2
- Date: Wed, 16 Sep 2026 12:15:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.427288
- Title: Geospatial Metadata Improves Discoverability by Connecting Datasets Across Scientific Disciplines
- Title(参考訳): 地理空間メタデータは科学分野にまたがってデータセットを接続することで発見可能性を改善する
- Abstract要約: Harvard Dataverseのデータセットを使って、小さな言語モデルをトレーニングし、微調整します。
メタデータが不足しているデータセットは、下流からの引用が少なく、他のデータセットへの解決可能な接続も少ないことが分かりました。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Research data repositories are essential infrastructure for scientific inquiry and for ensuring that datasets follow FAIR (Findable, Accessible, Interoperable, and Reusable) principles. However, repository reuse depends on the quality and completeness of geospatial and thematic metadata, which researchers generally provide voluntarily. Given limited curation resources, it is unsurprising that even Harvard Dataverse, the world's largest general-purpose research repository, contains many incomplete metadata records. Missing fields represent lost information and reduce interoperability. We find that datasets with more missing metadata receive fewer downstream citations and have fewer resolvable connections to other datasets. The implications are particularly important for geospatial datasets: only 0.3% of research datasets include a bounding box, and most represent archival points rather than complete geographic shapes. Our analysis shows that geospatial metadata helps connect concepts across disciplines. After embedding Harvard Dataverse datasets in a metadata knowledge graph, we find that datasets are twice as likely to connect across scientific disciplines through shared geospatial metadata as through keywords. This suggests that geographic metadata is a more reliable basis for cross-disciplinary interoperability than keyword vocabularies, which often remain discipline-specific. We train and fine-tune a small language model using datasets from Harvard Dataverse. Through geospatial metadata enrichment, we increase the share of datasets from different disciplines connected through metadata elements from 58.5% to 63.2%.
- Abstract(参考訳): 研究データリポジトリは、科学的調査とデータセットがFAIR(Findable、Accessible、Interoperable、Reusable)の原則に従うことを保証するための重要な基盤である。
しかし,レポジトリの再利用は地理空間的メタデータとテーマ的メタデータの品質と完全性に依存し,研究者が自発的に提供している。
キュレーション資源が限られていることを考えると、世界最大の汎用研究レポジトリであるHarvard Dataverseでさえ、多くの不完全なメタデータ記録を含んでいることは驚くにあたらない。
失われたフィールドは、失われた情報を表し、相互運用性を減らします。
メタデータが不足しているデータセットは、下流からの引用が少なく、他のデータセットへの解決可能な接続も少ないことが分かりました。
地理空間的データセットには特に重要な意味があり、研究データセットのわずか0.3%に境界ボックスが含まれており、そのほとんどは完全な地理的形状ではなく、考古学的な点を表している。
我々の分析によると、地理空間メタデータは、分野をまたいだ概念を結びつけるのに役立つ。
メタデータ知識グラフにHarvard Dataverseデータセットを埋め込んだ結果、データセットは、キーワードと同じように地理空間メタデータを共有することによって、科学分野にまたがる2倍の確率で接続できることがわかった。
これは、地理的メタデータが、しばしば規律に特有なキーワード語彙よりも、学際的相互運用の信頼性の高い基盤であることを示唆している。
Harvard Dataverseのデータセットを使って、小さな言語モデルをトレーニングし、微調整します。
地理空間メタデータの豊か化を通じて、メタデータ要素を介して接続された異なる分野からのデータセットのシェアを58.5%から63.2%に増やす。
関連論文リスト
- Geospatial AI, Dataverse Metadata, and the Study of Place-Based Government [0.0]
リポジトリの公開データとメタデータから知識グラフを構築します。
102,650のデータセットのうち43,991 人 (42.9%) が少なくとも1つの地理空間場を持っている。
保守的なキーワード検索は、地理的にタグ付けされたデータセット7,654を直接ポリシー関連であると識別する。
論文 参考訳(メタデータ) (2026-09-10T15:08:58Z) - Eye-Tracking-while-Reading: A Living Survey of Datasets with Open Library Support [5.162965495020878]
視線追跡時コーパスは多くの異なる分野において貴重な資源である。
既存のデータセットに関して、透明性と明確性の向上を目指しています。
論文 参考訳(メタデータ) (2026-02-23T08:40:50Z) - Multi-Disciplinary Dataset Discovery from Citation-Verified Literature Contexts [0.0]
本稿では,学術論文の引用文脈からデータセットを抽出する文献駆動フレームワークを提案する。
提案手法は,大規模引用コンテキスト抽出,スキーマ誘導型データセット認識,証明保存エンティティ解決を併用する。
コード、評価データセット、結果はGitHubで公開しています。
論文 参考訳(メタデータ) (2026-01-08T16:46:06Z) - EarthView: A Large Scale Remote Sensing Dataset for Self-Supervision [72.84868704100595]
本稿では,地球モニタリングタスクにおける深層学習アプリケーションを強化することを目的とした,リモートセンシングデータの自己監督を目的としたデータセットを提案する。
このデータセットは15テラピクセルのグローバルリモートセンシングデータにまたがっており、NEON、Sentinel、Satellogicによる1mの空間解像度データの新たなリリースなど、さまざまなソースの画像を組み合わせている。
このデータセットは、リモートセンシングデータの異なる課題に取り組むために開発されたMasked Autoencoderである。
論文 参考訳(メタデータ) (2025-01-14T13:42:22Z) - Putting Data at the Centre of Offline Multi-Agent Reinforcement Learning [3.623224034411137]
オフラインマルチエージェント強化学習(英語: offline multi-agent reinforcement learning, MARL)は、静的データセットを用いてマルチエージェントシステムの最適制御ポリシーを見つける研究のエキサイティングな方向である。
この分野は定義上はデータ駆動型だが、これまでのところ、最先端の結果を達成するための努力は、データを無視してきた。
研究の大部分は、一貫した方法論を使わずに独自のデータセットを生成し、これらのデータセットの特徴に関するまばらな情報を提供する。
論文 参考訳(メタデータ) (2024-09-18T14:13:24Z) - UniTraj: A Unified Framework for Scalable Vehicle Trajectory Prediction [93.77809355002591]
さまざまなデータセット、モデル、評価基準を統一する包括的なフレームワークであるUniTrajを紹介する。
我々は広範な実験を行い、他のデータセットに転送するとモデルの性能が大幅に低下することがわかった。
これらの知見を説明するために,データセットの特徴に関する洞察を提供する。
論文 参考訳(メタデータ) (2024-03-22T10:36:50Z) - infoVerse: A Universal Framework for Dataset Characterization with
Multidimensional Meta-information [68.76707843019886]
infoVerseは、データセットの特徴付けのための普遍的なフレームワークである。
infoVerseは、様々なモデル駆動メタ情報を統合することで、データセットの多次元特性をキャプチャする。
実世界の3つのアプリケーション(データプルーニング、アクティブラーニング、データアノテーション)において、infoVerse空間で選択されたサンプルは、強いベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2023-05-30T18:12:48Z) - DataFinder: Scientific Dataset Recommendation from Natural Language
Descriptions [100.52917027038369]
我々は、短い自然言語記述を与えられたデータセットを推奨するタスクを運用する。
この作業を容易にするために、我々は、より大規模な自動構築トレーニングセットと、より少ない専門家によるアノテート評価セットからなるDataFinderデータセットを構築した。
このシステムは、DataFinderデータセットに基づいてトレーニングされ、既存のサードパーティのデータセット検索エンジンよりも関連性の高い検索結果を見つける。
論文 参考訳(メタデータ) (2023-05-26T05:22:36Z) - Neural Network Architecture for Database Augmentation Using Shared
Features [0.0]
医学のような領域では、大きな単一ソースデータセットや同一の機能を持つマルチソースデータセットを作成するのが難しくなる。
本稿では、これらのデータセット間で共通する機能を用いて、データ拡張を提供するニューラルネットワークアーキテクチャを提案する。
論文 参考訳(メタデータ) (2023-02-02T19:17:06Z) - Detection Hub: Unifying Object Detection Datasets via Query Adaptation
on Language Embedding [137.3719377780593]
新しいデザイン(De Detection Hubという名前)は、データセット認識とカテゴリ整列である。
データセットの不整合を緩和し、検出器が複数のデータセットをまたいで学習するための一貫性のあるガイダンスを提供する。
データセット間のカテゴリは、ワンホットなカテゴリ表現を単語埋め込みに置き換えることで、意味的に統一された空間に整列される。
論文 参考訳(メタデータ) (2022-06-07T17:59:44Z) - Simple multi-dataset detection [83.9604523643406]
複数の大規模データセット上で統合検出器を訓練する簡単な方法を提案する。
データセット固有のアウトプットを共通の意味分類に自動的に統合する方法を示す。
私たちのアプローチは手動の分類学の調整を必要としません。
論文 参考訳(メタデータ) (2021-02-25T18:55:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。