論文の概要: Compass: Navigating Global Marine Lead Data Integration through Expert-Guided LLM Agent
- arxiv url: http://arxiv.org/abs/2605.29966v1
- Date: Thu, 28 May 2026 14:06:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:56.378636
- Title: Compass: Navigating Global Marine Lead Data Integration through Expert-Guided LLM Agent
- Title(参考訳): コンパス:専門家誘導型LLMエージェントによるグローバルマリンリードデータ統合のナビゲート
- Authors: Yiming Liu, Bin Lu, Meng Jin, Ziyuan Sang, Shuo Jiang, Lei Zhou, Xinbing Wang, Chenghu Zhou, Jing Zhang,
- Abstract要約: 海洋鉛(Pb)とその同位体は海洋循環と人為的汚染にとって重要なトレーサーである。
手動抽出はスケールできないが、汎用大規模言語モデル(LLM)は必要なドメイン固有の知識を欠いている。
我々は,LLMが微調整なしで厳密な科学的データ抽出を行うことのできる専門家誘導型適応手法を提案する。
- 参考スコア(独自算出の注目度): 55.77954024801206
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Marine lead (Pb) and its isotopes are critical tracers for ocean circulation and anthropogenic pollution, yet in-situ observations remain costly and sparse. While vast historical records exist, they lie buried within the unstructured content of academic papers, creating "data silos" inaccessible to comprehensive analysis. Manual extraction is unscalable, while general-purpose Large Language Models (LLMs) lack the necessary domain-specific knowledge, leading to hallucinations and scientifically invalid outputs. To address this, we introduce an expert-guided adaptation approach that enables LLMs to perform rigorous scientific data extraction without fine-tuning. We operationalize this approach through Compass, an LLM agent framework enhanced by a Knowledge Tree co-designed with marine scientists, which decomposes complex tasks into verifiable steps, guiding the agent's reasoning to ensure scientific validity. Deploying Compass across a corpus of over 230,000 relevant open-access papers, we successfully extract 3,751 previously unincorporated Pb records. This effort establishes the largest integrated marine Pb database to date. Beyond standard metrics, Compass demonstrates superior reliability through multi-layered validation, achieving 92% accuracy as confirmed through expert manual verification. The newly integrated data expand coverage in previously under-sampled regions such as the East China Sea and the Southern Ocean, providing an enriched data foundation for future scientific discoveries. We release an interactive visualization platform to facilitate open scientific access. Our work demonstrates that expert-guided agents can effectively bridge the gap between general-purpose LLMs and high-stakes scientific domains, enabling scalable data discovery in geosciences.
- Abstract(参考訳): 海洋鉛(Pb)とその同位体は海洋循環や人為的汚染にとって重要なトレーサーである。
膨大な歴史記録が存在するが、それらは学術論文の構造化されていない内容に埋もれており、包括的な分析にはアクセスできない「データサイロ」を作り出している。
手動の抽出は不可能であるが、汎用大規模言語モデル(LLM)は必要なドメイン固有の知識を欠いており、幻覚や科学的に無効な出力をもたらす。
そこで本研究では,LSMが微調整なしで厳密な科学的データ抽出を行うことのできる専門家誘導型適応手法を提案する。
我々は、複雑なタスクを検証可能なステップに分解し、科学的妥当性を確保するためにエージェントの推論を導く、知識ツリーによって強化されたLCMエージェントフレームワークであるCompassを通じて、このアプローチを運用する。
コンパスを23万件以上のオープンアクセス論文のコーパスに展開し, 未編入のPbレコード3,751件の抽出に成功した。
この取り組みにより、これまでで最大の海洋Pbデータベースが確立された。
標準的なメトリクス以外にも、Compassは多層検証によって優れた信頼性を示し、専門家の手動検証によって確認された精度を92%達成している。
新たに統合されたデータは、東シナ海や南海など、かつて未成年だった地域でカバー範囲を広げ、将来の科学的発見のための豊富なデータ基盤を提供する。
オープンな科学アクセスを容易にするインタラクティブな可視化プラットフォームをリリースする。
我々の研究は、専門家が指導するエージェントが、汎用LLMと高度な科学領域のギャップを効果的に埋め、地球科学におけるスケーラブルなデータ発見を可能にすることを実証している。
関連論文リスト
- OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models [57.19693589926157]
OceanPileは、海洋基盤モデル用に設計された大規模マルチモーダルコーパスである。
OceanCorpus、OceanInstruction、OceanBenchmarkの3つの重要なコンポーネントで構成されている。
すべてのデータセットは、海洋人工知能の分野を前進させるために公開されている。
論文 参考訳(メタデータ) (2026-04-25T14:53:37Z) - Opportunities in AI/ML for the Rubin LSST Dark Energy Science Collaboration [63.61423859450929]
この白書は、DESCの主要な宇宙探査と横断的分析を通して、AI/MLの現在の状況を調査している。
本研究では,大規模ベイズ推定,物理インフォームド手法,検証フレームワーク,発見のための能動的学習など,主要な方法論研究の優先事項を明らかにする。
論文 参考訳(メタデータ) (2026-01-20T18:46:42Z) - MARVEL: A Multi Agent-based Research Validator and Enabler using Large Language Models [2.0725712989738994]
本稿では,ドメイン認識型質問応答のためのフレームワークMARVELについて紹介する。
MARVELは、簡単なクエリのための高速パスと、より意図的なDeepSearchモードを組み合わせることで、検索拡張生成とMonte Carlo Tree Searchを統合している。
我々はこの枠組みをレーザー干渉計重力波観測に関する重力波研究の文脈に応用した。
論文 参考訳(メタデータ) (2026-01-06T21:47:22Z) - A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers [251.23085679210206]
科学大規模言語モデル(Sci-LLMs)は、科学研究において、知識の表現、統合、適用の方法を変えつつある。
この調査は、モデルとその基盤となるデータ基板の共進化として、Sci-LLMの開発を再考する。
我々は、科学的データの統一された分類法と、科学的知識の階層的なモデルを定式化する。
論文 参考訳(メタデータ) (2025-08-28T18:30:52Z) - OKG-LLM: Aligning Ocean Knowledge Graph with Observation Data via LLMs for Global Sea Surface Temperature Prediction [70.48962924608033]
この研究は、SST予測のための多様な海洋知識を表現するために特別に設計された海洋知識グラフ(OKG)を構築するための最初の体系的な取り組みを示す。
最後に, 学習知識を微粒な数値SSTデータと整列させ, 事前学習したLLMを用いてSSTパターンをモデル化し, 正確な予測を行う。
論文 参考訳(メタデータ) (2025-07-31T02:06:03Z) - Accelerating Earth Science Discovery via Multi-Agent LLM Systems [0.1398098625978622]
このパースペクティブは、地球科学における大規模言語モデル(LLM)を利用したマルチエージェントシステム(MAS)の変容の可能性を探る。
MASは、インテリジェントなデータ処理、自然言語インタフェース、協調的な問題解決機能を有効にすることで、科学者と地質学的データとの相互作用を改善するための変革的なポテンシャルを持っている。
論文 参考訳(メタデータ) (2025-03-07T13:25:56Z) - OceanBench: The Sea Surface Height Edition [5.307677318971956]
オーシャンサテライトデータは、その空間性や不規則なサンプリング、信号の複雑さ、ノイズによる情報抽出の課題を示す。
機械学習(ML)技術は、大規模で複雑な信号を扱う能力を実証している。
OceanBenchは、ドメインエキスパート標準に準拠した標準化された処理ステップを提供する統一フレームワークである。
論文 参考訳(メタデータ) (2023-09-27T12:00:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。