論文の概要: SciDataSailor: Deep Scientific Data Exploring
- arxiv url: http://arxiv.org/abs/2607.28098v1
- Date: Wed, 29 Jul 2026 05:08:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.549037
- Title: SciDataSailor: Deep Scientific Data Exploring
- Title(参考訳): SciDataSailor: 深層科学データ探索
- Abstract要約: SciDataSailorは,ツール間トラジェクトリを目的のエクスプロイトと広い探索のバランスをとることで,ツール間トラジェクトリを合成するフレームワークである。
我々は教師付き微調整のためのSciDataSailor-SFT-2Kと評価のためのSciDataSailor-Benchを構築し、後者は27データセットにわたる627のメタ情報要約タスクと586の科学的質問応答タスクからなる。
- 参考スコア(独自算出の注目度): 11.927301007678244
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scientific datasets are commonly organized as hierarchical repositories containing heterogeneous and interdependent files, making their inspection, integration, and analysis labor-intensive and reliant on domain expertise. Although large language model (LLM) agents have advanced substantially in planning, reasoning, and tool use, existing research has largely overlooked their ability to interact with real scientific data assets through executable environments. We introduce Deep Scientific Data Exploration, an agentic task paradigm in which agents navigate repositories, interpret heterogeneous files and schemas, execute analyses, integrate cross-file evidence, and produce conclusions grounded in executed observations. To operationalize this paradigm, we present SciDataSailor, a framework for synthesizing tool-interactive trajectories by balancing broad exploration with targeted exploitation. SciDataSailor instantiates trajectory synthesis as Monte Carlo Tree Search (MCTS) with four task-specific mechanisms: difficulty-stratified exploration seeds, dual-feedback first-play urgency, hierarchical strategy-to-tool action generation, and entropy-guided branching. Using this framework, we construct SciDataSailor-SFT-2K for supervised fine-tuning and SciDataSailor-Bench for evaluation, with the latter comprising 627 meta-information summarization tasks and 586 scientific question-answering tasks across 27 datasets spanning the life, earth, and physical sciences.
- Abstract(参考訳): 科学データセットは一般に、異種ファイルと相互依存ファイルを含む階層的なリポジトリとして構成され、検査、統合、分析はドメインの専門知識に依存している。
大規模言語モデル(LLM)エージェントは、計画、推論、ツールの使用において大きく進歩してきたが、既存の研究は実行可能環境を通じて実際の科学的データ資産と相互作用する能力を見落としている。
エージェントがリポジトリをナビゲートし、異種ファイルやスキーマを解釈し、解析を実行し、ファイル間のエビデンスを統合し、実行された観察に基づいて結論を導出する、エージェント的なタスクパラダイムであるDeep Scientific Data Explorationを紹介する。
このパラダイムを運用するために,ツール間トラジェクトリを合成するフレームワークであるSciDataSailorを提案する。
SciDataSailorは、モンテカルロ木探索(MCTS)として4つのタスク固有のメカニズムで軌道合成をインスタンス化する。
このフレームワークを用いて、教師付き微調整のためのSciDataSailor-SFT-2Kと評価のためのSciDataSailor-Benchを構築する。
関連論文リスト
- Rethinking Scientific Discovery in the Agentic Era [69.85050591628048]
SCIONは、Textbfの組織ネクサスとして機能するエージェント科学オペレーティングシステムである。
中心となるのは textbfResearch Execution Plan (REP) であり、これは高いレベルの科学的意図をステージ化された目的、依存関係、検証チェックポイント、ツール要件、期待される成果物、フォールバック条件にコンパイルする。
SCION 下での発見を textbfTarget- Conditioned Inverse Search として定式化し,有限実験予算下でのバッチ能動探索により隠れターゲット設定に拡張する。
論文 参考訳(メタデータ) (2026-07-04T13:09:33Z) - S1-DeepResearch: Beyond Search, Toward Real-World Long-Horizon Research Agents [22.248115680330496]
深層研究エージェントのための統一軌道構築パラダイムを提案する。
提案するフレームワークは,グラフグラウンドタスクの定式化,エージェントトラジェクトリのロールアウト,多次元トラジェクトリの検証からなる。
S1-DeepResearch-32Bは、同等のスケールのオープンソースモデル間で最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-06-13T16:04:42Z) - ASTER -- Agentic Science Toolkit for Exoplanet Research [35.64586091780559]
ASTERは、外惑星大気のキャラクタリゼーションのための統一されたプラットフォームを提供する。
ASTERは、NASA Exoplanet Archiveから惑星パラメータと観測データセットをダウンロードするためのツールを組み込んでいる。
論文 参考訳(メタデータ) (2026-03-27T19:47:53Z) - SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents [100.12367115920121]
SciGymAgentは4つの自然科学分野にまたがる1,780のドメイン固有ツールを備えたスケーラブルなインタラクティブ環境である。
SciAgentBenchについても紹介する。
論文 参考訳(メタデータ) (2026-02-13T14:58:18Z) - S1-NexusAgent: a Self-Evolving Agent Framework for Multidisciplinary Scientific Research [0.0]
S1-NexusAgentは科学研究のための自己進化型エージェントフレームワークである。
S1-NexusAgentは階層的なPlan-and-CodeAct実行パラダイムを採用し、サブタスクレベルのツール実行からグローバルな科学的計画を切り離している。
S1-NexusAgentは最先端の一般化性能を達成し、複雑な科学的タスクにおけるその有効性と能力を検証する。
論文 参考訳(メタデータ) (2026-02-02T02:33:25Z) - ResearchPulse: Building Method-Experiment Chains through Multi-Document Scientific Inference [19.363580418167114]
我々は、関連論文のモチベーション、方法論、実験結果を抽出し、調整する新しいタスクである、多文書科学的推論を定式化する。
提案するResearchPulseは,指導計画,科学コンテンツ抽出,構造化可視化を統合したエージェントベースのフレームワークである。
このタスクを支援するために、注釈付き紙クラスターの引用対応ベンチマークであるResearchPulse-Benchを紹介する。
論文 参考訳(メタデータ) (2025-09-03T15:45:03Z) - A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers [251.23085679210206]
科学大規模言語モデル(Sci-LLMs)は、科学研究において、知識の表現、統合、適用の方法を変えつつある。
この調査は、モデルとその基盤となるデータ基板の共進化として、Sci-LLMの開発を再考する。
我々は、科学的データの統一された分類法と、科学的知識の階層的なモデルを定式化する。
論文 参考訳(メタデータ) (2025-08-28T18:30:52Z) - DSBench: How Far Are Data Science Agents from Becoming Data Science Experts? [58.330879414174476]
現実的なタスクでデータサイエンスエージェントを評価するためのベンチマークであるDSBenchを紹介する。
このベンチマークには、466のデータ分析タスクと、EloquenceとKaggleのコンペからソースされた74のデータモデリングタスクが含まれている。
現状のLLM, LVLM, エージェントを評価したところ, 最高のエージェントはデータ解析タスクの34.12%しか解決できず, RPG(Relative Performance Gap)は34.74%であった。
論文 参考訳(メタデータ) (2024-09-12T02:08:00Z) - MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding [59.41495657570397]
本稿では,72の科学分野をカバーするNature Communicationsの記事からまとめられた包括的データセットについて述べる。
2つのベンチマークタスク(図のキャプションと複数選択)で19のプロプライエタリモデルとオープンソースモデルを評価し,人手による注釈を行った。
タスク固有データを用いた細調整Qwen2-VL-7Bは、GPT-4oや人間の専門家でさえも、マルチチョイス評価において優れた性能を示した。
論文 参考訳(メタデータ) (2024-07-06T00:40:53Z) - DiscoveryBench: Towards Data-Driven Discovery with Large Language Models [50.36636396660163]
我々は、データ駆動探索の多段階プロセスを形式化する最初の包括的なベンチマークであるDiscoveryBenchを紹介する。
我々のベンチマークには、社会学や工学などの6つの分野にまたがる264のタスクが含まれている。
私たちのベンチマークでは、自律的なデータ駆動型発見の課題を説明し、コミュニティが前進するための貴重なリソースとして役立ちます。
論文 参考訳(メタデータ) (2024-07-01T18:58:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。