論文の概要: SetGo: Metadata Readiness for Scientific AI Datasets
- arxiv url: http://arxiv.org/abs/2607.22677v1
- Date: Fri, 10 Jul 2026 15:44:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.020959
- Title: SetGo: Metadata Readiness for Scientific AI Datasets
- Title(参考訳): SetGo:科学的なAIデータセットのためのメタデータの準備
- Abstract要約: SetGoはオープンソースのPythonツールキットで、データセットが公開されるかアーカイブされる前にメタデータの準備性を評価し、修復する。
対話的かつ自動化をサポートするために、SetGoは/setgoスキルを通じて、大きな言語モデル(LLM)をベースとしたコーディングエージェントと統合する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scientific datasets intended for AI use require both computational readiness for model training and metadata readiness for discovery, sharing, and reuse. The Readiness Engine for Data Integration (REDI) addresses computational readiness, but no corresponding tool evaluates whether a dataset's metadata are sufficiently complete, governed, and standards-compliant for publication and agent-based consumption. Existing FAIR assessors operate only on published repository records, and no single system covers FAIR compliance, licensing, provenance, governance, reproducibility, and catalog readiness together. We present SetGo, an open-source Python toolkit that assesses and repairs metadata readiness across these six dimensions before a dataset is published or archived. Applied to four scientific corpora, SetGo surfaces deficiencies that general-purpose tools do not detect: ERA5 climate metadata scores 4% on ACDD 1.3 compliance; materials datasets fail OPTIMADE species-definition requirements; and PDB-derived proteomics data carries licensing terms incompatible with standard SPDX identifiers. Guided enrichment raises overall FAIR scores from 52-57% to 81-91%, and a single setgo publish command pushes to Hugging Face Hub, CKAN, or OpenMetadata with ML Commons Croissant 1.0 metadata sidecars. To support interactive and automated workflows, SetGo integrates with coding agents powered by large language models (LLMs) through a /setgo skill that enables natural-language execution of the full assess-enrich-publish loop, with user involvement limited to supplying missing metadata values.
- Abstract(参考訳): AIの使用を目的とした科学データセットは、モデルトレーニングのための計算的準備性と、発見、共有、再利用のためのメタデータの準備性の両方を必要とする。
Readiness Engine for Data Integration (REDI)は計算の準備ができているが、データセットのメタデータが十分に完成し、管理され、パブリッシュおよびエージェントベースの消費に標準に準拠しているかどうかを評価するツールは存在しない。
既存のFAIRアセスタは公開リポジトリレコードのみで動作し、単一のシステムがFAIR準拠、ライセンス、証明、ガバナンス、再現性、カタログの準備を一緒にカバーしている。
SetGoはオープンソースのPythonツールキットで、データセットが公開されるかアーカイブされる前に、これらの6次元にわたるメタデータの準備性を評価し、修復する。
一般的なツールでは検出できない欠陥: ERA5気候メタデータはACDD 1.3準拠度で4%、材料データセットはOPTIMADE種別定義要求に失敗し、PDB由来のプロテオミクスデータは標準SPDX識別子と互換性のないライセンス条件を持つ。
Guided Enrichmentは、全体的なFAIRスコアを52-57%から81-91%に引き上げ、Hugging Face Hub、CKAN、OpenMetadataに1セットのパブリッシュコマンドをプッシュして、ML Commons Croissant 1.0メタデータサイドカーを使用する。
インタラクティブで自動化されたワークフローをサポートするために、SetGoは/setgoスキルを通じて、大きな言語モデル(LLM)をベースとしたコーディングエージェントと統合されている。
関連論文リスト
- Automated Data Readiness for Scientific AI [0.0]
我々は、科学データセットをAI対応データに変換するためのオープンソースのフレームワークREDIを紹介する。
気候の場合、Frontierの100ノードにほぼ理想の並列スケーリングを示す。
これらの結果は、科学AIのための自動データ準備を提供するクロスドメインプラットフォームとしてREDIを確立する。
論文 参考訳(メタデータ) (2026-07-02T21:09:13Z) - Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models [63.96252564303143]
Embodied-R1.5は統合されたEmbodied Foundation Model(EFM)であり、包括的エンボディド推論機能を統合する。
我々は15B以上のトークンからなる大規模データシステムを構築し、マルチタスクバランスのRLレシピを設計する。
8Bパラメータしか持たず、Embodied-R1.5 SOTAは24のVLMベンチマークのうち16で、Gemini-Robotics-ER-1.5やGPT-5.4といった主要なモデルを上回った。
論文 参考訳(メタデータ) (2026-06-09T18:07:50Z) - DeepXiv-SDK: An Agentic Data Interface for Scientific Literature [60.19264121557117]
DeepXiv-SDKは科学文献のための3層エージェントデータインタフェースである。
DeepXiv-SDKは完全なArXivコーパスをサポートし、毎日同期して新しいリリースを組み込む。
論文 参考訳(メタデータ) (2026-02-14T23:07:28Z) - OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value [74.80873109856563]
OpenDataArena(ODA)は、トレーニング後のデータの本質的な価値をベンチマークするために設計された、総合的でオープンなプラットフォームである。
ODAは4つの主要な柱からなる包括的なエコシステムを確立している。 (i) 多様なモデル間で公平でオープンな比較を保証する統一的なトレーニング評価パイプライン、 (ii) 異なる軸数に沿ってデータ品質をプロファイリングする多次元スコアリングフレームワーク、 (iii) データセットの系図を視覚化してコンポーネントソースを識別するインタラクティブなデータ系統探索である。
論文 参考訳(メタデータ) (2025-12-16T03:33:24Z) - MeXtract: Light-Weight Metadata Extraction from Scientific Papers [48.73595915402094]
本稿では,科学論文からのメタデータ抽出を目的とした軽量言語モデルであるMeXtractを紹介する。
MeXtractはMOLEベンチマークでメタデータ抽出の最先端性能を達成する。
研究コミュニティのために、すべてのコード、データセット、モデルを公開しています。
論文 参考訳(メタデータ) (2025-10-08T11:12:28Z) - Scaling Generalist Data-Analytic Agents [95.05161133349242]
DataMindは、汎用データ分析エージェントを構築するために設計されたスケーラブルなデータ合成およびエージェントトレーニングレシピである。
DataMindは、オープンソースのデータ分析エージェントを構築する上で重要な3つの課題に取り組む。
論文 参考訳(メタデータ) (2025-09-29T17:23:08Z) - Flexible metadata harvesting for ecology using large language models [3.4117490081172774]
大規模言語モデル(LLM)に基づくメタデータ抽出装置を開発した。
任意のデータセットのランディングページからメタデータを柔軟に抽出する。
既存のメタデータ標準を使用して、これらをユーザ定義の統一フォーマットに変換する。
論文 参考訳(メタデータ) (2025-08-21T10:10:29Z) - Toward Total Recall: Enhancing FAIRness through AI-Driven Metadata Standardization [2.4347641401231126]
本稿では,GPT-4とCEDAR知識ベースからの構造化メタデータテンプレートを組み合わせることで,メタデータを自動的に標準化する手法を提案する。
我々の標準化プロセスでは、CEDARテンプレートを使用してGPT-4をガイドし、メタデータのエントリを大まかに修正する。
論文 参考訳(メタデータ) (2025-02-13T21:58:27Z) - Metadata Conditioning Accelerates Language Model Pre-training [76.54265482251454]
そこで本研究では,Metadata Conditioning then Cooldown (MeCo) と呼ばれる新しい手法を提案する。
MeCoは、さまざまなモデルスケール(600Mから8Bパラメータ)とトレーニングソース(C4、RefinedWeb、DCLM)の事前トレーニングを著しく加速する
MeCoは驚くほどシンプルで、計算オーバーヘッドを追加せず、より有能でステアブルな言語モデルを生成するという約束を示す。
論文 参考訳(メタデータ) (2025-01-03T18:59:23Z) - Discourse Features Enhance Detection of Document-Level Machine-Generated Content [53.41994768824785]
機械生成コンテンツは、学術プラジャリズムや誤報の拡散といった課題を提起する。
既存のMGC検出器は、しばしば表面レベルの情報のみに焦点を当て、暗黙的かつ構造的な特徴を見渡す。
これらの課題を克服するために、新しい方法論とデータセットを導入します。
論文 参考訳(メタデータ) (2024-12-17T08:47:41Z) - Use of a Structured Knowledge Base Enhances Metadata Curation by Large Language Models [2.186740861187042]
メタデータは、データセットの発見可能性、アクセシビリティ、相互運用性、再利用性を保証する上で重要な役割を果たす。
本稿では,メタデータ標準への準拠性を改善するため,大規模言語モデル (LLM) の可能性について検討する。
NCBI BioSampleレポジトリの肺がん関連サンプルを無作為に記録した200データについて実験を行った。
論文 参考訳(メタデータ) (2024-04-08T22:29:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。