論文の概要: A Multimodal Dataset for Large Language Model Applications in the Energy Domain
- arxiv url: http://arxiv.org/abs/2607.11459v1
- Date: Mon, 13 Jul 2026 12:08:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.459819
- Title: A Multimodal Dataset for Large Language Model Applications in the Energy Domain
- Title(参考訳): エネルギー領域における大規模言語モデル応用のためのマルチモーダルデータセット
- Abstract要約: mAIEnergyデータセットは、エネルギーセクターでLLM(Large Language Model)アプリケーションをサポートするために開発されたオープンアクセスマルチモーダルコーパスである。
このデータセットは、約50,000のテキストドキュメント、20,000の画像、2500万の数値時系列記録、200万の地理空間および関係データエントリを統合している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper presents the mAIEnergy dataset, an open-access, multimodal corpus developed to support Large Language Model (LLM) applications in the energy sector. The dataset integrates approximately 50,000 textual documents, 20,000 images, 25 million numerical time series records, and 2 million geospatial and relational data entries. It includes policy and regulatory texts, scientific articles and news articles, satellite and contextual imagery, electricity system measurements, weather observations, statistical indicators, and geospatial representations of energy infrastructure and related entities. All data have been harmonized into structured, ready-to-use formats, accompanied by consistent metadata and reproducible data retrieval and preparation workflows. The dataset can serve as a foundational energy knowledge base, allowing energy stakeholders to integrate additional open-source or proprietary data. The mAIEnergy dataset adheres to Findable, Accessible, Interoperable, and Reusable (FAIR) principles, enhancing its applicability for AI-driven energy research, modeling, and decision-making.
- Abstract(参考訳): 本稿では,エネルギーセクターにおける大規模言語モデル(LLM)アプリケーションをサポートするために開発されたオープンアクセス型マルチモーダルコーパスであるmAIEnergyデータセットを提案する。
このデータセットは、約50,000のテキストドキュメント、20,000の画像、2500万の数値時系列記録、200万の地理空間および関係データエントリを統合している。
政策・規制文書、科学論文・ニュース記事、衛星・文脈画像、電気システム計測、気象観測、統計指標、エネルギーインフラと関連するエンティティの地理空間的表現が含まれる。
すべてのデータは、一貫したメタデータと再現可能なデータ検索と準備ワークフローを伴って、構造化され、使用可能なフォーマットに調和している。
データセットは基礎的なエネルギー知識ベースとして機能し、エネルギー利害関係者が追加のオープンソースまたはプロプライエタリなデータを統合することができる。
mAIEnergyデータセットはFinderable、Accessible、Interoperable、Reusable(FAIR)の原則に準拠しており、AI駆動のエネルギー研究、モデリング、意思決定への適用性を高めている。
関連論文リスト
- Data Pyramid for Embodied Manipulation [135.16063649795234]
身体的エージェントは、物理的状態や行動と観察を混同するデータを必要とする。
具体化されたデータエコシステムは、5つの補完的なソースにまたがる“ピラミド”として組織化しています。
論文 参考訳(メタデータ) (2026-07-27T17:59:58Z) - Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development [314.80153557710616]
我々は、1,000以上のオープンアクセスデータセットをカバーする、医療画像データセットの現在における最大の調査を提示する。
私たちの分析では、範囲が狭いタスクにまたがって断片化され、臓器やモダリティに不均一に分散した、質素なスケールのランドスケープを公開しています。
本稿では,メタデータ駆動型融合パラダイム(MDFP)を提案する。
論文 参考訳(メタデータ) (2026-03-29T00:46:53Z) - OIDA-QA: A Multimodal Benchmark for Analyzing the Opioid Industry Documents Archive [50.468138755368805]
オピオイド危機は公衆衛生にとって重要な瞬間である。
UCSF-JHU Opioid Industry Documents Archive(OIDA)に公開されているデータと文書
本稿では,文書属性に応じて元のデータセットを整理することで,この問題に対処する。
論文 参考訳(メタデータ) (2025-11-13T03:27:32Z) - Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding [61.36285696607487]
文書理解は、財務分析から科学的発見への応用に不可欠である。
現在のアプローチでは、OCRベースのパイプラインがLarge Language Models(LLM)やネイティブのMultimodal LLMs(MLLM)に制限されている。
Retrieval-Augmented Generation (RAG)は、外部データの基底モデルを支援するが、文書のマルチモーダルな性質は、テキスト、テーブル、チャート、レイアウトを組み合わせることで、より高度なパラダイムを必要とする。
論文 参考訳(メタデータ) (2025-10-17T02:33:16Z) - GridMind: A Multi-Agent NLP Framework for Unified, Cross-Modal NFL Data Insights [0.0]
本稿では,Retrieval-Augmented Generation (RAG) と大規模言語モデル (LLM) を通じて構造化,半構造化,非構造化データを統一するフレームワークであるGridMindを紹介する。
このアプローチはマルチモーダル表現学習の進化する分野と一致する。
論文 参考訳(メタデータ) (2025-03-24T18:33:36Z) - SciER: An Entity and Relation Extraction Dataset for Datasets, Methods, and Tasks in Scientific Documents [49.54155332262579]
我々は,科学論文のデータセット,メソッド,タスクに関連するエンティティに対して,新たなエンティティと関係抽出データセットをリリースする。
我々のデータセットには、24k以上のエンティティと12kの関係を持つ106の注釈付きフルテキストの科学出版物が含まれています。
論文 参考訳(メタデータ) (2024-10-28T15:56:49Z) - MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding [59.41495657570397]
本稿では,72の科学分野をカバーするNature Communicationsの記事からまとめられた包括的データセットについて述べる。
2つのベンチマークタスク(図のキャプションと複数選択)で19のプロプライエタリモデルとオープンソースモデルを評価し,人手による注釈を行った。
タスク固有データを用いた細調整Qwen2-VL-7Bは、GPT-4oや人間の専門家でさえも、マルチチョイス評価において優れた性能を示した。
論文 参考訳(メタデータ) (2024-07-06T00:40:53Z) - The Price of Prompting: Profiling Energy Use in Large Language Models Inference [5.254805405012678]
本稿では,大規模言語モデル推論プロセスにおいて消費されるエネルギーを監視し,分析するフレームワークであるMELODIを紹介する。
MELODIを使用して生成されたデータセットは、幅広いLLMデプロイメントフレームワーク、複数の言語モデル、広範なプロンプトデータセットを含んでいる。
その結果,エネルギー効率の相違が指摘され,持続可能対策の最適化と導入の十分な範囲が示唆された。
論文 参考訳(メタデータ) (2024-07-04T12:16:28Z) - Language and Multimodal Models in Sports: A Survey of Datasets and Applications [20.99857526324661]
自然言語処理(NLP)とマルチモーダルモデルの最近の統合は、スポーツ分析の分野を進歩させてきた。
この調査は、2020年以降のこれらのイノベーションを駆動するデータセットとアプリケーションの包括的なレビューを示す。
論文 参考訳(メタデータ) (2024-06-18T03:59:26Z) - Transforming Agriculture with Intelligent Data Management and Insights [3.027257459810039]
現代の農業は、気候変動と天然資源の枯渇の制約の下で、食料、燃料、飼料、繊維の需要の増加に対応するための大きな課題に直面している。
データ革新は、アグロエコシステムの生産性、持続可能性、レジリエンスの確保と改善に緊急に必要です。
論文 参考訳(メタデータ) (2023-11-07T22:02:54Z) - Hybrid Transformer with Multi-level Fusion for Multimodal Knowledge
Graph Completion [112.27103169303184]
マルチモーダル知識グラフ(MKG)は、視覚テキストの事実知識を整理する。
MKGformerは、マルチモーダルリンク予測、マルチモーダルRE、マルチモーダルNERの4つのデータセット上でSOTA性能を得ることができる。
論文 参考訳(メタデータ) (2022-05-04T23:40:04Z) - Building power consumption datasets: Survey, taxonomy and future
directions [2.389598109913753]
本研究は,建築エネルギー消費データセットの数値的および方法論的性質を調査,研究,可視化するために提案される。
地理的な位置,収集期間,監視対象世帯数,収集データのサンプリング率,サブメータ家電数,抽出特徴量,リリース日など,合計31のデータベースを調査・比較した。
新たなデータセット、すなわち、注釈付き消費電力異常検出データセットであるカタール大学データセットが提示されている。
論文 参考訳(メタデータ) (2020-09-17T10:19:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。