論文の概要: How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?
- arxiv url: http://arxiv.org/abs/2606.26346v1
- Date: Wed, 24 Jun 2026 19:38:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.064854
- Title: How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?
- Title(参考訳): ツール強化LDMエージェントは実世界のエネルギー分析タスクにどのように機能するか?
- Abstract要約: 実世界のエネルギー市場分析タスクにおけるツール強化LDMエージェントの実証的研究について述べる。
我々の評価環境には、市場データ検索・分析、知識検索・解釈、高度な定量的モデリング・意思決定分析の3つのカテゴリにまたがる243の専門家による問題が含まれている。
エージェントには、米国の主要ISO向けのライブ電気市場API、規制ドケット検索、ユーティリティ関税データベース、資産最適化モデル、エネルギー市場文書による検索強化世代など、一連のドメインツールが備わっている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agentic benchmarks have emerged across general-purpose and domain-specific settings, including finance, coding, law, and drug discovery, yet energy-domain evaluations remain largely limited to static knowledge recall. This is a critical gap for a sector that requires live data retrieval, specialized regulatory and market knowledge, and multi-step quantitative reasoning under real-world constraints. We present an empirical study of tool-augmented LLM agents on real-world energy market analytics tasks. Our evaluation environment includes 243 expert-curated problems across three categories: (1) Market Data Retrieval and Analysis, (2) Knowledge Retrieval and Interpretation, and (3) Advanced Quantitative Modeling and Decision Analytics. Tasks include price and demand analysis, tariff impact modeling, asset revenue and returns estimation, hedging strategy analysis, and optimization modeling, with problems spanning multiple difficulty levels. Agents are equipped with a configurable suite of domain tools, including live electricity market APIs for major U.S. ISOs, regulatory docket search, utility tariff databases, asset optimization models, and retrieval-augmented generation over energy market documents. We assess agent responses using a multi-dimensional evaluation protocol that scores approach correctness, answer accuracy, attribute alignment, and source validity, with category-aware routing to match scoring criteria to question type. We evaluate both closed-source and open-source LLMs, providing a comparative analysis of how model capability and domain tooling interact in a high-stakes professional domain. Key artifacts are publicly released to support reproducibility and future research.
- Abstract(参考訳): エージェントベンチマークは、ファイナンス、コーディング、法則、薬物発見など、汎用的およびドメイン固有の設定で現れているが、エネルギー領域の評価は静的な知識リコールに限られている。
これは、ライブデータ検索、専門的な規制と市場知識、および実世界の制約の下での多段階の定量的推論を必要とするセクターにとって重要なギャップである。
実世界のエネルギー市場分析タスクにおけるツール強化LDMエージェントの実証的研究について述べる。
評価環境には,(1)市場データ検索・分析,(2)知識検索・解釈,(3)高度な定量的モデリング・意思決定分析の3つのカテゴリにまたがる243の専門的問題が含まれている。
課題には、価格と需要の分析、関税の影響モデリング、資産収益とリターンの推定、ヘッジ戦略分析、最適化モデリングなどが含まれる。
エージェントには、米国の主要ISO向けのライブ電気市場API、規制ドケット検索、ユーティリティ関税データベース、資産最適化モデル、エネルギー市場文書による検索強化世代など、設定可能な一連のドメインツールが備わっている。
多次元評価プロトコルを用いてエージェント応答の評価を行い,評価基準を問合せタイプに適合させるため,属性アライメント(属性アライメント)とソースアライメント(属性アライメント)の多次元評価を行う。
我々は,オープンソース LLM とクローズドソース LLM をともに評価し,モデル能力とドメイン・ツーリングが高度な専門分野においてどのように相互作用するかを比較分析した。
再現性と将来の研究をサポートするために、重要なアーティファクトが公開されている。
関連論文リスト
- AIDABench: AI Data Analytics Benchmark [62.45908988324612]
AIDABenchは、複雑なデータ分析タスクのAIシステムをエンドツーエンドで評価するためのベンチマークである。
AIDABenchは、質問応答、データビジュアライゼーション、ファイル生成という3つのコア機能ディメンションにまたがる600以上の多様なドキュメント分析タスクを含んでいる。
AIDABenchの11の最先端モデルを評価し、プロプライエタリ(Claude Sonnet 4.5、Gemini 3 Pro Previewなど)とオープンソース(Qwen3-Max-2026-01-23-Thinkingなど)の両方を対象とする。
論文 参考訳(メタデータ) (2026-02-27T08:58:05Z) - Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs [66.63911043019294]
データ準備は、生のデータセットを識別し、データセット間の関係を解明し、それらから貴重な洞察を抽出することを目的としている。
本稿では,様々な下流タスクのためのデータ準備にLLM技術を用いることに焦点を当てる。
データクリーニング、標準化、エラー処理、計算、データ統合、データ豊か化という3つの主要なタスクにフィールドを編成するタスク中心の分類を導入します。
論文 参考訳(メタデータ) (2026-01-22T12:02:45Z) - Advancing ESG Intelligence: An Expert-level Agent and Comprehensive Benchmark for Sustainable Finance [21.31987959023507]
ESGAgentは、特定のツールセットによって強化された階層型マルチエージェントシステムで、詳細なESG分析を生成する。
本稿では, 原子間共通感覚質問から, 総合的, 詳細な分析まで, 310件の企業サステナビリティレポートから得られた評価指標について述べる。
論文 参考訳(メタデータ) (2026-01-13T15:58:29Z) - CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency [60.83660377169452]
本稿では,Large Language Model (LLM)エージェントの現実的能力を厳格に評価するために設計された,最初の専門家による動的ベンチマークであるCryptoBenchを紹介する。
検索と予測のための汎用エージェントベンチマークとは異なり、プロの暗号分析は特定の課題を提示する。
論文 参考訳(メタデータ) (2025-11-29T09:52:34Z) - FutureX: An Advanced Live Benchmark for LLM Agents in Future Prediction [92.7392863957204]
FutureXは、将来の予測のための最大かつ最も多様なライブベンチマークである。
リアルタイムの日次更新をサポートし、質問収集と回答収集のための自動パイプラインを通じてデータの汚染を取り除く。
推論,検索機能,外部ツールの統合などを含む25のLLM/エージェントモデルを評価した。
論文 参考訳(メタデータ) (2025-08-16T08:54:08Z) - FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering [57.18367828883773]
FinAgentBenchは、ファイナンスにおける多段階推論によるエージェント検索を評価するためのベンチマークである。
このベンチマークは、S&P-500上場企業に関する26Kのエキスパートアノテート例から成っている。
我々は,最先端モデルの集合を評価し,対象の微調整がエージェント検索性能を大幅に向上することを示す。
論文 参考訳(メタデータ) (2025-08-07T22:15:22Z) - Survey on Evaluation of LLM-based Agents [28.91672694491855]
LLMベースのエージェントの出現は、AIのパラダイムシフトを表している。
本稿では,これらのエージェントに対する評価手法に関する総合的な調査を初めて実施する。
論文 参考訳(メタデータ) (2025-03-20T17:59:23Z) - FinSphere, a Real-Time Stock Analysis Agent Powered by Instruction-Tuned LLMs and Domain Tools [7.6993069412225905]
現在の金融大規模言語モデル(FinLLM)は2つの限界に悩まされている。
株価分析レポートの品質評価のための客観的評価指標の欠如と、株価分析の深みの欠如は、彼らのプロフェッショナルグレードの洞察を生み出す能力を妨げている。
本稿では、ストック分析エージェントであるFinSphereと3つの主要な貢献について紹介する。
論文 参考訳(メタデータ) (2025-01-08T07:50:50Z) - Evaluating Large Language Models on Financial Report Summarization: An Empirical Study [9.28042182186057]
我々は3つの最先端大言語モデル(LLM)の比較研究を行っている。
我々の主な動機は、これらのモデルがどのように金融の中で活用できるかを探求することであり、正確さ、文脈的関連性、誤った情報や誤解を招く情報に対する堅牢性を要求する分野である。
本稿では,定量的メトリクス(精度,リコールなど)と質的分析(コンテキスト適合性,一貫性など)を統合し,各モデルの出力品質の全体像を提供する,革新的な評価フレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-11T10:36:04Z) - InsightBench: Evaluating Business Analytics Agents Through Multi-Step Insight Generation [79.09622602860703]
3つの重要な特徴を持つベンチマークデータセットであるInsightBenchを紹介します。
財務やインシデント管理といったさまざまなビジネスユースケースを表す100のデータセットで構成されている。
単一のクエリに回答することに焦点を当てた既存のベンチマークとは異なり、InsightBenchは、エンドツーエンドのデータ分析を実行する能力に基づいてエージェントを評価する。
論文 参考訳(メタデータ) (2024-07-08T22:06:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。