論文の概要: PetroBench: A Benchmark for Large Language Models in Petroleum Engineering
- arxiv url: http://arxiv.org/abs/2605.28032v1
- Date: Wed, 27 May 2026 06:36:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.806316
- Title: PetroBench: A Benchmark for Large Language Models in Petroleum Engineering
- Title(参考訳): PetroBench: 石油工学における大規模言語モデルのベンチマーク
- Authors: Xiang Wang, Tingting Zhang, Sen Wang, Ying Wu, Heng Meng, Peng Zhou, Peng Li,
- Abstract要約: このベンチマークは、生産、貯水池、掘削エンジニアリングをカバーしており、複数の選択、真または偽、項定義、短解形式に1200の質問がある。
Gemini-3-Pro, Kimi-K2.5, Claude-Opus-4.6-Thinkingは72%-74%の得点を記録した。
- 参考スコア(独自算出の注目度): 28.90614550600507
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models are increasingly applied in the petroleum industry, highlighting the need for a domain-specific evaluation framework. This study develops a benchmark for LLMs in petroleum engineering, including a three-stage process of data preprocessing, quality filtering, and multi-model validation. Using expert review, a standardized question bank with strong domain relevance and discriminative capability was constructed. The benchmark covers production, reservoir, and drilling engineering, with 1,200 questions across multiple-choice, true or false, term definition, and short-answer formats. Eight mainstream LLMs were evaluated under a unified API environment. Results show that models performed better on subjective than objective questions, indicating weaknesses in factual knowledge discrimination. The highest accuracies for multiple-choice and true or false questions were 65.3% and 74.3%, respectively. Gemini-3-Pro, Kimi-K2.5, and Claude-Opus-4.6-Thinking achieved the best overall scores of 72%-74%. Models performed best in production engineering and weakest in reservoir engineering. Chinese models showed advantages in multiple-choice questions, while international models performed slightly better in short-answer questions. The benchmark provides a reproducible and practical reference for evaluating and deploying LLMs in petroleum engineering.
- Abstract(参考訳): 大規模言語モデルは石油業界にますます適用され、ドメイン固有の評価フレームワークの必要性を強調している。
本研究は,データ前処理,品質フィルタリング,マルチモデル検証の3段階プロセスを含む,石油工学におけるLCMのベンチマークを開発する。
専門家のレビューを用いて、強力なドメイン関連性と識別能力を備えた標準化された質問銀行を構築した。
このベンチマークは、生産、貯水池、掘削エンジニアリングをカバーしており、複数の選択、真または偽、項定義、短解形式に1200の質問がある。
8つの主要なLCMを統一されたAPI環境下で評価した。
その結果、モデルが客観的な質問よりも主観的に優れていることが示され、事実的知識識別の弱点が示唆された。
多重選択と真偽の質問に対する最も高い精度は、それぞれ65.3%と74.3%である。
Gemini-3-Pro, Kimi-K2.5, Claude-Opus-4.6-Thinkingは72%-74%の得点を記録した。
モデルは生産工学において最も良く、貯水池工学では最も弱い。
中国のモデルは複数質問で優位性を示し、国際モデルは短い質問でわずかに改善した。
このベンチマークは、石油工学におけるLCMの評価とデプロイのための再現可能で実用的なリファレンスを提供する。
関連論文リスト
- FormationEval, an open multiple-choice benchmark for petroleum geoscience [0.0]
FormationEvalは、石油地球科学の分野における言語モデルを評価するための、オープンな多重選択質問ベンチマークである。
評価対象はOpenAI, Anthropic, Google, Meta, オープンウェイトな代替品など,主要なプロバイダの72モデルである。
トップパフォーマーは97%以上の精度を達成し、Gemini 3 Pro Previewは99.8%に達した。
論文 参考訳(メタデータ) (2026-01-05T14:36:02Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - Empirical Evaluation of Large Language Models in Automated Program Repair [11.840927951970146]
大規模言語モデル(LLM)は、自動プログラム修復(APR)のための新しい機会を提供する
我々は,7Bから33Bパラメータ,多様なアーキテクチャ,目的の4つのオープンソースLLM,CodeLlama,LLaMA,StarCoder,DeepSeek-Coderを研究した。
2つのバグシナリオ(エンタプライズグレードとアルゴリズム)、3つの言語(Java、C/C++、Python)と4つのプロンプト戦略で評価し、6つのベンチマークで600万以上の生成されたパッチを分析しました。
論文 参考訳(メタデータ) (2025-06-16T07:52:15Z) - BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs [7.9458352414205295]
大規模な言語モデルは一般的なタスクでは優れていますが、ロジック重大で精度の高い、財務、法律、医療といった重要な領域での信頼性の評価は依然として難しいままです。
BizFinBenchは、実世界の金融アプリケーションにおけるLSMの評価に特化して設計された最初のベンチマークである。
BizFinBenchは中国語で6,781の注釈付きクエリで構成されており、数値計算、推論、情報抽出、予測認識、知識に基づく質問応答の5つの次元にまたがっている。
論文 参考訳(メタデータ) (2025-05-26T03:23:02Z) - R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation [75.33671166231096]
我々は、Reasoning Bench(R-Bench)と呼ばれる、大学院レベルの多学派、英語の中国語ベンチマークを導入する。
RBenchは108の被験者に1,094の質問を、83の被験者に665の質問を、マルチモーダルなモデルテストに当てはめている。
我々は,OpenAI o1,GPT-4o,DeepSeek-R1など,広く使用されているモデルを評価した。
論文 参考訳(メタデータ) (2025-05-04T07:48:36Z) - Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models [82.92771279118888]
マルチモーダル報酬モデルを評価するためのエキスパートアノテートベンチマークであるMultimodal RewardBenchを紹介する。
我々のデータセットは、様々な視覚言語モデルから収集された5,211個の注釈付き(プロンプト、選択された応答、拒否された応答)三つ子からなる。
Gemini 1.5 ProやClaude 3.5 Sonnetといったトップパフォーマンスモデルでさえ、全体的な精度は72%に過ぎません。
論文 参考訳(メタデータ) (2025-02-20T01:48:13Z) - MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly Detection [66.05200339481115]
本稿では,産業異常検出における最初のフルスペクトルMLLMベンチマークであるMMADを提案する。
産業検査におけるMLLMの7つの重要なサブタスクを定義し,MMADデータセットを生成するための新しいパイプラインを設計した。
MMADを用いて,様々な最先端MLLMの包括的,定量的評価を行った。
論文 参考訳(メタデータ) (2024-10-12T09:16:09Z) - An energy-based comparative analysis of common approaches to text
classification in the Legal domain [0.856335408411906]
大規模言語モデル(LLM)は、学術や産業におけるNLP問題に対処するために広く採用されている。
本稿では,LexGLUEベンチマークでLLMと従来のアプローチ(SVMなど)を詳細に比較する。
その結果、最も単純なアルゴリズムは大きなLLMに非常に近い性能を達成できることがわかった。
論文 参考訳(メタデータ) (2023-11-02T14:16:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。