論文の概要: Reliable LLM-Generated Programs for High-Energy Physics Experiments through Graph-Grounded Software Knowledge
- arxiv url: http://arxiv.org/abs/2609.01095v1
- Date: Tue, 01 Sep 2026 11:35:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.606864
- Title: Reliable LLM-Generated Programs for High-Energy Physics Experiments through Graph-Grounded Software Knowledge
- Title(参考訳): グラフ付きソフトウェア知識による高エネルギー物理実験のための信頼性LCM生成プログラム
- Authors: Yue Sun, Tong Liu, Yipu Liao, Jingde Chen, Ke Li,
- Abstract要約: 汎用大規模言語モデル (LLM) はしばしばそのようなタスクに対する信頼性の低いプログラムを生成する。
我々は、これらのソフトウェア関係を生成前に整理し、推論時にタスク関連知識を取得する。
ヘテロジニアスなソフトウェア知識グラフ上でのハイブリッド検索を組み合わせた完全基底システムの評価を行う。
- 参考スコア(独自算出の注目度): 18.431539281285225
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Extracting physics information from modern particle-physics experiments requires multistage analyses implemented on top of large and highly interconnected software ecosystems. General-purpose large language models (LLMs) often produce unreliable programs for such tasks because a user request alone rarely specifies the required APIs, dependencies, and usage conventions. We organize these software relations before generation and retrieve task-relevant knowledge at inference time. Using the open-source ROOT framework as a representative and reproducible testbed, we evaluate a complete grounding system that combines hybrid retrieval over a heterogeneous software knowledge graph, skill-selected workflow examples, and execution-guided repair. On a benchmark of 275 ROOT tasks, grounding improves first-attempt execution from 58.5% to 76.0% under Claude Code orchestration and from 51.3% to 64.0% under standalone orchestration. Final success increases from 90.5% to 96.0% and from 78.9% to 90.9%, respectively, while the average generation cost per successful task increases by only 1.3% and 3.2%. The gains persist under a strong coding agent, indicating that explicit software knowledge remains valuable even when agentic scaffolding is already in place. Because the method captures software relations common to large codebases rather than facts specific to ROOT or a particular model, it should transfer to other experiment frameworks and proprietary software, especially where documentation is sparse or internal dependencies are complex.
- Abstract(参考訳): 現代の粒子物理実験から物理情報を抽出するには、大規模で高度に相互接続されたソフトウェアエコシステム上に実装された多段階解析が必要である。
汎用の大規模言語モデル(LLM)は、ユーザ要求だけで必要なAPI、依存関係、使用規約を指定できないため、そのようなタスクに対する信頼性の低いプログラムを生成することが多い。
我々は、これらのソフトウェア関係を生成前に整理し、推論時にタスク関連知識を取得する。
オープンソースのROOTフレームワークを代表的かつ再現可能なテストベッドとして使用し、異種ソフトウェア知識グラフ上のハイブリッド検索、スキル選択ワークフロー例、実行誘導修復を組み合わせた完全な基盤システムの評価を行った。
275のROOTタスクのベンチマークでは、初回実行をCrude Codeオーケストレーションでは58.5%から76.0%、スタンドアロンオーケストレーションでは51.3%から64.0%に改善している。
最終成功率は90.5%から96.0%に増加し、78.9%から90.9%に増加した。
この利得は強力なコーディングエージェントの下で持続し、エージェント的な足場がすでにある場合でも、明示的なソフトウェア知識が価値のあるままであることを示している。
このメソッドはROOTや特定のモデルに固有の事実ではなく、大規模なコードベースに共通するソフトウェア関係をキャプチャするので、特にドキュメントが不足したり、内部依存関係が複雑である場合、他の実験フレームワークやプロプライエタリなソフトウェアに転送する必要がある。
関連論文リスト
- Orchard: An Open-Source Agentic Modeling Framework [124.68499958175111]
スケーラブルなエージェントモデリングのためのオープンソースのフレームワークOrchardを紹介します。
Orchard Envは、サンドボックスライフサイクル管理のための再利用可能なプリミティブを提供する軽量環境サービスである。
Orchard Envの上に、3つのエージェントモデリングレシピを構築します。
論文 参考訳(メタデータ) (2026-05-14T16:35:12Z) - Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies [29.138677906501865]
大規模なファイル依存を伴うワークスペース学習におけるAIエージェントの評価のためのベンチマークであるWorkspace-Benchを紹介する。
5つのワーカープロファイル、74のファイルタイプ、20,476のファイル(最大20GB)を持つ現実的なワークスペースを構築し、それぞれが7,399の合計ルーリックに対して評価された独自のファイル依存グラフを持つ388のタスクをキュレートする。
論文 参考訳(メタデータ) (2026-05-05T10:17:06Z) - Agentic AI in the Software Development Lifecycle: Architecture, Empirical Evidence, and the Reshaping of Software Engineering [0.0]
現代のエージェントシステムは、リポジトリ、機能、アルゴリズムの粒度で機能する。
本稿ではエージェントソフトウェア工学システムのための6層参照アーキテクチャを提案する。
調査の中心的な対象は、コード生成から人事監督下での委任執行へと移行したと論じる。
論文 参考訳(メタデータ) (2026-04-29T04:06:47Z) - SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents [100.12367115920121]
SciGymAgentは4つの自然科学分野にまたがる1,780のドメイン固有ツールを備えたスケーラブルなインタラクティブ環境である。
SciAgentBenchについても紹介する。
論文 参考訳(メタデータ) (2026-02-13T14:58:18Z) - Lifecycle-Aware code generation: Leveraging Software Engineering Phases in LLMs [12.70863561286374]
トレーニング段階と推論段階の両方に中間アーティファクトを組み込んだライフサイクル対応フレームワークを導入する。
実験によると、ライフサイクルレベルの微調整は、微調整の前に同じモデルで最大75%の精度でコードの正しさを向上させる。
オープンソース LLM は、かつて私たちのフレームワークの下で微調整され、コードで事前訓練されたモデルにマッチするか、わずかに優れています。
論文 参考訳(メタデータ) (2025-10-28T02:54:02Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - Advancing LLM Reasoning Generalists with Preference Trees [119.57169648859707]
推論に最適化された大規模言語モデル(LLM)のスイートであるEulusを紹介する。
Eurusモデルは、様々なベンチマークでオープンソースのモデルの間で最先端の結果を得る。
論文 参考訳(メタデータ) (2024-04-02T16:25:30Z) - SOEN-101: Code Generation by Emulating Software Process Models Using Large Language Model Agents [50.82665351100067]
FlowGenは、複数のLarge Language Model (LLM)エージェントに基づいたソフトウェアプロセスモデルをエミュレートするコード生成フレームワークである。
FlowGenScrumをHumanEval、HumanEval-ET、MBPP、MBPP-ETの4つのベンチマークで評価した。
論文 参考訳(メタデータ) (2024-03-23T14:04:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。