論文の概要: PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language
- arxiv url: http://arxiv.org/abs/2607.09789v1
- Date: Wed, 08 Jul 2026 16:35:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.194661
- Title: PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language
- Title(参考訳): PHITSBench:自然言語を用いたAI支援PHITS放射輸送入力生成のための実行スコア付きベンチマーク
- Abstract要約: PHITSBenchはモンテカルロ粒子および重イオン輸送システムのための実行スコア付きベンチマークである。
パラメータ編集(Edit)、構文修復(Repair)、自然言語記述からの完全なシミュレーション生成(Reproduce)の3つの一般的なワークフローカテゴリにまたがる282のトランスポート対応タスクで構成されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce PHITSBench, an execution-scored benchmark for the Monte Carlo Particle and Heavy Ion Transport code System (PHITS). PHITSBench comprises 282 transport-scorable tasks spanning three common workflow categories: parameter editing (Edit), syntax repair (Repair ), and complete simulation generation from natural-language descriptions (Reproduce). Each task is evaluated using a Composite Metric Score that combines execution success with agreement between generated and reference transport observables. Using PHITSBench, we evaluate five GPT-5.4-based configurations ranging from zero-shot prompting to knowledge-augmented and agentic workflows. Without domain-specific knowledge, the model performs well on editing and repair tasks (95% and 70% success, respectively) but fails to generate correct simulations from scratch (0% success on the Reproduce track). A structured, machine-readable PHITS knowledge catalog, supplied alongside the user manual, raises single-shot Reproduce-task success to 57%. Agentic execution provides a further improvement to 66-73%, but at increased computational cost. Failure analysis shows that the remaining errors are dominated by incorrect selection and configuration of physical observables rather than syntax generation. These results suggest that future progress in AI-assisted radiation-transport modeling will depend as much on machine-readable knowledge bases, curated domain-training datasets, and execution-grounded evaluation environments as on advances in foundation models themselves.
- Abstract(参考訳): PHITSBenchはモンテカルロ粒子および重イオン輸送符号系(PHITS)のベンチマークである。
PHITSBenchは、パラメータ編集(Edit)、構文修復(Repair)、自然言語記述(Reproduce)からの完全なシミュレーション生成の3つの一般的なワークフローカテゴリにまたがる282のトランスポート対応タスクで構成されている。
各タスクは、実行の成功と生成されたトランスポートオブザーバと参照トランスポートオブザーバとの一致を組み合わせた複合メトリックスコアを使用して評価される。
PHITSBenchを用いて、ゼロショットプロンプトから知識強化およびエージェントワークフローに至るまで、GPT-5.4ベースの5つの構成を評価する。
ドメイン固有の知識がなければ、モデルは編集および修復作業(それぞれ95%と70%の成功)でうまく機能するが、スクラッチから正しいシミュレーションを生成することができない(Reproduceのトラックで0%の成功)。
ユーザマニュアルと一緒に提供される構造化されたマシン読み取り可能なPHITSナレッジカタログは、シングルショットのReproduce-taskの成功を57%に引き上げている。
エージェント実行は66-73%の改善を提供するが、計算コストは増大する。
フェール解析は、残りのエラーは構文生成ではなく、物理的な可観測物の誤った選択と構成によって支配されていることを示している。
これらの結果は、AIによる放射線輸送モデリングの今後の進歩は、基礎モデル自体の進歩と同様に、機械可読な知識ベース、訓練済みのドメイントレーニングデータセット、実行基盤評価環境に依存することを示唆している。
関連論文リスト
- EvolveScaler: Synthesizing Information-Evolution Contexts via Executable State Machines and Natural-Language Rendering [57.87517047585447]
我々はEvolveScalerを紹介した。EvolveScalerはコード駆動のフレームワークで、自然言語としてレンダリングする前に情報進化を定義する。
EvolveScalerを117のタスクプロトタイプと159のファイナルクエスト演算子でインスタンス当たり約7~1200のイベントにまたがる5つの難易度でインスタンス化する。
very_longティアでは、最強のモデルが59.3%のavg@5に達し、6つのモデルが10%以下である。
論文 参考訳(メタデータ) (2026-09-08T08:40:05Z) - CRAFTS: Collaborative Role-Adaptive Fine-Tuning of LLM Agents for Chemical Process Simulation [27.88778816587853]
CRAFTSは、シミュレーションビルディングを有界なサブタスクに分解することで、化学工学者の段階的なワークフローを反映する。
微調整は、スキーマクリティカルな3つの視覚、トポロジ、および仕様の役割に適用される。
結果として得られるVisualGraphIR、TopologyIR、SpecIR、BuildPlan、SolveReportは、ユニット、ポート、熱力学、数値、実行の決定を公開する。
論文 参考訳(メタデータ) (2026-08-02T16:42:47Z) - A corrective agentic hybrid RAG and an operations-grounded evaluation for a scientific facility [0.0]
APS-RAG(Advanced Photon Source Retrieval Augmented Generation)を提案する。
検索エンジンは、密度、スパース、知識グラフチャネルをクエリ型適応逆数融合で融合する。
APS-Benchは50問の質問応答(QA)データセットで、監査可能な金の回答を提供する。
論文 参考訳(メタデータ) (2026-07-27T17:01:30Z) - GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science [39.146761527401424]
GRACE-DSは、LSMを用いたオートMLエージェントの事前デプロイ評価のための、データサイエンスにおけるリワード誘導エージェント補正環境である。
エージェントをリアルなワークフローステージに公開し、計画やデータインスペクションから機能エンジニアリング、モデル開発、バリデーション、コード修正まで、最終提出まで。
これらの結果から、GRACE-DSはLLMベースのAutoMLエージェントが実運用環境下で機械学習を実行する能力を評価するための堅牢なプラットフォームとして確立された。
論文 参考訳(メタデータ) (2026-06-14T19:58:06Z) - Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis [68.28714988482703]
プロセス・リワード・モデル(PRM)は、LLM(Large Language Models)の推論能力を増強することに成功した。
本稿では,一般ドメインのPRMがデータ分析エージェントの監督に苦慮していることを示す。
本稿では,新しい環境対応生成プロセス報酬モデルであるDataPRMを紹介する。
論文 参考訳(メタデータ) (2026-04-27T09:00:30Z) - Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation [3.225273674498579]
我々は,大言語モデルがコンパイルフェーズ中に実行可能なコードアーティファクトを生成するパラダイムであるコンパイルAIについて研究し,その後,さらなるモデル実行を必要とせずに決定的に実行する。
当社のコントリビューションは、ハイテイクなランタイムエンタープライズへの適用に関するシステム指向の研究です。
論文 参考訳(メタデータ) (2026-04-06T20:25:20Z) - SimuScene: Training and Benchmarking Code Generation to Simulate Physical Scenarios [71.65387146697319]
大規模言語モデル(LLM)は、数学の競争、複雑なコーディング、科学的推論といったタスクのために広く研究されている。
物理シナリオをシミュレートしてLLMを訓練し,評価する最初の体系的な研究であるSimuSceneを提案する。
品質を保証するために、人間の検証とともに、データ収集のための自動パイプラインを構築します。
論文 参考訳(メタデータ) (2026-02-11T13:26:02Z) - From Brute Force to Semantic Insight: Performance-Guided Data Transformation Design with LLMs [48.83701310501069]
大規模言語モデル(LLM)は、コード合成において顕著な性能を達成した。
本稿では,LLMが最適変換を自律的に設計できる性能対応クローズドループソリューションを提案する。
6,000以上のPyTorch拡張関数を実験的に評価した新しいリポジトリ上で,低ランク適応型LPMを微調整する。
論文 参考訳(メタデータ) (2026-01-07T11:13:02Z) - Multi-Agent Systems for Dataset Adaptation in Software Engineering: Capabilities, Limitations, and Future Directions [8.97512410819274]
本稿では,データセット適応タスクにおいて,最先端のマルチエージェントシステムがどのように機能するかについて,最初の実証的研究を行う。
我々は、GitHub Copilotを評価し、ROCODEやLogHub2.0といったベンチマークリポジトリからSE研究成果物を適用する。
その結果、現在のシステムはキーファイルを識別し、部分的な適応を生成することができるが、正しい実装を生成することは滅多にない。
論文 参考訳(メタデータ) (2025-11-26T13:26:11Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - CorrectBench: Automatic Testbench Generation with Functional Self-Correction using LLMs for HDL Design [6.414167153186868]
機能的自己検証と自己補正を備えた自動テストベンチ生成フレームワークであるCorrectBenchを提案する。
提案手法は, 88.85%の成功率で生成したテストベンチの正当性を検証できる。
作業性能は, 従来よりも62.18%高く, 直接手法のパス比の約5倍である。
論文 参考訳(メタデータ) (2024-11-13T10:45:19Z) - FlowTS: Time Series Generation via Rectified Flow [67.41208519939626]
FlowTSは、確率空間における直線輸送を伴う整流フローを利用するODEベースのモデルである。
非条件設定では、FlowTSは最先端のパフォーマンスを達成し、コンテキストFIDスコアはStockとETThデータセットで0.019と0.011である。
条件設定では、太陽予測において優れた性能を達成している。
論文 参考訳(メタデータ) (2024-11-12T03:03:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。