論文の概要: Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Autonomous Experimental Design
- arxiv url: http://arxiv.org/abs/2608.03501v1
- Date: Tue, 04 Aug 2026 11:43:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.159411
- Title: Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Autonomous Experimental Design
- Title(参考訳): LLMは高品質な実験を設計できるか? : 自律的実験設計に関する総合的・体系的ベンチマーク
- Authors: Zejun Liu, Jian Wu, Ru Peng, Yuliang Ji, Dongyuan Li, Renhe Jiang, Yue Zhang,
- Abstract要約: AI for Research(AI4Research)は、AIを活用して科学的合理性を自動化する。
体系的な実験設計を行うAIの能力を評価するためのベンチマークは存在しない。
ベンチマークでは,(1)ほとんどのLLMは直接的に高品質な実験を設計できない,(2)低レベルな構成では全てのLLMが性能ボトルネックを示し,(3)検索モードでは設計品質が向上しない,という3つの結果が示されている。
- 参考スコア(独自算出の注目度): 28.981794518841777
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI for Research (AI4Research) leverages AI to automate and improve scientific workflows. While experimental design is a critical stage of the research process, prior work has focused primarily on code implementation and execution, overlooking the importance of this stage, and no benchmark exists to evaluate AI's ability to conduct systematic experiment design. To bridge this gap, we propose SCOPE, a Scientific COmprehensive Planning Evaluation Benchmark constructed from 300 high-quality latest papers across 19 research domains from top-tier venues (e.g., ICML, NeurIPS, and ICLR),evaluating LLMs on two dimensions: High-Level planning completeness (main, ablation, and analysis experiments) and Low-Level configuration accuracy and rationality (datasets, baselines, and metrics). Benchmarking reveals three findings: (1) most LLMs cannot directly design high-quality experiments; (2) all LLMs exhibit a performance bottleneck in low-level configuration; and (3) search mode does not improve design quality. Furthermore, to address these challenges, we propose OptED, a novel agentic workflow to optimize LLM-based experimental design, that enhances LLM-based experimental planning through stage isolation, tool augmentation, and rule-based constraints, effectively alleviating the configuration bottleneck.
- Abstract(参考訳): AI for Research(AI4Research)は、AIを活用して科学ワークフローの自動化と改善を行う。
実験設計は研究プロセスの重要な段階であるが、以前の研究は主にコードの実装と実行に重点を置いており、この段階の重要性を見落としており、AIが体系的な実験設計を行う能力を評価するためのベンチマークは存在しない。
このギャップを埋めるために、SCOPE(Science COmprehensive Planning Evaluation Benchmark)を提案し、トップレベル(ICML、NeurIPS、ICLRなど)からトップレベル(ICML、NeurIPS、ICLRなど)の19研究領域にまたがる300の高品質な最新論文から、高レベルプランニング完全性(メイン、アブレーション、分析実験)と低レベル構成精度と合理性(データセット、ベースライン、メトリクス)を2次元で評価する。
ベンチマークでは,(1)ほとんどのLLMは直接的に高品質な実験を設計できない,(2)低レベルな構成では全てのLLMが性能ボトルネックを示し,(3)検索モードでは設計品質が向上しない,という3つの結果が示されている。
さらに,これらの課題に対処するために,ステージ分離,ツール拡張,ルールベース制約を通じてLLMに基づく実験計画を強化し,構成ボトルネックを効果的に緩和する,LSMベースの実験設計を最適化する新しいエージェントワークフローであるOPtEDを提案する。
関連論文リスト
- FrontierOR: Benchmarking LLMs' Capacity for Efficient Algorithm Design in Large-Scale Optimization [61.43300970020897]
大規模言語モデル(LLM)は、最適化モデリングとソルバコード生成にますます使われている。
既存のベンチマークは、実際のスケールと複雑さよりもはるかに低い、小さな、あるいは単純化された例に限られている。
現実的な大規模最適化問題に対して,LLMに基づく効率的なアルゴリズム設計を評価するための最初のベンチマークとしてFrontierORを紹介した。
論文 参考訳(メタデータ) (2026-05-24T20:10:42Z) - AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration - Learning from Cheap, Optimizing Expensive [46.53605767076999]
不適切な構成選択は、かなりの計算資源を浪費し、モデルがその潜在能力を最大限に実現できないようにする。
従来の自動手法は、繰り返し試行錯誤が可能な安価な設定のために設計されている。
我々は,人間研究者が低忠実度実験から一般化可能な原理を学習する方法を模倣するエージェントフレームワークであるAutoLLMResearchを提案する。
論文 参考訳(メタデータ) (2026-05-12T04:42:35Z) - Large Language Models for Physics Instrument Design [0.0]
物理機器設計における大規模言語モデル(LLM)の利用について検討し、その性能を強化学習(RL)と比較する。
RL はより強力な最終設計をもたらすが、現代の LLM は、有効で、リソースを意識し、物理的に意味のある構成を一貫して生成する。
そのため、自動クローズドループ・インスツルメンツの設計に向け、最適化の構築と監督に要する人的労力を削減できる。
論文 参考訳(メタデータ) (2026-01-12T14:30:54Z) - OPT-Engine: Benchmarking the Limits of LLMs in Optimization Modeling via Complexity Scaling [13.57588221678224]
大規模言語モデル(LLM)は、最適化モデリングの驚くべき進歩を示している。
自動定式化と問題解決におけるそれらの能力の境界は、まだよく理解されていない。
OPT-ENGINEは、制御可能でスケーラブルな難易度を持つ最適化モデルにおいて、LCMを評価するために設計されたベンチマークフレームワークである。
論文 参考訳(メタデータ) (2026-01-09T09:22:33Z) - SelfAI: Building a Self-Training AI System with LLM Agents [79.10991818561907]
SelfAIは、高レベルの研究目的を標準化された実験構成に変換するためのUser Agentを組み合わせた、一般的なマルチエージェントプラットフォームである。
実験マネージャは、連続的なフィードバックのための構造化知識ベースを維持しながら、異種ハードウェアをまたいだ並列かつフォールトトレラントなトレーニングを編成する。
回帰、コンピュータビジョン、科学計算、医用画像、薬物発見ベンチマークなどを通じて、SelfAIは一貫して高いパフォーマンスを達成し、冗長な試行を減らしている。
論文 参考訳(メタデータ) (2025-11-29T09:18:39Z) - Can LLMs Configure Software Tools [0.76146285961466]
ソフトウェア工学では、複雑なシステム内での最適なパフォーマンスを確保するためには、ソフトウェアツールの精巧な構成が不可欠である。
本研究では,Large-Language Models (LLMs) を利用したソフトウェア構成プロセスの合理化について検討する。
本研究は,Chat-GPTなどのLCMを用いて,開始条件を特定し,検索空間を狭め,構成効率を向上する手法を提案する。
論文 参考訳(メタデータ) (2023-12-11T05:03:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。