論文の概要: Fantastic Scientific Agents and How to Build Them: AgentBuild for Rietveld Refinement
- arxiv url: http://arxiv.org/abs/2606.12834v1
- Date: Thu, 11 Jun 2026 03:01:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-12 15:55:27.550244
- Title: Fantastic Scientific Agents and How to Build Them: AgentBuild for Rietveld Refinement
- Title(参考訳): 幻の科学エージェントと作り方: 果樹園のエージェントビル
- Authors: Woong Shin, Craig A. Bridges, Marshall T. McDonnell, Rafael Ferreira da Silva,
- Abstract要約: 本稿では,エージェント構築をワークフローの段階として扱うことを提案する。
Contractはバージョン管理のルーブリックであり、難易度の高いカリキュラムであり、外部知識ベースのカリキュラムである。
MCP および A2Aveld の背後にある GSAS-II による X 線回折データのリート微細化のためにこれをインスタンス化する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As scientific workflows shift from deterministic executables to LLM-based agents, the development practices on offer, such as fine-tuning, reinforcement learning, and prompt-and-go, bury the scientist's judgment. We propose treating agent construction as a workflow stage and introduce AgentBuild, which builds a scientific agent from a contract the scientist authors. The contract is a version-controlled rubric, a difficulty-graded curriculum, and a curated external knowledge base. A rubric-driven judge gates a meta-optimizer coding agent that edits the agent within a declared boundary, so the build compiles the agent, not the scientist's judgment. We instantiate this for Rietveld refinement of X-ray diffraction data through GSAS-II behind MCP and A2A, where a blank-harness construction run progresses through a lithium lanthanum zirconium oxide (LLZO) signal-to-noise ladder, reaches the 4 hour scan as a frontier case, and exposes the workflow-scope limits that remain. The same rubric that rewards credible fits also scores trajectory scope, making the frontier a contract failure rather than a pattern-fitting failure. As base models evolve, re-running AgentBuild is a re-tune, not a rebuild, and the scientist's authored contract remains the durable asset.
- Abstract(参考訳): 科学的ワークフローが決定論的実行可能なものからLLMベースのエージェントへと移行するにつれて、微調整、強化学習、即時学習といった開発プラクティスが科学者の判断を埋める。
本稿では,エージェント構築をワークフローの段階として扱うことを提案する。
この契約は、バージョン管理されたルーリックであり、難易度の高いカリキュラムであり、外部知識ベースである。
ルーリック駆動の裁判官は、宣言された境界内でエージェントを編集するメタ最適化エージェントをゲートするので、ビルドは科学者の判断ではなくエージェントをコンパイルする。
MCP と A2A の後方で GSAS-II による X 線回折データのRietveld 改良のためにこれをインスタンス化し, リチウムランタンジルコニウム酸化ジルコニウム(LLZO) 信号-ノイズラグを通り, 4 時間の走査をフロンティアケースとして達成し, 残するワークフロースコープの限界を露呈する。
信頼に合うのと同じルーリックが軌道のスコープをスコアし、フロンティアはパターンに適合する失敗ではなく、契約の失敗になる。
ベースモデルが進化するにつれて、AgentBuildの再実行は再チューニングであり、再構築ではない。
関連論文リスト
- The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development? [80.24951682268332]
本稿では,自律エージェント開発のためのフロンティアモデルのキャパシティをテストするための評価フレームワークであるMeta-Agent Challenge(MAC)を紹介する。
評価の整合性を確保するため、このフレームワークは報奨ハッキングに対する多層防御によって確保される。
メタエージェントは人間工学的な基本方針とほとんど一致せず、その一部はプロプライエタリなフロンティアモデルに支配されている。
論文 参考訳(メタデータ) (2026-06-03T04:58:17Z) - Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction [0.02446672595462589]
我々は,LHC(Large Hadron Collider)から,公開論文とオープンサイエンスソフトウェアのみを用いて,言語モデルエージェントが実験分析を再現できるかどうかを評価するベンチマークであるCollind-Benchを紹介する。
したがってエージェントは、これらのギャップを埋めるために、物理的推論、ドメイン知識、試行錯誤に頼らなければならない。
以上の結果から, 平均的なエージェントが, ループ内解法を確実に打ち負かすことは不可能であることが示唆された。
論文 参考訳(メタデータ) (2026-05-13T18:00:00Z) - How to Interpret Agent Behavior [56.59836196946289]
本稿では,エージェントの動作を実行時に記述・解析するための分類法であるACT*ONOMYを紹介する。
共用語彙を提供することで、ACT*ONOMYは研究者、エージェントデザイナー、エンドユーザーがエージェントの振る舞いをより一貫して解釈するのに役立つ。
論文 参考訳(メタデータ) (2026-05-13T14:52:40Z) - An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc [7.236134946837382]
petscagent-benchはエージェント評価エージェントのパラダイムに基づいて構築されたエージェントフレームワークである。
正確性、パフォーマンス、コード品質、アルゴリズムの適切性、ライブラリ固有の規約の5つの評価カテゴリで14評価パイプラインを編成する。
本フレームワークは,HPC用PETScライブラリを用いて,現実的な問題のベンチマークスイート上で実演する。
論文 参考訳(メタデータ) (2026-03-16T22:46:10Z) - Veri-Sure: A Contract-Aware Multi-Agent Framework with Temporal Tracing and Formal Verification for Correct RTL Code Generation [4.723302382132762]
シリコングレードの正しさは、 (i) シミュレーション中心の評価の限られたカバレッジと信頼性、 (ii) 回帰と修復幻覚、 (iii) エージェントハンドオフ間で意図が再解釈される意味的ドリフトによってボトルネックが残っている。
エージェントの意図を整合させる設計契約を確立するマルチエージェントフレームワークであるVeri-Sureを提案する。
論文 参考訳(メタデータ) (2026-01-27T16:10:23Z) - Alita-G: Self-Evolving Generative Agent for Agent Generation [54.49365835457433]
汎用エージェントをドメインエキスパートに変換するフレームワークであるALITA-Gを提案する。
このフレームワークでは、ジェネラリストエージェントが対象ドメインタスクのキュレートされたスイートを実行する。
計算コストを削減しながら、大きな利益を得ることができます。
論文 参考訳(メタデータ) (2025-10-27T17:59:14Z) - Agent-Testing Agent: A Meta-Agent for Automated Testing and Evaluation of Conversational AI Agents [2.3429263075112288]
本稿では,静的コード解析,デザイナの尋問,文献マイニング,ペルソナ駆動の対人テスト生成を組み合わせたメタエージェントであるAgent-Testing Agent(ATA)を提案する。
各対話はLLM-as-a-Judge (LAAJ)ルーブリックでスコアされ、その後の試験をエージェントの最も弱い能力に向けて操るために使用される。
論文 参考訳(メタデータ) (2025-08-24T15:02:13Z) - R&D-Agent: An LLM-Agent Framework Towards Autonomous Data Science [70.1638335489284]
高レベルの機械学習エンジニアリングタスクは、労働集約的で反復的である。
機械学習プロセスを形式化する包括的で分離されたフレームワークであるR&D-Agentを紹介します。
R&D-AgentはMLEを2つのフェーズと6つのコンポーネントに定義し、MLEのエージェント設計を原則としてテスト可能なプロセスに変える。
論文 参考訳(メタデータ) (2025-05-20T06:07:00Z) - AgentGym: Evolving Large Language Model-based Agents across Diverse Environments [116.97648507802926]
大規模言語モデル(LLM)はそのようなエージェントを構築するための有望な基盤と考えられている。
我々は、自己進化能力を備えた一般機能 LLM ベースのエージェントを構築するための第一歩を踏み出す。
我々はAgentGymを提案する。AgentGymは、幅広い、リアルタイム、ユニフォーマット、並行エージェント探索のための様々な環境とタスクを特徴とする新しいフレームワークである。
論文 参考訳(メタデータ) (2024-06-06T15:15:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。