論文の概要: MatClaw: An Autonomous Code-First LLM Agent for End-to-End Materials Exploration
- arxiv url: http://arxiv.org/abs/2604.02688v1
- Date: Fri, 03 Apr 2026 03:32:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 17:20:24.303158
- Title: MatClaw: An Autonomous Code-First LLM Agent for End-to-End Materials Exploration
- Title(参考訳): MatClaw: エンド・ツー・エンドの材料探査のための自律型コードファーストLLMエージェント
- Abstract要約: 我々は、Pythonを直接書き、実行するためのコードファーストエージェントであるMatchClawを提示する。
MatClawはコード生成を確実に扱うが、暗黙のドメイン知識に苦慮している。
その結果、ガイド付きと完全に自律的な計算材料研究のギャップはこれまで以上に狭くなっていることが明らかとなった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing LLM agents for computational materials science are constrained by pipeline-bounded architectures tied to specific simulation codes and by dependence on manually written tool functions that grow with task scope. We present MatClaw, a code-first agent that writes and executes Python directly, composing any installed domain library to orchestrate multi-code workflows on remote HPC clusters without predefined tool functions. To sustain coherent execution across multi-day workflows, MatClaw uses a four-layer memory architecture that prevents progressive context loss, and retrieval-augmented generation over domain source code that raises per-step API-call accuracy to ${\sim}$99 %. Three end-to-end demonstrations on ferroelectric CuInP2S6 (machine-learning force field training via active learning, Curie temperature prediction, and heuristic parameter-space search) reveal that the agent handles code generation reliably but struggles with tacit domain knowledge. The missing knowledge, such as appropriate simulation timescales, equilibration protocols, and sampling strategies, is the kind that researchers accumulate through experience but rarely formalize. Two lightweight interventions, literature self-learning and expert-specified constraints, bridge these gaps, defining a guided autonomy model in which the researcher provides high-level domain knowledge while the agent handles workflow execution. Our results demonstrate that the gap between guided and fully autonomous computational materials research is narrower than ever before: LLMs already handle code generation and scientific interpretation reliably, and the rapid improvement in their capabilities will accelerate materials discovery beyond what manual workflows can achieve. All code and benchmarks are open-source.
- Abstract(参考訳): 既存の計算材料科学のLLMエージェントは、特定のシミュレーションコードに結びついたパイプラインバウンドアーキテクチャと、タスクスコープに応じて成長する手書きのツール関数に依存して制約される。
我々は,Pythonを直接書き,実行するためのコードファーストエージェントであるMatClawを紹介し,事前に定義されたツール関数を使わずに,リモートHPCクラスタ上でマルチコードワークフローをオーケストレーションするインストール済みのドメインライブラリを構成する。
マルチ日ワークフロー間のコヒーレントな実行を維持するため、MatchClawでは、プログレッシブなコンテキスト損失を防止する4層メモリアーキテクチャと、ステップごとのAPIコール精度を${\sim}$99 %に上げるドメインソースコードに対する検索拡張生成を使用している。
強誘電体CuInP2S6(アクティブラーニング、キュリー温度予測、ヒューリスティックパラメータ空間探索による機械学習力場トレーニング)のエンドツーエンドの3つのデモでは、エージェントがコード生成を確実に処理するが、暗黙のドメイン知識に苦しむことが明らかになった。
適切なシミュレーションタイムスケール、均衡プロトコル、サンプリング戦略などの不足した知識は、研究者が経験を通じて蓄積するが、形式化されることは滅多にない。
2つの軽量な介入、文献の自己学習と専門家が特定した制約は、これらのギャップを埋め、エージェントがワークフローの実行を処理している間に、研究者が高度なドメイン知識を提供するガイド付き自律モデルを定義する。
LLMは、すでにコード生成と科学的解釈を確実に処理しており、その能力の急速な向上は、手動のワークフローが達成できる範囲を超えて、材料発見を加速します。
すべてのコードとベンチマークはオープンソースである。
関連論文リスト
- PRAXIS: Graph-Grounded Tacit Knowledge for Domain Code Generation [61.752289169878566]
ドメイン固有のビジネスルール、インターフェース契約、開発者が実践を通じて内部化するが文書化しない運用規約を含む、エージェントの暗黙の知識の欠如の根本原因を特定します。
この知識は、ドメイン・コードの下に深く埋もれており、コード・エンティティとその依存関係にまたがっており、それを持たないエージェントには見えません。
本稿では,ドメインコード生成のための暗黙的知識の抽出,表現,再利用を可能にするフレームワークであるPRAXISを提案する。
論文 参考訳(メタデータ) (2026-08-20T08:28:28Z) - ToFu: A White-Box, Token-Efficient Agent Harness for Researchers [73.72929185946842]
ToFuは、ファイルを読み、ファイルを編集し、コマンドを実行し、開発ツールと統合する研究者のためのエージェントハーネスだ。
研究助手として、より優れたトークン効率、低コスト、多言語能力で実践的な研究を支援する。
研究対象として、ToFuはホワイトボックスのエージェントハーネスを提供しており、研究者はオーケストレーションロジック、ツール使用の振る舞い、デザインを検査、修正、評価することができる。
論文 参考訳(メタデータ) (2026-07-13T11:26:06Z) - Large Language Model Agent for User-friendly Chemical Process Simulations [0.0]
大規模言語モデル (LLM) エージェントは AVEVA Process Model Protocol (MCP) と統合され、自然言語のシミュレーションを可能にする。
2つのケーススタディは、異なるタスクの複雑さと相互作用モードにわたるフレームワークを評価する。
このフレームワークは、技術的な概念の翻訳と実証によって教育目的と、データ抽出の自動化、ルーチンタスクの高速化、サポートによって経験豊富な実践者の両方に役立ちます。
オーバーシンプル化、計算エラー、技術的ヒックアップといった現在の制限は専門家の監視を必要とするが、このフレームワークはLSMベースのエージェントが貴重な協力者になれることを示唆している。
論文 参考訳(メタデータ) (2026-01-15T12:18:45Z) - An Agentic Framework for Autonomous Materials Computation [70.24472585135929]
大規模言語モデル(LLM)は、科学的発見を加速するための強力なツールとして登場した。
近年の進歩はLLMをエージェントフレームワークに統合し、複雑な科学実験のための検索、推論、ツールの使用を可能にしている。
本稿では,第一原理計算の信頼性向上を目的としたドメイン特化エージェントを提案する。
論文 参考訳(メタデータ) (2025-12-22T15:03:57Z) - From Code Foundation Models to Agents and Applications: A Practical Guide to Code Intelligence [150.3696990310269]
大規模言語モデル(LLM)は、自然言語記述を直接関数コードに変換することによって、自動ソフトウェア開発を変革した。
コードLLMに関する総合的な合成と実践的ガイド(一連の解析および探索実験)を提供する。
一般LLM(GPT-4, Claude, LLaMA)とコード特殊化LLM(StarCoder, Code LLaMA, DeepSeek-Coder, QwenCoder)のコード機能の解析を行う。
論文 参考訳(メタデータ) (2025-11-23T17:09:34Z) - On LLM-Assisted Generation of Smart Contracts from Business Processes [0.08192907805418582]
大規模言語モデル(LLM)は、ソフトウェアの生成方法の現実を変えました。
本稿では、ビジネスプロセス記述からスマートコントラクトコードを生成するためのLCMの使用について探索的研究を行う。
以上の結果から,LLMの性能はスマートコントラクト開発に必要な信頼性に劣ることがわかった。
論文 参考訳(メタデータ) (2025-07-30T20:39:45Z) - Is Compression Really Linear with Code Intelligence? [60.123628177110206]
textitFormat Annealingは、事前訓練されたモデルの本質的な能力を同等に評価するために設計された、軽量で透明なトレーニング手法である。
我々の経験的結果は、測定されたコードインテリジェンスとビット・パー・キャラクタ(BPC)の基本的な対数関係を明らかにする。
私たちの研究は、コードインテリジェンスの開発における圧縮の役割をより微妙に理解し、コードドメインにおける堅牢な評価フレームワークに貢献します。
論文 参考訳(メタデータ) (2025-05-16T16:59:14Z) - LLM Agents Making Agent Tools [2.5529148902034637]
ツールの使用は、大規模言語モデル(LLM)を、複雑なマルチステップタスクを実行できる強力なエージェントに変えた。
しかし、これらのツールは人間の開発者によって事前に実装されなければならない。
論文をコードで自律的にLLM互換のツールに変換するエージェントフレームワークであるToolMakerを提案する。
論文 参考訳(メタデータ) (2025-02-17T11:44:11Z) - OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models [76.59316249991657]
コードのための大規模言語モデル(LLM)は、コード生成、推論タスク、エージェントシステムなど、さまざまな領域で必須になっている。
オープンアクセスのコード LLM はプロプライエタリなモデルの性能レベルに近づきつつあるが、高品質なコード LLM は依然として限られている。
トップクラスのコードLLMであるOpenCoderは、主要なモデルに匹敵するパフォーマンスを達成するだけでなく、研究コミュニティの"オープンクックブック"としても機能します。
論文 参考訳(メタデータ) (2024-11-07T17:47:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。