論文の概要: Evaluating a 4B open-weights local LLM for agentic DFT workflows: a literature reproducibility audit
- arxiv url: http://arxiv.org/abs/2608.29665v1
- Date: Sun, 30 Aug 2026 08:59:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.041016
- Title: Evaluating a 4B open-weights local LLM for agentic DFT workflows: a literature reproducibility audit
- Title(参考訳): エージェントDFTワークフローのための4BオープンウェイトローカルLLMの評価:文献再現性監査
- Abstract要約: この研究は、様々なハードウェア制約に対して自律的な科学パイプラインを実行するオープンウェイトQwen3:4Bモデルを評価する。
このシステムは、非構造化テキストからパラメータを抽出し、それらを密度汎関数理論(DFT)入力に変換し、シミュレーションを収束させる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic workflows in materials science relying on hosted commercial models face severe reproducibility, economic, and data-privacy constraints. To explore fully local agentic science, this work evaluates an open-weights Qwen3:4B model executing an autonomous scientific pipeline across varying hardware constraints. Applied to pentagonal two-dimensional materials, the system extracts parameters from unstructured text, translates them into density functional theory (DFT) inputs, and drives simulations to convergence under a strict neurosymbolic architecture where agents propose and deterministic code disposes. The workflow is guarded by verbatim text grounding and multi-pass inference unions to counteract hardware-induced structural collapse. Evaluated against 201 expert judgements, the extractor achieves 95.7% precision (95% CI 90.3-98.1%) and 67.3% recall (59.8-74.0%), ensuring extracted parameters are strictly factual. However, precision identifying absent parameters does not exceed 47.0%, establishing that the measured omission rate constitutes a loose upper bound on true literature incompleteness. Across three hardware configurations, complete GPU residency governs extraction quality more fundamentally than weight or cache precision, raising Matthews correlation from 0.414 to 0.530 at fixed quantisation and to 0.560 with an unquantised cache. A corpus-scale audit indicates only 19 (33.3%) of the 57 studies are reproducible in principle, reporting every method parameter needed to re-initialise the calculation. Driven to convergence, the workflow reproduces published lattice constants with a mean absolute relative error of 2.3% where the relaxed structure retains its prototype, establishing that lightweight open-weights models can reliably drive autonomous agentic workflows when bounded by deterministic code gates.
- Abstract(参考訳): ホストされた商業モデルに依存した材料科学のエージェントワークフローは、再現性、経済的、データプライバシの厳しい制約に直面している。
完全に局所的なエージェント科学を探求するために、この研究は、様々なハードウェア制約を越えて自律的な科学パイプラインを実行するオープンウェイトなQwen3:4Bモデルを評価する。
ペンタゴナルな2次元材料に適用すると、システムは非構造化テキストからパラメータを抽出し、それらを密度汎関数理論(DFT)入力に変換し、エージェントが提案し決定的なコードを配置する厳密なニューロシンボリックアーキテクチャの下でシミュレーションを収束させる。
このワークフローは、ハードウェアが引き起こす構造的崩壊に対抗するために、冗長テキストグラウンドとマルチパス推論ユニオンによって守られている。
201人の専門家の判断に対して評価され、抽出器は95.7%の精度(95% CI 90.3-98.1%)と67.3%のリコール(59.8-74.0%)を達成し、抽出されたパラメータが厳密に事実であることを保証する。
しかし、欠落パラメータを特定する精度は47.0%を超えておらず、測定された欠落率は真の文献の不完全性に対する緩やかな上限となっている。
3つのハードウェア構成全体にわたって、完全なGPU常駐は、重量やキャッシュ精度よりも抜粋品質を根本的に管理し、固定量子化時にマシューズ相関を0.414から0.530、未定量キャッシュで0.560に引き上げる。
コーパススケール監査は、57研究のうち19(33.3%)のみが原則として再現可能であり、計算を再起動するために必要なすべてのメソッドパラメータを報告している。
収束により、ワークフローは公表された格子定数を平均的な絶対相対誤差2.3%で再現し、緩和された構造はそのプロトタイプを維持し、軽量なオープンウェイトモデルが決定論的コードゲートでバウンドされた場合、自律的なエージェントワークフローを確実に駆動できることを確立した。
関連論文リスト
- State of Thought Enables Endogenous Reasoning [48.902117018115256]
大規模言語モデル(LLM)の能力向上のための主要なアプローチとして、テスト時推論が登場した。
LLMにおける内在的推論を可能にする新しい推論パラダイムであるState of Thoughtを提案する。
SoTは平均ベースライン精度を一貫して改善し,生成トークンを62.6%,エンドツーエンドのレイテンシを44.6%削減した。
論文 参考訳(メタデータ) (2026-09-13T05:55:03Z) - Vision-Language Models for Analog Gauge Reading: An Empirical Study of Specialization, Transfer and Reliability [3.112410411428948]
本研究は,汎用視覚言語モデル(VLM)の特殊化,伝達,堅牢性,信頼性の体系的評価である。
Qwen2.5-VL-7B-インストラクトモデルは、ゼロショットプロンプト、インコンテキストラーニング(ICL)、および量子化低ランク適応(QLoRA)を用いたパラメータ効率の微調整を用いて評価される。
最高の微調整MPE値は、95%信頼区間(CI)が1.43-3.90%、圧力ゲージデータセットが2.61%、CIが1.66-3.80%、および4.4の合成データセットで2.39%である。
論文 参考訳(メタデータ) (2026-08-18T12:47:14Z) - A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents [0.0]
専門的エージェント軌道上のオープンウェイトLSMの微調整が、有能なコードエージェントを構築するための顕著なアプローチとして現れている。
本稿では,SWEトラジェクトリデータセット上でのQwen2.5-Coder-7B-InstructのLoRA微調整のためのトラジェクトリデータフィルタリングの系統的研究について述べる。
我々は,2軸品質評価フレームワークである効率とスタイルを提案し,戦略,スケール,アブレーション分析にまたがる16の制御実験を通じて評価する。
論文 参考訳(メタデータ) (2026-07-19T11:52:32Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - From Papers to Property Tables: A Priority-Based LLM Workflow for Materials Data Extraction [1.0901176137697233]
本稿では, 構造的, ショットレベルの衝撃物理実験記録を自動的に抽出し, 再構成するための, 即時駆動型階層的ワークフローを提案する。
パイプラインは1ショット当たり37の実験的なフィールドをターゲットにし、3段階の優先順位戦略を適用した。
ワークフローの精度は94.93%(T1)、92.04%(T2)、83.49%(T3)、全体的な重み付け精度は94.69%であった。
論文 参考訳(メタデータ) (2026-04-08T20:37:17Z) - Symmetry-Constrained Language-Guided Program Synthesis for Discovering Governing Equations from Noisy and Partial Observations [0.0]
SymLang (Symmetry-Constrained Language-Guided equation discovery) は3つの異なるアイデアをまとめる統一フレームワークである。
133の力学系において、SymLangは観測ノイズの10%以下で83.7%の正確な構造回復率を達成する。
すべての試験された体制において、この枠組みは構造的縮退を正しく識別し、自信ある1つの方程式を返すのではなく、明確に報告する。
論文 参考訳(メタデータ) (2026-03-06T20:42:36Z) - From Memorization to Creativity: LLM as a Designer of Novel Neural-Architectures [48.83701310501069]
大規模言語モデル(LLM)は、プログラム合成において優れているが、ニューラルネットワーク設計(信頼性、性能、構造的ノベルティ)を自律的にナビゲートする能力は、未調査のままである。
コード指向LLMをクローズドループ合成フレームワークに配置し、22の教師付き微調整サイクルの進化を解析することによって、この問題に対処する。
論文 参考訳(メタデータ) (2026-01-06T13:20:28Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Adaptive Monitoring and Real-World Evaluation of Agentic AI Systems [3.215065407261898]
大規模言語モデルと外部ツールを組み合わせたマルチエージェントシステムは、研究機関からハイテイクドメインへと急速に移行している。
この「先進的な」続編は、アルゴリズムのインスタンス化や経験的な証拠を提供することで、そのギャップを埋める。
AMDMは擬似ゴールドリフトで異常検出遅延を12.3秒から5.6秒に減らし、偽陽性率を4.5%から0.9%に下げる。
論文 参考訳(メタデータ) (2025-08-28T15:52:49Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。