論文の概要: Auto Research for Materials: Auditable AI-Scientist Workflows with Held-Out Transfer
- arxiv url: http://arxiv.org/abs/2607.17100v1
- Date: Sun, 19 Jul 2026 07:02:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.357239
- Title: Auto Research for Materials: Auditable AI-Scientist Workflows with Held-Out Transfer
- Title(参考訳): Auto Research for Materials: Held-Out TransferによるAI-Scientistワークフローの監査
- Abstract要約: AI研究エージェントは、新しい材料に作用するモデリング変更を見つけることなく、目に見えるスコアを改善することができる。
クローズドループエージェントは、未確認のエビデンスや、タスク間で再利用され、組み合わせられるコード変更に生き残る決定を生成できることを示す。
- 参考スコア(独自算出の注目度): 13.399139714704226
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: An AI research agent can improve the score it sees without finding a modelling change that works on new materials. We ask a stricter question. After repeated experiments, does the selected change survive on data that never entered the loop, and can its code be reused? We separate the search into changes to features, models, representations, and training data. Seven searches produce 701 evaluated changes across ten Matbench endpoints. Agents receive only the mean over five inner folds, reducing reliance on any single development split. We then freeze the selected code and evaluate it once on an untouched holdout. Nine of ten choices remain the best tested single intervention. The surviving changes reveal two materials modelling regimes. With composition alone, feature, model, and representation changes provide comparable routes to improvement. They include held-out MAE reductions of 17.4\% for band gap and 18.6\% for steel strength, as well as gains on both classification endpoints, while screened external data adds little. For structure tasks, richer geometry descriptors and model or calibration changes lower mean held-out MAE by 14.6\% and 7.1\% and lead on different property families, whereas composition embeddings do not transfer. Combining separately found feature and model changes yields a 26.3\% mean held-out improvement. These results show in materials prediction that closed-loop agents can produce decisions that survive unseen evidence and code changes that can be reused across tasks and combined. More broadly, they provide an evaluation design for testing executable discoveries beyond the feedback loop.
- Abstract(参考訳): AI研究エージェントは、新しい材料に作用するモデリング変更を見つけることなく、目に見えるスコアを改善することができる。
我々はより厳格な質問をする。
繰り返しの実験の後、選択した変更はループに入らなかったデータで生き残り、そのコードを再利用できますか?
検索を機能、モデル、表現、トレーニングデータの変更に分割します。
7つの検索は、10のMatebenchエンドポイント間で評価された701の変更を生成する。
エージェントは5つ以上の内部の折り目のみを受け取り、単一の開発分割への依存を減らす。
その後、選択したコードを凍結し、未修正のホールトアウトで評価します。
10の選択肢のうち9つは、最もテストされた単一介入である。
生き残った変化により、2つの物質モデリング体制が明らかになった。
コンポジションだけでは、機能、モデル、表現の変更は改善のための同等のルートを提供する。
これらは、バンドギャップが17.4\%、鋼鉄の強度が18.6\%の持続的MAE削減と、両方の分類エンドポイントでの利得を含み、スクリーニングされた外部データは少ない。
構造タスクでは、よりリッチな幾何学記述子とモデルまたはキャリブレーションは平均保持率MAEを14.6\%以下、7.1\%以下に減らし、異なるプロパティーファミリーを導くが、合成埋め込みは転送されない。
別々に発見された特徴とモデルの変更を組み合わせると、平均的保留時間の改善率は26.3 %となる。
これらの結果は、クローズドループエージェントが未確認のエビデンスや、タスク間で再利用可能なコード変更に耐える決定を生成できることを示す。
より広範に、フィードバックループを超えて実行可能な発見をテストするための評価設計を提供する。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - UpgradeBench: A Decision-Centric Benchmark for Upgrading Fine-Tuned LLM Specialists [10.23869027501654]
4つの連続したQwenリリースをカバーする決定駆動型縦断ベンチマークであるUpgradeを提示する。
アップグレードは、新しいチェックポイントが、固定準備された専門家のパフォーマンスを改善するかどうか、バージョン間での資産移動、そして、リカバリリソースが使用可能なものかどうか、という3つの中核的な疑問を解消する。
論文 参考訳(メタデータ) (2026-08-21T09:37:47Z) - DarwinX: Evolving Agent Harnesses Through Natural Selection [48.64258219266629]
ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
論文 参考訳(メタデータ) (2026-07-31T05:34:02Z) - The Librarian Who Refused to Code: Model-Dependent Identity Enactment in LLM Code Generation [0.0]
4つの条件(ペルソナなし、2人のエンジニアペルソナ、研究図書館ペルソナ)、12のコード生成タスク、2つのフロンティアモデル、5つのセル実行)をテストした。
事前登録された混合効果分析では, プロバイダが報告した出力トークンに対して, 条件・バイ・モデル相互作用が重要であった。
Claude Opusでは、最小限のエンジニアのペルソナが正確性を改善することなく可視出力を30%削減し、一方、徹底的なエンジニアのペルソナは正確性のないアウトプットを増加させた。
論文 参考訳(メタデータ) (2026-07-19T21:47:58Z) - Self-Evolving Agent Harnesses via Gated Semantic Quality-Diversity [10.3661763716032]
配置において、ハーネスは利用可能な唯一のレバーであるため、自動的に改善することが重量に触れることなくパフォーマンスを上げる自然な方法である。
本稿では,自己進化型エージェント・ハーネス・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-15T10:26:26Z) - Contrastive Reflection for Iterative Prompt Optimization [0.6533652962118279]
エージェントIRの反復的プロンプト最適化フレームワークであるContrastive Reflectionを提案する。
フレームワークをツリーベースのスライスセレクタでインスタンス化するが、コントリビューションはツリー自体よりもコントラストループである。
論文 参考訳(メタデータ) (2026-06-29T19:16:07Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Tool-Augmented Reward Modeling [58.381678612409]
本稿では,外部環境へのアクセスによるRMの強化により,制約に対処するツール拡張された嗜好モデリング手法であるThemisを提案する。
我々の研究は、外部ツールをRMに統合し、様々な外部ソースとの相互作用を可能にすることを目的としている。
人間の評価では、テミスで訓練されたRLHFはベースラインと比較して平均32%の勝利率を得る。
論文 参考訳(メタデータ) (2023-10-02T09:47:40Z) - Evaluating Prediction-Time Batch Normalization for Robustness under
Covariate Shift [81.74795324629712]
我々は予測時間バッチ正規化と呼び、共変量シフト時のモデル精度とキャリブレーションを大幅に改善する。
予測時間バッチ正規化は、既存の最先端アプローチに相補的な利点をもたらし、ロバスト性を向上させることを示します。
この手法は、事前トレーニングと併用して使用すると、さまざまな結果が得られるが、より自然なタイプのデータセットシフトでは、パフォーマンスが良くないようだ。
論文 参考訳(メタデータ) (2020-06-19T05:08:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。