論文の概要: Coding-agents can replicate scientific machine learning papers
- arxiv url: http://arxiv.org/abs/2607.02134v1
- Date: Thu, 02 Jul 2026 13:11:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.837511
- Title: Coding-agents can replicate scientific machine learning papers
- Title(参考訳): コーディングエージェントは科学的な機械学習論文を複製できる
- Abstract要約: 論文複製により、選択された各論文は、記録された証拠を持つターゲットを主張し、コーディングエージェントスキルとして実装する。
このワークフローにより、エージェントはこれらのターゲットを記録し、論文の手法を再構築し、計算実験を行い、生成された出力を証明とリンクさせ、論文の主張と比較する。
本論文は,4つの理科の機械学習論文における12の独立した実行について,ペーパーレプリケーションを評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scientific machine learning papers typically make computational claims, e.g., that the relative mean square error is less than 5% or that the 95% predictive credible interval covers the test data. A coding agent can be prompted to replicate those claims from paper materials alone, but the prompt does not by itself reliably preserve progress or check whether generated evidence supports the paper's claims. We introduce Paper-replication, a workflow that makes each selected paper claim a target with recorded evidence, and implement it as a coding-agent skill. The workflow makes the agent record those targets, reconstruct the paper's method, run computational experiments, link generated outputs to provenance and comparisons with the paper's claims, record where matched evidence appears in the replication report, and pass validation checks before completion. We evaluate Paper-replication on twelve independent runs across four scientific machine learning papers. All twelve workspaces pass the completion gate, and all 158 recorded targets are matched with report coverage. Even in this completed workspace state, repeated runs differ in how papers are divided into targets, in numerical fidelity to the source papers, in elapsed replication time, in the number of intermediate executions replaced before final evidence is accepted, and in the rules used to accept evidence. Paper-replication makes completion depend on workspace evidence and validation checks rather than on the agent's final message.
- Abstract(参考訳): 科学機械学習の論文は一般に、相対的な平均二乗誤差が5%未満であるか、95%の予測可能な区間がテストデータをカバーするという計算的な主張をしている。
符号化エージェントは、紙材料だけでこれらの主張を複製するよう促すことができるが、プロンプトはそれ自体が進捗を確実に保存したり、生成された証拠が論文の主張を支持しているかどうかを確認することはない。
本稿では,各論文が記録された証拠をターゲットとして主張するワークフローであるPaper-Replicationを紹介し,それをコーディングエージェントのスキルとして実装する。
このワークフローにより、エージェントはこれらのターゲットを記録し、紙の手法を再構築し、計算実験を実行し、生成された出力を証明とリンクさせ、論文の主張と比較する。
本論文は,4つの理科の機械学習論文における12の独立した実行について,ペーパーレプリケーションを評価した。
12のワークスペースは全て完了ゲートを通過し、記録された158のターゲットはすべてレポートカバレッジにマッチする。
この完了したワークスペース状態においても、紙をターゲットに分割する方法、原論文への数値忠実度、経過した複製時間、最終証拠が受け入れられる前に置換された中間実行回数、そして証拠を受け入れるために使用される規則で繰り返し実行される。
ペーパーレプリケーションは、エージェントの最終メッセージではなく、ワークスペースのエビデンスや検証チェックに依存する。
関連論文リスト
- Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill [8.917367808177904]
本稿では,既存のコーディングアシスタント内の13種類の構成可能なスキルとして実装された,エンドツーエンドの研究論文生成システムSpark-to-Paperを紹介する。
実験計画と報告を分離し、結果が観察される前に必要な証拠が特定され、測定結果に応じて原稿クレームが修正される。
8つの制御された研究トピックの中で、Spark-to-Paperは99.5%の引用妥当性と96.4%の数値編集性を達成した。
論文 参考訳(メタデータ) (2026-08-12T11:11:07Z) - DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments [51.049999642138]
誤解を招く証拠の下で、回答回復のための100タスクのベンチマークであるDRNOISEを紹介する。
それぞれのタスクは、2つの間接的レコードチェーンが支持する固有の金の答えを持ち、ペアのノイズ条件は競合する答えを直接記述する1つのもっともらしい文書を付加する。
強いクリーンタスク性能を持つエージェント全体で、この単一の介入は66-88ポイントの精度低下を引き起こす。
論文 参考訳(メタデータ) (2026-07-19T15:20:40Z) - ResearchLoop: An Evidence-Gated Control Plane for AI-Assisted Research [4.9833735627186435]
ResearchLoopはAI支援型計算研究のためのエビデンス付き制御プレーンである。
ResearchLoopは、リサーチ質問、タスク契約、エビデンスオブジェクト、クレーム台帳、クローズアウト、ペーパーバインディングを耐久性のあるプロジェクトステートとして扱う。
この技術レポートは、完全なプロトコル仕様、状態モデル、トランジションルール、クレーム・アドミッション・アルゴリズム、インサイト・コンポーティングメカニズムを提供する。
論文 参考訳(メタデータ) (2026-05-27T10:29:00Z) - Rollout Cards: A Reproducibility Standard for Agent Research [15.381365113892848]
論文は、レポートされたスコアでシステムを比較し、それらのスコアの背後にロールアウトレコードを残すことは、検査が困難である。
エージェント的なタスクでは、評価がロールアウトの異なる部分を選択したり、異なるレポートルールを適用する場合、同じ振る舞いが異なるレポートスコアを受け取ることができるため、これが重要です。
50の人気のあるトレーニングと評価レポジトリの構造化監査では、ヘッドラインスコアとともに、実行が失敗、エラー、あるいはスキップされた回数を報告していないことが判明した。
論文 参考訳(メタデータ) (2026-05-12T13:54:31Z) - AutoResearch: An Execution-Grounded Multi-Agent Framework for Reliable Research Workflow Automation [8.807417226975081]
AutoResearchは、信頼性の高い研究ワークフロー自動化のための実行基盤のマルチエージェントフレームワークである。
システムは、エラー、引用検証失敗、レビューエージェントフィードバックを、生成された研究成果物の実用的なフィルタリング信号として扱う。
論文 参考訳(メタデータ) (2026-05-04T08:24:21Z) - Read the Paper, Write the Code: Agentic Reproduction of Social-Science Results [46.81245843451412]
論文から構造化された方法記述を抽出するエージェント再生システムを開発した。
エージェントは元のコードや結果、あるいは紙を見ることはない。
エラー帰属ステップは、根本原因を特定するためにシステムチェーンをトレースする。
論文 参考訳(メタデータ) (2026-04-23T17:59:18Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - What Papers Don't Tell You: Recovering Tacit Knowledge for Automated Paper Reproduction [57.86097956633207]
Methodは、学術論文から実行可能なコードを生成するグラフベースのエージェントフレームワークである。
3つのドメイン、10のタスク、10の最近の論文にまたがる拡張ReproduceBenchでは、公式実装に対する平均的なパフォーマンスギャップが10.04%に達する。
論文 参考訳(メタデータ) (2026-03-02T12:33:31Z) - Enhancing Automated Paper Reproduction via Prompt-Free Collaborative Agents [8.185402940269794]
本稿では,コード生成の品質を自動的に向上する,プロンプトフリーな協調エージェントフレームワークを提案する。
提案手法では,各ステップの出力が対応するシステムプロンプトに規定された要求を満たすかどうかを検証する検証エージェントと,識別された問題に基づいて出力を更新する精査エージェントの2つを用いている。
論文 参考訳(メタデータ) (2025-12-02T14:24:23Z) - Reflective Paper-to-Code Reproduction Enabled by Fine-Grained Verification [46.845133190560375]
複雑なコードを効率的にデバッグするために、人間が体系的なチェックリストを使う方法に触発されて、textbfReflective Paper-to-Code textbfReproductionフレームワークである textbfReProを提案する。
紙の指紋を自動的に抽出し、高品質な監視信号として機能する、正確で原子的な基準の包括的なセットを参照する。
ベースラインよりも13.0%のパフォーマンスギャップを達成し、反射の複雑な論理的および数学的基準を正しく修正する。
論文 参考訳(メタデータ) (2025-08-21T06:57:44Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。