論文の概要: DeepRepro: State-Aware Subplanning for Paper-to-Code Reproduction in Evolving Repositories
- arxiv url: http://arxiv.org/abs/2608.26557v1
- Date: Thu, 27 Aug 2026 02:54:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.231151
- Title: DeepRepro: State-Aware Subplanning for Paper-to-Code Reproduction in Evolving Repositories
- Title(参考訳): DeepRepro: 進化するリポジトリにおけるPaper-to-Code再現のためのステートアウェアなサブプランニング
- Abstract要約: 本稿では,実行状態対応サブプランニングに基づく,紙からコードへの再生のための状態認識フレームワークを提案する。
DeepReproは、進化するリポジトリの状態とランタイムフィードバックを、きめ細かい実装サブプランに変換する。
PaperBench Code-Devの実験によると、DeepReproは強力な科学的および商業的なコードエージェントベースラインを一貫して上回っている。
- 参考スコア(独自算出の注目度): 116.27249583403871
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in agentic large language models (LLMs) have enabled increasingly autonomous software engineering workflows, yet automatic machine learning (ML) paper-to-code reproduction remains a challenging long-horizon problem. Unlike conventional code generation, this task requires constructing and maintaining a fully functional repository whose state continuously evolves during execution. Existing systems typically rely on static upfront planning followed by sequential file-level generation, which often leads to inconsistencies as dependencies, interfaces, and execution feedback change over time. We propose DeepRepro, a state-aware framework for paper-to-code reproduction based on execution-state-aware subplanning. DeepRepro dynamically transforms evolving repository states and runtime feedback into fine-grained implementation subplans, keeping planning aligned with execution throughout repository construction. The framework further incorporates repository-aware orchestration and a lightweight process-aware interface for transparent monitoring of long-horizon reproduction. Experiments on PaperBench Code-Dev show that DeepRepro consistently outperforms strong scientific and commercial code-agent baselines.
- Abstract(参考訳): エージェント型大規模言語モデル(LLM)の最近の進歩は、ますます自律的なソフトウェアエンジニアリングワークフローを可能にしている。
従来のコード生成とは異なり、このタスクは実行中に状態が継続的に進化する完全に機能するリポジトリの構築とメンテナンスを必要とする。
既存のシステムは静的な事前計画に頼り、逐次ファイルレベルの生成が続く。
本稿では,DeepReproを提案する。
DeepReproは、進化しているリポジトリの状態とランタイムフィードバックを、きめ細かな実装サブプランに動的に変換し、リポジトリの構築全体を通して、計画と実行との整合性を維持する。
このフレームワークには、リポジトリ対応のオーケストレーションと、長い水平再生の透過的な監視のための軽量プロセス対応インターフェースも組み込まれている。
PaperBench Code-Devの実験によると、DeepReproは強力な科学的および商業的なコードエージェントベースラインを一貫して上回っている。
関連論文リスト
- Adaptive Critical Token-Aware Retrieval for Repository-Level Code Generation [53.85136813868056]
ACToRは、リポジトリレベルのコード生成のための適応型クリティカルトークン対応検索フレームワークである。
我々は、ACToRが、リポジトリレベルのベンチマークにおいて、最先端のメソッドを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-09-01T17:59:39Z) - Agentic Hardware Design as Repository-Level Code Evolution [8.614736536216526]
HORIZONは、ハードウェア設計をリポジトリレベルのコード進化として扱うセルフ進化エージェントフレームワークである。
我々はChipBench, RTLLM, Verilog-Eval, 9つのCVDPカテゴリについて検討した。
論文 参考訳(メタデータ) (2026-06-26T17:21:06Z) - Learning to Commit: Generating Organic Pull Requests via Online Repository Memory [11.042326503752756]
大きな言語モデル(LLM)ベースのコーディングエージェントは、制御されたベンチマークで印象的な結果を得るが、実際のメンテナが拒否するプルリクエストを定期的に生成する。
オンラインリポジトリメモリを通じてこのギャップを埋めるフレームワークであるLearning to Commitを紹介します。
論文 参考訳(メタデータ) (2026-03-27T17:58:56Z) - Understanding by Reconstruction: Reversing the Software Development Process for LLM Pretraining [66.89012795621349]
大規模言語モデル(LLM)は、複雑なソフトウェア工学に必要な、深く、長期にわたる推論に苦しむことが多い。
本稿では,再構築による理解という,新しいパラダイムを提案する。
マルチエージェントシミュレーションを用いて潜在エージェント軌道を合成するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-11T09:23:20Z) - CktEvo: Repository-Level RTL Code Benchmark for Design Evolution [7.09459001862514]
本稿では、レポレベルのRTL進化のためのベンチマークおよび参照フレームワークであるCktEvoを紹介する。
以前のベンチマークとは異なり、我々のベンチマークは、PPAがファイル間の依存関係から現れる完全なIPコアをターゲットにしています。
初期リポジトリが与えられたら、PPAを改善しながら機能的な動作を保存する編集を生成します。
実験の結果, 参照フレームワークは人間のインタラクションを伴わずに, PPAの改善を実現していることがわかった。
論文 参考訳(メタデータ) (2026-02-10T02:46:15Z) - ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development [72.4729759618632]
本稿では,現実的かつ実行可能なワークフロー内でエージェントバックエンドコーディングを評価するベンチマークであるABC-Benchを紹介する。
オープンソースリポジトリから8つの言語と19のフレームワークにまたがる224の実践的なタスクをキュレートしました。
我々の評価は、最先端モデルでさえ、これらの総合的なタスクに対して信頼性の高いパフォーマンスを提供するのに苦労していることを示している。
論文 参考訳(メタデータ) (2026-01-16T08:23:52Z) - NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents [79.29376673236142]
既存のベンチマークは、完全なソフトウェアシステムを構築するのに必要な長期的能力の厳格な評価に失敗する。
符号化エージェントの長期リポジトリ生成能力を評価するために設計されたベンチマークであるNL2Repo Benchを提案する。
論文 参考訳(メタデータ) (2025-12-14T15:12:13Z) - Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning [70.04746094652653]
機械学習論文を機能コードリポジトリに変換するフレームワークであるPaperCoderを紹介した。
PaperCoderは3つの段階で動作する。計画、図によるシステムアーキテクチャの設計、ファイル依存の特定、構成ファイルの生成である。
次に、モデルベースおよび人的評価の両方に基づいて、機械学習論文からコード実装を生成するPaperCoderを評価する。
論文 参考訳(メタデータ) (2025-04-24T01:57:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。