論文の概要: MirrorCode: AI can rebuild entire programs from behavior alone
- arxiv url: http://arxiv.org/abs/2606.30182v1
- Date: Mon, 29 Jun 2026 11:57:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.210448
- Title: MirrorCode: AI can rebuild entire programs from behavior alone
- Title(参考訳): MirrorCode: AIは行動だけでプログラム全体を再構築できる
- Authors: Tom Adamczewski, David Owen, David Rein, Florian Brand, Giles Edkins, Allen Hart, Daniel O'Connell,
- Abstract要約: MirrorCodeは、ソフトウェアプロジェクト全体の再実装に基づく、長期にわたるコーディングベンチマークである。
既存のAIモデルは、すでに複雑なソフトウェアを再実装できる。
我々はAIエージェントが、特に要求が正確に指定された場合に、既に長期のソフトウェアエンジニアリングタスクを完了できることを示します。
- 参考スコア(独自算出の注目度): 1.052679131856939
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI models are rapidly improving at autonomous coding, as shown by benchmark progress and one-off demonstrations such as AI implementing a C compiler. However, existing coding benchmarks tend to focus on shorter tasks, and one-off demonstrations are hard to compare systematically because they often have some human guidance, and are not standardized or repeated across models. To address these challenges, we introduce MirrorCode, a long-horizon coding benchmark based on reimplementing entire software projects. In MirrorCode, AI agents must replicate the functionalities of an existing program, without access to its source code. AI solutions must match the original program's output exactly on end-to-end tests, including held-out tests. MirrorCode's 25 target programs span different areas of computing: Unix utilities, data serialization and query tools, bioinformatics, interpreters, static analysis, cryptography, and compression. Existing AI models can already reimplement complex software, with the strongest model scoring 56% across the benchmark. For example, AI can reimplement gotree, a 16,000-line bioinformatics toolkit - a task that we believe would take weeks for a human engineer. However, studying the frontier of performance requires a larger inference budget than typical benchmarks, for example, \$2,600 over 19 days for a single attempt on a large task. We show that AI agents can already complete long-horizon software engineering tasks, especially when requirements are precisely specified. More broadly, our work suggests AI will have transformative effects on software engineering, as autonomous agents continue to improve.
- Abstract(参考訳): AIモデルは、ベンチマークの進捗や、Cコンパイラを実装するAIのようなワンオフデモで示されているように、自律的なコーディングにおいて急速に改善されている。
しかし、既存のコーディングベンチマークは、より短いタスクにフォーカスする傾向があり、ワンオフのデモは、しばしば人間のガイダンスを持っているため、体系的に比較することは困難であり、モデル間で標準化や反復が行われていない。
これらの課題に対処するために、ソフトウェアプロジェクト全体を再実装した長期コーディングベンチマークであるMirrorCodeを紹介します。
MirrorCodeでは、AIエージェントはソースコードにアクセスすることなく、既存のプログラムの機能を複製する必要がある。
AIソリューションは、ホールドアウトテストを含むエンドツーエンドテストにおいて、元のプログラムの出力と正確に一致しなければならない。
MirrorCodeの25のターゲットプログラムは、Unixユーティリティ、データシリアライゼーションとクエリツール、バイオインフォマティクス、インタプリタ、静的解析、暗号、圧縮など、コンピューティングのさまざまな領域にまたがっている。
既存のAIモデルは、すでに複雑なソフトウェアを再実装できる。
例えば、AIは16,000行のバイオインフォマティクスツールキットであるgotreeを再実装することができます。
しかし、パフォーマンスのフロンティアを研究するには、一般的なベンチマークよりも大きな推論予算を必要とする。
我々はAIエージェントが、特に要求が正確に指定された場合に、既に長期のソフトウェアエンジニアリングタスクを完了できることを示します。
私たちの研究は、自律的なエージェントが改善を続けるにつれて、AIがソフトウェアエンジニアリングに変革をもたらすことを示唆しています。
関連論文リスト
- AI for Auto-Research: Roadmap & User Guide [107.0834449839233]
研究ライフサイクル全体にわたってAIをエンドツーエンドに分析する。
我々は、信頼できる援助と信頼できない自律性の間に、鋭くステージに依存した境界を特定できる。
障害モードを排除するのではなく、より大きな自動化が不明瞭であることが示されています。
論文 参考訳(メタデータ) (2026-05-18T17:08:26Z) - ProgramBench: Can Language Models Rebuild Programs From Scratch? [59.40748183470308]
ProgramBenchは、ソフトウェアエンジニアリングエージェントがソフトウェアをホリシックに開発する能力を測定する。
エンドツーエンドの動作テストはエージェント駆動ファジィによって生成される。
モデルは、人間が書いたコードと大きく異なるモノリシックでシングルファイルの実装を好む。
論文 参考訳(メタデータ) (2026-05-05T09:17:02Z) - LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces [65.11019654023978]
LongCLI-Benchは、長期にわたる現実的なタスクにまたがるエージェント能力を評価するために設計されたベンチマークである。
私たちは、1000以上のコンピュータサイエンスの課題と現実世界のタスクから、20の高品質で長い水平タスクをキュレートしました。
実験によると、最先端のエージェントでさえLongCLI-Benchの20%未満のパスレートを達成する。
論文 参考訳(メタデータ) (2026-02-15T23:12:57Z) - SWE-AGI: Benchmarking Specification-Driven Software Construction with MoonBit in the Era of Autonomous Agents [21.8776989802963]
SWE-AGIはMoonBitで書かれたソフトウェアシステムのエンドツーエンド、仕様駆動の構築を評価するためのオープンソースのベンチマークである。
それぞれのタスクには1000~10,000行のコアロジックを実装する必要がある。
論文 参考訳(メタデータ) (2026-02-10T06:31:47Z) - AIRS-Bench: a Suite of Tasks for Frontier AI Research Science Agents [49.67355440164857]
AIRS-Benchは、最先端の機械学習論文から得られた20のタスクからなるスイートである。
Airs-Benchタスクは、研究ライフサイクル全体のエージェント能力を評価する。
本稿では,AIRS-Benchタスク定義と評価コードをオープンソースとして公開し,自律科学研究のさらなる発展を促す。
論文 参考訳(メタデータ) (2026-02-06T16:45:02Z) - GAICo: A Deployed and Extensible Framework for Evaluating Diverse and Multimodal Generative AI Outputs [8.34331981959369]
GAICo (Generative AI Comparator): GenAI出力比較を標準化したオープンソースのPythonライブラリ。
GAICoは、構造化されていないテキスト、構造化データフォーマット、マルチメディアのための、包括的な参照ベースのメトリクススイートをサポートする統一されたフレームワークを提供する。
2025年6月にPyPIがリリースされて以来、このツールはバージョンで13K回ダウンロードされ、コミュニティの関心が高まっている。
論文 参考訳(メタデータ) (2025-08-22T19:13:21Z) - AutoCodeRover: Autonomous Program Improvement [8.66280420062806]
プログラムの改善を自律的に達成するために、GitHubの問題を解決する自動化アプローチを提案する。
AutoCodeRoverと呼ばれるアプローチでは、LLMは洗練されたコード検索機能と組み合わせられ、最終的にプログラムの変更やパッチにつながります。
SWE-bench-lite(300の現実のGitHubイシュー)の実験では、GitHubの問題を解決する効果が向上している(SWE-bench-liteでは19%)。
論文 参考訳(メタデータ) (2024-04-08T11:55:09Z) - Measuring Coding Challenge Competence With APPS [54.22600767666257]
コード生成のベンチマークであるAPPSを紹介する。
私たちのベンチマークには1万の問題が含まれています。
GPT-Neoのような最近のモデルでは、導入問題のテストケースの約15%をパスできる。
論文 参考訳(メタデータ) (2021-05-20T17:58:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。