論文の概要: From Dead Code and Static Requirements to Working Engines: Software Revival with Coding Agents
- arxiv url: http://arxiv.org/abs/2609.36161v1
- Date: Mon, 28 Sep 2026 19:30:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.971582
- Title: From Dead Code and Static Requirements to Working Engines: Software Revival with Coding Agents
- Title(参考訳): デッドコードと静的要件からワーキングエンジンへ - コーディングエージェントによるソフトウェア復活
- Abstract要約: ReviveBenchは、ネイティブ実行環境に対する隠れ検証によって評価された2つのタスクファミリを持つベンチマークである。
リカバリファミリーは、依存関係の非互換性、削除されたコアモジュール、レガシビルド、GPUベースのファンデーションモデルを含む10のタスクで構成される。
再構成ファミリーは、数値、幾何学、ハードウェア、取引システムにまたがる13のタスクからなる。
- 参考スコア(独自算出の注目度): 14.661282304807145
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Can coding agents restore software that no longer runs while preserving its underlying methods, and reconstruct industrial software engines from open specifications? Here we introduce ReviveBench, a benchmark with two task families evaluated by hidden verifiers calibrated against native execution environments, established engineering tools, or purpose-built reference implementations. The revival family comprises ten tasks involving dependency incompatibilities, deleted core modules, legacy builds, and a GPU-based foundation model. Every starting workspace fails verification, and the strongest evaluated model passes all ten tasks in at least one run each. In contamination-control experiments, identifier obfuscation reduces line similarity to the original implementations from 0.51--0.96 to 0.03--0.44 without reducing the observed pass rate of any evaluated model. On repositories created after the stated knowledge cutoffs, the strongest model passes eight of nine runs. The reconstruction family comprises thirteen tasks spanning numerical, geometric, hardware, and transactional systems (e.g. CAD and CRM). Two models meet the benchmark's pass criteria on all thirteen, although our audit shows that the CFD task cannot establish numerical-solver capability. Benchmark construction and auditing uncover 28 verifier defects, including 24 false negatives and two false positives. These findings show that executable verification can itself introduce substantial measurement error. We present three practical checks: test whether prescribed methods can reach the grading thresholds, investigate agreement among independently generated candidates, and recompute diagnostics from submitted artifacts. ReviveBench thus provides both an evaluation of software revival and engine reconstruction, and cases in validating the verifiers used to measure coding agents for software design.
- Abstract(参考訳): コーディングエージェントは、基盤となるメソッドを維持しながら、もはや動作しないソフトウェアを復元し、オープン仕様から産業用ソフトウェアエンジンを再構築できるだろうか?
ReviveBenchは、ネイティブ実行環境、確立されたエンジニアリングツール、あるいは目的に構築されたリファレンス実装に対して校正された隠れバリデーションによって評価された2つのタスクファミリを持つベンチマークである。
リカバリファミリーは、依存性の不互換性、削除されたコアモジュール、レガシビルド、GPUベースのファンデーションモデルを含む10のタスクで構成される。
開始するワークスペースはすべて検証に失敗し、最も評価の高いモデルは、少なくとも1つの実行で10タスク全てをパスします。
汚染制御実験において、識別子難読化は、評価されたモデルの通過率を低下させることなく、元の実装と類似性を0.11--0.96から0.03--0.44に減少させる。
知識の遮断後に作成されたリポジトリでは、最強のモデルが9つのうち8つをパスしている。
再構成ファミリーは、数値、幾何学、ハードウェア、トランザクションシステム(CAD、CRMなど)にまたがる13のタスクからなる。
評価の結果,CFDタスクは数値解法能力の確立には至らなかったが,13項目すべてで2つのモデルがベンチマークのパス基準を満たしていることがわかった。
ベンチマークの構築と監査により、24個の偽陰性と2つの偽陽性を含む28個の検証済み欠陥が明らかになった。
これらの結果から,実行可能検証自体に相当な測定誤差が生じる可能性が示唆された。
本稿では,所定の方法が評価基準に達するかどうかを検証し,個別に生成した候補間の合意を検証し,提出された成果物から診断を再計算する3つの実践的チェックを提案する。
これにより、ReviveBenchは、ソフトウェアリカバリとエンジンリカバリの評価と、ソフトウェア設計のためのコーディングエージェントの測定に使用されるバリデータを検証するケースの両方を提供する。
関連論文リスト
- Verification-Aware Training for Speculative Decoding [57.84976863792784]
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
論文 参考訳(メタデータ) (2026-08-31T01:42:10Z) - DeepInsight II: One Trace from Benchmark to Robot [8.388561928330978]
DeepInsight IIは、その基板を固定し、エンボディされたハーフを定量化する。
MotionBenchは、リリースされている4つのボディコントローラを1つのワークロードとメトリックコントラクトの下に配置する。
合成されたシステム2--1--0の研究は、トレースの局在を5つのエビデンスグラウンドのハンドオフラベルに拡張する。
論文 参考訳(メタデータ) (2026-08-17T13:25:24Z) - Security Tests as Executable Specifications for LLM Code Generation: Benefits, Trade-offs, and Coverage Limits [14.44743150931186]
テストが事前に表示されるか、失敗した実行がリビジョンを引き起こすか、失敗が選択され、どのように表現されるかの3つの要素を分離する、制御されたテストフィードバックの足場を開発する。
2,705の軌道、31のタスクインスタンス、3つのセキュアコードベンチマーク、16のCWEカテゴリ、2つのモデルファミリがあり、すべての目に見えるテストが前もって隠れた機能とセキュリティのジョイントの成功を平均19.3%増加させている。
共有候補比較では、構造化されたフィードバック修復は、当初、共同回帰のない80の候補が失敗し、固定された生フィードバック修復83は3つの回帰を引き起こす。
論文 参考訳(メタデータ) (2026-08-10T15:37:09Z) - PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation [51.92442051257354]
PairCoderは、実行のみではなく、完全な公式メトリックスイート上で、アーティファクトが検証可能なすべてのベンチマークを本質的に改善する。
TikZのコンパイルレートは、各モデルで10から30ポイント、シングルモデルの2.9から9.2倍である。
論文 参考訳(メタデータ) (2026-07-02T08:36:02Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - CrackMeBench: Binary Reverse Engineering for Agents [3.93181912653522]
CrackMeBenchは、言語モデルエージェントを教育のリバースエンジニアリングタスクで評価するためのベンチマークである。
v0ベンチマークでは、8つのパブリックキャリブレーションCrackMesと、シードされたC、Rust、Goテンプレートから構築された12のメインスコアタスクを組み合わせる。
CrackMeBenchは pass@1 と pass@3 を記録し、リクエスト、ウォールクロック時間、コマンドトレース、ツールカテゴリ、プロバイダがレポートしたトークンの使用状況、推定コスト、定性的な障害ラベルを記録している。
論文 参考訳(メタデータ) (2026-05-11T14:01:36Z) - Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework [0.0]
生産エージェントシステムに特有の7つの障害モードの分類法を提案する。
標準メトリクスは、7つの障害モードのうち4つを完全に検出することができない。
オープンソースの参照実装を備えた5次元評価フレームワークPAEFを提案する。
論文 参考訳(メタデータ) (2026-05-02T21:02:08Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Taming Imperfect Process Verifiers: A Sampling Perspective on Backtracking [54.43083499412643]
言語モデルの生成能力をプロセス検証器と組み合わせたテストタイムアルゴリズムは、新しい推論能力を引き出すための有望なレバーを提供する。
提案手法は, 理論的に根拠付きバックトラックを用いて, 検証誤差に対して, 確実な堅牢性を実現するための新しいプロセス誘導型テスト時間サンプリングアルゴリズムであるVGBを導入する。
論文 参考訳(メタデータ) (2025-10-03T16:21:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。