論文の概要: RefactorPlatform: An Open-Source Harness for Controlled Evaluation of Repository-Scale Refactoring Agents
- arxiv url: http://arxiv.org/abs/2609.04898v1
- Date: Fri, 04 Sep 2026 08:58:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.985688
- Title: RefactorPlatform: An Open-Source Harness for Controlled Evaluation of Repository-Scale Refactoring Agents
- Title(参考訳): RefactorPlatform: リポジトリスケールリファクタリングエージェントの評価制御のためのオープンソースのハーネス
- Abstract要約: RefactorPlatformは、環境を固定し、各設計軸を変化させるオープンソースの評価ハーネスである。
各実行は、ライブ端末ストリーミング、トークン、差分、およびトランスクリプトのタスクごとのロギング、ASTベースの検証、監査と再生のためのエクスポート可能なテレメトリを備えた、独立したワークスペースで実行される。
- 参考スコア(独自算出の注目度): 0.09320657506524148
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Repository-scale refactoring requires coding agents to propagate a single change across many interdependent files without altering program behavior, yet to our knowledge no existing harness isolates the design choices that determine agent success on this task. We present RefactorPlatform, an open-source evaluation harness that holds the environment fixed and varies each design axis explicitly: model backbone (via OpenRouter and GitHub Copilot CLI), execution regime (baseline, retrieval-augmented, and multi-agent), and prompt specificity. Each run executes in an isolated workspace with live terminal streaming, per-task logging of tokens, diffs, and transcripts, AST-based verification, and exportable telemetry for audit and reproduction. Demonstrating the platform on 100 multi-file RefactorBench tasks across four model families, we illustrate the analyses it supports: AST-aware chunking outperforms naive token-window chunking by 25-30% across prompt modes, whereas naive retrieval falls below the retrieval-free baseline; a lean retrieval-augmented single agent (86%) beats the sub-agent configuration we evaluated (66%) on matched tasks with no task passing under delegation that fails under retrieval; and retrieval's accuracy gains absorb its token overhead, leaving cost per successful refactoring unchanged. RefactorPlatform is open-sourced to make refactoring-agent evaluation reproducible and auditable.
- Abstract(参考訳): リポジトリスケールのリファクタリングでは、プログラムの振る舞いを変えることなく、多くの相互依存ファイル間で単一の変更を伝達するために、コーディングエージェントが必要であるが、我々の知る限り、このタスクにおけるエージェントの成功を決定する設計選択を、既存のハーネスが分離していない。
RefactorPlatformは、(OpenRouterとGitHub Copilot CLIを介して)モデルバックボーン、(ベースライン、検索強化、マルチエージェントを介して)実行レシエーション、およびアクセシビリティの促進という、各設計軸を明示的に変更した環境を保持するオープンソースの評価ハーネスである。
各実行は、ライブ端末ストリーミング、トークン、差分、およびトランスクリプトのタスクごとのロギング、ASTベースの検証、監査と再生のためのエクスポート可能なテレメトリを備えた、独立したワークスペースで実行される。
AST-aware chunking outperforms naive token-window chunking by 25-30% across prompt modes while naive search fall below the search-free baseline; lean search-augmented single agent (86%)は、私たちが評価したサブエージェント構成(66%)を、検索で失敗するデリゲートの下でタスクをパスしない状態で評価し、検索の精度はトークンのオーバーヘッドを吸収し、リファクタリングが成功すればコストは変化しない。
RefactorPlatformは、リファクタリングエージェントの評価を再現可能で監査可能にするために、オープンソースである。
関連論文リスト
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - REFINE: A Multi-Agent LLM Approach for Evidence-Guided Code Refactoring [3.294884078309524]
REFINEはツールに依存しないエビデンス対応のマルチエージェントアプローチで、Javaファイルレベルの候補を生成する。
我々は15のオープンソースシステムから450のJavaファイル上でREFINEを評価する。
論文 参考訳(メタデータ) (2026-08-21T17:44:40Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents [5.604484678527336]
CLOSER-Bench (CLOSER-Bench) は、予算付きクロスステージ設計クロージャのための制御された評価プロトコルである。
Spec-to-RTL、RTL-to-GDS、Spec-to-GDSタスクを組み合わせ、すべてのシミュレータ、合成、STA、プレース・アンド・ルートの呼び出しを記録する。
最終品質、任意の進捗状況、ツールコスト、ステージ間のリカバリを測定します。
論文 参考訳(メタデータ) (2026-07-18T04:28:47Z) - AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows [1.6785141970297952]
AEVAL(Agentic Evaluation)はCI統合フレームワークで、このプラクティスをエージェントスキルのための決定論的かつ再現可能なテストパイプラインに置き換える。
すべてのスキル変更がテストイベントをトリガーする。スキルは、自動エグゼキュータ内の開発者が宣言した評価契約に対して実行される。
鍵となる要素は、実行子とグレーダの間の構造的分離であり、微妙だが広汎な障害モードを防止する。
論文 参考訳(メタデータ) (2026-07-16T21:33:05Z) - RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations [51.43574078961796]
本稿では,SWE-Bench Verified上に構築された2段階評価スイートRepoMirageを紹介する。
RepoMirage-Perturbは、リポジトリレベルの摂動を保存する3つのタイプのセマンティクスを適用している。
RepoAnchorは、下流の問題解決からリポジトリの探索を分離する構造第一のプロトタイプワークフローである。
論文 参考訳(メタデータ) (2026-05-25T06:26:43Z) - ReproScore: Separating Readiness from Outcome in Research Software Reproducibility Assessment [0.9623578875486184]
デジタルライブラリは、数百万の研究ソフトウェアアーティファクトをキュレートするが、それらのアーティファクトが実行可能かどうかを評価するためのスケーラブルなインフラが欠如している。
ReproScoreは、結果(ROS)から読みやすさ(RRS)を明示的に分離する2層フレームワークである。
RRSは5つのカテゴリにまたがって26のサブメトリックで構成されており、ROSはサンドボックスインフラストラクチャが利用可能であるときに実行ベースのプローブを提供する。
論文 参考訳(メタデータ) (2026-05-13T09:54:06Z) - Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning [79.88942231770629]
強化学習(RL)は、大規模言語モデル(LLM)の推論能力を向上させるための訓練後の中心的なツールとなっている。
統一表記によるロールアウトパイプラインの形式化とGenerate-Filter-Control-Replay(GFCR)の導入
検証可能な報酬、プロセスの監督、判断に基づくゲーティング、ガイドとツリー/セグメントのロールアウト、アダプティブな計算割り当て、早期終了と部分的なロールアウト、スループット最適化、自己改善のための再生/再配置でRLにまたがる手法を合成する。
論文 参考訳(メタデータ) (2026-04-08T00:53:29Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - RefAgent: A Multi-agent LLM-based Framework for Automatic Software Refactoring [8.038518812060897]
RefAgentは、エンドツーエンドソフトウェアのためのマルチエージェントLLMベースのフレームワークである。
テストの計画、実行、反復的な精錬を担当する特殊なエージェントで構成されています。
単体テストの合格率は90%で、コードの臭いを52.5%減らし、キーの品質特性を8.6%改善している。
論文 参考訳(メタデータ) (2025-11-05T03:20:58Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - RefactorBench: Evaluating Stateful Reasoning in Language Agents Through Code [7.156224931977546]
RefactorBenchは、人気のあるオープンソースリポジトリで100の大規模な手作りのマルチファイルタスクからなるベンチマークである。
ベースラインは、現在のLMエージェントが単純な構成タスクで苦労していることを明らかにし、ベース命令で22%のタスクしか解決していない。
状態表現の条件にベースラインエージェントを適用することにより、RefactorBenchタスクの解決において43.9%の改善が達成される。
論文 参考訳(メタデータ) (2025-03-10T20:23:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。