論文の概要: AtomicCommitBench: Can Coding Agents Reconstruct Commit Histories from Squashed Patches?
- arxiv url: http://arxiv.org/abs/2607.03332v1
- Date: Fri, 03 Jul 2026 13:51:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 12:43:16.142307
- Title: AtomicCommitBench: Can Coding Agents Reconstruct Commit Histories from Squashed Patches?
- Title(参考訳): AtomicCommitBench: コーディングエージェントは、スクワッドパッチからコミット履歴を再構築できるか?
- Authors: Zhihao Lin, Mingyi Zhou, Li Li,
- Abstract要約: コーディングエージェントは、機能の実装、バグ修正、パーティショニング、テスト、設定の編集を混ぜた1つのスクワッドパッチを返すことで、セッションを終了することが多い。
エージェントがコミットをグループ化し、再生可能なコミットシーケンスを具体化する。
私たちは10のPythonプロジェクトから800の連続的なエピソードを含むAtomicCommitBenchを構築します。
- 参考スコア(独自算出の注目度): 9.689734830501429
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Coding agents often finish a session by returning one squashed patch that mixes feature implementation, bug fixes, refactorings, tests, and configuration edits. While the final code may be correct, collapsing unrelated edits into one patch removes the history structure needed for review, selective revert, and later maintenance. We study retrospective commit-history reconstruction: given a completed squashed change, an agent groups its hunks into commits and materializes a replayable commit sequence. We formalize the task as hunk-to-commit partitioning with a replay requirement and build AtomicCommitBench, containing 800 real consecutive-commit episodes from 10 Python projects. Because multiple decompositions may be reasonable, we evaluate outputs using complementary metrics: PPAR for replay validity, ARI for reference-based grouping quality, and TCR for failure containment on scoreable modified-test episodes. Natural retrospective reconstruction proves substantially harder than replay checking or synthetic tangling. Although nearly all non-random methods achieve replay validity (PPAR >= 0.988), grouping quality ranges from 0.03 to 0.46 ARI. Matched synthetic composites are much easier than real same-author squashed diffs (+0.333 ARI). In our evaluation, the GPT-5.4 setup driven by Codex CLI (0.46 ARI) and the GLM-5 setup driven by Claude Code (0.43 ARI) outperform MiniMax (0.31) and Kimi (0.29). Qualitative analysis identifies same-file lumping and support-hunk drift as recurring failure modes. Dependency-Aware Commit Evidence (DACE) improves the lower-scoring setups by 0.05 to 0.08 ARI, indicating that dependency cues and hunk-role information help agents avoid locality-driven grouping errors. AtomicCommitBench enables evaluation of the commit histories produced by coding agents alongside the final code.
- Abstract(参考訳): コーディングエージェントは、機能の実装、バグ修正、リファクタリング、テスト、設定の編集を混ぜ合わせた一箇所のパッチを返すことで、セッションを終了することが多い。
最終的なコードは正しいかもしれないが、無関係な編集を1つのパッチにラップすると、レビュー、選択的なリバージョン、後のメンテナンスに必要な履歴構造が削除される。
エージェントがコミットをグループ化し、再生可能なコミットシーケンスを具体化する。
我々は、タスクをリプレイ要件でハンク・ツー・コミットのパーティショニングとして形式化し、10のPythonプロジェクトから800回の連続コミットを含むAtomicCommitBenchを構築します。
複数の分解が妥当である可能性があるので、相補的なメトリクスを用いて出力を評価する: 再生妥当性PPAR、参照ベースのグループ化品質ARI、得点可能な修正テストエピソードにおける障害封じ込めTCR。
自然な振り返りの再構築は、リプレイチェックや合成タングリングよりもはるかに難しい。
ほとんどすべての非ランダムな手法が再生妥当性(PPAR >=0.988)を達成するが、グループ化の品質は0.03から0.46ARIの範囲である。
マッチングされた合成合成合成物は、実際の同一のスクアッシュディフ(+0.333 ARI)よりもはるかに容易である。
評価では,Codex CLI (0.46 ARI) が駆動する GPT-5.4 と Claude Code (0.43 ARI) が駆動する GLM-5 が MiniMax (0.31) と Kimi (0.29) を上回った。
定性的分析は、同じファイルのラッピングとサポートハンクドリフトを繰り返し失敗モードとして識別する。
Dependency-Aware Commit Evidence (DACE) は、ローショニングのセットアップを 0.05 から 0.08 ARI に改善し、依存関係のキューとハンクロール情報によって、エージェントがローカリティ駆動のグルーピングエラーを回避することを示唆している。
AtomicCommitBenchは、最終コードと一緒にコーディングエージェントによって生成されるコミット履歴の評価を可能にする。
関連論文リスト
- CREDENCE: Claim Reduction for Decomposition & Enhanced Credibility -- Semantic Metrics and Convergence Analysis [0.0]
複合文を原子的検証可能なクレームに分解することは、信頼性の高い自動事実チェックの前提条件である。
従来の作業は、パラフレーズ的クレームの分解品質を体系的に過小評価するトークンオーバーラップ(Jaccard)メトリクスに依存していました。
両欠点に対処するクレーム分解および評価フレームワークであるクレデンスについて述べる。
論文 参考訳(メタデータ) (2026-06-18T05:48:37Z) - ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues [54.98461672730087]
ReproRepoは、人為的なGitHub問題を活用するスケーラブルな評価フレームワークで、現実的な再現ブロッカーを自然に監視する。
ReproRepoは、大規模なカンファレンスから1,149件の機械学習論文をインスタンス化し、4つのフロンティアモデルエージェント構成を評価します。
その結果, LLMエージェントは, コードを実行せずにも, 紙とリポジトリのペアから多くの実世界の問題を識別できることがわかった。
論文 参考訳(メタデータ) (2026-06-16T17:58:05Z) - SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers [55.39407031861402]
本稿では,スマートコントラクトデコンパイルのためのデータセットとベンチマーク手法であるSCDBenchを紹介する。
データセットには600の現実のSolidityコントラクトと、ペア化されたバイトコード入力、地味なソースコード、再生可能なセマンティックチェックポイントが含まれている。
我々は,GLM-5の変種を含むゼロショット逆コンパイル設定において,Claude Opus 4.7,GPT-5.3-Codex,GLM-5を評価した。
論文 参考訳(メタデータ) (2026-05-27T20:08:47Z) - TeamTR: Trust-Region Fine-Tuning for Multi-Agent LLM Coordination [11.65571332626047]
TeamTRは信頼領域フレームワークで、各コンポーネントの更新後にトラジェクトリを再サンプリングし、エージェントごとの分散制御を実行する。
TeamTRはシングルエージェントとシーケンシャルベースラインを平均7.1%で上回り、調整のレグレッションを緩和し、プラグアンドプレイのコンポーネント置換をサポートする。
論文 参考訳(メタデータ) (2026-05-01T23:42:57Z) - Runtime Execution Traces Guided Automated Program Repair with Multi-Agent Debate [8.424102114588559]
自動プログラム修復(APR)は複雑なロジックエラーとサイレント障害に悩まされる。
現在のLLMベースのAPRメソッドは主に静的であり、ソースコードと基本的なテスト出力に依存している。
我々は、パッチ検証のための共有制約としてランタイム事実を活用するマルチエージェントフレームワークであるTraceRepairを提案する。
論文 参考訳(メタデータ) (2026-04-03T02:23:25Z) - APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay [7.370176470430802]
LLMベースの自律エージェントは、永続的な手続き記憶を欠いている。
我々は,構造化手続き計画の蓄積,検索,再利用を行う非パラメトリックオンライン学習フレームワークであるAPEX-EMを提案する。
論文 参考訳(メタデータ) (2026-03-31T00:24:56Z) - Outcome-Conditioned Reasoning Distillation for Resolving Software Issues [49.16055123488827]
本稿では, 検証済みパッチを監督として, リポジトリ内問題を解決したO-CRD(Outcome-Conditioned Reasoning Distillation)フレームワークを提案する。
歴史的修正から始まり、検証結果から段階的な修理トレースを後方に再構築する。
SWE-Bench Liteでは、GPT-4oではPass@1が10.4%、DeepSeek-V3では8.6%、GPT-5では10.3%増加する。
論文 参考訳(メタデータ) (2026-01-30T18:25:39Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - ARCS: Agentic Retrieval-Augmented Code Synthesis with Iterative Refinement [1.980982378865332]
ARCSは凍結モデル上で、予算化された合成実行再生ループを介して動作する。
生成前に関連するコードコンテキストを検索し、候補を提案し、テストに対して実行し、実行フィードバックに基づいて修正する。
LANLの科学コーパスでは、ベースラインRAGよりも+0.115改良されている。
論文 参考訳(メタデータ) (2025-04-29T05:15:52Z) - RAP-Gen: Retrieval-Augmented Patch Generation with CodeT5 for Automatic
Program Repair [75.40584530380589]
新たな検索型パッチ生成フレームワーク(RAP-Gen)を提案する。
RAP-Gen 以前のバグ修正ペアのリストから取得した関連する修正パターンを明示的に活用する。
RAP-GenをJavaScriptのTFixベンチマークとJavaのCode RefinementとDefects4Jベンチマークの2つのプログラミング言語で評価する。
論文 参考訳(メタデータ) (2023-09-12T08:52:56Z) - Detection Transformer with Stable Matching [48.963171068785435]
もっとも重要な設計は, 肯定的な事例の分類スコアを監督するために, 位置測定値のみを使用することである。
本原理では,DTRの分類損失とマッチングコストに位置測定値を統合することで,簡易かつ効果的な2つの修正を提案する。
12エポックおよび24エポックのトレーニング設定の下でResNet-50バックボーンを用いてCOCO検出ベンチマークで50.4および51.5APを達成する。
論文 参考訳(メタデータ) (2023-04-10T17:55:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。