論文の概要: When Models Edit Too Much: On the Fidelity of Minimal Code Edits
- arxiv url: http://arxiv.org/abs/2609.04061v1
- Date: Thu, 03 Sep 2026 16:36:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.155157
- Title: When Models Edit Too Much: On the Fidelity of Minimal Code Edits
- Title(参考訳): モデルが編集しすぎるとき:最小限のコード編集の忠実さについて
- Abstract要約: 大きな言語モデル(LLM)は、既存のコードの編集にますます使われていますが、正確性だけでは不十分です。
オーバーエジット(over-editing) — バグ修正に必要なものを超えて,モデルがコードを書き直す傾向があること。
我々は,制御されたASTレベルの汚職を参照ソリューションに注入することにより,400のBigCodeBench問題から評価フレームワークを構築した。
- 参考スコア(独自算出の注目度): 21.17848461238914
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used to edit existing code, but correctness alone is not enough: useful repairs should also be minimal, reviewable, and faithful to the original implementation. We study over-editing, the tendency of a model to rewrite code beyond what is required to fix a bug. We construct an evaluation framework from 400 BigCodeBench problems by injecting controlled AST-level corruptions into reference solutions, giving each repair task a known minimal patch. Across frontier LLMs, over-editing is widespread even among strong models like GPT-5.5: high Pass@1 can coexist with unnecessarily large edits and added cognitive complexity. A preservation instruction substantially reduces this behavior, lowering average excess Levenshtein distance from 0.195 to 0.131, reducing added cognitive complexity by 26.6%, and increasing Pass@1 by 2.3 points. However, these gains do not simply follow from a larger reasoning budget or larger models. We next ask whether minimal editing can be learned directly during post-training. We observe that supervised fine-tuning overfits to seen corruption patterns, whereas reinforcement learning gives the best out-of-domain edit-fidelity and performance-retention trade-off. These results position edit fidelity as a distinct axis of code-repair quality and show that it can be measured and learned.
- Abstract(参考訳): 大きな言語モデル(LLM)は、既存のコードの編集にますます使われていますが、正確性だけでは不十分です。
オーバーエジット(over-editing) — バグ修正に必要なものを超えて,モデルがコードを書き直す傾向があること。
我々は、制御されたASTレベルの汚職を参照ソリューションに注入し、400のBigCodeBench問題から評価フレームワークを構築し、各修復タスクに既知の最小限のパッチを与える。
GPT-5.5のような強力なモデルでも過剰編集は広まっており、High Pass@1は必然的に大きな編集や認知の複雑さの追加と共存することができる。
保存指導は、この行動を大幅に減らし、平均余剰レベンシュテイン距離を0.195から0.131に下げ、認知の複雑さを26.6%減らし、Pass@1を2.3ポイント増した。
しかし、これらの利益は単により大きな理由づけ予算やより大きなモデルに従わない。
次に、ポストトレーニング中に最小限の編集を直接学習できるかを問う。
教師付き微調整オーバーフィットが汚職パターンに見合うのに対して、強化学習はドメイン外の編集忠実さとパフォーマンス維持トレードオフを最高のものにします。
これらの結果から, コード修復品質の異なる軸として, 編集忠実度を位置決めし, 測定し, 学習できることが示唆された。
関連論文リスト
- REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Imperfect Visual Verification for Code Edition : A Case Study on TikZ [3.6213861298681826]
問題の中心的困難を分離するケーススタディとしてTikZを使用します。
視覚的コードのカスタマイズを不完全なオラクルによる反復的な編集問題と定義する。
その結果,不完全な検証者でさえ,コードに視覚的指示を適用するかどうかを適度に判断し,F1スコアを最大0.815まで達成できることがわかった。
論文 参考訳(メタデータ) (2026-04-09T12:21:52Z) - QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization [50.722636027998]
大規模言語モデル (LLM) はプログラム修復性能が高いが、しばしば過剰な編集に悩まされる。
オーバー編集を軽減し,修復精度を向上させるフレームワークであるPRepairを提案する。
論文 参考訳(メタデータ) (2026-04-07T14:56:38Z) - Conflict-Resolving and Sharpness-Aware Minimization for Generalized Knowledge Editing with Multiple Updates [69.6610686845008]
CoRSAは、複数の更新を伴う知識編集のためのパラメータ効率が高く、全体的なアプローチである。
異なる入力形式への一般化を改善し、複数の更新の安定性を向上させる。
CoRSAはまた、コードドメインに一般化し、更新の有効性において5.48%のPass@5で最強のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-02-03T16:18:06Z) - Understanding Robustness of Model Editing in Code LLMs: An Empirical Study [1.5624785508022727]
本稿では,5つの最先端モデル編集手法の体系的研究を行う。
これらの手法を3つの主要なオープンソースコードLLM、CodeLlama、CodeQwen1.5、DeepSeek-Coderに適用する。
インスタント編集はモデル性能を常に劣化させ、構文的妥当性は86ポイントまで低下し、機能的正しさは最高のパフォーマンス設定でも45ポイントまで低下する。
論文 参考訳(メタデータ) (2025-11-05T04:58:13Z) - MEMOIR: Lifelong Model Editing with Minimal Overwrite and Informed Retention for LLMs [76.28901550926021]
寿命の長いモデル編集のための既存の方法は、妥協の一般化、過去の編集の妨害、長い編集シーケンスへのスケールの失敗である。
我々は,学習済みモデルのコア能力を保ちながら,残メモリを介して知識を注入する,新しいスケーラブルなフレームワークMEMOIRを提案する。
MeMOIRは信頼性、一般化、ローカリティのメトリクスにまたがる最先端のパフォーマンスを実現し、最小限の忘れ物で数千のシーケンシャルな編集にスケールする。
論文 参考訳(メタデータ) (2025-06-09T16:16:42Z) - The Butterfly Effect of Model Editing: Few Edits Can Trigger Large Language Models Collapse [58.0132400208411]
単一の編集でさえモデル崩壊を引き起こし、様々なベンチマークタスクで大幅なパフォーマンス低下を示す。
編集後の大規模言語モデルのベンチマークは、過激な時間とリソース集約である。
我々は、GPT-3.5を用いて、ハードケースに基づいた新しいデータセット、HardEditを開発した。
論文 参考訳(メタデータ) (2024-02-15T01:50:38Z) - Converge to the Truth: Factual Error Correction via Iterative
Constrained Editing [30.740281040892086]
最小限の編集で事実誤り訂正(FEC)を行う新しい手法であるVENCEを提案する。
VENCEは、FEC問題を目標密度関数に対する反復サンプリング編集動作として定式化する。
公開データセットでの実験では、VENCEは以前の最遠距離で監督された手法よりもよく測定されたSARIの基準を5.3(または11.8%の相対的な改善)改善している。
論文 参考訳(メタデータ) (2022-11-22T10:03:13Z) - Memory-Based Model Editing at Scale [102.28475739907498]
既存のモデルエディタは、編集対象のスコープを正確にモデル化するのに苦労する。
SERAC(Retrieval-Augmented Counterfactal Model)を用いた半パラメトリック編集を提案する。
SERACは、編集を明示的なメモリに格納し、必要に応じてベースモデルの予測を変更できるように、それらを推論することを学ぶ。
論文 参考訳(メタデータ) (2022-06-13T23:40:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。