論文の概要: Diffs vs. Whole Files: An Empirical Comparison of Iterative Edit-Based and Direct Generation for Flutter/Dart Code Models
- arxiv url: http://arxiv.org/abs/2609.05779v1
- Date: Sat, 05 Sep 2026 00:13:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.135222
- Title: Diffs vs. Whole Files: An Empirical Comparison of Iterative Edit-Based and Direct Generation for Flutter/Dart Code Models
- Title(参考訳): Diffs vs. Whole Files:Flutter/Dartコードモデルの反復編集ベースと直接生成の比較
- Abstract要約: 直接生成と差分ベース生成という2つの出力方式で2つのコードモデルをトレーニングします。
直接生成は、測度毎に差分ベースの生成を大幅に上回る。
差分ベースの生成が勝つ条件の背後にある、アーキテクチャに依存しない単一のメカニズムを特定します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models used for code editing can be trained and deployed in at least two output regimes: direct generation, where the model emits the entire modified file in one shot, and iterative diff-based generation ("steps"), where the model emits a sequence of localized search/replace edits applied one at a time until it signals completion or a step budget is exhausted. The diff-based regime is attractive because it mirrors how developers edit code and should require far fewer generated tokens per turn. We train two code models - a 100M-parameter model trained from scratch (Rainbow-Pony-100M) and a fine-tuned Qwen2.5-Coder-0.5B - in both regimes on a shared Flutter/Dart dataset, and evaluate all four resulting models on a held-out set of approx 1,790 tasks per model. Direct generation substantially outperforms diff-based generation on every metric we measure - compilation/static-analysis pass rate, bits-per-byte, character-level similarity to the reference, and blinded LLM-judge ratings of goal fulfillment, correctness, and code quality - and the gap persists after controlling for task difficulty via a matched-ID comparison and when restricting to code that compiles on both sides. We then identify a single, architecture-independent mechanism behind the conditions where diff-based generation does win: it is competitive on short, spatially localized edits, and its category-level wins concentrate in exactly the two task categories - refactoring and error-handling/edge-case fixes - with the lowest mean edit-step count in our dataset. We term this task locality and discuss its implications for when an edit-based training regime is and is not the right choice for a code-editing model.
- Abstract(参考訳): コード編集に使用される大きな言語モデルは、少なくとも2つの出力レギュレーションでトレーニングされ、デプロイすることができる: ダイレクトジェネレーション、モデルが修正ファイル全体を1ショットで出力するダイレクトジェネレーション、およびモデルが完了またはステップ予算が切れるまで適用されたローカル検索/リプレース編集のシーケンスを出力する反復ディフベース生成(ステップ)。
差分ベースのレシエーションは、開発者がコードを編集する方法を反映し、ターンごとに生成されるトークンをはるかに少なくする必要があるため、魅力的なものだ。
我々は、共有Flutter/Dartデータセット上で、スクラッチからトレーニングされた100Mパラメータモデル(Rainbow-Pony-100M)と微調整されたQwen2.5-Coder-0.5B)の2つのモデルをトレーニングし、モデル毎に1,790タスクの保持されたセット上で、結果の4つのモデルを評価します。
直接生成は、コンピレーション/静的分析パスレート、ビット/バイト、参照と文字レベルの類似性、目標達成率、正確性、コード品質のLCM-judge評価など、測定したメトリック毎に差分ベースの生成を著しく上回ります。
次に、差分ベースの生成が勝つ条件の背後にある単一のアーキテクチャに依存しないメカニズムを特定します。それは、短く、空間的に局所化された編集に競争力があり、そのカテゴリレベルの勝利は、リファクタリングとエラー処理/エッジケース修正という2つのタスクカテゴリに正確に集中しています。
我々は、このタスクの局所性を定義し、編集ベースのトレーニング体制がいつであり、コード編集モデルにとって適切な選択肢であるかについて、その意味を議論する。
関連論文リスト
- Encoder-Decoder Manifold Alignment for Idempotent Generation [51.959208893243776]
この失敗の主な理由は、エンコーダとデコーダによって学習された多様体間の幾何学的ミスマッチである。
我々は、エンコーダとデコーダに同じ基礎となるデータ多様体の一貫性のある表現を学習させ、このギャップを明示的に埋める新しいトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-21T02:14:37Z) - To Diff or Not to Diff? Structure-Aware and Adaptive Output Formats for Efficient LLM-based Code Editing [54.399335188667045]
BlockDiffとFuncDiffは構造対応のdiffフォーマットで、変更を構文的に一貫性のあるユニットのブロックレベルの書き換えとして表現する。
AdaEdit は LLM に与えられたdiff フォーマットと全コードの間で最もトークン効率の良いフォーマットを動的に選択するよう訓練する一般的な適応編集戦略である。
論文 参考訳(メタデータ) (2026-04-30T01:14:13Z) - Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs [63.82840470917859]
本稿では,dLLMの復号化機構をモデル属性の強力なツールとして利用できることを示す。
本稿では、デコードステップ間の構造的関係を捉え、モデル固有の振る舞いをよりよく明らかにする、DDM(Directed Decoding Map)と呼ばれる新しい情報抽出手法を提案する。
論文 参考訳(メタデータ) (2025-10-02T06:25:10Z) - Datarus-R1: An Adaptive Multi-Step Reasoning LLM for Automated Data Analysis [0.0]
本稿では,Qwen 2.5-14B-Instructの言語モデルであるDatarus-R1-14Bを提案する。
Datarusは、独立した問合せペアではなく、推論ステップ、コード実行、エラートレース、自己補正、最終的な結論を含む完全な分析トラジェクトリに基づいて訓練されている。
論文 参考訳(メタデータ) (2025-08-18T21:58:18Z) - LLM-Based Detection of Tangled Code Changes for Higher-Quality Method-Level Bug Datasets [8.166584296080805]
本稿では,コミットメッセージとメソッドレベルのコード差分の両方を活用することで,絡み合ったコード変化を検出するための大規模言語モデルの有用性について検討する。
その結果,コミットメッセージとコード差分を組み合わせることで,モデルの性能が著しく向上することがわかった。
49のオープンソースプロジェクトにアプローチを適用することで、バグギーと非バグギーメソッド間のコードのメトリクスの分散分離性が向上します。
論文 参考訳(メタデータ) (2025-05-13T06:26:13Z) - Robust Learning of Diverse Code Edits [10.565439872488328]
ソフトウェアエンジニアリングのアクティビティは、しばしば既存のコードへの編集を伴います。
コード言語モデル(LM)には、さまざまなタイプのコード編集要求を処理する能力がない。
本稿では,新しい合成データ生成パイプラインと適応アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-03-05T16:39:04Z) - COrAL: Order-Agnostic Language Modeling for Efficient Iterative Refinement [80.18490952057125]
反復改良は、複雑なタスクにおける大規模言語モデル(LLM)の能力を高める効果的なパラダイムとして登場した。
我々はこれらの課題を克服するために、コンテキストワイズ順序非依存言語モデリング(COrAL)を提案する。
当社のアプローチでは、管理可能なコンテキストウィンドウ内で複数のトークン依存関係をモデル化しています。
論文 参考訳(メタデータ) (2024-10-12T23:56:19Z) - ELDER: Enhancing Lifelong Model Editing with Mixture-of-LoRA [55.697627106315004]
大規模言語モデル(LLM)は、特定の知識を効率的に更新し、事実の誤りを避けるためにモデル編集を必要とする。
従来のアプローチでは、元のパラメータを凍結し、知識更新毎に新しいパラメータを個別に割り当てることで、シーケンシャルな編集を管理する。
本稿では,データとアダプタを連続的に関連付ける新しい手法であるELDERを提案する。
論文 参考訳(メタデータ) (2024-08-19T02:27:00Z) - Single-Stage Visual Relationship Learning using Conditional Queries [60.90880759475021]
TraCQは、マルチタスク学習問題とエンティティペアの分布を回避する、シーングラフ生成の新しい定式化である。
我々は,DETRをベースとしたエンコーダ-デコーダ条件付きクエリを用いて,エンティティラベル空間を大幅に削減する。
実験結果から、TraCQは既存のシングルステージシーングラフ生成法よりも優れており、Visual Genomeデータセットの最先端の2段階メソッドを多く上回っていることがわかった。
論文 参考訳(メタデータ) (2023-06-09T06:02:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。