論文の概要: Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models
- arxiv url: http://arxiv.org/abs/2607.12463v3
- Date: Sun, 19 Jul 2026 05:59:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.363332
- Title: Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models
- Title(参考訳): 符号化エージェント基礎モデルにおける中間訓練としての関数対応充足
- Authors: Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie, Wenhu Chen,
- Abstract要約: コーディングエージェントは、継続的な推論に外部ツールリターンを統合する必要がある。
我々は,中等教育における機能意識の充足を通じてこれを活用する。
- 参考スコア(独自算出の注目度): 49.259951930558
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Coding agents must integrate external tool returns into ongoing reasoning - a capability that standard left-to-right pretraining on code exposes only in its forward direction. We observe that the action-observation-continuation loop of a coding agent is structurally isomorphic to a function call site, where a caller binds arguments, a callee returns a value computed elsewhere, and downstream code consumes that value. This conditioning structure exists at internet scale in ordinary code. We exploit it through function-aware fill-in-the-middle (FIM) mid-training: a self-supervised objective that masks functions selected via program dependency graph analysis and a complexity-inferability double criterion. We mid-train Qwen2.5-Coder-Instruct (7B/14B) and Qwen3-8B on a 2.6B-token decontaminated corpus drawn from 968 GitHub repositories, then apply existing agentic post-training pipelines. Mid-training improves SWE-Bench-Verified by +2.8/+3.0 at 7B/14B and by +3.2 on Qwen3-8B; SWE-Bench-Lite gains are +3.7/+4.0/+5.4 on the same models. The improvement holds across two post-training pipelines (R2E-Gym, SWE-Smith) and on a non-Qwen2.5 base (Qwen3-8B with SWE-Lego). Beyond in-domain gains, mid-training also mitigates the capability erosion that agentic post-training otherwise inflicts on non-agent coding (e.g., LiveCodeBench) and non-coding tool-use benchmarks (tau-bench, BFCL): although the mid-training corpus contains Python code only, the function-call inductive bias survives post-training and yields consistent gains.
- Abstract(参考訳): コーディングエージェントは、現在進行中の推論に外部ツールリターンを統合する必要がある。
符号化エージェントの動作-観測-継続ループは関数呼び出しサイトと構造的に同型であり、呼び出し元が引数をバインドし、呼び出し元が他の場所で計算された値を返し、ダウンストリームコードがその値を消費する。
この条件付け構造は、通常のコードでインターネット規模に存在する。
プログラム依存グラフ解析と複雑性推論の二重基準によって選択された関数をマスクする自己教師型目標であるFIM(Function-aware fill-in-the-middle)ミドルトレーニングを通じてこれを活用する。
968のGitHubリポジトリから引き出された2.6Bの非汚染コーパス上で、Qwen2.5-Coder-Instruct(7B/14B)とQwen3-8Bを使用して、既存のエージェント的なポストトレーニングパイプラインを適用します。
ミッドトレーニングでは、7B/14Bで+2.8/+3.0、Qwen3-8Bで+3.2でSWE-Bench-Liteゲインが+3.7/+4.0/+5.4で改善されている。
改良は2つのポストトレーニングパイプライン(R2E-Gym、SWE-Smith)と、Qwen2.5ベース(Qwen3-8BとSWE-Lego)にまたがる。
ドメイン内のゲイン以外にも、中間トレーニングはエージェントが非エージェントコーディング(例えば、LiveCodeBench)や非コーディングツール使用ベンチマーク(Tau-bench、BFCL)に支障をきたすような機能侵食を緩和する。
関連論文リスト
- KAT-Coder-V2.5 Technical Report [61.907486544595336]
KAT-Coder-V2.5は、実際の実行可能リポジトリ内で自律的に動作するよう訓練されたコーディング中心のエージェントモデルである。
マルチ言語リポジトリをサンドボックス環境に再構築し、フェイル・ツー・パスとパス・ツー・パスの検証を大規模に行う。
我々はさらに、ハーネスランダム化による強化学習、信頼性の強化されたサンドボックス、非対称なアクター-クリティックPPO、およびハイチ指向の報酬フレームワークをスケールする。
論文 参考訳(メタデータ) (2026-07-06T08:14:02Z) - Skill Is Not Document: A Query-Conditional Benchmark and Two-Stage Retriever for LLM Agent Skill Routing [40.648572239231804]
R3-Skillは、現実的なエージェントスキルルーティングのベンチマークである。
スキル互換性を明示的な訓練信号とする2段階検索システムを構築した。
データセット、トレーニングコード、モデルウェイトは、エージェントスキルルーティングのためのオープンソースとしてリリースされている。
論文 参考訳(メタデータ) (2026-06-02T12:30:46Z) - Mellum2 Technical Report [1.1239988514721222]
Mellum 2は、ソフトウェア工学に特化した汎用言語モデルである。
完成中心の4B高密度メルロンモデルの後継である。
Mellum 2 は 4B-14B の範囲でオープンウェイトベースラインと競合し、2.5B の高密度モデルのトーケン毎の計算で実行される。
論文 参考訳(メタデータ) (2026-05-29T13:01:11Z) - Agent Explorative Policy Optimization for Multimodal Agentic Reasoning [97.64835302176056]
エージェント推論は2つの行動と構造的非対称性(思考と道具の使用)をインターリーブする。
GRPOのような標準的なRLレシピでは、ギャップはトレーニング中に2つの診断症状として現れる。
AXPO (Agent eXplorative Policy Optimization) を提案する。
論文 参考訳(メタデータ) (2026-05-27T17:36:39Z) - ChipMATE: Multi-Agent Training via Reinforcement Learning for Enhanced RTL Generation [55.947962672433675]
ChipMATEは、RTL生成のための最初の自己学習型マルチエージェントフレームワークである。
ChipMATEは産業的な実践に触発され、VerilogエージェントとPythonのリファレンスモデルエージェントをペアにし、相互に出力を検証する。
ChipMATEは、VerilogEval V2で75.0%と80.1%パス@1を4Bと9Bベースモデルで達成している。
論文 参考訳(メタデータ) (2026-05-13T01:04:21Z) - SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding [41.98672557723593]
SWEQA-Proは,多種多様な長期リポジトリと実行可能な環境から構築されたベンチマークである。
さらに,2段階のトレーニングレシピであるSupervised Fine-Tuning(SFT)とReinforcement Learning from AI Feedback(RLAIF)という,スケーラブルな合成データパイプラインを提案する。
SWE-QA-ProのGPT-4oを2.3ポイント超え、最先端モデルとのギャップを大幅に狭める。
論文 参考訳(メタデータ) (2026-03-17T05:12:48Z) - TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework [62.66056331998838]
TeaRAGは、検索内容と推論ステップの両方を圧縮できるトークン効率のエージェントRAGフレームワークである。
報奨関数は,過剰な推論ステップをペナルティ化しながら,知識マッチング機構によって知識満足度を評価する。
論文 参考訳(メタデータ) (2025-11-07T16:08:34Z) - Chain of Execution Supervision Promotes General Reasoning in Large Language Models [48.100128916029064]
TracePileは260万のサンプルからなる大規模なコーパスで、コード実行を明示的でステップバイステップのチェーン・オブ・シンクスタイルの論理に変換する。
我々は,継続事前訓練,事前訓練後の指導訓練,2段階微調整という3つのトレーニング設定を用いてTracePileを評価する。
特にTracePileは、9つの数学データセットでLLaMA3.1-8Bを平均7.1%向上させ、LiveCodeBench、CRUX、MMLUで明確なゲインを提供する。
論文 参考訳(メタデータ) (2025-10-24T02:21:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。