論文の概要: A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents
- arxiv url: http://arxiv.org/abs/2607.17205v1
- Date: Sun, 19 Jul 2026 11:52:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.392801
- Title: A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents
- Title(参考訳): コードエージェントのLoRAファインチューニングのための軌道データキュレーションの体系的評価
- Abstract要約: 専門的エージェント軌道上のオープンウェイトLSMの微調整が、有能なコードエージェントを構築するための顕著なアプローチとして現れている。
本稿では,SWEトラジェクトリデータセット上でのQwen2.5-Coder-7B-InstructのLoRA微調整のためのトラジェクトリデータフィルタリングの系統的研究について述べる。
我々は,2軸品質評価フレームワークである効率とスタイルを提案し,戦略,スケール,アブレーション分析にまたがる16の制御実験を通じて評価する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Supervised fine-tuning (SFT) of open-weight LLMs on expert agent trajectories has emerged as a prominent approach to building capable code agents without reliance on proprietary models. A central yet underexplored question is how trajectory quality and quantity jointly shape model performance. We present a systematic empirical study of trajectory data filtering for LoRA fine-tuning of Qwen2.5-Coder-7B-Instruct on the SWE-trajectory dataset (67,074 trajectories, of which 32,161 are resolved). We propose a two-axis quality scoring framework -- Efficiency and Style -- and evaluate it through 16 controlled experiments spanning strategy, scale, and ablation analyses. Since 7B-scale models attain near-zero SWE-bench resolve rates, we adopt cross-entropy (CE) loss on held-out trajectories as the primary metric, validated via first-action generation: CE loss and ROUGE-L are perfectly rank-correlated (Spearman $ρ$ = -1.00), with limited-sample evidence supporting but not conclusively establishing this proxy. Our results reveal a scale-dependent quality-quantity trade-off: at small scales, doubling the dataset (500 to 1,000) yields ~12.7% CE-loss reduction whereas the TopQ-Random gap stays <1% (Mann-Whitney p > 0.10); at 2,000 trajectories this same gap widens to 3.6% (p = 0.016). Ablation further identifies error-retry rate as the dominant sub-dimension, performing comparably to the full composite ($Δ$ < 0.2%). Together, these findings establish trajectory-level quality scoring as a viable but scale-sensitive lever for code-agent SFT and offer a proxy-validated evaluation protocol for the regime where end-to-end resolve rate is statistically infeasible.
- Abstract(参考訳): プロプライエタリなモデルに頼らずに有能なコードエージェントを構築するための顕著なアプローチとして、プロプライエタリなエージェントトラジェクトリに対するオープンウェイト LLM の監督された微調整 (SFT) が登場した。
探索されていない中心的な疑問は、軌道品質と結合形状モデルの性能についてである。
本稿では,SWEトラジェクトリデータセット上のQwen2.5-Coder-7B-インストラクション(67,074トラジェクトリ,うち32,161が解決)のLoRA微調整のためのトラジェクトリデータフィルタリングの系統的研究について述べる。
我々は,2軸品質評価フレームワークである効率とスタイルを提案し,戦略,スケール,アブレーション分析にまたがる16の制御実験を通じて評価する。
7BスケールのSWE-ベンチ分解速度がほぼゼロであるため、ホールトアウト軌道上でのクロスエントロピー(CE)損失を一次指標として、CE損失とROUGE-Lは完全にランク関連である(Spearman $ρ$ = -1.00)。
その結果,小規模ではデータセット(500~1,000)の倍率 ~12.7% CE-loss が減少する一方,TopQ-Random のギャップは <1% (Mann-Whitney p > 0.10) であり,2000 のトラジェクトリでは,同じギャップが 3.6% (p = 0.016) に拡大することがわかった。
アブレーションはさらに、エラー再試行率を支配的なサブ次元として認識し、全合成物(Δ$ < 0.2%)と同等に実行する(Δ$ < 0.2%)。
これらの結果から,コードエージェントSFTにおいて,トラジェクトリレベルの品質スコアリングが有効だがスケールに敏感なレバーとして確立され,エンドツーエンドの解決率が統計的に実現不可能なレジームに対して,プロキシ検証評価プロトコルが提供される。
関連論文リスト
- Post-Hoc Trajectory-Risk Certification for Modular LLM-Based Security Agents [1.4915002678801434]
ボンフェロニ配置は分布自由であるが,相関誤差下では保守的であることを示す。
粗いラベルの選択は、学習された依存なしにほぼ完璧な相関関係を作ることができる。
ステージ単位の証明書とペアの重なり合うバウンドを用いたモジュール証明書は、正の平均利得が0.6%となる。
論文 参考訳(メタデータ) (2026-08-04T23:48:36Z) - How Faithful Is Trajectory-Based Data Attribution? Error Sources, Remedies, and Practical Guidelines [21.57090069950487]
トラジェクトリに基づくデータ帰属法は、トレーニングの軌跡をアンロールすることで、モデル予測に対するトレーニングサンプルの影響を推定する。
これらの手法の包括的なエラー解析が欠如しており、メソッドの忠実性に対する懸念を高め、信頼性の高いデプロイメントを妨げる。
本稿では,トラジェクトリに基づくデータ属性における誤り源の体系的解析と,これらを緩和するための具体的対策,および下流利用のための実践的ガイドラインについて述べる。
論文 参考訳(メタデータ) (2026-05-12T09:50:45Z) - Open-Set Vein Biometric Recognition with Deep Metric Learning [0.0]
我々は厳密なオープンセット制約の下でDeep Metric Learning(DML)の計算境界を厳格に評価する。
提案手法は,非ネイティブなL2正規化埋め込みを学習し,類似性しきい値を用いたプロトタイプベースマッチングを採用する。
大規模MMCBNU 6000ベンチマークでは、我々の最良のモデル(ResNet50-CBAM)がOSCR 0.9945、AUROC 0.9974、EER 1.57%を達成し、高い識別精度 (99.6% Rank-1) を維持しながら、未知の被験者を頑健に拒否する。
論文 参考訳(メタデータ) (2026-04-16T11:03:11Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - Influence-Preserving Proxies for Gradient-Based Data Selection in LLM Fine-tuning [51.87858735871145]
対象モデルから直接影響保存プロキシを導出するフレームワークであるIproxを紹介する。
Iproxは、既製のプロキシやベースラインメソッドよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-02-19T20:57:30Z) - Latent Sculpting for Zero-Shot Generalization: A Manifold Learning Approach to Out-of-Distribution Anomaly Detection [2.8547732086436306]
教師付きディープラーニングの基本的限界は「一般化崩壊」である
階層型2段階表現学習フレームワークであるLatent Sculptingを提案する。
我々は「浸潤」のシナリオについて88.89%の検知率を報告した。
論文 参考訳(メタデータ) (2025-12-19T11:37:02Z) - Quantifying Return on Security Controls in LLM Systems [0.0]
本稿では、残留リスクを定量化するための意思決定指向フレームワークを提案する。
敵のプローブの結果を金融リスク推定と戻り制御の指標に変換する。
論文 参考訳(メタデータ) (2025-12-17T04:58:09Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Graph-Structured Data Analysis of Component Failure in Autonomous Cargo Ships Based on Feature Fusion [20.287188044863925]
本稿では,障害モードのグラフ構造化データセットを構築するためのハイブリッド機能融合フレームワークを提案する。
サブシステム/コンポーネント機能のエンコードにWord2Vecエンコーディング、障害モード/領域の処理にBERT-KPCA、障害影響と緊急意思決定のセマンティックな関連を定量化するSentence-BERTを用いて階層的特徴融合フレームワークを構築する。
論文 参考訳(メタデータ) (2025-07-18T08:02:49Z) - Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach [51.76826149868971]
モンテカルロシミュレーションによる政策評価は多くのMC強化学習(RL)アルゴリズムの中核にある。
本研究では,異なる長さの軌跡を用いた回帰推定器の平均二乗誤差のサロゲートとして品質指標を提案する。
本稿では,Robust and Iterative Data Collection Strategy Optimization (RIDO) という適応アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-17T11:47:56Z) - Scale-Equivalent Distillation for Semi-Supervised Object Detection [57.59525453301374]
近年のSemi-Supervised Object Detection (SS-OD) 法は主に自己学習に基づいており、教師モデルにより、ラベルなしデータを監視信号としてハードな擬似ラベルを生成する。
実験結果から,これらの手法が直面する課題を分析した。
本稿では,大規模オブジェクトサイズの分散とクラス不均衡に頑健な簡易かつ効果的なエンド・ツー・エンド知識蒸留フレームワークであるSED(Scale-Equivalent Distillation)を提案する。
論文 参考訳(メタデータ) (2022-03-23T07:33:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。