論文の概要: SWE-Prime: Fewer Trajectories, Better Performance
- arxiv url: http://arxiv.org/abs/2608.27449v1
- Date: Thu, 27 Aug 2026 17:58:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.523156
- Title: SWE-Prime: Fewer Trajectories, Better Performance
- Title(参考訳): SWE-Prime: トラジェクトリが少なく、パフォーマンスが向上
- Abstract要約: SWE-Primeは多粒度2段階のSFTデータ選択法である。
第1段階は、プロセス品質、結果品質、データ代表性に基づく軌道レベルのスクリーニングを行う。
第2段階は、連続したステップをセマンティックセグメントにグループ化することでセグメントレベルの選択を行う。
- 参考スコア(独自算出の注目度): 53.66792153458889
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: To improve large language models' ability to resolve real-world software issues, prior work has focused on constructing large-scale agent trajectory datasets and performing supervised fine-tuning (SFT) on successful trajectories. However, task success does not guarantee high-quality supervision: successful trajectories may still contain ineffective, redundant, or risky steps. Directly using such trajectories for SFT can introduce noisy supervision and encourage models to imitate undesirable problem-solving behaviors. Therefore, we propose SWE-Prime, a multi-granularity, two-stage SFT data selection method that progressively filters training data at the trajectory and segment levels. Specifically, the first stage performs trajectory-level screening based on process quality, result quality, and data representativeness, selecting a high-quality and representative subset of successful trajectories. The second stage performs segment-level selection by grouping consecutive steps into semantic segments and assessing each segment based on its contribution to the final solution, learnability, and potential risks. During SFT, all segments remain in the sequence to preserve context, while only selected segments contribute to the loss computation. Experiments on SWE-Bench Pro and SWE-Bench Verified show that training on the 10% trajectory subset selected by SWE-Prime outperforms training on the full resolved dataset, yielding relative performance gains of up to 12.2% and 24.2%, respectively.
- Abstract(参考訳): 大規模言語モデルによる現実世界のソフトウェア問題を解決する能力を改善するため、従来の研究は大規模なエージェントトラジェクトリデータセットの構築と、成功したトラジェクトリに対する教師付き微調整(SFT)の実行に重点を置いてきた。
しかし、タスクの成功は高品質な監視を保証するものではない。
このような軌道を直接SFTに利用することで、ノイズの多い監視を導入し、望ましくない問題解決行動を模倣するようモデルに促すことができる。
そこで我々は,SWE-Primeを提案する。SWE-Primeは多粒度で2段階のSFTデータ選択方式で,軌道およびセグメントレベルのトレーニングデータを段階的にフィルタする。
具体的には、第1段階は、プロセス品質、結果品質、データ代表性に基づいて軌道レベルのスクリーニングを行い、成功した軌道の高品質で代表的なサブセットを選択する。
第2段階は、連続したステップをセマンティックセグメントにグループ化し、最終解、学習可能性、潜在的なリスクへの貢献に基づいて各セグメントを評価することによってセグメントレベルの選択を行う。
SFTの間、全てのセグメントはコンテキストを保存するためにシーケンスに残され、選択されたセグメントだけが損失計算に寄与する。
SWE-Bench Pro と SWE-Bench Verified の実験では、SWE-Prime が選択した10%の軌道サブセットでのトレーニングは、完全なデータセットでのトレーニングよりも優れており、それぞれ 12.2% と 24.2% の相対的なパフォーマンス向上が得られた。
関連論文リスト
- From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models [73.72877445629383]
Interpretability-Guided Data Selection (IGDS) は、まず周波数リコールと干渉フィルタリングによって因果タスクの特徴を識別するフレームワークである。
我々は,数学的推論,要約,翻訳タスクに関するIGDSをGemma-2,LLaMA-3.1,Qwen3モデルで検証する。
論文 参考訳(メタデータ) (2026-04-28T03:16:24Z) - SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling [13.335296846555204]
現在のパイプラインは、最適化されていないデモデータ、スパース実行報酬、計算的に禁止された推論スケーリングによってボトルネックされる。
SWE-TRACEはデータキュレーション、強化学習(RL)、テスト時間推論にまたがるSWEエージェントライフサイクルを最適化する統合フレームワークである。
標準SWEベンチマークの実験により、SWE-TRACEは、両方のトークン消費推論遅延を大幅に削減しつつ、解決率を最大化し、最先端の精度を大幅に向上することが示された。
論文 参考訳(メタデータ) (2026-04-16T09:41:47Z) - DataProphet: Demystifying Supervision Data Generalization in Multimodal LLMs [49.877224470539126]
トレーニングデータセットが目標ベンチマークに与える影響を,トレーニングが実行される前に見積もることができるか?
この結果から,直感的タスク類似性は伝達可能性の信頼できない予測因子であり,一般化はタスクカテゴリよりも特定のデータセットに依存していることがわかった。
そこで本研究では,マルチモーダルなパープレクティリティ,類似性,データ多様性を組み合わせたトレーニング不要な指標であるDatePROPHETを提案する。
論文 参考訳(メタデータ) (2026-03-20T06:42:26Z) - Verified Critical Step Optimization for LLM Agents [67.05296684575445]
クリティカルステップ最適化は、検証されたクリティカルステップに優先学習を集中する。
メソッドは、専門家のデモンストレーションではなく、失敗するポリシーの軌道から始まります。
GAIA-Text-103とXBench-DeepSearchの実験では、CSOはSFTベースラインよりも37%、相対的に26%改善している。
論文 参考訳(メタデータ) (2026-02-03T11:41:02Z) - STEP: Success-Rate-Aware Trajectory-Efficient Policy Optimization [23.48518286261969]
軌道レベルの最適化は、各軌道を単一のトレーニングサンプルとして扱う。
このアプローチは非効率であり、誤解を招く学習信号が得られる。
提案するSTEP(Success-rate-aware Trajectory-Efficient Policy Optimization)は,タスクごとの成功率に基づいてサンプリングを動的に割り当てるフレームワークである。
論文 参考訳(メタデータ) (2025-11-17T07:43:15Z) - CoT-Saliency: Unified Chain-of-Thought Reasoning for Heterogeneous Saliency Tasks [96.64597365827046]
本稿では,3つの運用上不均一なサリエンシタスクを共同で処理する,最初の統合フレームワークを提案する。
タスクの不均一性を橋渡しする視覚言語モデル(VLM)において、チェーン・オブ・ソート(CoT)推論プロセスを導入する。
我々は,全タスクにまたがる特別なSOTA手法と強力なクローズドソースVLMの整合性を示す。
論文 参考訳(メタデータ) (2025-11-01T04:37:01Z) - SST: Self-training with Self-adaptive Thresholding for Semi-supervised Learning [42.764994681999774]
SST(Self-Adaptive Thresholding)は、新しい、効果的で効率的なSSLフレームワークである。
SSTはモデルの学習進捗に基づいてクラス固有のしきい値を調整する。
Semi-SST-ViT-Hugeは競合するImageNet-1K SSLベンチマークで最高の結果を得る。
論文 参考訳(メタデータ) (2025-05-31T08:34:04Z) - Bridging SFT and DPO for Diffusion Model Alignment with Self-Sampling Preference Optimization [67.8738082040299]
自己サンプリング優先最適化(SSPO)は,訓練後強化学習のための新しいアライメント手法である。
SSPOは、SFTのトレーニング安定性を維持しながら、ペアデータと報酬モデルの必要性を排除する。
SSPOは、テキスト・ツー・イメージベンチマークにおける以前のアプローチを全て上回り、テキスト・ツー・ビデオベンチマークにおける優れたパフォーマンスを示している。
論文 参考訳(メタデータ) (2024-10-07T17:56:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。