論文の概要: Open-SWE-Traces: Advancing Dual-Mode Multilingual Distillation for Software Engineering Agents
- arxiv url: http://arxiv.org/abs/2606.16038v1
- Date: Sun, 14 Jun 2026 22:10:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:34.002471
- Title: Open-SWE-Traces: Advancing Dual-Mode Multilingual Distillation for Software Engineering Agents
- Title(参考訳): Open-SWE-Traces:Dual-Mode Multilingual Distillation for Software Engineering Agents
- Authors: Wasi Uddin Ahmad, Nikolai Ludwig, Somshubra Majumdar, Boris Ginsburg,
- Abstract要約: 私たちのデータセットは 9つのプログラミング言語にまたがる 207,489のエージェント・トラジェクトリのデータセットです
このデータは、長距離推論が可能なモデルのトレーニングを容易にする。
最高の性能モデルは、SWEベンチ検証で61.7%、SWEベンチ多言語で57.1%、SWEベンチProで36.8%である。
- 参考スコア(独自算出の注目度): 42.7127695634038
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The path toward autonomous software engineering is currently bottlenecked by a severe deficit of diverse, large-scale trajectory data. We address this by introducing \ourdataset, an expansive dataset of 207,489 agentic trajectories spanning nine programming languages (Python, Go, TS, JS, Rust, Java, PHP, C, C++). Sourced from 20,000 real-world PRs via OpenHands and SWE-agent harnesses, the dataset utilizes a hybrid-reasoning synthesis: Minimax-M2.5 generates trajectories with explicit "thinking" processes, while Qwen3.5-122B provides high-quality "non-thinking" traces. Filtered for permissive licenses (MIT, Apache, BSD) from SWE-rebench-V2, this data facilitates the training of models capable of long-horizon reasoning. We validate the dataset by fine-tuning the Qwen3-30B-A3B series (Thinking, Instruct, and Coder). The best performing model achieves resolve rates of 61.7% on SWE-bench Verified, 57.1% on SWE-bench Multilingual, and 36.8% on SWE-bench Pro. These results establish Open-SWE-Traces as a premier resource for distilling human-level software engineering capabilities into efficient, open-source agentic LLMs.
- Abstract(参考訳): 自律的なソフトウェアエンジニアリングへの道は、現在、多種多様な大規模軌跡データの深刻な欠陥によってボトルネックになっている。
これは、9つのプログラミング言語(Python、Go、TS、JS、Rust、Java、PHP、C、C++)にまたがる、207,489のエージェントトラジェクトリからなる拡張データセットである。
OpenHandsとSWE-agentのハーネスを通じて2万の現実世界のPRから得られたこのデータセットは、ハイブリッド推論合成を利用する: Minimax-M2.5は明示的な"思考"プロセスで軌道を生成し、Qwen3.5-122Bは高品質な"思考"トレースを提供する。
このデータは、SWE-rebench-V2の許容ライセンス(MIT、Apache、BSD)をフィルタリングすることで、長距離推論が可能なモデルのトレーニングを容易にする。
我々はQwen3-30B-A3Bシリーズ(シンキング、インストラクション、コーダ)を微調整してデータセットを検証する。
最高の性能モデルは、SWEベンチ検証で61.7%、SWEベンチ多言語で57.1%、SWEベンチProで36.8%である。
これらの結果から, Open-SWE-Traces は人間レベルのソフトウェア工学能力を効率よくオープンソースのエージェント LLM に蒸留するための最重要資源となる。
関連論文リスト
- Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders [49.87696007629591]
トレーニング後のデータエンジニアリングは外部信号に大きく依存しており、モデル内部にある豊富な固有信号を無視している。
強化学習のためのデータエンジニアリングフレームワークSAERLを提案する。
Sparse Autoencoder(SAE)によって抽出されたモデル内部を使用して、多様性、難易度、品質の3つの固有のデータ特性をモデル化する。
論文 参考訳(メタデータ) (2026-05-26T17:55:59Z) - Orchard: An Open-Source Agentic Modeling Framework [124.68499958175111]
スケーラブルなエージェントモデリングのためのオープンソースのフレームワークOrchardを紹介します。
Orchard Envは、サンドボックスライフサイクル管理のための再利用可能なプリミティブを提供する軽量環境サービスである。
Orchard Envの上に、3つのエージェントモデリングレシピを構築します。
論文 参考訳(メタデータ) (2026-05-14T16:35:12Z) - Delta-Based Neural Architecture Search: LLM Fine-Tuning via Code Diffs [48.83701310501069]
大規模言語モデル(LLM)は、ニューラルアーキテクチャ生成の強力な可能性を示している。
既存のアプローチは、ゼロから完全なモデル実装を生成します。
我々はデルタ符号生成法を提案し、細調整されたLLMはコンパクトな統一差分を生成する。
論文 参考訳(メタデータ) (2026-05-06T13:32:05Z) - Immersion in the GitHub Universe: Scaling Coding Agents to Mastery [60.359983359258955]
ScaleSWEは、高品質なSWEデータを大規模に構築するために設計された、自動化されたサンドボックス化されたマルチエージェントワークフローである。
このシステムは、環境設定、テスト生成、問題記述合成のための3つの特別なエージェントをコーディネートし、5200リポジトリにわたる600万のプルリクエストを処理する。
論文 参考訳(メタデータ) (2026-02-10T15:30:19Z) - Skywork-SWE: Unveiling Data Scaling Laws for Software Engineering in LLMs [19.766885088032932]
ソフトウェアエンジニアリング(SWE)は、次世代のLLMエージェントにとって重要なテストベッドとして登場した。
既存のデータセットのほとんどは、わずか数千のGitHubソースインスタンスに制限されている。
SWEデータセットのボリュームと多様性の両方を体系的にスケールするインクリメンタルな自動データキュレーションパイプラインを提案する。
論文 参考訳(メタデータ) (2025-06-24T03:53:36Z) - SWE-Dev: Building Software Engineering Agents with Training and Inference Scaling [39.53265893083118]
大規模言語モデル(LLM)は、会話による問題解決から、ツール使用に関わる現実的なタスクへの対処まで、急速に進歩している。
この問題に対処するために、オープンソースのLLM上に構築されたSWEエージェントであるSWE-Devを提案する。
SWE-bench-Verifiedベンチマークの実験は、SWE-Devモデルが全てのオープンなSWEエージェントの中で最高のパフォーマンスを達成できることを示している。
論文 参考訳(メタデータ) (2025-06-09T11:03:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。