論文の概要: NexForge: Scaling Agent Capabilities through Requirement-Driven Task Synthesis for LLMs
- arxiv url: http://arxiv.org/abs/2607.14186v2
- Date: Fri, 17 Jul 2026 10:25:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.41538
- Title: NexForge: Scaling Agent Capabilities through Requirement-Driven Task Synthesis for LLMs
- Title(参考訳): NexForge: LLMの要求駆動タスク合成によるエージェントのスケーリング機能
- Abstract要約: 我々は,多種多様なエージェントタスクとSFT専門トラジェクトリを合成する要求駆動型フレームワークであるNexForgeを紹介した。
同じパイプラインは3,600の端末タスクと2000のオフィスタスクをドメイン固有のインフラストラクチャなしで生成する。
NexForgeの合成軌道は、Qwen3.5-35B-A3BをGDPvalで75.3%まで前進させるオープンエージェントモデルであるNex-N2のSFTを監督する。
- 参考スコア(独自算出の注目度): 34.42399339869598
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Synthesizing training data to scale agent capabilities in LLM post-training is bottlenecked by substrate-bound task synthesis: tasks are generated from fixed tools, repositories, or skill graphs, so expanding coverage requires manual substrate engineering, transferring to a new domain demands bespoke infrastructure, and the resulting distributions inherit substrate biases rather than reflecting real-world demand. We introduce NexForge, a requirement-driven framework that synthesizes diverse, executable agent tasks and expert trajectories for SFT from high-level capability requirements. NexForge first profiles real-world demand into representative scenarios and task profiles, then samples task forms per scenario. It then performs distribution-aware compilation, automatically retrieving or constructing files, repositories, dependencies, and runtime configurations to instantiate each task, followed by synthesizing expert rollouts and distilling trajectories. The same pipeline generates 3,600 terminal tasks and 2,000 office tasks without any domain-specific infrastructure, improving Qwen3.5-35B-A3B Base from 22.5\% to 52.0\% on Terminal-Bench 2.0 and from 813 to 1338 Elo on GDPval. Scaling to 43.2K terminal tasks further improves performance to 58.4\%, surpassing Claude Opus 4.6. At scale, NexForge-synthesized trajectories supervise SFT of Nex-N2, a family of open agent models that advance Qwen3.5-35B-A3B to 75.3\% on Terminal-Bench 2.1 and 1585 Elo on GDPval -- achieving state-of-the-art open-source performance and surpassing several frontier proprietary systems. Nex-N2 models are available at https://nex.sii.edu.cn/.
- Abstract(参考訳): タスクは固定ツール、リポジトリ、またはスキルグラフから生成されるので、カバレッジの拡大には手動の基板エンジニアリングが必要であり、新しいドメイン要求のインフラに移行し、その結果のディストリビューションは実際の需要を反映するのではなく、基板バイアスを継承する。
NexForgeは、多種多様な実行可能なエージェントタスクと、高レベルの能力要件からSFTのエキスパートトラジェクトリを合成する、要求駆動のフレームワークである。
NexForgeはまず、現実の要求を代表シナリオとタスクプロファイルにプロファイルし、次にシナリオ毎のタスクフォームをサンプリングする。
次に、ファイル、リポジトリ、依存関係、ランタイム設定を自動的に検索または構築して各タスクをインスタンス化し、その後専門家のロールアウトを合成し、トラジェクトリを蒸留する。
同じパイプラインは3,600の端末タスクと2000のオフィスタスクをドメイン固有のインフラストラクチャなしで生成し、Qwen3.5-35B-A3Bベースを22.5\%から52.0\%に改善し、GDPvalでは813から1338 Eloに改善した。
43.2Kの端末タスクへのスケーリングにより、パフォーマンスはさらに58.4\%向上し、Claude Opus 4.6を上回った。
NexForge-synthesized trajectories は Qwen3.5-35B-A3B を GDPval の Terminal-Bench 2.1 と 1585 Elo で 75.3 % に進化させるオープンエージェントモデルである Nex-N2 の SFT を監督している。
Nex-N2モデルはhttps://nex.sii.edu.cn/.comで入手できる。
関連論文リスト
- AgentOmnia: Scaling Agentic Models for Full-Scenario Applications [36.656762500581216]
大規模言語モデルエージェントは急速に進歩しているが、ドメイン、機能、タスクの難しさ、インタラクション設定にはまだ進歩が断片化されている。
これはTo-Consumer(ToC)、To-Business(ToB)、To-Employee(ToE)アプリケーション間でタスク空間の定義、データ合成、ポストトレーニング、評価、改善を調整するフレームワークです。
論文 参考訳(メタデータ) (2026-07-25T09:58:24Z) - ProCUA-SFT Technical Report [80.97543110323542]
コンピュータ使用エージェント(CUA)の訓練には、全デスクトップ環境で収集された大規模で多様な軌跡データが必要である。
93Kの合成軌道から抽出した3.1MステップレベルのSFTサンプルのデータセットであるProCUA-SFTについて述べる。
ProCUA-SFTの微調整UI-TARS 7Bは、OSWorldで45.0%、ベースモデルよりも18.7ポイント改善されている。
論文 参考訳(メタデータ) (2026-06-15T22:04:11Z) - Open-SWE-Traces: Advancing Dual-Mode Multilingual Distillation for Software Engineering Agents [42.7127695634038]
私たちのデータセットは 9つのプログラミング言語にまたがる 207,489のエージェント・トラジェクトリのデータセットです
このデータは、長距離推論が可能なモデルのトレーニングを容易にする。
最高の性能モデルは、SWEベンチ検証で61.7%、SWEベンチ多言語で57.1%、SWEベンチProで36.8%である。
論文 参考訳(メタデータ) (2026-06-14T22:10:06Z) - Terminal-World: Scaling Terminal-Agent Environments via Agent Skills [52.39713754337834]
エージェントスキルを中心的な合成プリミティブとして利用する完全自動化パイプラインである Terminal-World を紹介する。
我々は,5,723のトレーニング環境を構築し,端末-ワールド-8B/14B/32Bを6つのベンチマークで評価した。
Terminal-World-32B は Terminal-Bench 2.0 で Nemotron-Terminal-32B を +4.5 Pass@1 (31.5) で上回り、43.8 Pass@3 に達する。
論文 参考訳(メタデータ) (2026-05-20T08:14:51Z) - Orchard: An Open-Source Agentic Modeling Framework [124.68499958175111]
スケーラブルなエージェントモデリングのためのオープンソースのフレームワークOrchardを紹介します。
Orchard Envは、サンドボックスライフサイクル管理のための再利用可能なプリミティブを提供する軽量環境サービスである。
Orchard Envの上に、3つのエージェントモデリングレシピを構築します。
論文 参考訳(メタデータ) (2026-05-14T16:35:12Z) - On Data Engineering for Scaling LLM Terminal Capabilities [62.14352406328365]
最先端の端末エージェントの背後にあるトレーニングデータ戦略はほとんど公表されていない。
端末エージェントのデータエンジニアリングプラクティスの体系的研究を通じて,このギャップに対処する。
当社のパイプラインは,端末タスク用の大規模オープンソースデータセットである Terminal-Corpus を生成する。
論文 参考訳(メタデータ) (2026-02-24T18:51:04Z) - Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents [56.72789202127874]
この記事では、最新のネイティブGUIエージェントモデルであるGUI-Owl-1.5を紹介する。
クラウドとエッジのコラボレーションとリアルタイムのインタラクションを実現するために、さまざまなプラットフォーム(デスクトップ、モバイル、ブラウザなど)をサポートしている。
オープンソースモデル上で20以上のGUIベンチマークで最先端の結果を得る。
論文 参考訳(メタデータ) (2026-02-15T01:52:19Z) - Endless Terminals: Scaling RL Environments for Terminal Agents [39.60665149203152]
Endless Terminalsは、人間のアノテーションを使わずに端末用タスクを手続き的に生成する、完全に自律的なパイプラインである。
我々は、バイナリエピソードレベルの報酬と最小の相互作用ループを持つバニラPPOを使用してエージェントを訓練する。
これらの改善は人為的なベンチマークに移行する。
論文 参考訳(メタデータ) (2026-01-23T04:39:55Z) - UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning [155.51875080423883]
グラフィカルユーザインタフェースのための自律エージェントの開発は、人工知能における大きな課題を示している。
本稿では,GUI中心のエージェントモデルであるUI-TARS-2を提案する。
実証的な評価では、UI-TARS-2は以前のUI-TARS-1.5よりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-09-02T17:44:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。