論文の概要: NexForge: Scaling Agent Capabilities through Requirement-Driven Task Synthesis for LLMs
- arxiv url: http://arxiv.org/abs/2607.14186v3
- Date: Tue, 21 Jul 2026 11:28:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.182194
- Title: NexForge: Scaling Agent Capabilities through Requirement-Driven Task Synthesis for LLMs
- Title(参考訳): NexForge: LLMの要求駆動タスク合成によるエージェントのスケーリング機能
- Authors: Jiarong Zhao, Zhikai Lei, Zhiheng Xi, Rui Zheng, Hang Yan, Jie Zhou, Qin Chen, Liang He,
- Abstract要約: NexForgeは要求駆動のフレームワークで、高レベルの機能要件を入力として受け取ります。
NexForgeは3.6K端末と2Kオフィスタスクを生成し、Qwen3.5-35B-A3Bベースを22.5%から52.0%に改善した。
NexForge合成データは、公開されているエージェントモデルのファミリーであるNex-N2のトレーニングに寄与する。
- 参考スコア(独自算出の注目度): 34.42399339869598
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scaling executable agent training data for LLM post-training is bottlenecked by substrate-bound methods that tie task generation to predefined tools, repositories, or skill graphs: expanding coverage requires manual substrate engineering, each new domain demands a bespoke pipeline, and the resulting task distributions often reflect substrate biases rather than real-world demand. We introduce NexForge, a requirement-driven framework that takes high-level capability requirements as input and synthesizes diverse, executable agent tasks and expert trajectories for SFT. NexForge first investigates real-world demand to construct representative scenarios and task profiles, then performs distribution-aware compilation to generate task directives. For each directive, NexForge automatically retrieves or constructs the required files, dependencies, and runtime configurations, and finally synthesizes expert rollouts and produces training trajectories. Without domain-specific infrastructure, NexForge produces 3.6K terminal and 2K office tasks, improving Qwen3.5-35B-A3B Base from 22.5\% to 52.0\% on Terminal-Bench 2.0 and from 813 to 1338 Elo on GDPval; scaling further to 43.2K terminal tasks yields 58.4\%, on par with Claude Opus 4.6 equipped with Claude Code. Scaled further, NexForge-synthesized data contributes to the training of Nex-N2, a family of publicly available agent models that lift Qwen3.5-35B-A3B to 75.3\% on Terminal-Bench 2.1 and to 1585 Elo on GDPval -- achieving state-of-the-art open-source performance and surpassing several frontier proprietary systems. Nex-N2 models are available at https://nex.sii.edu.cn/.
- Abstract(参考訳): LLMポストトレーニングのための実行可能なエージェントトレーニングデータのスケーリングは、タスク生成を事前に定義されたツール、リポジトリ、あるいはスキルグラフに結びつけるための基板バウンドメソッドによってボトルネックされる。
NexForgeは要求駆動のフレームワークで、高いレベルの能力要件を入力として取り、多様な実行可能なエージェントタスクとSFTのエキスパートトラジェクトリを合成する。
NexForgeはまず、代表シナリオとタスクプロファイルを構築するための実世界の要求を調査し、次に、タスクディレクティブを生成するために分散対応コンパイルを実行する。
各ディレクティブに対して、NexForgeは必要なファイル、依存関係、ランタイム設定を自動的に取得または構築し、最終的に専門家のロールアウトを合成し、トレーニングトラジェクトリを生成する。
ドメイン固有のインフラがなければ、NexForgeは3.6K端末と2Kオフィスタスクを生成し、Qwen3.5-35B-A3Bベースを22.5\%から52.0\%に改善し、GDPvalは813から1338 Eloに改善し、さらに43.2K端末タスクはClaude Codeを搭載したClaude Opus 4.6と同等の58.4\%に拡大した。
さらに、NexForgeを合成したデータは、Qwen3.5-35B-A3Bをターミナルベンチ2.1で75.3\%、GDPvalで1585 Eloに引き上げ、最先端のオープンソースパフォーマンスを達成し、いくつかのフロンティアプロプライエタリシステムを上回る公開エージェントモデルのNex-N2のトレーニングに貢献している。
Nex-N2モデルはhttps://nex.sii.edu.cn/.comで入手できる。
関連論文リスト
- ProCUA-SFT Technical Report [80.97543110323542]
コンピュータ使用エージェント(CUA)の訓練には、全デスクトップ環境で収集された大規模で多様な軌跡データが必要である。
93Kの合成軌道から抽出した3.1MステップレベルのSFTサンプルのデータセットであるProCUA-SFTについて述べる。
ProCUA-SFTの微調整UI-TARS 7Bは、OSWorldで45.0%、ベースモデルよりも18.7ポイント改善されている。
論文 参考訳(メタデータ) (2026-06-15T22:04:11Z) - Terminal-World: Scaling Terminal-Agent Environments via Agent Skills [52.39713754337834]
エージェントスキルを中心的な合成プリミティブとして利用する完全自動化パイプラインである Terminal-World を紹介する。
我々は,5,723のトレーニング環境を構築し,端末-ワールド-8B/14B/32Bを6つのベンチマークで評価した。
Terminal-World-32B は Terminal-Bench 2.0 で Nemotron-Terminal-32B を +4.5 Pass@1 (31.5) で上回り、43.8 Pass@3 に達する。
論文 参考訳(メタデータ) (2026-05-20T08:14:51Z) - On Data Engineering for Scaling LLM Terminal Capabilities [62.14352406328365]
最先端の端末エージェントの背後にあるトレーニングデータ戦略はほとんど公表されていない。
端末エージェントのデータエンジニアリングプラクティスの体系的研究を通じて,このギャップに対処する。
当社のパイプラインは,端末タスク用の大規模オープンソースデータセットである Terminal-Corpus を生成する。
論文 参考訳(メタデータ) (2026-02-24T18:51:04Z) - Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents [56.72789202127874]
この記事では、最新のネイティブGUIエージェントモデルであるGUI-Owl-1.5を紹介する。
クラウドとエッジのコラボレーションとリアルタイムのインタラクションを実現するために、さまざまなプラットフォーム(デスクトップ、モバイル、ブラウザなど)をサポートしている。
オープンソースモデル上で20以上のGUIベンチマークで最先端の結果を得る。
論文 参考訳(メタデータ) (2026-02-15T01:52:19Z) - Endless Terminals: Scaling RL Environments for Terminal Agents [39.60665149203152]
Endless Terminalsは、人間のアノテーションを使わずに端末用タスクを手続き的に生成する、完全に自律的なパイプラインである。
我々は、バイナリエピソードレベルの報酬と最小の相互作用ループを持つバニラPPOを使用してエージェントを訓練する。
これらの改善は人為的なベンチマークに移行する。
論文 参考訳(メタデータ) (2026-01-23T04:39:55Z) - UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning [155.51875080423883]
グラフィカルユーザインタフェースのための自律エージェントの開発は、人工知能における大きな課題を示している。
本稿では,GUI中心のエージェントモデルであるUI-TARS-2を提案する。
実証的な評価では、UI-TARS-2は以前のUI-TARS-1.5よりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-09-02T17:44:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。