論文の概要: NexForge: Scaling Executable Agent Tasks via Requirement-First Synthesis
- arxiv url: http://arxiv.org/abs/2607.14186v1
- Date: Wed, 15 Jul 2026 15:34:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.857072
- Title: NexForge: Scaling Executable Agent Tasks via Requirement-First Synthesis
- Title(参考訳): NexForge: 要求第一合成による実行可能なエージェントタスクのスケーリング
- Authors: Jiarong Zhao, Zhikai Lei, Zhiheng Xi, Rui Zheng, Hang Yan, Jie Zhou, Qin Chen, Liang He,
- Abstract要約: NexForgeは要件優先のフレームワークで、フリーフォームの能力要件を実行可能なエージェントトレーニングデータにコンパイルする。
3600のターミナルタスクと2000のオフィスタスクを生産し、Qwen3.5-35B-A3Bベースを22.5%から52.0%に改善した。
NexForge合成データは、公開されているエージェントモデルのファミリーであるNex-N2のトレーニングに寄与する。
- 参考スコア(独自算出の注目度): 34.42399339869598
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scaling executable agent training data is bottlenecked by substrate-first methods that tie task generation to predefined tools, repositories, or skill graphs: expanding coverage requires manual expansion of the substrate, each new domain demands a bespoke pipeline, and the resulting task distributions often reflect substrate convenience rather than real-world demand. We introduce NexForge, a requirement-first framework that compiles free-form capability requirements into executable agent training data. NexForge first performs research-based demand discovery to identify representative task forms, realistic scenarios, and their relative prevalence. It then applies distribution-aware task compilation and automatically retrieves or constructs the files, repositories, dependencies, and runtime configurations required to materialize each task, followed by teacher rollout collection and trajectory distillation. The same pipeline, without any domain-specific infrastructure, produces 3,600 terminal tasks and 2,000 office tasks, improving Qwen3.5-35B-A3B Base from 22.5% to 52.0% on Terminal-Bench 2.0 and from 813 to 1338 Elo on GDPval; scaling to 43.2K terminal tasks reaches 58.4%, surpassing Claude Opus 4.6. Scaled further, NexForge-synthesized data contributes to the training of Nex-N2, a family of publicly available agent models that lift Qwen3.5-35B-A3B to 75.3% on Terminal-Bench 2.1 and to 1585 Elo on GDPval -- achieving state-of-the-art open-source performance and surpassing several frontier proprietary systems. Nex-N2 models are available at https://nex.sii.edu.cn/
- Abstract(参考訳): 実行可能エージェントのトレーニングデータのスケーリングは、タスク生成を事前に定義されたツールやリポジトリ、あるいはスキルグラフに結びつけるための、基質優先の手法によってボトルネックされる。
我々は、フリーフォーム機能要件を実行可能なエージェントトレーニングデータにコンパイルする、要求優先のフレームワークであるNexForgeを紹介した。
NexForgeはまず、代表的なタスクフォーム、現実シナリオ、およびそれらの相対的な頻度を特定するために、リサーチベースの需要発見を実行する。
次に、分散対応タスクコンパイルを適用し、各タスクを実現するために必要なファイル、リポジトリ、依存関係、ランタイム設定を自動で取得または構築し、続いて教師のロールアウトコレクションとトラジェクトリ蒸留を行う。
同じパイプラインは、ドメイン固有のインフラがなければ3,600の端末タスクと2000のオフィスタスクを生成し、Qwen3.5-35B-A3Bベースを22.5%から52.0%に改善し、GDPvalでは813から1338 Eloに改善し、43.2Kの端末タスクは58.4%、Claude Opus 4.6を上回った。
さらに、NexForge合成データは、Qwen3.5-35B-A3Bをターミナルベンチ2.1で75.3%、GDPvalで1585 Eloに引き上げる公開エージェントモデルのNex-N2のトレーニングに寄与している。
Nex-N2モデルはhttps://nex.sii.edu.cn/で入手できる。
関連論文リスト
- ProCUA-SFT Technical Report [80.97543110323542]
コンピュータ使用エージェント(CUA)の訓練には、全デスクトップ環境で収集された大規模で多様な軌跡データが必要である。
93Kの合成軌道から抽出した3.1MステップレベルのSFTサンプルのデータセットであるProCUA-SFTについて述べる。
ProCUA-SFTの微調整UI-TARS 7Bは、OSWorldで45.0%、ベースモデルよりも18.7ポイント改善されている。
論文 参考訳(メタデータ) (2026-06-15T22:04:11Z) - Terminal-World: Scaling Terminal-Agent Environments via Agent Skills [52.39713754337834]
エージェントスキルを中心的な合成プリミティブとして利用する完全自動化パイプラインである Terminal-World を紹介する。
我々は,5,723のトレーニング環境を構築し,端末-ワールド-8B/14B/32Bを6つのベンチマークで評価した。
Terminal-World-32B は Terminal-Bench 2.0 で Nemotron-Terminal-32B を +4.5 Pass@1 (31.5) で上回り、43.8 Pass@3 に達する。
論文 参考訳(メタデータ) (2026-05-20T08:14:51Z) - On Data Engineering for Scaling LLM Terminal Capabilities [62.14352406328365]
最先端の端末エージェントの背後にあるトレーニングデータ戦略はほとんど公表されていない。
端末エージェントのデータエンジニアリングプラクティスの体系的研究を通じて,このギャップに対処する。
当社のパイプラインは,端末タスク用の大規模オープンソースデータセットである Terminal-Corpus を生成する。
論文 参考訳(メタデータ) (2026-02-24T18:51:04Z) - Mobile-Agent-v3.5: Multi-platform Fundamental GUI Agents [56.72789202127874]
この記事では、最新のネイティブGUIエージェントモデルであるGUI-Owl-1.5を紹介する。
クラウドとエッジのコラボレーションとリアルタイムのインタラクションを実現するために、さまざまなプラットフォーム(デスクトップ、モバイル、ブラウザなど)をサポートしている。
オープンソースモデル上で20以上のGUIベンチマークで最先端の結果を得る。
論文 参考訳(メタデータ) (2026-02-15T01:52:19Z) - Endless Terminals: Scaling RL Environments for Terminal Agents [39.60665149203152]
Endless Terminalsは、人間のアノテーションを使わずに端末用タスクを手続き的に生成する、完全に自律的なパイプラインである。
我々は、バイナリエピソードレベルの報酬と最小の相互作用ループを持つバニラPPOを使用してエージェントを訓練する。
これらの改善は人為的なベンチマークに移行する。
論文 参考訳(メタデータ) (2026-01-23T04:39:55Z) - UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning [155.51875080423883]
グラフィカルユーザインタフェースのための自律エージェントの開発は、人工知能における大きな課題を示している。
本稿では,GUI中心のエージェントモデルであるUI-TARS-2を提案する。
実証的な評価では、UI-TARS-2は以前のUI-TARS-1.5よりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-09-02T17:44:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。