論文の概要: Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
- arxiv url: http://arxiv.org/abs/2609.04148v1
- Date: Thu, 03 Sep 2026 17:41:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:39.188881
- Title: Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
- Title(参考訳): 終端ユニバーサル:エージェント軌道をスケーラブルな終端環境に変換する
- Authors: Jie Wu, Zhenru Zhang, Beichen Zhang, Xuwu Wang, Yuhui Su, Mouxiang Chen, Peng Wang, Zhihai Wang, Que Shen, Hao Zhou, An Yang, Fei Huang, Yujiu Yang, Dayiheng Liu,
- Abstract要約: それぞれの軌道を再利用可能な環境に変えるためのフレームワークである Terminal-Universe を紹介する。
Terminal-Universeは、トラジェクトリに記録されたファイル操作をリプレイして、エージェントが変更する前に各ファイルを復元し、部分的なワークスペースを生成する。
また、タスクは幅と深さの2つの軸に沿ってスケールします。
- 参考スコア(独自算出の注目度): 89.86581796261123
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As terminal-based code agents become prevalent, agent trajectories have accumulated at scale, while realistic, executable environments remain scarce. However, environments are what agent post-training actually requires: each can be re-queried into many verifiable tasks and provides execution feedback, whereas a trajectory is a single frozen demonstration. Rather than generating environments from scratch, we observe that the tool-execution history in existing trajectories exposes the structure and contents of the environments in which they ran, making it possible to reconstruct those environments from the trajectories themselves. Thus, we introduce Terminal-Universe, a framework which turns each trajectory into a reusable environment and explores it for synthesizing new tasks and continued interactions. Specifically, Terminal-Universe replays the file operations recorded in a trajectory to restore each file before the agent modified it, yielding a partial workspace; a completion agent then supplies the missing files and dependencies. On this recovered workspace, we both reconstruct the original intent task and synthesize entirely new ones. Besides, we also scale the tasks along two complementary axes: breadth and depth. For breadth, we mine directional dependency relations between related environments and synthesize cross-workspace queries spanning multiple codebases, as developers routinely do in real-world development. For depth, we extend the initial single-turn query into a multi-round session that captures iterative user feedback and requirement refinement via a user agent. Applied to public terminal agent trajectories, Terminal-Universe produces 37.3k task-sufficient environments. Supervised fine-tuning of Qwen3.5-27B on this corpus improves single-round performance on Terminal-Bench 2.1 by 11.9 points and multi-round performance on EvoCode-Bench v2 MT@4 by 13.8 points.
- Abstract(参考訳): ターミナルベースのコードエージェントが普及するにつれて、エージェントのトラジェクトリは大規模に蓄積され、現実的な実行環境は依然として不足している。
それぞれのタスクを検証可能な多くのタスクに再クエリし、実行フィードバックを提供する。
既存のトラジェクトリにおけるツール実行履歴は,スクラッチから環境を生成するのではなく,実行環境の構造や内容を明らかにすることで,それらの環境をトラジェクトリ自体から再構築することができる。
そこで本研究では,各軌道を再利用可能な環境に転換し,新たなタスクを合成し,継続的なインタラクションを行うためのフレームワークであるTerminal-Universeを紹介する。
具体的には、Terminal-Universeはトラジェクトリに記録されたファイル操作をリプレイして、エージェントが変更する前に各ファイルを復元し、部分的なワークスペースを生成します。
この回復されたワークスペースでは、どちらも本来の意図のタスクを再構築し、完全に新しいタスクを合成します。
さらに、タスクを2つの相補的な軸(幅と深さ)に沿ってスケールする。
広義には,関係する環境間の指向的な依存関係関係を抽出し,複数のコードベースにまたがるクロスワークスペースクエリを合成する。
深度については、ユーザエージェントを介して反復的なユーザフィードバックと要求改善をキャプチャするマルチラウンドセッションに、初期シングルターンクエリを拡張します。
公共のターミナルエージェントの軌道に適用すると、ターミナル・ユニバースは37.3kのタスクに十分な環境を生産する。
このコーパスでのQwen3.5-27Bの微調整により、ターミナルベンチ2.1でのシングルラウンドのパフォーマンスは11.9ポイント、EvoCode-Bench v2 MT@4でのマルチラウンドパフォーマンスは13.8ポイント向上した。
関連論文リスト
- SPADE: Self-Play in Adaptive Synthetic Executable Environments [110.80471334001574]
1つのLLMが2つの役割を演じるセルフプレイのRLフレームワークであるSPADEを紹介する。
Environment Designerは、OpenAI Gymスタイルのreset()/step()インターフェイスで実行可能なコードとして、完全な長距離トレーニング環境を記述する。
環境デザイナは,大規模な事前学習コーパスから採取した文書に基づいて構築し,蓄積した環境記憶を与える。
論文 参考訳(メタデータ) (2026-08-19T17:58:56Z) - Meta-Task: Turning Terminal Task Synthesis into a Terminal Task for Scalable Agent Training [13.580418686043815]
大規模な端末エージェントの訓練には、多様な検証可能な端末タスクと高品質な対話トラジェクトリが必要である。
既存のメソッドは、タスク生成と実際の実行の切り離しによって生じる信頼性の弱い2つの重要な制限に直面している。
本稿では,ターミナル・ベンチ形式タスク自体として端末タスク合成を再定義するMeta-Taskを提案する。
論文 参考訳(メタデータ) (2026-07-30T09:41:08Z) - LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents [74.07551833809536]
ドメイン仕様から直接端末トレーニング環境を生成するゼロ依存パイプラインである LiteCoder-Terminal-Gen を紹介する。
このフレームワークを用いて,10ドメインにわたる11,255のエキスパートトラジェクトリからなるLiteCoder-Terminal-SFTと,トラジェクトリレベルの優先度最適化のための602の検証可能な環境を備えたLiteCoder-Terminal-RLという2つの大規模リソースを構築した。
論文 参考訳(メタデータ) (2026-05-28T08:11:57Z) - Terminal-World: Scaling Terminal-Agent Environments via Agent Skills [52.39713754337834]
エージェントスキルを中心的な合成プリミティブとして利用する完全自動化パイプラインである Terminal-World を紹介する。
我々は,5,723のトレーニング環境を構築し,端末-ワールド-8B/14B/32Bを6つのベンチマークで評価した。
Terminal-World-32B は Terminal-Bench 2.0 で Nemotron-Terminal-32B を +4.5 Pass@1 (31.5) で上回り、43.8 Pass@3 に達する。
論文 参考訳(メタデータ) (2026-05-20T08:14:51Z) - CLI-Gym: Scalable CLI Task Generation via Agentic Environment Inversion [26.52253286270211]
エージェントコーディングは、例えばコマンドラインインターフェース(CLI)のような実行環境と対話するエージェントを必要とする。
本研究では,環境履歴をシミュレートし,探索するためにエージェントを採用することを提案する。
提案手法はCLI-Gymと命名され, 環境集約型タスク1,655件が抽出され, この種のコレクションとしては最大である。
論文 参考訳(メタデータ) (2026-02-11T16:22:18Z) - TermiGen: High-Fidelity Environment and Robust Trajectory Synthesis for Terminal Agents [70.68963723787424]
TermiGenは検証可能な環境とレジリエントな専門家軌道を合成するためのエンドツーエンドパイプラインである。
TermiGen-Qwen2.5-Coder-32B は TerminalBench 上で 31.3% のパスレートを達成した。
論文 参考訳(メタデータ) (2026-02-06T23:56:50Z) - ANCHOR: Branch-Point Data Generation for GUI Agents [52.22377425487]
デスクトップ環境向けのエンドツーエンドGUIエージェントは、大量の高品質なインタラクションデータを必要とする。
本稿では,拡張フレームワークであるAnchorについて紹介する。このフレームワークは,小規模で検証済みのシードデモから,スケーラブルなデスクトップ監視をブートストラップする。
OSWorldとWindowsAgentArenaの標準デスクトップベンチマークの実験では、拡張されたコーパスに微調整されたモデルが一貫した改善を実現している。
論文 参考訳(メタデータ) (2026-02-06T19:55:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。