論文の概要: LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents
- arxiv url: http://arxiv.org/abs/2605.29559v1
- Date: Thu, 28 May 2026 08:11:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:56.052283
- Title: LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents
- Title(参考訳): LiteCoder-Terminal:学習言語エージェントのための長距離端末環境のスケーリング
- Authors: Xiaoxuan Peng, Kaiqi Zhang, Xinyu Lu, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun,
- Abstract要約: ドメイン仕様から直接端末トレーニング環境を生成するゼロ依存パイプラインである LiteCoder-Terminal-Gen を紹介する。
このフレームワークを用いて,10ドメインにわたる11,255のエキスパートトラジェクトリからなるLiteCoder-Terminal-SFTと,トラジェクトリレベルの優先度最適化のための602の検証可能な環境を備えたLiteCoder-Terminal-RLという2つの大規模リソースを構築した。
- 参考スコア(独自算出の注目度): 74.07551833809536
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mastering terminal environments requires language agents capable of multi-step planning, feedback-grounded execution, and dynamic state adaptation. However, training such agents is currently bottlenecked by a reliance on scraped external repositories, which limits domain diversity, environment controllability, and the targeting of specific capability deficits. We introduce LiteCoder-Terminal-Gen, a zero-dependency synthesis pipeline that autonomously generates executable and verifiable terminal training environments directly from domain specifications. Using this framework, we construct two large-scale resources: LiteCoder-Terminal-SFT, comprising 11,255 expert trajectories across 10 domains, and LiteCoder-Terminal-RL, featuring 602 verifiable environments for trajectory-level preference optimization. Supervised fine-tuning of Qwen-family models on our SFT dataset yields agents that significantly outperform their base counterparts. Notably, our 32B variant achieves 29.06%, 18.54%, and 34.00% pass@1 on Terminal Bench 1.0, 2.0, and Pro, respectively. Furthermore, applying Direct Multi-turn Preference Optimization (DMPO) on our RL environments yields additional performance gains. These results systematically demonstrate that fully synthetic, executable environments offer a scalable and verifiable supervision signal for mastering complex, real-world command-line workflows.
- Abstract(参考訳): マスタリング端末環境には、多段階計画、フィードバックグラウンド実行、動的状態適応が可能な言語エージェントが必要である。
しかし、そのようなエージェントのトレーニングは、現在、ドメインの多様性、環境制御性、特定の能力不足のターゲティングを制限する、スクラップ化された外部リポジトリへの依存によってボトルネックになっている。
ドメイン仕様から直接,実行可能かつ検証可能な端末トレーニング環境を自律的に生成するゼロ依存合成パイプラインである LiteCoder-Terminal-Gen を紹介する。
このフレームワークを用いて,10ドメインにわたる11,255のエキスパートトラジェクトリからなるLiteCoder-Terminal-SFTと,トラジェクトリレベルの優先度最適化のための602の検証可能な環境を備えたLiteCoder-Terminal-RLという2つの大規模リソースを構築した。
SFTデータセット上のQwenファミリーモデルの微調整によって、エージェントはベースモデルよりも大幅に優れています。
特に、我々の32B変種は、それぞれターミナルベンチ1.0、2.0、Proで29.06%、18.54%、34.00%パス@1を達成した。
さらに、我々のRL環境にDMPO(Direct Multi-turn Preference Optimization)を適用することで、さらなる性能向上が期待できる。
これらの結果は、完全に合成された実行可能環境が、複雑な実世界のコマンドラインワークフローをマスターするためのスケーラブルで検証可能な監視信号を提供することを体系的に示している。
関連論文リスト
- Terminal-World: Scaling Terminal-Agent Environments via Agent Skills [52.39713754337834]
エージェントスキルを中心的な合成プリミティブとして利用する完全自動化パイプラインである Terminal-World を紹介する。
我々は,5,723のトレーニング環境を構築し,端末-ワールド-8B/14B/32Bを6つのベンチマークで評価した。
Terminal-World-32B は Terminal-Bench 2.0 で Nemotron-Terminal-32B を +4.5 Pass@1 (31.5) で上回り、43.8 Pass@3 に達する。
論文 参考訳(メタデータ) (2026-05-20T08:14:51Z) - EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL [54.09410318521061]
本稿では,エージェント強化学習(Agentic RL)トレーニングのための完全に自動化されたフレームワークであるEnvFactoryを紹介する。
EnvFactoryは、認証リソースから自律的に、ステートフルで実行可能なツール環境を探索する。
トポロジーを意識したサンプリングとキャリブレーションによる自然なマルチターン軌道を合成する。
トレーニング効率とダウンストリーム性能が向上し、BFCLv3ではQwen3シリーズモデルを最大15%改善し、MPP-Atlasでは+8.6%、VitaBenchでは+6%向上した。
論文 参考訳(メタデータ) (2026-05-18T17:37:40Z) - CLI-Gym: Scalable CLI Task Generation via Agentic Environment Inversion [26.52253286270211]
エージェントコーディングは、例えばコマンドラインインターフェース(CLI)のような実行環境と対話するエージェントを必要とする。
本研究では,環境履歴をシミュレートし,探索するためにエージェントを採用することを提案する。
提案手法はCLI-Gymと命名され, 環境集約型タスク1,655件が抽出され, この種のコレクションとしては最大である。
論文 参考訳(メタデータ) (2026-02-11T16:22:18Z) - TermiGen: High-Fidelity Environment and Robust Trajectory Synthesis for Terminal Agents [70.68963723787424]
TermiGenは検証可能な環境とレジリエントな専門家軌道を合成するためのエンドツーエンドパイプラインである。
TermiGen-Qwen2.5-Coder-32B は TerminalBench 上で 31.3% のパスレートを達成した。
論文 参考訳(メタデータ) (2026-02-06T23:56:50Z) - Large-Scale Terminal Agentic Trajectory Generation from Dockerized Environments [36.81059045059001]
終端型タスクのトレーニングエージェントモデルは、現実的な長距離相互作用を捉える高品質な終端軌道に依存する。
我々は,Dockerに準拠したタスクインスタンスを生成し,エージェントトラジェクトリを実行可能なバリデーションコードで合成する,スケーラブルなパイプラインである textbfTerminalTraj を提案する。
TerminalTrajを使って32KのDockerイメージをキュレートし、8つのドメインにわたる50,733の認証済みターミナルトラジェクトリを生成します。
論文 参考訳(メタデータ) (2026-02-01T14:09:23Z) - Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem [90.17610617854247]
本稿では,エージェントモデルの生産パイプラインを最適化する基盤インフラであるエージェント学習エコシステム(ALE)を紹介する。
ALEは、重量最適化のためのトレーニング後のフレームワークであるROLL、軌道生成のためのサンドボックス環境マネージャであるROCK、効率的なコンテキストエンジニアリングのためのエージェントフレームワークであるiFlow CLIの3つのコンポーネントで構成されている。
ROMEはALEが基盤として100万件以上のトラジェクトリをトレーニングしたオープンソースエージェントです。
論文 参考訳(メタデータ) (2025-12-31T14:03:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。