論文の概要: Recursive Synthesis for Long-Horizon Terminal Tasks
- arxiv url: http://arxiv.org/abs/2608.05466v2
- Date: Fri, 07 Aug 2026 02:05:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 14:11:31.089795
- Title: Recursive Synthesis for Long-Horizon Terminal Tasks
- Title(参考訳): 長軸終端タスクに対する再帰的合成
- Abstract要約: Recursive Synthetic Terminal Tasks (RST) は、大規模に長期の端末エージェントタスクを構築するためのフレームワークである。
RSTは37,484個の合成端末エージェントタスクを1タスクあたり0.05ドルで生成する。
軌道の微調整により、Qwen3.5-27BとQwen3.5-122B-A10Bはターミナルベンチ2、ターミナルベンチハード、ロングホライゾンターミナルベンチで最大10ポイント改善される。
- 参考スコア(独自算出の注目度): 50.39352383646813
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: High-quality long-horizon training data for terminal agents is expensive to produce, often costing hundreds to thousands of dollars per task, because each task must keep the instruction, environment, reference solution, and verifier mutually consistent. Human authoring does not scale, and direct generation with large language models (LLMs) often breaks these dependencies. We present Recursive Synthetic Terminal Tasks (RST), a recursive verified synthesis framework for constructing long-horizon terminal-agent tasks at scale. Starting from verified seed tasks, RST extends the reference solution, realigns the verifier and instruction to the new workflow, validates the result in a fresh sandbox, and reuses accepted tasks as seeds for subsequent rounds. Across fifteen recursive rounds, RST produces 37,484 synthesized terminal-agent tasks at roughly $0.05 per task. Task difficulty increases substantially over rounds: the median reference solution grows from 67 to 374 lines, the median number of executed commands grows from 40 to 244, and DeepSeek-V4-Pro pass@4 drops from 90% at R1 to 2.5% at R15. To demonstrate training utility, we collect rejection-sampled Qwen3.5 trajectories on the synthesized tasks and use them for supervised fine-tuning. Fine-tuning on these trajectories improves Qwen3.5-27B and Qwen3.5-122B-A10B by up to 10 points on Terminal-Bench 2, Terminal-Bench Hard, and Long-Horizon Terminal Bench, while agentic PPO lifts Qwen3.5-27B to 49.44%, 32.00%, and 22.07% on the three benchmarks, corresponding to relative gains of 20.0%, 41.2%, and 21.9% over the base model. Moreover, after 15 rounds, the recursion shows no ceiling: synthesis yield and validation rates remain stable as difficulty keeps climbing, indicating that the process can continue well beyond the scale reported here.
- Abstract(参考訳): 端末エージェントの高品質なロングホライゾントレーニングデータは製造コストが高く、各タスクは命令、環境、参照ソリューション、検証を相互に一貫性を保つ必要があるため、1タスクあたり数百ドルから数千ドルかかることが多い。
人間のオーサリングはスケールせず、大きな言語モデル(LLM)による直接生成は、これらの依存関係を壊すことが多い。
本稿では、大規模に長期の端末エージェントタスクを構築するための再帰的検証された合成フレームワークであるRecursive Synthetic Terminal Tasks (RST)を提案する。
検証済みのシードタスクから始めて、RTTは参照ソリューションを拡張し、検証と命令を新しいワークフローに再設定し、その結果を新鮮なサンドボックスで検証し、続くラウンドのシードとして受け入れられたタスクを再利用する。
15回の再帰ラウンドで、RTTは37,484個の合成端末エージェントタスクを1タスクあたり0.05ドルで生成する。
中央値参照ソリューションは67行から374行に増加し、実行中のコマンドの中央値は40行から244行に増加し、DeepSeek-V4-Pro pass@4はR1で90%からR15で2.5%に減少する。
学習の利便性を示すために, 合成されたタスクのリジェクションサンプリングされたQwen3.5トラジェクトリを収集し, 教師付き微調整に使用する。
これらの軌道の微調整により、Qwen3.5-27BとQwen3.5-122B-A10Bはターミナルベンチ2、ターミナルベンチハード、ロングホライゾンターミナルベンチで最大10ポイント改善され、エージェントPPOはQwen3.5-27Bを49.44%、32.00%、および22.07%に引き上げ、ベースモデルの相対利得は20.0%、41.2%、21.9%となった。
さらに15ラウンドの後に、再帰は天井を持たない: 合成の収率と検証率は、上昇が困難なため安定であり、ここで報告されたスケールを超えるプロセスが継続可能であることを示唆している。
関連論文リスト
- T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks [27.750923745153145]
T1は、強化学習で訓練された122BのMixture-of-Expertsモデルである。
実際のシェルをクラウドサンドボックスで運用し、タスク毎に最大300以上のツールコールを回し、各タスク独自の検証を実行することで報酬を得る。
Terminal-Bench 2.1では、最初のベースモデルを43.8%からT1に引き上げ、64.0%が解決した。
論文 参考訳(メタデータ) (2026-09-10T03:42:01Z) - Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments [89.86581796261123]
それぞれの軌道を再利用可能な環境に変えるためのフレームワークである Terminal-Universe を紹介する。
Terminal-Universeは、トラジェクトリに記録されたファイル操作をリプレイして、エージェントが変更する前に各ファイルを復元し、部分的なワークスペースを生成する。
また、タスクは幅と深さの2つの軸に沿ってスケールします。
論文 参考訳(メタデータ) (2026-09-03T17:41:05Z) - AgentOmnia: Scaling Agentic Models for Full-Scenario Applications [36.656762500581216]
大規模言語モデルエージェントは急速に進歩しているが、ドメイン、機能、タスクの難しさ、インタラクション設定にはまだ進歩が断片化されている。
これはTo-Consumer(ToC)、To-Business(ToB)、To-Employee(ToE)アプリケーション間でタスク空間の定義、データ合成、ポストトレーニング、評価、改善を調整するフレームワークです。
論文 参考訳(メタデータ) (2026-07-25T09:58:24Z) - SETA: Scaling Environments for Terminal Agents [49.686781072283814]
強化学習のための検証可能な端末環境を生成するためのスケーラブルなフレームワークであるSETAを提案する。
SETA-Envは、これまでで最大4500以上の環境を含む、オープンソースの検証可能な端末RLデータセットです。
論文 参考訳(メタデータ) (2026-07-12T19:40:27Z) - Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading [46.911171278867585]
Long-Horizon-Terminal-Benchは、9つのカテゴリにまたがる46の長距離タスクの終端ベンチマークである。
各タスクは、参照ソリューションまたはシミュレーションエンジンを備えたターミナルベンチスタイルのセットアップに従うが、さらにきめ細かいサブタスクに格付けされる。
我々は15のフロンティアモデルを評価し、エージェントがタスク毎に平均9.9Mトークンを消費していることを発見した。
論文 参考訳(メタデータ) (2026-07-09T21:56:37Z) - SPOQ: Specialist Orchestrated Queuing for Multi-Agent Software Engineering [2.0769172070951067]
マルチエージェントAIシステムは、ソフトウェアエンジニアリングタスクの自動化を約束する。
既存のアプローチでは、調整のオーバーヘッド、品質管理のギャップ、人間の監視が制限されている。
SPOQ(Specialist Orchestrated Queuing)は,3つのイノベーションを組み合わせた方法論である。
論文 参考訳(メタデータ) (2026-06-02T03:59:56Z) - Terminal-World: Scaling Terminal-Agent Environments via Agent Skills [52.39713754337834]
エージェントスキルを中心的な合成プリミティブとして利用する完全自動化パイプラインである Terminal-World を紹介する。
我々は,5,723のトレーニング環境を構築し,端末-ワールド-8B/14B/32Bを6つのベンチマークで評価した。
Terminal-World-32B は Terminal-Bench 2.0 で Nemotron-Terminal-32B を +4.5 Pass@1 (31.5) で上回り、43.8 Pass@3 に達する。
論文 参考訳(メタデータ) (2026-05-20T08:14:51Z) - On Data Engineering for Scaling LLM Terminal Capabilities [62.14352406328365]
最先端の端末エージェントの背後にあるトレーニングデータ戦略はほとんど公表されていない。
端末エージェントのデータエンジニアリングプラクティスの体系的研究を通じて,このギャップに対処する。
当社のパイプラインは,端末タスク用の大規模オープンソースデータセットである Terminal-Corpus を生成する。
論文 参考訳(メタデータ) (2026-02-24T18:51:04Z) - Large-Scale Terminal Agentic Trajectory Generation from Dockerized Environments [36.81059045059001]
終端型タスクのトレーニングエージェントモデルは、現実的な長距離相互作用を捉える高品質な終端軌道に依存する。
我々は,Dockerに準拠したタスクインスタンスを生成し,エージェントトラジェクトリを実行可能なバリデーションコードで合成する,スケーラブルなパイプラインである textbfTerminalTraj を提案する。
TerminalTrajを使って32KのDockerイメージをキュレートし、8つのドメインにわたる50,733の認証済みターミナルトラジェクトリを生成します。
論文 参考訳(メタデータ) (2026-02-01T14:09:23Z) - Endless Terminals: Scaling RL Environments for Terminal Agents [39.60665149203152]
Endless Terminalsは、人間のアノテーションを使わずに端末用タスクを手続き的に生成する、完全に自律的なパイプラインである。
我々は、バイナリエピソードレベルの報酬と最小の相互作用ループを持つバニラPPOを使用してエージェントを訓練する。
これらの改善は人為的なベンチマークに移行する。
論文 参考訳(メタデータ) (2026-01-23T04:39:55Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - AgentSynth: Scalable Task Generation for Generalist Computer-Use Agents [60.881609323604685]
Agent Synthはスケーラブルで費用効率のよいパイプラインで、高品質なタスクとトラジェクトリデータセットを自動的に合成する。
我々のパイプラインは1軌道あたりの平均コストが0.60ドルで、人間のアノテーションよりも桁違いに安い。
論文 参考訳(メタデータ) (2025-06-17T05:46:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。