論文の概要: When Terminal-Agent Training Stalls: Demystifying Data Generation and Verification Challenge
- arxiv url: http://arxiv.org/abs/2610.02405v1
- Date: Thu, 01 Oct 2026 19:32:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 19:20:54.749663
- Title: When Terminal-Agent Training Stalls: Demystifying Data Generation and Verification Challenge
- Title(参考訳): 端末エージェントトレーニングが停止したとき:データ生成と検証の難しさ
- Abstract要約: Dockerイメージと実行可能なテストスイートは、ターミナルエージェントのトレーニングに忠実なエンドツーエンドパイプラインを保証するものではない。
このギャップによって動機付けられたメタエージェントパイプラインを,ベンチマークの無効性,脆さの活用,報酬の誤調整という,3種類の障害を診断する。
- 参考スコア(独自算出の注目度): 37.88805760346003
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Using a frontier model like Claude Opus as a meta-agent to generate terminal tasks and verifiers for RL training is increasingly common. Yet a runnable Docker image and executable test suite do not guarantee a faithful end-to-end pipeline for terminal agent training. We present a meta-agent pipeline motivated by this gap, diagnosing three classes of failure: benchmark invalidity, harness brittleness, and reward misalignment. Prompt redesign and context extension raise baseline solvability 5.6 times, but a 9B model saturates at 81.3% mean pass@2 within 20 steps on Claude Opus-generated tasks. Adding hard tasks reduces mean pass@2 to 20.6% without changing the training configuration, a strong evidence that the solvability band is model-specific. These findings demonstrate that meta-agent reliability requires solvability-band calibration, verifier audits, and infrastructure error accounting as first-class evaluation criteria, not post-hoc diagnost.
- Abstract(参考訳): Claude Opusのようなフロンティアモデルをメタエージェントとして使用して、ターミナルタスクとRLトレーニングの検証がますます一般的になっている。
しかし、実行可能なDockerイメージと実行可能なテストスイートは、ターミナルエージェントのトレーニングに忠実なエンドツーエンドパイプラインを保証するものではない。
このギャップによって動機付けられたメタエージェントパイプラインを,ベンチマークの無効性,脆さの活用,報酬の誤調整という,3種類の障害を診断する。
プロンプトの再設計とコンテキスト拡張により、ベースラインの可解性は5.6倍に向上するが、9Bモデルは81.3%で飽和し、Claude Opus生成タスクでは20ステップ以内でpass@2となる。
ハードタスクを追加することで、トレーニング設定を変更することなく平均パス@2から20.6%が削減される。
これらの結果から,メタエージェントの信頼性には可溶性バンドの校正,検証監査,インフラストラクチャエラー会計が必要であることが示唆された。
関連論文リスト
- Cross-Benchmark Transfer from RL on Agentic Coding Tasks [0.13579757545152057]
多くの場合、コーディングエージェントは最後の1マイルで失敗する。機能の大部分を構築し、要件をドロップし、実装がすでに処理しているケースのみをテストし、無傷であるはずの動作を壊したり、未確認の仮定に対して検証する。
専門家が構築したエージェントコーディングタスクの強化学習がこのギャップを埋めるか、エージェントが学習するものがトレーニング分布を超えるのかを問う。
我々は,隠れフェール・ツー・パステストとパス・ツー・パステストによって評価された1,700のタスクと,専門家が書いた隠れバリデーションによって評価された700の端末タスクについて,Kim K2.7コードをポストトレーニングした。
論文 参考訳(メタデータ) (2026-10-01T01:12:24Z) - LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents [56.902747731541695]
LEGO-RLは、ネイティブコーディングエージェントハーネスをスケーラブルなポリシ-グラディエント最適化でブリッジするフレームワークです。
我々は、3つのネイティブコーディングエージェントハーネスにまたがるGSPOを用いて、疎いMoEモデルQwen3.5-35B-A3BをトレーニングすることでLEGO-RLを評価する。
論文 参考訳(メタデータ) (2026-08-18T05:34:35Z) - SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents [56.400332595452966]
我々は、監査人が検索エージェントの障害をローカライズ、属性付け、修復できるかどうかを評価するベンチマークであるSearchAuditBenchを紹介する。
SearchAuditBenchは1,243の障害トラックで構成され、平均73.1メッセージと65.1Kトークンを5つのディープサーチベンチマークで8つのオープンウェイトモデルから収集している。
本稿では,検索エージェントの障害を効果的にローカライズ,属性,修復するマルチパースペクティブ監査フレームワークであるSearchAuditorを提案する。
論文 参考訳(メタデータ) (2026-08-05T09:09:00Z) - Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents [83.37969790806069]
LLMエージェントのエラーは、エラーが表面化するステップが原因ではないことが多いため、デバッグが難しい。
Agent DebuggerXはオープンソースのフレームワークで、デバッグをDe Detect, Attribute, Recover, Rerunのクローズドループとして整理する。
コアとなるDeep Debuggerは、グローバルな軌跡理解を通じてマルチターン根本原因診断を行う。
論文 参考訳(メタデータ) (2026-07-21T06:21:13Z) - Trace2Skill: Verifier-Guided Skill Evolution for Long-Context EDA Agents [0.3733676450456031]
テスト時間スケーリングフレームワークであるTrace2Skillを提案する。
新しいモデルをトレーニングしたり、より多くの候補ソリューションをサンプリングする代わりに、Trace2Skillはエージェントの自然言語スキルを進化可能なポリシーとして扱う。
成功と失敗モードのために繰り返しロールアウトトレースをマイニングし、それらを密集した診断やオラクルのレッスンに変換し、オラクル、ミューテータ、セレクタループを使用してタスク固有のスキルを生成する。
論文 参考訳(メタデータ) (2026-05-20T23:10:49Z) - ChipMATE: Multi-Agent Training via Reinforcement Learning for Enhanced RTL Generation [55.947962672433675]
ChipMATEは、RTL生成のための最初の自己学習型マルチエージェントフレームワークである。
ChipMATEは産業的な実践に触発され、VerilogエージェントとPythonのリファレンスモデルエージェントをペアにし、相互に出力を検証する。
ChipMATEは、VerilogEval V2で75.0%と80.1%パス@1を4Bと9Bベースモデルで達成している。
論文 参考訳(メタデータ) (2026-05-13T01:04:21Z) - CUJBench: Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend [2.9612444540570113]
診断フレーミングにおけるブラウザ可視性障害証拠とバックエンド可観測性を組み合わせた最初のベンチマークであるCUJBenchを提案する。
このベンチマークでは、全体的な精度は19.7%、天井は52%、飽和度よりかなり低い。
論文 参考訳(メタデータ) (2026-04-25T22:10:53Z) - TRAJEVAL: Decomposing Code Agent Trajectories for Fine-Grained Diagnosis [23.834704102474927]
コードエージェントはGitHubの問題を解決することができるが、失敗した場合、現在の評価は場所や理由を可視化しない。
本稿では,エージェントトラジェクトリを3つの解釈段階に分解する診断フレームワークTRAJEVALを紹介する。
我々はこれらの診断が予測可能であることを確認し、0.87-2.1% MAEでモデルレベルのPass@1予測を達成する。
論文 参考訳(メタデータ) (2026-03-25T05:27:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。