論文の概要: SCAD: Structured Credit Assignment and Distillation for Long-Horizon Agents
- arxiv url: http://arxiv.org/abs/2610.03372v2
- Date: Mon, 05 Oct 2026 02:27:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.545117
- Title: SCAD: Structured Credit Assignment and Distillation for Long-Horizon Agents
- Title(参考訳): SCAD:ロングホライゾン剤の構造的クレジット割り当てと蒸留
- Abstract要約: SCADは、プランニングとサブタスク実行へのインタラクションを整理し、ローカルコンテキストでの実行を蒸留し、クロスロールアウトのサブタスクプレフィックスツリーを通じてプランニングクレジットを洗練する。
SCADは、最強のトレーニングベースラインに対するマクロ平均精度を、テキストタスクでは4.48ポイント、マルチモーダルタスクでは4.19ポイント改善する。
- 参考スコア(独自算出の注目度): 41.49251116520886
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Training long-horizon agents to solve complex tasks requires effective supervision over extended interaction sequences. However, sparse terminal rewards obscure intermediate contributions, while on-policy distillation can lose informative teacher guidance as student-generated histories grow. To address this problem, we introduce SCAD, which organizes interactions into planning and bounded subtask execution, distills execution in local contexts, and refines planning credit through cross-rollout subtask prefix trees, with planning receiving full terminal credit and execution receiving positive terminal credit and teacher guidance. Across all evaluated benchmarks, SCAD improves macro-average accuracy over the strongest training baseline by 4.48 percentage points for text tasks and 4.19 points for multimodal tasks. SCAD effectively combines outcome-based credit assignment with teacher-guided distillation to improve planning and execution in long-horizon agents.
- Abstract(参考訳): 複雑なタスクを解決するために長い水平エージェントを訓練するには、拡張された相互作用シーケンスに対する効果的な監督が必要である。
しかし, 学生が生み出す歴史が成長するにつれて, 家庭内蒸留は教師の指導を損なう可能性がある。
この問題に対処するために、SCADを導入し、プランニングとサブタスク実行の連携を整理し、ローカルコンテキストで実行を蒸留し、クロスロールアウトサブタスクプレフィックスツリーを通して計画クレジットを洗練し、完全な端末クレジットを受信し、正の端末クレジットと教師の指導を受ける計画を立てる。
評価されたすべてのベンチマークにおいて、SCADは最強のトレーニングベースラインに対して、テキストタスクでは4.48ポイント、マルチモーダルタスクでは4.19ポイントのマクロ平均精度を改善している。
SCADは、成果に基づく信用割当と教師誘導蒸留を効果的に組み合わせ、長距離エージェントの計画と実行を改善する。
関連論文リスト
- StructRL: Online Structured Reinforcement Learning for Long-Horizon Vision-Language-Action Tasks [25.560039911794266]
StructRLは、検証可能なサブタスク完了から構造化中間監視を構築するオンライン強化学習フレームワークである。
RoboCasa365 と LIBERO-Long には GR00T-N1.5 と pi 0.5 があり、StructRL はオンライン RL ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-09-28T22:34:43Z) - Adaptive Consistency Graph for Long-Horizon Agents [6.052949010696364]
本稿では,長距離実行のための適応一貫性グラフ(ACG)を提案する。
ACGは、実行証拠とその証明を永続的なグラフに段階的に整理し、各決定に対して一時的な要求中心のビューを構築する。
一致した評価では、ACGはGPT-5.6-lunaの平均的な成功率を44.5%から50.2%に改善し、BrowseComp-Plusで最大の上昇となった。
論文 参考訳(メタデータ) (2026-09-26T16:19:40Z) - SWE-MILE: Asynchronous Potential-Induced Milestone Credit Assignment for Long-Horizon Software Engineering Agents [52.92536111845184]
SWE-MILEは、ワークフローランタイムからきめ細かいプロセス監視を導出するプロセス監視フレームワークである。
非同期シャドウプローブは、分離されたサンドボックス内のリポジトリ変更アクションを再生し、エージェントのプライマリインタラクションと並行して検証を実行する。
2つの代表的な長期SWEタスクの実験は、エージェント性能を大幅に改善したことを示している。
論文 参考訳(メタデータ) (2026-09-26T13:49:14Z) - HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning [51.95194664412812]
大規模言語モデル(LLM)は、幅広いタスクにまたがる自律エージェントとして強力な能力を示している。
長期LLMエージェント学習のための階層的計画と情報フォールディング(HIPIF)を提案する。
HIPIFはエージェントをエンドツーエンドにトレーニングし、明示的なサブゴールの周りに長い水平実行を組織すると同時に、完了したサブゴール履歴を折り畳み、長いコンテキスト干渉を減らす。
論文 参考訳(メタデータ) (2026-06-09T07:35:14Z) - Milestone-Guided Policy Learning for Long-Horizon Language Agents [67.87164829944238]
我々は,長軸言語エージェントを訓練するためのマイルストーン誘導型政策学習フレームワークBEACONを紹介する。
ALFWorld、WebShop、ScienceWorldでは、BEACONはGRPOとGiGPOを一貫して上回っている。
これらの結果から,長期言語エージェントの訓練に有効なパラダイムとして,マイルストーン・アチョンド・クレジット・アサインが確立された。
論文 参考訳(メタデータ) (2026-05-07T12:00:40Z) - LongCLI-Bench: A Preliminary Benchmark and Study for Long-horizon Agentic Programming in Command-Line Interfaces [65.11019654023978]
LongCLI-Benchは、長期にわたる現実的なタスクにまたがるエージェント能力を評価するために設計されたベンチマークである。
私たちは、1000以上のコンピュータサイエンスの課題と現実世界のタスクから、20の高品質で長い水平タスクをキュレートしました。
実験によると、最先端のエージェントでさえLongCLI-Benchの20%未満のパスレートを達成する。
論文 参考訳(メタデータ) (2026-02-15T23:12:57Z) - Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon Agents [28.061156787350395]
Task-Decoupled Planning (TDP)は、絡み合った推論をタスク・デカップリングに置き換えるトレーニング不要のフレームワークである。
TDPは、ワークフローを中断することなく、推論とアクティブなサブタスクへのリプレーニングを限定する。
TravelPlanner、ScienceWorld、HotpotQAの結果は、TDPがトークン消費を最大82%削減しながら、強力なベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2026-01-12T14:30:10Z) - PlanDQ: Hierarchical Plan Orchestration via D-Conductor and Q-Performer [47.924941959320996]
我々はPlanDQと呼ばれるオフラインRL用に設計された階層型プランナを提案する。
PlanDQはD-Conductorという名前の拡散型プランナーを高レベルに組み込んでおり、サブゴールを通じて低レベル政策を導く。
低レベルでは、これらのサブゴールを達成するためにQ-Performerと呼ばれるQ-ラーニングベースのアプローチを使用しました。
論文 参考訳(メタデータ) (2024-06-10T20:59:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。