論文の概要: TAP: Efficient Long-Horizon Agent Pruning via Trajectory-Anchored Recovery
- arxiv url: http://arxiv.org/abs/2610.09074v1
- Date: Tue, 06 Oct 2026 20:18:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.596252
- Title: TAP: Efficient Long-Horizon Agent Pruning via Trajectory-Anchored Recovery
- Title(参考訳): TAP: トラジェクトリアンコールドリカバリによる高効率ロングホライゾン・エージェント・プルーニング
- Abstract要約: Trajectory-Anchored Pruning (TAP) は、強化学習(RL)訓練エージェントのための最初の構造的プルーニングフレームワークである。
ワンショットプルーニングの代わりに、TAPは回復目標の勾配を使ってチャンネルを再スコアする。
FFNチャネルの60%が除去され、TAPは密度の高い7Bエージェントのタスク成功率の99.2%と88.0%を維持している。
- 参考スコア(独自算出の注目度): 16.888658921909858
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Emerging long-horizon agentic tasks require repeated model calls, worsening the inference cost of already-costly language models. While narrow agentic tasks suggest potential for aggressive model pruning without performance drop, empirical results show existing methods proposed for question answering tasks severely degrade task performance when applied to agentic models. We trace this failure to two decisions: what to prune and how to recover. For pruning, one-shot importance estimates fail to track how the pruned model adapts. For recovery, offline distillation covers only teacher prefixes, while full-trajectory on-policy distillation causes student errors to compound across turns. In this work, we propose Trajectory-Anchored Pruning (TAP), the first structural pruning framework for reinforcement learning (RL)-trained agents. TAP couples structural pruning with efficient on-policy recovery, anchoring interactions to teacher trajectories while allowing the student to generate each reasoning-action response. A frozen dense teacher supervises the student's response prefixes, addressing within-response training-inference mismatch while preventing student-induced deviations from propagating across training turns. Instead of one-shot pruning, TAP re-scores channels using gradients of the recovery objective on the recovered student, connecting iterative channel selection to the evolving policy. With 60% of FFN channels removed, TAP retains 99.2% and 88.0% of the dense 7B agents' task success rates on ALFWorld and WebShop, respectively, while reducing GPU time per successful task by approximately 22% and 17%. These results demonstrate effective structural compression of long-horizon agents under a limited recovery budget.
- Abstract(参考訳): 長期のエージェントタスクの創発には、繰り返しモデルコールが必要で、すでにコストがかかる言語モデルの推論コストが悪化する。
エージェント的タスクは,パフォーマンス低下を伴わないアグレッシブモデルプルーニングの可能性を示す一方で,エージェント的モデルに適用した場合のタスク性能を著しく低下させる質問応答タスクの提案手法を実証的に示す。
私たちはこの失敗を、2つの決定に辿り着きました。
プルーニングでは、ワンショットの重要度推定は、プルーニングされたモデルがどのように適応するかを追跡するのに失敗する。
回復のためには、オフラインの蒸留は教師の接頭辞のみをカバーするが、完全なオンライン蒸留は学生の誤りを交互に複雑にする。
本研究では,強化学習(RL)学習エージェントのための最初の構造解析フレームワークであるトラジェクトリ・アンチョレッド・プルーニング(TAP)を提案する。
TAPは、効率的なオンラインリカバリと構造的プルーニングを結合し、教師の軌跡との相互作用を固定し、学生がそれぞれの推論・アクション応答を生成できるようにする。
冷凍密集した教師は、学生の反応プレフィックスを監督し、学生が引き起こした偏差がトレーニングターンを越えて伝播するのを防止しながら、反応中のトレーニング-推論ミスマッチに対処する。
ワンショットプルーニングの代わりに、TAPは回復目標の勾配を用いてチャネルを再スコアし、反復的なチャネル選択と進化するポリシーを接続する。
FFNチャネルの60%を削除したTAPは、ALFWorldとWebShopの7Bエージェントのタスク成功率の99.2%と88.0%を保持し、成功したタスク当たりのGPU時間を約22%と17%削減している。
これらの結果は, 限られた回収予算下での長期保存剤の効率的な構造圧縮効果を示す。
関連論文リスト
- ReSAIL: Mitigating Collapse in Iterative Agent Self-Distillation [10.981168734023385]
反復的な自己蒸留により、エージェントは連続したデプロイメントから学ぶことができる。
反復型自己蒸留法(ReSAIL)の適応的・選択的拡張について紹介する。
ALFWorldとTextCraftでは、ReSAILは3サイクルにわたるモデルスケールで大幅に向上している。
論文 参考訳(メタデータ) (2026-09-30T08:49:03Z) - MeshHeal: Two-Timescale Self-Healing for Gray Failures in Decentralized LLM Agent Networks [60.95806999869478]
MeshHealは、完全に分散化された自己修復フレームワークである。
能力にマッチしたピアレビューを2つのタイムスケールに分けている。
1タスクあたり51kのトータルモデルトークンを使用して0.839の劣化位相精度を達成し、最強のベースラインでは1タスクあたり115kの0.807の精度を達成した。
論文 参考訳(メタデータ) (2026-09-24T04:29:37Z) - On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents [50.78688247330029]
オン・ポリシィ蒸留(On-Policy Distillation、OPD)は、小規模の学生にその能力を伝達するための自然なレシピである。
本稿では,教師と生徒が生成するターンを各ロールアウトに混在させるシンプルなアルゴリズムであるGuided-OPD(Guided-OPD)を提案する。
Guided-OPDは、平均してバニラOPDよりも21.1%、成功率25.5%向上している。
論文 参考訳(メタデータ) (2026-06-14T16:41:45Z) - Self-Distilled Agentic Reinforcement Learning [65.24201057390938]
自己蒸留型エージェント強化学習は、トークンレベルの信号をシグモノイドゲートにマップする。
SDARはモデルスケール全体のハイブリッドRL--OPSDベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-14T17:51:26Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - Explore Data Left Behind in Reinforcement Learning for Reasoning Language Models [61.78513830395669]
RLVR(Reinforcement Learning with Verifiable Rewards)は,大規模言語モデル(LLM)の推論能力向上に有効な手法として登場した。
モデルがより長く、規模が大きくなるにつれて、トレーニングのプロンプトは残余のプロンプトになる。
政策最適化フレームワークにおける探索的残留確率(Explore Residual Prompts in Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2025-11-06T20:40:27Z) - From Correction to Mastery: Reinforced Distillation of Large Language Model Agents [13.982204994247718]
大規模言語モデルエージェントは反復的推論とツールの使用を通じて複雑なタスクの解決に長けている。
既存の蒸留手法は、小規模の生徒に完全な教師の軌跡を模倣するように訓練する。
本研究では,教師が最初期の誤りのみを訂正する学習者中心のフレームワークであるSCoReを提案する。
論文 参考訳(メタデータ) (2025-09-12T15:34:07Z) - Retrieve-Augmented Generation for Speeding up Diffusion Policy without Additional Training [25.184915903566104]
拡散政策(DP)は,様々な模倣学習タスクにおいて,大幅な精度向上を実現する能力に注目されている。
DPは拡散モデルに依存しており、1つのアクションを生成するために複数のノイズ除去ステップを必要とするため、長い時間が発生する。
本稿では,事前学習されたDPの推測を高速化するために,知識ベースを用いた追加トレーニングを不要とする新しいフレームワークとして,RAGDPを提案する。
論文 参考訳(メタデータ) (2025-07-29T02:43:34Z) - Solving Offline Reinforcement Learning with Decision Tree Regression [0.0]
本研究は, オフライン強化学習問題に対して, 回帰タスクとして再検討することで, 新たなアプローチを提案する。
我々は、リターン条件付きとリターン重み付き決定ツリーポリシーの2つの異なるフレームワークを紹介します。
オフラインRLに対するこの改定されたアプローチに固有の単純化にもかかわらず、我々のエージェントは、少なくとも確立された手法と同等の性能を示す。
論文 参考訳(メタデータ) (2024-01-21T23:50:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。