論文の概要: LEAP: Learning Efficient Action Proposals For LLM Agents
- arxiv url: http://arxiv.org/abs/2610.02670v1
- Date: Fri, 02 Oct 2026 01:44:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.159753
- Title: LEAP: Learning Efficient Action Proposals For LLM Agents
- Title(参考訳): LEAP: LLMエージェントのための効率的なアクション提案を学習する
- Abstract要約: LLMエージェントはロールアウトが遅いことが知られている。
近年の研究では、アクションフェーズでも同様の考え方が適用され始めている。
我々は投機ラウンドの遅延フレームワークを開発する。
- 参考スコア(独自算出の注目度): 8.416874235858929
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents are known to be slow in rollouts. An agent completes a task one step at a time. At each step, it reasons and then chooses an action to execute. The next step and action cannot start until the previous one has finished. Speculative decoding accelerates the rollouts at the reason phase by drafting and verifying the inference tokens. Recent works have also started to apply similar ideas at the action phase. These works use off-the-shelf models, usually large, to draft action proposals for target model to verify. Large drafters match the target more often but take longer to propose, while small off-the-shelf models are fast but rarely make the same decision as the target. We ask a more general question: what determines the end-to-end speedup of action speculation? To answer it, we develop a latency framework for the speculative round. The framework compares what a round gains with what it costs. The gain depends on how well the drafter predicts the target and on how many steps the task can take before it ends. The cost comes from drafting, from waiting for target verification and from executing tools. Guided by the framework, we introduce LEAP (Learning Efficient Action Proposals) which keeps the drafter small and makes it accurate by training it on the target actions sequences. With a small 0.6B model, LEAP agrees with the target on most decisions and makes agents up to 60% faster in end-to-end wall clock time, with no systematic change in task success. Across various datasets, target models and draft models, the framework accounts for most of the measured speedups. We also show the draft model can be online trained with no prior trace collection and match the performance of offline training, making LEAP practical to deploy in the real world.
- Abstract(参考訳): LLMエージェントはロールアウトが遅いことが知られている。
エージェントがタスクを1ステップずつ完了します。
各ステップで、その理由を判断し、実行すべきアクションを選択する。
次のステップとアクションは、前のステップが終わるまで開始できません。
投機的復号化は推論トークンの起草と検証によって、推論フェーズでのロールアウトを加速させる。
近年の研究では、アクションフェーズでも同様の考え方が適用され始めている。
これらの作業では、ターゲットモデルを検証するためのアクション提案のドラフトを作成するために、通常、オフザシェルフモデルを使用する。
大型のドラフトラは目標にマッチすることが多いが、提案に時間がかかり、小型のオフ・ザ・シェルフモデルは高速だが、目標と同じ決定を下すことは稀である。
我々は、アクションの投機におけるエンドツーエンドのスピードアップを決定するにはどうすればよいのか?
これに答えるために、投機的なラウンドのための遅延フレームワークを開発する。
このフレームワークは、ラウンドで得られるものとコストを比較する。
利得は、ドラフト作成者がターゲットをどの程度正確に予測するか、タスクが終了するまでにどれだけのステップを踏むかによって決まる。
コストは、ドラフト作成、ターゲットの検証を待つこと、ツールの実行から来る。
フレームワークによってガイドされたLEAP(Learning Efficient Action Proposals)を導入し、プロダラを小さく保ち、ターゲットアクションシーケンスでトレーニングすることで正確化します。
小型の0.6Bモデルでは、LEAPはほとんどの決定において目標と一致し、エージェントをエンドツーエンドのウォールクロック時間で最大60%高速化する。
さまざまなデータセット、ターゲットモデル、ドラフトモデルにわたって、フレームワークは測定されたスピードアップの大部分を担っている。
また、ドラフトモデルを事前のトレース収集なしでオンライントレーニングし、オフライントレーニングのパフォーマンスと一致させることで、LEAPを現実の世界に展開できることを示す。
関連論文リスト
- Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning [87.18590662029432]
本稿では,プロアクティブルーティングパラダイムであるPRPを提案する。このパラダイムは,ドラフトモデルとターゲットモデルの両方の能力を評価することで,早期意思決定を可能にする。
筆者らの試案であるレーティング学習 (DRL) は内部信頼度推定器を内蔵し, 共同レーティング学習 (JRL) は対象モデルが与えられたクエリをどの程度処理できるかを予測する。
これらの評価により、詳細なインスタンスレベルの textbfProactive Routing が可能になり、全体的なパフォーマンスを損なうことなく、推論を大幅に高速化できる。
論文 参考訳(メタデータ) (2026-06-29T12:30:24Z) - Draft-OPD: On-Policy Distillation for Speculative Draft Models [49.23782868133977]
投機的復号化は,提案したトークンを並列に検証した軽量なドラフトモデルとターゲットモデルを組み合わせることで,大規模言語モデル推論を加速させる。
本稿では,安定な継続のために目標支援ロールアウトを利用するDraft-OPDを提案する。
論文 参考訳(メタデータ) (2026-05-28T04:30:22Z) - Beyond the Target: From Imitation to Collaboration in Speculative Decoding [23.603110768087973]
投機的復号(SPD)は、より小さなドラフトモデルに、より大きなターゲットモデルによって並列に検証される複数の将来のトークンを提案することによって、大きな言語モデル(LLM)推論を加速させる。
支配的なSPDパラダイムは、ターゲットモデルを唯一信頼できる教師として扱い、ターゲット予測と正確に一致する場合にのみドラフトトークンを受け入れる。
我々は、SPDの一般化である textbfCollaborative Decoding (CoSpec) を導入し、ターゲットモデルを唯一のトークンレベルの権威として扱わなくなった。
論文 参考訳(メタデータ) (2026-05-24T00:34:53Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding [73.67253077506672]
大規模言語モデル(LLM)は、優れた生成品質を提供するが、非常に高い推論コストをもたらす。
早期排他的自己投機的復号法(EESD)がこのコストを軽減するために登場した。
ドラフトと検証作業を完全にパイプライン化するパイプライン・パラレル自己スペクティブ・デコーディング(PPSD)を提案する。
論文 参考訳(メタデータ) (2025-09-19T04:51:41Z) - Efficient Reasoning for LLMs through Speculative Chain-of-Thought [39.56636034410561]
OpenAI-o1やDeepseek-R1のような大きな推論言語モデルは、タスク解決能力が優れていたため、広く注目を集めている。
効率的な推論のための既存の方法は、主にモデルパラメータの数を減らしたり、チェーンオブ思考の長さを短縮することに焦点を当てている。
本稿では,平均推論速度の高速化により推理遅延を他の視点から低減するSCoT(Speculative Chain-of-Thought)を提案する。
論文 参考訳(メタデータ) (2025-04-27T03:56:39Z) - PEARL: Parallel Speculative Decoding with Adaptive Draft Length [12.166703341906242]
本稿では,適応dRaft Length(PEARL)を用いた投機的復号化(Parallel speculative decoding)を促進するための,概念的にシンプルでフレキシブルで汎用的なフレームワークを提案する。
PEARLは、ドラフトフェーズ中に事前に最初のドラフトトークンを検証し、検証フェーズ中により多くのドラフトトークンを生成するための後検証を提案する。
各種テキスト生成ベンチマークの実験では、PEARLの有効性が実証されており、自動回帰復号法とバニラ投機復号法と比較して、パフォーマンスが4.43$times$と1.50$times$に向上した。
論文 参考訳(メタデータ) (2024-08-13T08:32:06Z) - Reason for Future, Act for Now: A Principled Framework for Autonomous
LLM Agents with Provable Sample Efficiency [53.8779374188643]
本稿では,推論と行動のオーケストレーションを行うための,証明可能な後悔の保証を備えた原則的枠組みを提案する。
具体的には、メモリバッファから学習する推論のためのプロンプトテンプレートを設計し、長い水平線上で将来の軌道を計画する。
各ステップにおいて、LLMエージェントは計画された軌跡の初期動作("act for now")を受け取り、収集したフィードバックをメモリバッファに格納し、推論ルーチンを再起動して、将来の軌跡を新しい状態から再設計する。
論文 参考訳(メタデータ) (2023-09-29T16:36:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。