論文の概要: Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL
- arxiv url: http://arxiv.org/abs/2607.25816v1
- Date: Tue, 28 Jul 2026 15:00:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.876559
- Title: Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL
- Title(参考訳): 推論中:統合エージェント・スペキュレータRLによる次のツールコールの予測をエージェントに教える
- Abstract要約: 自己特定エージェントは、エージェントモードでタスクを解決し、投機モードで部分軌跡から次のツールコールを予測する。
統合エージェント・スペキュレータ強化学習法は、エージェント自身のロールアウトから投機的ターゲットを導き、エージェントと投機的更新を交互に行う。
- 参考スコア(独自算出の注目度): 26.192522057926737
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model agents often spend substantial wall-clock time waiting for tool call results. Tool-call speculation can hide this latency by predicting and pre-executing an agent's next tool call if the prediction matches the agent's eventual tool call, but existing speculators are typically separate draft models or cached traces that are poorly aligned with the deployed agent's own behavior. We identify this speculator-agent gap and show that the target agent itself is a strong next-call speculator. This points to a simpler design: unifying the agent and speculator within the same model. In this paper, we introduce the self-speculating agent, a single model that both solves tasks in agent mode and predicts its next tool call from partial trajectories in speculator mode, fully reusing prefix KV cache. To enable this dual-mode agent without degrading performance, we propose a joint agent-speculator reinforcement learning method, which derives speculation targets from the agent's own rollouts and alternates agent and speculator updates. Across agentic search QA and conversational tool-use agentic tasks, our method improves average next tool-call Hit@1 from 44.1 to 61.2 for Qwen3-4B and from 48.9 to 66.3 for Qwen3.5-4B, while preserving agent task success.
- Abstract(参考訳): 大規模な言語モデルエージェントは、ツールコール結果を待つのにかなりの時間を費やすことが多い。
ツールコールの憶測は、エージェントの最終的なツールコールに一致した場合、エージェントの次のツールコールを予測し、事前実行することで、このレイテンシを隠蔽することができる。
我々は、この投機器とエージェントのギャップを識別し、ターゲットエージェント自体が強力な次世代投機であることを示す。
これは、エージェントと投機を同じモデル内で統一する、よりシンプルな設計を示している。
本稿では,エージェントモードにおけるタスクの解決と,プリフィックスKVキャッシュを完全に再利用した投機モードにおける部分的トラジェクトリからの次のツールコールの予測を行う単一モデルである自己表現エージェントを提案する。
エージェントのロールアウトから推測対象を導出し,エージェントと投機を交互に更新する共同エージェント・スペキュレータ強化学習法を提案する。
エージェント検索QAと会話ツール使用エージェントタスク全体で,Qwen3-4Bでは44.1から61.2に,Qwen3.5-4Bでは48.9から66.3に改善し,エージェントタスクの成功を抑える。
関連論文リスト
- AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning [57.72181998599248]
AgentFugueは、共通の推論ハブを中心に構築された、集合的推論フレームワークである。
ピアエージェントが同じタスクを並列に探索する際、ハブは各エージェントが何を確立、試み、あるいは除外したかを簡潔に記録する。
この結果から,集団推論によってピアエージェントシステムのスケールアウトが実現可能であることが示唆された。
論文 参考訳(メタデータ) (2026-05-23T09:21:51Z) - Speculative Interaction Agents: Building Real-Time Agents with Asynchronous I/O and Speculative Tool Calling [64.40340291543971]
我々は,小さなエッジスケールモデルとのリアルタイムインタラクションを実現するための投機的インタラクションエージェントを提案する。
また、ストリーミング入力と非同期応答を処理するためにモデルを適応させるクロックベースのトレーニング手法を提案する。
このアプローチは、Qwen2.5-3B-InstructとLlama-3.2-3B-Instructモデルを複数のツール呼び出しベンチマークで1.6-2.2$times$ Speedupを提供する。
論文 参考訳(メタデータ) (2026-05-13T11:20:52Z) - Act While Thinking: Accelerating LLM Agents via Pattern-Aware Speculative Tool Execution [18.50317396128381]
PASTEは、推測によってツールの遅延を隠すように設計されたPattern-Aware Speculative Tool Executionメソッドである。
PASTEは平均タスク完了時間を48.5%削減し、ツールの実行スループットを1.8倍改善する。
論文 参考訳(メタデータ) (2026-03-19T13:36:50Z) - Behind the Prompt: The Agent-User Problem in Information Retrieval [4.563318916484434]
情報検索におけるユーザモデルは、観察された振る舞いが意図を明らかにするという基本的な仮定に依存している。
エージェントが取る任意のアクションに対して、隠された命令は同一の出力を生成し、個々のレベルで意図を識別できないようにする。
エージェントネイティブソーシャルプラットフォームからの大規模コーパスによるエージェントユーザ問題について検討する。
論文 参考訳(メタデータ) (2026-03-04T01:42:14Z) - AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification [25.817251923574286]
大規模言語モデル(LLM)エージェントのための新しい推論時間検出・緩和フレームワークを提案する。
AgentSentryは、時間的因果的テイクオーバーとしてマルチターンIPIをモデル化する最初の推論時防御である。
我々は, textscAgentDojo ベンチマークにおいて, 4つのタスクスイート, 3つの IPI 攻撃ファミリー, 複数のブラックボックス LLM に対する AgentSentry の評価を行った。
論文 参考訳(メタデータ) (2026-02-26T07:59:10Z) - AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent [57.10083973844841]
AgentArkは、マルチエージェントダイナミクスを単一のモデルの重みに蒸留する新しいフレームワークである。
各種モデル,タスク,スケーリング,シナリオの3つの階層的蒸留戦略について検討する。
シミュレーションからトレーニングへ計算の負担をシフトさせることで、蒸留されたモデルは、複数のエージェントの強い推論と自己補正性能を示しながら、一つのエージェントの効率を保ちます。
論文 参考訳(メタデータ) (2026-02-03T19:18:28Z) - BackdoorAgent: A Unified Framework for Backdoor Attacks on LLM-based Agents [58.83028403414688]
大規模言語モデル(LLM)エージェントは、計画、メモリ、ツールの使用を組み合わせた多段階ワークフローを通じてタスクを実行する。
エージェントワークフローの特定のステージに注入されたバックドアトリガーは、複数の中間状態を通して持続し、下流出力に悪影響を及ぼす可能性がある。
LLMエージェントにおけるバックドア脅威を統一したエージェント中心のビューを提供するモジュールおよびステージアウェアフレームワークである textbfBackdoorAgent を提案する。
論文 参考訳(メタデータ) (2026-01-08T03:49:39Z) - SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents [45.71333459905404]
SmartSnapは、受動的でポストホックな検証から、エージェント自身による積極的な自己検証へのパラダイムシフトである。
両ミッションで設計された新しいタイプのエージェントである「自己検証エージェント」を導入し、タスクを完了し、検証された証拠でその達成を証明した。
モデルファミリとスケールにわたるモバイルタスクの実験は、SmartSnapパラダイムによって、スケーラブルなLLM駆動エージェントのトレーニングが可能になることを実証しています。
論文 参考訳(メタデータ) (2025-12-26T14:51:39Z) - InfoAgent: Advancing Autonomous Information-Seeking Agents [143.15973604285304]
本稿では,革新的なデータ合成パイプラインとWeb検索ツールを駆使したディープリサーチエージェントInfoAgentを紹介する。
我々の方法では、InfoAgentはBrowseCompで15.3%、BrowseComp-ZHで29.2%、Xbench-DSで40.4%の精度を達成した。
論文 参考訳(メタデータ) (2025-09-29T17:59:57Z) - Scaling Agents via Continual Pre-training [80.97989245493326]
我々は,エージェント連続事前学習(Agentic CPT)を深層研究エージェント訓練パイプラインに組み込んで,強力なエージェント基礎モデルを構築することを提案する。
我々は,AgentFounder-30Bを10のベンチマークで評価し,強力なツール使用能力を保ちながら最先端のパフォーマンスを実現した。
論文 参考訳(メタデータ) (2025-09-16T17:57:19Z) - AgentFormer: Agent-Aware Transformers for Socio-Temporal Multi-Agent
Forecasting [25.151713845738335]
我々は、時間と社会的次元を共同でモデル化する新しいトランスフォーマー、AgentFormerを提案する。
エージェントフォーマに基づいて,任意のエージェントの特徴に任意の時間ステップで対応可能なマルチエージェント軌道予測モデルを提案する。
提案手法は,歩行者および自律運転用データセットにおける技術状況を大幅に改善する。
論文 参考訳(メタデータ) (2021-03-25T17:59:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。