論文の概要: AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs
- arxiv url: http://arxiv.org/abs/2608.26004v1
- Date: Wed, 26 Aug 2026 16:50:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.9151
- Title: AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs
- Title(参考訳): AsymSpec:エージェントLDMのためのコンテキスト非対称投機的デコード
- Abstract要約: AsymSpecはエージェントパイプラインのための非対称な投機的デコーディングフレームワークである。
AsymSpecは平均して90%のフルコンテキスト精度で$approxに到達し、1.3$-$1.7times$スループットのスピードアップを提供する。
その結果、非対称な文脈アクセスは、圧縮が臨界推論信号を捨てたとき、正確にかなりの利得が得られることが示された。
- 参考スコア(独自算出の注目度): 17.842477184182556
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agentic LLM pipelines face escalating inference costs as context accumulates across retrieval, tool use, and multi-turn interactions. To control latency, deployments routinely compress inputs, but this degrades task accuracy. Speculative decoding (SD) accelerates generation losslessly, yet it assumes the drafter and verifier share an identical context, preventing SD from resolving the accuracy-overhead trade-off. We propose AsymSpec, an asymmetric speculative decoding framework that breaks this symmetry: a lightweight drafter reads the full input while the large verifier operates on the compressed view. The drafter steers the verifier via a contrastive $δ$-fusion of logits, modulated by a divergence-aware acceptance gate that preserves verification stability and high draft acceptance rates. Evaluated across four agentic capabilities and two end-to-end agent benchmarks, AsymSpec reaches $\approx 90\%$ of full-context accuracy on average, delivering $1.3$--$1.7\times$ throughput speedups at $0.2$--$0.3\times$ the compute cost on isolated text capabilities. These results show that asymmetric context access yields substantial gains precisely when compression discards critical reasoning signals.
- Abstract(参考訳): エージェントLLMパイプラインは、検索、ツール使用、マルチターンインタラクションのコンテキストが蓄積されるにつれて、推論コストの増大に直面している。
レイテンシを制御するために、デプロイメントは定期的に入力を圧縮するが、これはタスクの精度を低下させる。
投機的復号(SD)は生成を損失なく加速するが、ドラフト作成者と検証者が同一のコンテキストを共有すると仮定し、SDが精度とオーバヘッドのトレードオフを解消するのを防ぐ。
本稿では,この対称性を破る非対称な投機的復号化フレームワークであるAsymSpecを提案する。
プロファイラは、検証安定性と高いドラフト受入率を保持する分散対応受入ゲートにより変調された、対照的な$δ$-fusion of logitsを介して検証を行う。
4つのエージェント機能と2つのエンドツーエンドエージェントベンチマークで評価され、AsymSpecは平均で90\%$のフルコンテキスト精度を実現し、1.3$--$1.7\times$スループットのスピードアップを0.2$-$0.3\times$で提供する。
これらの結果から、非対称な文脈アクセスは、圧縮が臨界推論信号を捨てたとき、精度良くかなりの利得が得られることが示された。
関連論文リスト
- Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models [65.49950267695267]
我々はコヒーレンス保存コンテクスト蒸留によるパラメトリックメモリの効率的な圧縮フレームワークであるOmni2LoRAを紹介する。
本手法は,マルチモーダルメモリを固定予算で再利用可能なパラメータ状態に変換することにより,応答時間のマルチモーダルトーケン負荷をゼロにする。
論文 参考訳(メタデータ) (2026-08-10T07:49:10Z) - A Cost-Aware, Paired Protocol for Auditing Dynamic Tool Synthesis in Agentic Video Question Answering [2.1096366377985185]
Agentic Video Questioning (VideoQA) システムは推論中にツールを呼び出すが、ツールライブラリは修正されている。
本稿では,ツール拡張ビデオエージェントの監査のための費用対プロトコルを提案する。
論文 参考訳(メタデータ) (2026-07-01T21:01:57Z) - Raw-Curve Quantum Fingerprints: A Mahalanobis Authentication Framework with Drift Early Warning and Adversarial Detection [11.819995530903567]
量子クラウドプラットフォームは強力なコンピューティング機能を提供することを目指しているが、ユーザは、どの物理デバイスがワークロードを実行するかを検証する直接的な手段を持っていない。
この透明性の欠如により、悪意のある敵がジョブを代替または劣等なプロセッサにリダイレクトするハードウェア置換攻撃が可能になる。
実測データから多次元量子指紋を構築することにより,この問題に対処する汎用認証フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-10T04:10:21Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference [56.297697169678095]
WISV(Wireless-Informed Semantic Verification)は、分散投機的復号化フレームワークである。
WISVは最大60.8%の許容長の増加、37.3%の対話ラウンドの削減、31.4%のエンドツーエンドレイテンシの改善を実現している。
NVIDIA Jetson AGX OrinとA40搭載サーバからなるハードウェアテストベッド上でWISVを検証する。
論文 参考訳(メタデータ) (2026-04-20T01:29:56Z) - RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding [80.12789199134511]
大規模言語モデル(LLM)における自己回帰デコーディングは、ステップ毎に1つのトークンを生成し、高い推論遅延を引き起こす。
我々は,検索した正確なパターンとロジット駆動の将来の手がかりを統合する軽量でトレーニング不要な $textbfRACER を提案する。
Spec-Bench、HumanEval、MGSM-ZHの実験では、RACERは推論を継続的に加速し、自動回帰デコーディングよりも2倍以上のスピードアップを達成した。
論文 参考訳(メタデータ) (2026-04-16T11:23:55Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference [11.957170239588535]
投機的復号化は、ドラフトモデルを使用して推測を加速する。
事前の方法は、ドラフトコストを部分的に削減するが、受け入れを低下させるか、スケーリングを制限するオーバーヘッドを導入する。
本稿では,遅延受容トレードオフを破る推論アルゴリズムであるMirror Speculative Decoding(Mirror-SD)を提案する。
論文 参考訳(メタデータ) (2025-10-15T05:22:57Z) - SpecReason: Fast and Accurate Inference-Time Compute via Speculative Reasoning [14.020244011380063]
SpecReasonは、LEM推論を加速するシステムである。
最終回答の正確性を維持する上で、思考トークンのセマンティックな柔軟性を利用する。
バニラLEM推論よりも1.4-3.0times$のスピードアップを実現している。
論文 参考訳(メタデータ) (2025-04-10T16:05:19Z) - DASA: Delay-Adaptive Multi-Agent Stochastic Approximation [64.32538247395627]
我々は,N$エージェントが並列に動作し,中央サーバと通信することで,一般的な近似問題を高速化することを目的とした設定を考える。
遅延とストラグラーの効果を軽減するために,マルチエージェント近似のための遅延適応アルゴリズムである textttDASA を提案する。
論文 参考訳(メタデータ) (2024-03-25T22:49:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。