論文の概要: Amphista: Bi-directional Multi-head Decoding for Accelerating LLM Inference
- arxiv url: http://arxiv.org/abs/2406.13170v2
- Date: Fri, 18 Oct 2024 04:13:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-10-21 14:23:22.167434
- Title: Amphista: Bi-directional Multi-head Decoding for Accelerating LLM Inference
- Title(参考訳): Amphista: LLM推論を高速化する双方向マルチヘッドデコーディング
- Authors: Zeping Li, Xinlong Yang, Ziheng Gao, Ji Liu, Guanchen Li, Zhuang Liu, Dong Li, Jinzhang Peng, Lu Tian, Emad Barsoum,
- Abstract要約: 私たちはMedusa上に構築された拡張投機的復号化フレームワークであるAmphistaを紹介します。
具体的には、Amphistaは並列推論が可能なAuto-embedding Blockをモデル化する。
AmphstaはStaged Adaptation Layersを統合し、ターゲットモデルの自己回帰推論からドラフトヘッドの非自己回帰推論へのセマンティック情報のシームレスな移行を保証する。
- 参考スコア(独自算出の注目度): 16.93944940434572
- License:
- Abstract: Large Language Models (LLMs) inherently use autoregressive decoding, which lacks parallelism in inference and results in significantly slow inference speed. While methods such as Medusa constructs parallelized heads, they lack adequate information interaction across different prediction positions. To overcome this limitation, we introduce Amphista, an enhanced speculative decoding framework that builds upon Medusa. Specifically, Amphista models an Auto-embedding Block capable of parallel inference, incorporating bi-directional attention to enable interaction between different drafting heads. Additionally, Amphista integrates Staged Adaptation Layers, which ensure a seamless transition of semantic information from the target model's autoregressive inference to the drafting heads' non-autoregressive inference, effectively achieving paradigm shift and feature fusion. Experimental results on Vicuna models using MT-Bench and Spec-Bench demonstrate that Amphista achieves substantial acceleration while maintaining generation quality. On MT-Bench, Amphista delivers up to 2.75$\times$ speedup over vanilla autoregressive decoding and 1.40$\times$ over Medusa on Vicuna 33B in wall-clock time.
- Abstract(参考訳): 大規模言語モデル(LLM)は本質的に自己回帰復号法を用いており、推論の並列性に欠けており、推論速度が著しく遅い。
Medusaのような手法は並列化ヘッドを構成するが、異なる予測位置間での適切な情報相互作用は欠如している。
この制限を克服するために、Medusa上に構築された拡張投機的復号化フレームワークであるAmphistaを紹介します。
具体的には、Amphistaは並列推論が可能なAuto-embedding Blockをモデル化し、双方向の注意を取り入れて、異なるドラフトヘッド間のインタラクションを可能にする。
さらに、AmphistaはStaged Adaptation Layersを統合し、ターゲットモデルの自己回帰推論からドラフトヘッドの非自己回帰推論へのセマンティック情報のシームレスな移行を保証し、パラダイムシフトと機能融合を効果的に達成する。
MT-BenchとSpec-Benchを用いたVicunaモデル実験の結果,Amphistaは生成品質を維持しながら相当な加速を達成できた。
MT-Benchでは、2.75$\times$バニラオートレグレッシブデコーディングのスピードアップと、1.40$\times$ over Medusa on Vicuna 33Bをウォールタイムで提供する。
関連論文リスト
- M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference [8.792650582656913]
M2R2(Mixture of Multi-rate Residuals)は,残差速度を動的に変調して早期アライメントを改善するフレームワークである。
M2R2は最先端の距離ベースの戦略を超え、生成品質とスピードアップのバランスをとる。
自己投機的復号化では、M2R2はMT-Benchで最大2.8倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2025-02-04T06:13:52Z) - Falcon: Faster and Parallel Inference of Large Language Models through Enhanced Semi-Autoregressive Drafting and Custom-Designed Decoding Tree [7.438117410146904]
Falconは、ドラフト作成者の並列性と出力品質の両方を増強するために設計された革新的な投機的復号化フレームワークである。
FalconにはCoupled Sequential Glancing Distillation(英語版)技術が組み込まれている。
論文 参考訳(メタデータ) (2024-12-17T08:02:08Z) - BiT-MamSleep: Bidirectional Temporal Mamba for EEG Sleep Staging [9.917709200378217]
BiT-MamSleepは,Triple-Resolution CNN(TRCNN)を統合し,効率的なマルチスケール特徴抽出を行う新しいアーキテクチャである。
BiT-MamSleepにはAdaptive Feature Recalibration (AFR)モジュールと時間拡張ブロックが組み込まれている。
4つの公開データセットの実験は、BiT-MamSleepが最先端の手法を大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2024-11-03T14:49:11Z) - AMP: Autoregressive Motion Prediction Revisited with Next Token Prediction for Autonomous Driving [59.94343412438211]
本稿では,GPT方式の次のトークン動作予測を動作予測に導入する。
同種単位-ワードからなる言語データとは異なり、運転シーンの要素は複雑な空間的・時間的・意味的な関係を持つ可能性がある。
そこで本稿では,情報集約と位置符号化スタイルの異なる3つの因子化アテンションモジュールを用いて,それらの関係を捉えることを提案する。
論文 参考訳(メタデータ) (2024-03-20T06:22:37Z) - Tandem Transformers for Inference Efficient LLMs [49.75726447408795]
これらの問題に対処するために,新しいアーキテクチャであるタンデム変換器を導入する。
このアーキテクチャは、小さな自己回帰モデルとブロックモードで動作する大きなモデルを組み合わせたものである。
PaLM2プレトレーニングデータセットでは、PaLM2-BisonとPaLM2-Geckoのタンデムが次点予測精度を3.3%改善している。
論文 参考訳(メタデータ) (2024-02-13T18:24:08Z) - BiTA: Bi-Directional Tuning for Lossless Acceleration in Large Language
Models [37.09385961422664]
大規模言語モデル(LLM)は、推論中に自己回帰生成を使用することが多く、高いメモリ帯域幅要求と拡張レイテンシをもたらす。
半自己回帰生成とドラフト検証によるLCMの高速化手法であるBiTA(Bi-directional Tuning for Losless Acceleration)を提案する。
提案されたBiTA、LLaMA-2-70B-ChatはMT-Benchベンチマークで2.7$times$のスピードアップを達成した。
論文 参考訳(メタデータ) (2024-01-23T06:36:49Z) - Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads [60.84145004678826]
大規模言語モデル (LLM) では、逐次計算を必要とする自動回帰デコーディングを採用している。
我々は、余分なデコードヘッドを追加することでLLM推論を強化する効率的な方法であるMedusaを提案する。
ツリーベースのアテンションメカニズムを使用して、Medusaは複数の候補継続を構築し、各デコードステップでそれらを同時に検証する。
論文 参考訳(メタデータ) (2024-01-19T15:48:40Z) - Real-Time Motion Prediction via Heterogeneous Polyline Transformer with
Relative Pose Encoding [121.08841110022607]
既存のエージェント中心の手法は、公開ベンチマークで顕著な性能を示した。
K-nearest neighbor attention with relative pose encoding (KNARPE) は、トランスフォーマーがペアワイズ相対表現を使用できる新しいアテンション機構である。
エージェント間でコンテキストを共有し、変化しないコンテキストを再利用することで、私たちのアプローチはシーン中心のメソッドと同じくらい効率的になり、最先端のエージェント中心のメソッドと同等に実行されます。
論文 参考訳(メタデータ) (2023-10-19T17:59:01Z) - StreamYOLO: Real-time Object Detection for Streaming Perception [84.2559631820007]
将来を予測する能力を備えたモデルを提供し、ストリーミング知覚の結果を大幅に改善する。
本稿では,複数の速度を駆動するシーンについて考察し,VasAP(Velocity-Awared streaming AP)を提案する。
本手法は,Argoverse-HDデータセットの最先端性能を実現し,SAPとVsAPをそれぞれ4.7%,VsAPを8.2%改善する。
論文 参考訳(メタデータ) (2022-07-21T12:03:02Z) - Approximated Bilinear Modules for Temporal Modeling [116.6506871576514]
CNNの2層は補助ブランチサンプリングを追加することで、時間的双線形モジュールに変換できる。
我々のモデルは、事前トレーニングなしで、Something v1とv2データセットの最先端メソッドよりも優れている。
論文 参考訳(メタデータ) (2020-07-25T09:07:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。