論文の概要: DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation
- arxiv url: http://arxiv.org/abs/2606.00535v1
- Date: Sat, 30 May 2026 05:05:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.513178
- Title: DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation
- Title(参考訳): DREAM-S:マルチモーダル・ジェネレーションのための検索可能な描画とターゲット・アウェア・リファインメントによる投機的デコーディング
- Abstract要約: 投機的復号化(SD)は,大規模言語モデル(LLM)における自己回帰生成の促進に有効な手法であることが証明されている。
視覚言語モデル(VLM)の高速かつ効率的な復号化を目的とした新しいSDフレームワークであるtextitDREAM-S を提案する。
- 参考スコア(独自算出の注目度): 9.686226209336207
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Speculative decoding (SD) has proven to be an effective technique for accelerating autoregressive generation in large language models (LLMs) however, its application to vision-language models (VLMs) remains relatively unexplored. We propose~\textit{DREAM-S}, a novel SD framework designed specifically for fast and efficient decoding in VLMs. DREAM-S leverages a neural architecture search (NAS) framework with target-aware supernet training to automatically identify both the optimal interaction strategy between the draft and target models, and the most suitable draft model architecture for the underlying hardware implementation platform. DREAM-S additionally incorporates adaptive intermediate feature distillation, guided by attention entropy, to enable efficient draft training. Experiments on a range of well-established VLMs show that DREAM-S achieves up to a $3.85\times$ speedup compared to standard decoding approaches and significantly outperforms existing SD baselines. The code is publicly available at: https://github.com/SAI-Lab-NYU/DREAM-S .
- Abstract(参考訳): 投機的復号法(SD)は,大規模言語モデル(LLM)における自己回帰生成を高速化する有効な手法であることが証明されているが,視覚言語モデル(VLM)への応用はいまだに未検討である。
VLMの高速かつ効率的な復号のために設計された新しいSDフレームワークである~\textit{DREAM-S}を提案する。
DREAM-Sは、ターゲットを意識したスーパーネットトレーニングを備えたニューラルネットワークサーチ(NAS)フレームワークを活用して、ドラフトモデルとターゲットモデルの間の最適なインタラクション戦略と、基盤となるハードウェア実装プラットフォームに最適なドラフトモデルアーキテクチャの両方を自動的に識別する。
DREAM-Sは適応的な中間的特徴蒸留も取り入れており、注意エントロピーによって誘導され、効率的なドラフトトレーニングを可能にしている。
DREAM-Sは標準的な復号法に比べて最大$3.85のスピードアップを達成し、既存のSDベースラインを大幅に上回っている。
コードは、https://github.com/SAI-Lab-NYU/DREAM-Sで公開されている。
関連論文リスト
- Software Defined Vehicle Code Generation: A Few-Shot Prompting Approach [0.0]
汎用大規模言語モデル (LLM) は、ドメイン間の変換ポテンシャルを実証している。
本研究は, LLMと対話し, 応答をリダイレクトするための共通かつ基本的な手法であるプロンプトを用いることを提案する。
高度なプロンプト技術を用いて設計された適切な効率的なプロンプト構造を持つシステムプロンプトのみを用いることで、LLMはトレーニングセッションや基本設計へのアクセスを必要とせずに製造することができる。
論文 参考訳(メタデータ) (2025-11-06T22:27:39Z) - Fast-dLLM v2: Efficient Block-Diffusion LLM [64.38006546510337]
Fast-dLLM v2はブロック拡散言語モデルで、訓練済みのARモデルをdLLMに適応して並列テキストを生成する。
これは、Dream(580Bトークン)のようなフルアテンション拡散LDMと比較して、トレーニングデータの500倍の減少を示す。
論文 参考訳(メタデータ) (2025-09-30T14:40:18Z) - Cross-Attention Speculative Decoding [20.999323581400336]
最先端の投機的復号法は自己アテンションに基づくトランスフォーマーデコーダに依存しており、しばしば補助的なプーリングや融合層で拡張される。
本稿では,有向型トランスフォーマーデコーダSDモデルであるBudget Eagleについて述べる。
また,ブロックレベルの注意シナリオにおいて,学習の安定性と収束効率を向上する新しい手法である2段階ブロック注意訓練を提案する。
論文 参考訳(メタデータ) (2025-05-30T12:52:35Z) - OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging [124.91183814854126]
モデルマージは、複数のエキスパートモデルをひとつのモデルに組み合わせようとしている。
本稿ではMLLMのトレーニングと評価のタスクを明確に分割したモデルマージ研究のベンチマークを紹介する。
モデルマージは、トレーニングデータを必要とせずに改善されたMLLMを構築するための有望な方法であることがわかった。
論文 参考訳(メタデータ) (2025-05-26T12:23:14Z) - DREAM: Drafting with Refined Target Features and Entropy-Adaptive Cross-Attention Fusion for Multimodal Speculative Decoding [12.069531378404632]
投機的復号化(SD)は,大規模言語モデル(LLM)における自己回帰生成を高速化する強力な手法として登場した。
視覚言語モデル(VLM)に適した新しい投機的復号化フレームワークであるDREAMを紹介する。
論文 参考訳(メタデータ) (2025-05-25T15:56:50Z) - EVEv2: Improved Baselines for Encoder-Free Vision-Language Models [72.07868838411474]
既存のエンコーダフリービジョン言語モデル(VLM)は、エンコーダベースモデルと性能ギャップを狭めている。
我々は,主流のエンコーダをベースとしたVLMと競合するエンコーダフリーVLMの効率的な戦略を開発する。
統一モデルにおいて、視覚と言語を適切に階層的に関連付けることで、モダリティ間の干渉を減少させることを示す。
論文 参考訳(メタデータ) (2025-02-10T18:59:58Z) - Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies [7.14946066475415]
投機的復号法(SD法)は、単一の目標フォワードパスを使用して複数のトークンを生成することにより、実質的な効率向上をもたらす。
既存のSDアプローチでは、ドラフトラとターゲットモデルは同じ語彙を共有する必要があるため、ドラフトラのプールが制限される。
この共有語彙制約を除去する3つの新しいSD手法を提案する。
我々のアルゴリズムは、標準の自己回帰復号よりも最大2.8倍の高速化を示す。
論文 参考訳(メタデータ) (2025-01-31T19:13:58Z) - AdaEAGLE: Optimizing Speculative Decoding via Explicit Modeling of Adaptive Draft Structures [11.436315332919245]
適応型ドラフト構造を明示的にモデル化する最初のSDフレームワークであるAdaEAGLEを紹介する。
AdaEAGLEは、バニラARデコードよりも1.62倍のスピードアップを実現し、固定長のSotAベースラインを上回っている。
論文 参考訳(メタデータ) (2024-12-25T13:57:33Z) - EMMA: Efficient Visual Alignment in Multi-Modal LLMs [56.03417732498859]
EMMAは、視覚的およびテキスト的エンコーディングを効率的に融合するために設計された軽量なクロスプラットフォームモジュールである。
EMMAは複数のタスクのパフォーマンスを最大9.3%向上させ、幻覚に対する堅牢性を大幅に向上させる。
論文 参考訳(メタデータ) (2024-10-02T23:00:31Z) - NVLM: Open Frontier-Class Multimodal LLMs [64.00053046838225]
NVLM 1.0は、フロンティアクラスのマルチモーダル言語モデル(LLM)のファミリーであり、視覚言語タスクの最先端結果を実現する。
トレーニング効率とマルチモーダル推論能力を両立させる新しいアーキテクチャを提案する。
我々は、NVLM-1.0モデルのための生産級マルチモーダリティを開発し、視覚言語タスクに優れる。
論文 参考訳(メタデータ) (2024-09-17T17:59:06Z) - DistillSpec: Improving Speculative Decoding via Knowledge Distillation [70.61777015900272]
投機的復号(SD)は、複数のトークンを生成するためにより高速なドラフトモデルを使用することで、大きな言語モデル推論を加速する。
本稿では,SDを適用する前に,知識蒸留を用いて,ドラフトモデルとターゲットモデルとの整合性を向上するDistillSpecを提案する。
DistillSpecは標準SDよりも10~45%のスピードアップを実現しています。
論文 参考訳(メタデータ) (2023-10-12T16:21:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。