論文の概要: Training Hybrid Block Diffusion Language Models with Partial Bidirectionality
- arxiv url: http://arxiv.org/abs/2607.02805v1
- Date: Thu, 02 Jul 2026 22:37:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.425507
- Title: Training Hybrid Block Diffusion Language Models with Partial Bidirectionality
- Title(参考訳): 部分的双方向性を考慮したハイブリッドブロック拡散言語モデルの訓練
- Abstract要約: 長文生成は、大規模言語モデルにおいて重要な課題の1つである。
本稿では,逆マンバスキャンをアクティブデノナイジングブロックに制限することにより,この問題に対処するBDLMマンバ-アテンションハイブリッドを提案する。
長文推論では、BDLM Mamba-H はフルシーケンスの DiffuMamba-H の 65K トークンのスループットの 19.7 倍、BDLM の 262K のスループットの 3.7 倍に達する。
- 参考スコア(独自算出の注目度): 11.618306403714692
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: High-throughput long-context generation is one of the central challenges for large language models. Generation is typically memory-bandwidth-bound rather than compute-bound: each decoding step must stream the accumulated key/value (KV) cache from memory, so bandwidth demand grows with context length while only one token is emitted. Two parallel approaches have therefore emerged: reducing memory access with efficient attention variants and linear-time mixers such as Mamba, or increasing parallel computation by generating blocks of tokens at once. However, technical challenges arise when combining these two ideas. Earlier hybrid diffusion models such as DiffuMamba use bidirectional Mamba mixing, including a reverse-direction scan relative to causal generation. This reverse scan needs to scan the entire sequence, so its states are not prefix-only and cannot be precisely reused as a cache even when diffusion is performed block by block. We propose a BDLM Mamba--attention hybrid that addresses this challenge by restricting the reverse Mamba scan to the active denoising block, which enables exact caching across blocks. In an 87M-parameter DCLM sweep, BDLM Mamba-H achieves the best C4-en validation perplexity compared to BDLM attention and full-sequence baselines. At 350M parameters, it remains competitive with BDLM attention. For long-context inference, BDLM Mamba-H reaches 19.7x the throughput of full-sequence DiffuMamba-H at 65K tokens and 3.7x the throughput of BDLM attention at 262K, showing that Mamba hybrids are a potential long-context diffusion architecture.
- Abstract(参考訳): 高スループット長文生成は、大規模言語モデルにおいて重要な課題の1つである。
それぞれのデコードステップは、蓄積されたキー/値(KV)キャッシュをメモリからストリームしなければなりません。
したがって、2つの並列的なアプローチが出現した: 効率的な注意変動を伴うメモリアクセスと、Mambaのような線形時間ミキサー、あるいはトークンのブロックを一度に生成することで並列計算を増加させる。
しかし、これら2つのアイデアを組み合わせる際に技術的な課題が発生する。
DiffuMambaのような初期のハイブリッド拡散モデルは、因果生成に対する逆方向スキャンを含む双方向のMamba混合を使用する。
この逆スキャンはシーケンス全体をスキャンする必要があるため、その状態はプレフィックスのみではなく、ブロック単位で拡散がブロックされた場合でもキャッシュとして正確に再利用することはできない。
本稿では,ブロック間の正確なキャッシュを実現するために,逆マンバスキャンをアクティブデノナイジングブロックに制限することにより,この問題に対処するBDLMマンバ-アテンションハイブリッドを提案する。
87MパラメーターDCLMスイープにおいて、BDLM Mamba-Hは、BDLMの注意と全シーケンスベースラインと比較して、最高のC4-enバリデーションの難易度を達成する。
350万のパラメータでは、BDLMの注目と競合する。
長文推論では、BDLM Mamba-Hは65KのDiffuMamba-Hのスループットの19.7倍、BDLMの262Kのスループットの3.7倍に達する。
関連論文リスト
- Fixed State, Long Reach: What a Constant-Size Cache Buys Block Diffusion at Scale [18.318746660954663]
ブロック拡散はブロックバイブロックを復号することでキャッシュを復元する。
我々はこのレシピを大規模に研究し,300Bトークン上に3つの3Bブロック拡散復号器を事前学習した。
論文 参考訳(メタデータ) (2026-09-09T23:37:47Z) - Multi-Block Diffusion Language Models [46.581695254036]
ブロック拡散言語モデル(BD-LM)は、KVキャッシングとフレキシブルな長文生成により拡散ベースのテキスト生成を改善する。
マルチブロック教師強制(MultiTF)を用いたBD-LMの訓練後得られたマルチブロック拡散言語モデル(MBD-LM)を提案する。
MBD-LLaDA2-Miniは平均Tokens Per Forward Pass (TPF)を3.47から6.19に増加させ、平均精度を79.95%から81.03%に向上させる。
DMaxと組み合わせると、MBD-LLaDA2-Mini-DMaxの平均TPFは9.34である。
論文 参考訳(メタデータ) (2026-06-28T05:53:45Z) - DMax: Aggressive Parallel Decoding for dLLMs [77.24184219948337]
効率的な拡散言語モデル(dLLM)のための新しいパラダイムであるDMaxを提案する。
並列デコードにおけるエラーの蓄積を軽減し、生成品質を維持しながらアグレッシブデコードを可能にする。
当社のアプローチの核心は、マスクと均一なdLLMを効率的に統合する新しいトレーニング戦略であるOn-Policy Uniform Trainingである。
論文 参考訳(メタデータ) (2026-04-09T14:35:42Z) - ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning [11.388109553982089]
完全にオープンなマルチモーダル大言語モデル(MLLM)による動画キャプションに焦点を当てる。
ABMambaは、ビデオシーケンスのスケーラブルな処理を可能にする線形計算複雑性を持つ完全にオープンなMLLMである。
VATEX や MSR-VTT のような標準的なビデオキャプションベンチマークでは、ABMamba は典型的な MLLM と比較して競争性能を示している。
論文 参考訳(メタデータ) (2026-04-09T09:58:56Z) - MaBERT:A Padding Safe Interleaved Transformer Mamba Hybrid Encoder for Efficient Extended Context Masked Language Modeling [3.5795275871379704]
MaBERTはハイブリッドエンコーダで、TransformerレイヤとMambaレイヤをインターリーブし、リニアな状態更新を行う。
GLUEでは、MaBERTは8つのタスクのうち5つのタスクで最高の平均スコアを獲得し、CoLAと文ペア推論タスクで高いパフォーマンスを得る。
論文 参考訳(メタデータ) (2026-03-03T13:52:33Z) - Stateful Token Reduction for Long-Video Hybrid VLMs [69.6930118088911]
ハイブリッドビデオビジョン言語モデル(VLM)のクエリ条件付きトークン削減について検討する。
本稿では,低段階から高段階の減算スケジュールと,注意とマンバブロックの両ブロックを対象とした言語認識スコアリング機構を提案する。
積極的圧縮条件下では,本手法はテスト時にほぼベースライン精度で精度の高いプリフィルング・スピードアップを実現する。
論文 参考訳(メタデータ) (2026-02-27T08:11:06Z) - VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding [52.69880888587866]
現在のビデオ大言語モデル(ビデオLLM)は、典型的にはエンコーダビジョンを介してフレームを符号化し、自己回帰(AR)LLMを使用して理解と生成を行う。
本稿では,言語モデル(DLM)に基づく拡散ビデオLLMであるVidLaDAを提案する。
実験によると、VidLaDAは最先端のARベースラインと競合し、DLMベースラインを上回り、MARS-Cacheは精度を損なうことなく12倍のスピードアップを提供する。
論文 参考訳(メタデータ) (2026-01-25T15:02:01Z) - ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding [37.86179431483446]
自己回帰モデル(ARM)は、遅いシーケンシャル推論によって妨げられる。
本稿では,優れた性能と効率を実現するマスク付き拡散モデルReFusionを紹介する。
ReFusionは、2.33$timesの平均スピードアップを維持しながら、パフォーマンスギャップを強力なARMに橋渡しする。
論文 参考訳(メタデータ) (2025-12-15T17:41:19Z) - dParallel: Learnable Parallel Decoding for dLLMs [77.24184219948337]
拡散大言語モデル(dLLM)は並列トークン予測と低推論遅延を提供する。
既存のオープンソースモデルは、パフォーマンスを確保するためにトークン長のデコードステップをほとんど必要としています。
高速サンプリングのためにdLLMs固有の並列性を解き放つシンプルで効果的な方法であるdParallelを導入する。
論文 参考訳(メタデータ) (2025-09-30T16:32:52Z) - Fast-dLLM v2: Efficient Block-Diffusion LLM [64.38006546510337]
Fast-dLLM v2はブロック拡散言語モデルで、訓練済みのARモデルをdLLMに適応して並列テキストを生成する。
これは、Dream(580Bトークン)のようなフルアテンション拡散LDMと比較して、トレーニングデータの500倍の減少を示す。
論文 参考訳(メタデータ) (2025-09-30T14:40:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。