論文の概要: AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size
- arxiv url: http://arxiv.org/abs/2509.26432v2
- Date: Wed, 01 Oct 2025 11:26:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-10-02 14:33:21.851787
- Title: AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size
- Title(参考訳): AdaBlock-dLLM:適応ブロックサイズによる意味認識拡散LDM推論
- Abstract要約: 拡散に基づく大規模言語モデル (dLLM) は並列デコードに固有の能力で注目を集めている。
本稿では,セミARデコードにおける固定ブロックサイズの仮定に挑戦する最初の体系的な研究を提案する。
AdaBlock-dLLMは,実行中のブロックサイズを調整することで,ブロック境界とセマンティックステップを適応的に調整する,トレーニング不要のプラグイン・アンド・プレイスケジューラである。
- 参考スコア(独自算出の注目度): 7.442463267121892
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion-based large language models (dLLMs) are gaining attention for their inherent capacity for parallel decoding, offering a compelling alternative to autoregressive LLMs. Among various decoding strategies, blockwise semi-autoregressive (semi-AR) approaches are widely adopted due to their natural support for KV caching and their favorable accuracy-speed trade-off. However, this paper identifies two fundamental limitations in the conventional semi-AR decoding approach that applies a fixed block size: i) late decoding overhead, where the unmasking of high-confidence tokens outside the current block is unnecessarily delayed, and ii) premature decoding error, where low-confidence tokens inside the current block are committed too early, leading to incorrect tokens. This paper presents the first systematic investigation challenging the fixed block size assumption in semi-AR decoding. Through a statistical analysis of confidence dynamics during the denoising process, we identify a volatility band (VB) region during dLLM decoding, which encodes local semantic structure and can be used to guide adaptive block sizing. Leveraging these insights, we introduce AdaBlock-dLLM, a training-free, plug-and-play scheduler that adaptively aligns block boundaries with semantic steps by adjusting block size during runtime. Extensive experiments across diverse benchmarks show that AdaBlock-dLLM achieves up to 5.3% accuracy improvement under the same throughput budget. Beyond inference-time optimization, we hope our semantics-aware adaptive scheduling approach and confidence-based analysis will inspire future training strategies for dLLMs.
- Abstract(参考訳): 拡散に基づく大規模言語モデル(dLLM)は、並列デコードに固有の能力で注目を集めており、自己回帰型LLMに代わる魅力的な代替手段となっている。
復号化戦略の中で、KVキャッシングの自然なサポートと精度・速度のトレードオフにより、ブロックワイズ半自己回帰(セミAR)アプローチが広く採用されている。
しかし,本論文では,固定ブロックサイズを適用した従来の半AR復号法における2つの基本的制約について述べる。
一 遅延復号であって、現在のブロックの外側の高信頼トークンの不正化が必然的に遅れているもの
二 現在のブロック内の低信頼トークンのコミットが早すぎる場合の早期復号エラーにより、不正なトークンが発生すること。
本稿では,セミARデコードにおける固定ブロックサイズの仮定に挑戦する最初の体系的な研究を提案する。
復調過程における信頼度動態の統計的解析を通じて,局所的な意味構造を符号化し,適応的ブロックサイズを導出するのに使用できる,dLLM復号時の揮発性帯域(VB)領域を同定する。
これらの知見を活かしたAdaBlock-dLLMは,実行中のブロックサイズを調整することで,ブロック境界をセマンティックステップに適応的にアライメントする,トレーニング不要のプラグイン・アンド・プレイスケジューラである。
様々なベンチマークによる大規模な実験により、AdaBlock-dLLMは同じスループットの予算で最大5.3%の精度の改善が達成された。
推論時間の最適化以外にも、セマンティクスを意識した適応スケジューリングアプローチと信頼度に基づく分析が、将来のdLLMのトレーニング戦略を刺激することを期待します。
関連論文リスト
- Early-Bird Decoding: Accelerating Diffusion LLMs with Learnable Block Sizes and Parallel Sampling [11.823547220829083]
拡散大言語モデル(dLLM)は、自己回帰生成の代替として有望な並列デコードパラダイムを提供する。
同様に低いエントロピーを持つトークンがクラスタ化される傾向にあるという観察から動機付けられた「アーリーバード(EB)」デコーディングフレームワークを提案する。
EB-Decodeは,(1)類似の不確実性のあるトークンを,固定ブロックサイズに依存するのではなく,可変長ブロックに適応的にグループ化する学習可能なネットワーク,(2)予測された可変長ブロック内の復号ステップを減らして,並列でトークンをアンマスクする位置認識型サンプリング,という2つの重要なイネーラを統合する。
論文 参考訳(メタデータ) (2026-09-15T00:12:37Z) - Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMs [7.894740505622926]
拡散多モード大言語モデル (dMLLM) は、意味的ドリフトと反復によってマーレされた長い形式の出力を生成する。
我々は,ソフトマックスの信頼度と近接する近傍の乗算合成により,各マスキング位置をスコアする訓練不要な復号法であるtextbfContext-textbfAware textbfCluster textbfDecodingを提案する。
論文 参考訳(メタデータ) (2026-08-23T11:16:04Z) - SimSD: Simple Speculative Decoding in Diffusion Language Models [61.33773959352141]
拡散大言語モデル (dLLMs) は、並列またはブロックワイド復号による高速な推論を提供する。
彼らのマスク付き言語モデリングの定式化は、標準的なトークンレベルの投機的復号法とは相容れないままである。
我々は,dLLMに時間的に有効なトークンレベルのコンテキストを付与する,SimSDと呼ばれるdLLMの投機的復号アルゴリズムを提案する。
提案手法は,平均生成品質を維持しつつ,最大7.46倍高い復号スループットを実現する。
論文 参考訳(メタデータ) (2026-06-01T17:46:46Z) - Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention [58.484607892210015]
Diffusion Language Models (DLM) は、グローバルコヒーレント、双方向、および制御可能なテキスト生成を可能にする。
既存の多くのブロックスパースアテンション手法は、高分解能アテンション空間上の固定サンプリングパターンによってブロックを選択する。
本稿では,ブロックワイド事前サンプリング操作によるBA-Att(Block Approximate Sparse Attention framework)を提案する。
論文 参考訳(メタデータ) (2026-05-19T12:01:13Z) - Prefix-Adaptive Block Diffusion for Efficient Document Recognition [52.15352911463151]
ブロック拡散モデル(BDM)は並列生成、フレキシブルな出力、KVキャッシュをサポートし、効率的な文書解析を約束する。
本稿では,前置詞から接尾辞への因果表記に代えて,ブロック内双方向化を代替するPrefix-Block Diffusion Model (PA-BDM)を提案する。
実験の結果、3B PA-BDMはいくつかのベンチマークで高い認識スコアを達成し、2.5B MinerU-Diffusionに対して推論スループットを71.6%向上した。
論文 参考訳(メタデータ) (2026-05-16T07:50:13Z) - DepCap: Adaptive Block-Wise Parallel Decoding for Efficient Diffusion LM Inference [16.909416809565194]
拡散言語モデル (DLM) は自己回帰型言語生成に代わる有望な代替手段として登場した。
この可能性を解き明かすためには、DLM推論は生成品質と復号速度を慎重にバランスさせなければならない。
効率的なブロックワイドDLM推論のためのトレーニングフリーフレームワークであるDepCapを提案する。
論文 参考訳(メタデータ) (2026-04-17T06:53:27Z) - Advancing Block Diffusion Language Models for Test-Time Scaling [73.54022593833638]
BDLMにおけるテスト時間スケーリングのための統一的なフレームワークを提案する。
復号化とブロックワイズ生成の両方に適応性を導入する。
BACD, TCCFをTDAR-8Bに適用すると, 強いベースラインよりも顕著な改善が得られた。
論文 参考訳(メタデータ) (2026-02-10T09:05:07Z) - DSB: Dynamic Sliding Block Scheduling for Diffusion LLMs [17.284485483927448]
拡散大言語モデル(dLLM)は、テキスト生成の有望な代替手段として登場した。
広く使われている固定ブロック (naive) スケジュールは意味的難易度に非依存であり、品質と効率の両面での準最適戦略である。
本研究では,動的ブロックの剛性を克服するため,動的サイズを有するスライディングブロックを用いて,トレーニング不要なブロックスケジューリング手法であるDynamic Sliding Block (DSB)を提案する。
論文 参考訳(メタデータ) (2026-02-05T18:41:38Z) - Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models [96.0074341403456]
LLM推論を改善するための実用的な方法として、推論時計算が再導入されている。
テスト時間スケーリング(TTS)アルゴリズムの多くは、自動回帰デコーディングに依存している。
そこで我々は,dLLM のための効率的な TTS フレームワーク Prism を提案する。
論文 参考訳(メタデータ) (2026-02-02T09:14:51Z) - Deferred Commitment Decoding for Diffusion Language Models with Confidence-Aware Sliding Windows [33.361153168706444]
トレーニング不要なデコード戦略として,Dederred Commitment Decoding (DCD)を提案する。
DCDは、マスクされたトークンの上に信頼性を意識したスライディングウィンドウを保持しており、十分な文脈証拠が得られるまで、高い不確実性トークンを延期しながら、早期に低不確実性トークンを解決している。
実験の結果、DCDは固定ブロックベースの拡散法に比べて平均時間で1.39%向上し、最も顕著な改善は9.0%に達した。
論文 参考訳(メタデータ) (2026-01-05T12:57:33Z) - From Next-Token to Next-Block: A Principled Adaptation Path for Diffusion LLMs [58.640039233470766]
原理的AR-to-block-diffusion適応は,DLMをスクラッチからトレーニングする上で,有効かつ効率的な代替手段であることを示す。
NBDiff-7B(BaseとInstruct)は、長文のモデリングと推論機能を継承し、最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-12-07T10:28:21Z) - From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models [19.97248408121574]
Diffusion Language Models (DLMs) は並列デコードにより高速な推論速度で同等の精度を提供する。
高信頼トークンは無視可能な情報を持ち、それらに厳密に依存することで、各デコードラウンドにおける効果的な進捗を制限する。
本研究では,情報スループットと復号効率を最大化する学習自由復号法であるExplore-Then-Exploit (ETE)を提案する。
論文 参考訳(メタデータ) (2025-11-26T06:38:37Z) - Fast-dLLM v2: Efficient Block-Diffusion LLM [64.38006546510337]
Fast-dLLM v2はブロック拡散言語モデルで、訓練済みのARモデルをdLLMに適応して並列テキストを生成する。
これは、Dream(580Bトークン)のようなフルアテンション拡散LDMと比較して、トレーニングデータの500倍の減少を示す。
論文 参考訳(メタデータ) (2025-09-30T14:40:18Z) - Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding [60.06816407728172]
離散拡散言語モデルは、テキスト生成に強い可能性を示している。
半自己回帰推論による微調整ミスアライメントの標準化
我々は、応答を固定サイズブロックに分割するBlockwise SFTを提案する。
論文 参考訳(メタデータ) (2025-08-27T02:49:33Z) - Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction [58.044803442346115]
Diffusion Large Language Models (dLLMs) は推論と並列デコードにおいてブレークスルーを実現するが、推論中に計算の複雑さやメモリオーバーヘッドに悩まされる。
Sparse-dLLMは、動的キャッシュ消去とスパースアテンションを統合した最初のトレーニングフリーフレームワークであり、遅延双方向スパースキャッシングを経由するスパースアテンションである。
論文 参考訳(メタデータ) (2025-08-04T16:14:03Z) - Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding [51.711605076319216]
拡散に基づく大規模言語モデル (Diffusion LLM) は、並列復号機能を持つ非自己回帰テキスト生成を約束している。
本稿では,双方向拡散モデルに適したブロック単位で近似したKVキャッシュ機構を提案する。
本稿では,信頼しきい値を超えるトークンを選択的に復号し,依存関係違反を軽減し,生成品質を維持できる信頼度対応並列復号方式を提案する。
論文 参考訳(メタデータ) (2025-05-28T17:39:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。