論文の概要: GeoBlock: Inferring Block Granularity from Dependency Geometry in Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2603.26675v1
- Date: Wed, 04 Mar 2026 18:45:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 02:36:13.062227
- Title: GeoBlock: Inferring Block Granularity from Dependency Geometry in Diffusion Language Models
- Title(参考訳): GeoBlock:拡散言語モデルにおける依存幾何学からのブロック粒度推定
- Abstract要約: GeoBlockは、注目に起因した依存性の幾何学から直接ブロックの粒度を決定するブロック推論フレームワークである。
依存性の幾何に適応することにより、GeoBlockは、自己回帰的信頼性を示す依存性一貫性の洗練を図りながら、ブロック拡散の並列効率を保ちます。
- 参考スコア(独自算出の注目度): 14.455425759091503
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Block diffusion enables efficient parallel refinement in diffusion language models, but its decoding behavior depends critically on block size. Existing block-sizing strategies rely on fixed rules or heuristic signals and do not account for the dependency geometry that determines which tokens can be safely refined together. This motivates a geometry view of diffusion decoding: \emph{regions with strong causal ordering require sequential updates, whereas semantically cohesive regions admit parallel refinement.} We introduce GeoBlock, a geometry-aware block inference framework that determines block granularity directly from attention-derived dependency geometry. Instead of relying on predefined schedules or local confidence heuristics, GeoBlock analyzes cross-token dependency patterns to identify geometrically stable refinement regions and dynamically determines appropriate block boundaries during decoding. By adapting block granularity to the dependency geometry, GeoBlock preserves the parallel efficiency of block diffusion while enforcing dependency-consistent refinement that exhibits autoregressive reliability. GeoBlock requires no additional training and integrates seamlessly into existing block diffusion architectures. Extensive experiments across multiple benchmarks show that GeoBlock reliably identifies geometry-consistent block boundaries and improves the accuracy of block diffusion with only a small additional computational budget.
- Abstract(参考訳): ブロック拡散は拡散言語モデルの効率的な並列化を可能にするが、その復号化挙動はブロックサイズに大きく依存する。
既存のブロックサイズ戦略は固定ルールやヒューリスティック信号に依存しており、どのトークンを安全に精製できるかを決定する依存幾何学を考慮していない。
これは拡散復号の幾何学的ビューを動機付けている: 強い因果順序を持つ \emph{ Regions は逐次更新を必要とするが、セマンティック結合性領域は並列精製を許容する。
我々はGeoBlockを紹介した。GeoBlockは、注目に依存した依存性の幾何から直接ブロックの粒度を決定する幾何学的ブロック推論フレームワークである。
事前に定義されたスケジュールや局所的な信頼性ヒューリスティックに頼る代わりに、GeoBlockは、幾何学的に安定な洗練領域を特定するために、クロストークンの依存関係パターンを分析し、復号中に適切なブロック境界を動的に決定する。
依存性幾何学にブロックの粒度を適応させることで、GeoBlockは自己回帰的信頼性を示す依存性一貫性の洗練を図りながら、ブロック拡散の並列効率を保っている。
GeoBlockは追加のトレーニングを必要とせず、既存のブロック拡散アーキテクチャとシームレスに統合する。
複数のベンチマークにわたる大規模な実験により、GeoBlockは幾何一貫性のあるブロック境界を確実に識別し、小さな計算予算だけでブロック拡散の精度を向上させることが示されている。
関連論文リスト
- Latent Block-Diffusion Temporal Point Processes: A Semi-Autoregressive Framework for Asynchronous Event Sequence Generation [48.64529006657015]
高品質かつ可変長イベントシーケンス生成のための遅延ブロック拡散時間点プロセス(LBDTPP)を提案する。
各ブロックでイベントを同時にサンプリングしながらブロックを逐次生成することにより、LBDTPPは自己回帰TPPの長さ柔軟性を保持する。
LBDTPPは、非条件および条件生成タスクの両方において最先端のTPPベースラインを上回っている。
論文 参考訳(メタデータ) (2026-06-23T13:45:28Z) - DreamReasoner-8B: Block-Size Curriculum Learning for Diffusion Reasoning Models [82.86749180125919]
我々は,オープンソースのブロック拡散推論モデルであるDreamReasoner-8Bを開発した。
我々の分析では、大きなブロックサイズでのトレーニングは、非常に不十分な推論をもたらすという、パフォーマンスの相違が明らかになっている。
本稿では,より粒度の細かいブロックサイズから粗いブロックサイズに段階的に移行したブロックサイズのカリキュラム学習を提案する。
論文 参考訳(メタデータ) (2026-06-17T16:34:02Z) - SemBlock: Semantic Boundary Dynamic Blocks for Diffusion LLMs [11.207858704138786]
SemBlockは、拡散言語モデルのための意味駆動型動的ブロックデコーディングフレームワークである。
本研究では,セマンティック・バウンダリ・データセットであるSemBoundを構築した。
GSM8K、IFEval、MATH、HumanEvalの実験では、SemBlockは固定ブロックデコーディングやAdaBlockよりも一貫して改善されている。
論文 参考訳(メタデータ) (2026-06-03T14:48:27Z) - BlockBatch: Multi-Scale Consensus Decoding for Efficient Diffusion Language Model Inference [15.424211656458453]
拡散言語モデルは、複数のトークン位置を並列に反復的に認知することでテキストを生成する。
小さなブロックはローカル条件を保存するが、多くのデノーミングステップを必要とするが、大きなブロックはより並列性を公開するが、早期のコミットとキャッシュエラーを蓄積することができる。
バッチ転送パス内で同じリクエストに対して複数のブロックサイズのブランチを実行する,トレーニング不要なオンライン推論フレームワークであるBlockBatchを提案する。
論文 参考訳(メタデータ) (2026-05-28T01:48:29Z) - Towards Generalization of Block Attention via Automatic Segmentation and Block Distillation [61.19473093799777]
ブロックアテンションは、Retrieval-Augmented Generation (RAG)のような長期コンテキストシナリオにおけるKVキャッシュの再利用を改善することができる。
しかし、入力テキストを意味のある自己完結ブロックに分割することの難しさと、性能低下のリスクを負う既存のブロック微調整手法の非効率性である。
ブロック微細チューニングよりも効率的な訓練フレームワークであるブロック蒸留を提案し, 凍結したフルアテンション教師モデルを用いて, ブロックアテンション学生を指導する。
論文 参考訳(メタデータ) (2026-05-15T12:51:32Z) - Dynamic Chunking for Diffusion Language Models [39.198939178122714]
ブロック離散拡散言語モデルは、固定サイズの位置ブロック上で自己回帰的にシーケンスを分解する。
textbfDynamic textbfChunking textbfDiffusion textbfModel (DCDM)を紹介する。
DCDMは、位置ブロックをコンテンツ定義セマンティックチャンクに置き換える。
論文 参考訳(メタデータ) (2026-05-15T06:56:05Z) - DSB: Dynamic Sliding Block Scheduling for Diffusion LLMs [17.284485483927448]
拡散大言語モデル(dLLM)は、テキスト生成の有望な代替手段として登場した。
広く使われている固定ブロック (naive) スケジュールは意味的難易度に非依存であり、品質と効率の両面での準最適戦略である。
本研究では,動的ブロックの剛性を克服するため,動的サイズを有するスライディングブロックを用いて,トレーニング不要なブロックスケジューリング手法であるDynamic Sliding Block (DSB)を提案する。
論文 参考訳(メタデータ) (2026-02-05T18:41:38Z) - FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion [51.1618564189244]
FlashBlockは、安定したアテンション出力を再利用し、拡散プロセスを変更することなくアテンション計算とKVキャッシュアクセスを減らす、キャッシュされたブロック外部アテンションメカニズムである。
拡散言語モデルとビデオ生成の実験では、1.44$times$高いトークンスループットと1.6$times$の注意時間を短縮し、生成品質に無視できない影響を与えている。
論文 参考訳(メタデータ) (2026-02-05T04:57:21Z) - From Next-Token to Next-Block: A Principled Adaptation Path for Diffusion LLMs [58.640039233470766]
原理的AR-to-block-diffusion適応は,DLMをスクラッチからトレーニングする上で,有効かつ効率的な代替手段であることを示す。
NBDiff-7B(BaseとInstruct)は、長文のモデリングと推論機能を継承し、最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-12-07T10:28:21Z) - Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding [60.06816407728172]
離散拡散言語モデルは、テキスト生成に強い可能性を示している。
半自己回帰推論による微調整ミスアライメントの標準化
我々は、応答を固定サイズブロックに分割するBlockwise SFTを提案する。
論文 参考訳(メタデータ) (2025-08-27T02:49:33Z) - DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation [11.910667302899638]
DiffusionBlocksは、トランスフォーマーベースのネットワークを独立したトレーニング可能なブロックに変換するための、原則化されたフレームワークである。
本実験は,DiffusionBlocksトレーニングがエンドツーエンドトレーニングの性能に合致することを示すものである。
論文 参考訳(メタデータ) (2025-06-17T05:44:18Z) - Towards Universal Dense Blocking for Entity Resolution [49.06313308481536]
ドメインに依存しない、容易に観測可能なコーパス上で事前学習を行う密集型ブロッカであるUniBlockerを提案する。
ドメインに依存しない事前トレーニングを行うことで、UniBlockerはドメイン固有の微調整を必要とせずに、さまざまなダウンストリームブロッキングシナリオに適応できる。
提案したUniBlockerは、ドメイン固有の学習を一切行わず、従来の自己および教師なしの密なブロッキング手法よりも大幅に優れていた。
論文 参考訳(メタデータ) (2024-04-23T08:39:29Z) - Unifying Nonlocal Blocks for Neural Networks [43.107708207022526]
非局所ブロックは、コンピュータビジョンタスクにおける長距離空間的依存関係をキャプチャするために設計されている。
我々はそれらを解釈するための新しい視点を提供し、完全連結グラフ上で生成されたグラフフィルタの集合と見なす。
より堅牢でフレキシブルなスペクトル非局所ブロックを提案する。
論文 参考訳(メタデータ) (2021-08-05T08:34:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。