論文の概要: Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMs
- arxiv url: http://arxiv.org/abs/2608.22367v1
- Date: Sun, 23 Aug 2026 11:16:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:36.974535
- Title: Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMs
- Title(参考訳): 文脈対応クラスタデコーディング:dMLLMにおける意味的アンカー駆動コヒーレンス
- Abstract要約: 拡散多モード大言語モデル (dMLLM) は、意味的ドリフトと反復によってマーレされた長い形式の出力を生成する。
我々は,ソフトマックスの信頼度と近接する近傍の乗算合成により,各マスキング位置をスコアする訓練不要な復号法であるtextbfContext-textbfAware textbfCluster textbfDecodingを提案する。
- 参考スコア(独自算出の注目度): 7.894740505622926
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion multimodal large language models (dMLLMs) frequently produce long-form outputs marred by semantic drift and repetition, with quality generally degrading as output length increases. We identify two structural deficiencies in existing decoding methods as primary drivers of these failures: confidence-based scoring ignores decoded-neighbor support, and block partitioning prevents access to high-readiness semantic anchors, together causing tokens to be committed before their local context is sufficiently established. We propose \ours{} (\textbf{C}ontext-\textbf{A}ware \textbf{C}luster \textbf{D}ecoding), a training-free decoding method that scores each masked position by a multiplicative composite of softmax confidence and neighbor proximity, promoting contextually ready tokens above isolated candidates while suppressing low-confidence positional noise, operating block-free to keep high-readiness anchors globally accessible. \ours{} further applies architecture-aware calibration to handle confidence heterogeneity induced by diverse visual integration strategies. Experiments on three dMLLMs across four benchmarks demonstrate consistent quality gains and hallucination reduction over Original, with larger gains in several longer generation settings, highlighting the importance of neighbor support and visual integration strategy for future dMLLM decoding method design. Our code is openly available at https://github.com/zhaoyk-sysu/CACD-dMLLM.
- Abstract(参考訳): 拡散多モーダル大言語モデル (dMLLM) は、しばしば意味的ドリフトと反復によってマークされた長い形式の出力を生成し、出力長が増加するにつれて品質は一般的に低下する。
信頼に基づくスコアリングはデコード隣のサポートを無視し、ブロックパーティショニングは高可読性セマンティックアンカーへのアクセスを妨げ、局所的なコンテキストが十分に確立される前にトークンをコミットする。
ソフトマックスの信頼性と近接した近傍の乗算合成により各マスク位置をスコアリングする学習自由復号法である \ours{} (\textbf{C}ontext-\textbf{A}ware \textbf{C}luster \textbf{D}ecoding) を提案する。
さらに \ours{} は、様々な視覚統合戦略によって引き起こされる信頼の不均一性を扱うために、アーキテクチャを意識したキャリブレーションを適用している。
4つのベンチマークによる3つのdMLLM実験は、オリジナルよりも一貫した品質向上と幻覚減少を示し、より長い世代設定で大きく向上し、将来のdMLLM復号法設計における近隣サポートと視覚統合戦略の重要性を強調した。
私たちのコードはhttps://github.com/zhaoyk-sysu/CACD-dMLLM.comで公開されています。
関連論文リスト
- Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMs [5.167210035701369]
Information-Guided Frontier Decodingは、トレーニング不要のデコーディング戦略である。
トークンの信頼度、近隣の不確実性、構造的コミットメントリスクを用いて候補者をランク付けする。
脆弱な構造トークンを遅らせながら、信頼性の高いセマンティックアンカーの早期コミットを促進する。
論文 参考訳(メタデータ) (2026-08-27T05:51:00Z) - Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs [69.52853771994451]
我々はLLaDA 2.0の復号軌道を解析し、繰り返し拡散信頼トラップを同定する。
本稿では,拡散復号化を進化過程とみなす訓練不要なテスト時間スケーリングフレームワークである進化復号法を提案する。
論文 参考訳(メタデータ) (2026-08-01T11:48:25Z) - One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting [51.09550363815034]
シーンテキストスポッティングはテキスト認識と空間的局所化の間に高精度なアライメントを必要とする。
本研究では,個々のテキストインスタンスを単一のアンカー視覚トークンでルーティングする視覚中心のフレームワークであるSingle-Patch Text Spotting (SPaTS)を提案する。
SPaTS はフロンティアのクローズドソースMLLM と OCR MLLM の両方で一貫した性能を示し,その性能を著しく向上させる。
論文 参考訳(メタデータ) (2026-07-30T09:17:48Z) - Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens [22.687236570529844]
本稿では,組込み空間内で動作するトレーニングフリーフレームワークASRDを提案する。
我々はASRDが最近のリメイキングベースラインを上回り、最大6.4%の精度向上を実現し、推論スループットを最大7.2倍に向上させることを示した。
論文 参考訳(メタデータ) (2026-06-15T15:23:47Z) - SimSD: Simple Speculative Decoding in Diffusion Language Models [61.33773959352141]
拡散大言語モデル (dLLMs) は、並列またはブロックワイド復号による高速な推論を提供する。
彼らのマスク付き言語モデリングの定式化は、標準的なトークンレベルの投機的復号法とは相容れないままである。
我々は,dLLMに時間的に有効なトークンレベルのコンテキストを付与する,SimSDと呼ばれるdLLMの投機的復号アルゴリズムを提案する。
提案手法は,平均生成品質を維持しつつ,最大7.46倍高い復号スループットを実現する。
論文 参考訳(メタデータ) (2026-06-01T17:46:46Z) - FLARE: Diffusion for Hybrid Language Model [72.60770374799634]
FLAREは、ハイブリッドアテンションな大規模言語モデルのための体系的な変換フレームワークである。
トークン平等なAR/拡散目標、ハードウェア対応カーネル、統一推論を組み合わせることで、ひとつのチェックポイントがARスタイルの検証された復号化と拡散スタイルの並列復号化の両方をサポートすることができる。
この結果から,実際のdLLMは復号化アルゴリズムだけでなく,データ品質や現在のブロック拡散目標のトレーニング非効率によって制限されていることが示唆された。
論文 参考訳(メタデータ) (2026-06-01T06:58:15Z) - OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs [31.589945976149973]
我々は、Attributionを世代追跡問題として形式化する軽量でモデルに依存しないフレームワークであるOmniTraceを紹介した。
本研究では, 世代別スパンレベルの属性が, 自己帰属よりも安定かつ解釈可能な説明をもたらすことを示す。
この結果から,属性を構造化された生成時トレース問題として扱うことは,オムニモーダル言語モデルにおける透明性のスケーラブルな基盤となることが示唆された。
論文 参考訳(メタデータ) (2026-03-20T17:25:00Z) - HIPPO: Accelerating Video Large Language Models Inference via Holistic-aware Parallel Speculative Decoding [48.55833840968632]
投機的復号化は、出力品質を犠牲にすることなくLSM推論を加速するための有望なアプローチとして登場した。
提案するHIPPOは,汎用的な並列投機復号化フレームワークである。
6つのベンチマークで4つのビデオLLMの実験では、HIPPOの有効性が示され、最大3.51倍のスピードアップが達成された。
論文 参考訳(メタデータ) (2026-01-13T07:02:43Z) - Deferred Commitment Decoding for Diffusion Language Models with Confidence-Aware Sliding Windows [33.361153168706444]
トレーニング不要なデコード戦略として,Dederred Commitment Decoding (DCD)を提案する。
DCDは、マスクされたトークンの上に信頼性を意識したスライディングウィンドウを保持しており、十分な文脈証拠が得られるまで、高い不確実性トークンを延期しながら、早期に低不確実性トークンを解決している。
実験の結果、DCDは固定ブロックベースの拡散法に比べて平均時間で1.39%向上し、最も顕著な改善は9.0%に達した。
論文 参考訳(メタデータ) (2026-01-05T12:57:33Z) - Accelerating Diffusion LLM Inference via Local Determinism Propagation [27.751279909685604]
LocalLeapは、トレーニング不要の適応並列デコード戦略である。
6.94$times$スループットの改善を実現し、デコード手順を元の要件の14.2%に短縮する。
論文 参考訳(メタデータ) (2025-10-08T14:39:34Z) - Growing Visual Generative Capacity for Pre-Trained MLLMs [60.826355079902505]
Bridgeは純粋な自己回帰統合MLLMであり、学習済みの視覚的理解モデルを生成能力で強化する。
本稿では,コンパクトなセマンティックトークンと微細なピクセルトークンを統合するセマンティック・ツー・ピクセルの離散表現を提案する。
論文 参考訳(メタデータ) (2025-10-02T00:40:02Z) - AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size [7.442463267121892]
拡散に基づく大規模言語モデル (dLLM) は並列デコードに固有の能力で注目を集めている。
本稿では,セミARデコードにおける固定ブロックサイズの仮定に挑戦する最初の体系的な研究を提案する。
AdaBlock-dLLMは,実行中のブロックサイズを調整することで,ブロック境界とセマンティックステップを適応的に調整する,トレーニング不要のプラグイン・アンド・プレイスケジューラである。
論文 参考訳(メタデータ) (2025-09-30T15:53:56Z) - Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding [51.711605076319216]
拡散に基づく大規模言語モデル (Diffusion LLM) は、並列復号機能を持つ非自己回帰テキスト生成を約束している。
本稿では,双方向拡散モデルに適したブロック単位で近似したKVキャッシュ機構を提案する。
本稿では,信頼しきい値を超えるトークンを選択的に復号し,依存関係違反を軽減し,生成品質を維持できる信頼度対応並列復号方式を提案する。
論文 参考訳(メタデータ) (2025-05-28T17:39:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。