論文の概要: Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2607.29079v1
- Date: Fri, 31 Jul 2026 06:58:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.640584
- Title: Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models
- Title(参考訳): 高速化された多モーダル拡散言語モデルにおけるコンテンツドリフトの診断と制御
- Abstract要約: トレーニング不要なアクセラレーションにより、拡散に基づくマルチモーダル大言語モデル(dMLLM)のデプロイが容易になるが、生成したコンテンツはサイレントに変化する可能性がある。
本研究では,300個の実画像上でのサービス時間整合性問題について検討し,Fast-dLLM出力と同一モデルの非加速出力を比較した。
- 参考スコア(独自算出の注目度): 8.219681202858172
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Training-free acceleration makes diffusion-based multimodal large language models (dMLLMs) more deployable, but it may silently change generated content. We study this serving-time consistency problem on 300 real images, comparing Fast-dLLM outputs with the same model's unaccelerated outputs. Across the mild parallelism induced in our long-form setting (1.05--1.25 committed tokens per step), confidence-threshold tuning changes decoding behavior but not baseline agreement. State-refresh ablations and an image-swap intervention instead identify stale visual and generated-text states as contributors to drift. For the tested Fast-dLLM implementation, shortening the KV-cache refresh interval yields a monotonic speed--agreement frontier and near-exact agreement at a measured 1.3x speedup. The initial diagnosis also appears with dLLM-Cache and LaViDa, although dLLM-Cache recovers agreement only after both caches are tightened, which removes its speed advantage. Independent prompts and images reproduce the threshold-insensitivity and refresh recovery. A targeted audit finds genuine content substitution in half of 50 low-agreement pairs. In a separate blinded two-annotator evaluation, the pooled accelerated-minus-baseline factual-error difference is 0.00 (95% CI [-0.17,+0.17]); this sample detects no difference but does not establish factual equivalence. Finally, none of the tested adaptive or smoothed-refresh variants beats the fixed interval at matched compute. Our contribution is a paired diagnostic and an implementation-scoped consistency control, not an accuracy or safety guarantee.
- Abstract(参考訳): トレーニング不要なアクセラレーションにより、拡散に基づくマルチモーダル大言語モデル(dMLLM)のデプロイが容易になるが、生成したコンテンツはサイレントに変化する可能性がある。
本研究では,300個の実画像上でのサービス時間整合性問題について検討し,Fast-dLLM出力と同一モデルの非加速出力を比較した。
長い形式の設定(1.05~1.25のコミットトークン)で引き起こされる軽度の並列性は、信頼を保ったチューニングはデコード動作を変えるが、ベースライン合意は変更しない。
ステート・リフレッシュの短縮とイメージ・スワップの介入は代わりに、古い視覚状態と生成されたテキスト状態がドリフトへのコントリビュータとして識別する。
試験されたFast-dLLM実装では、KV-cacheリフレッシュ間隔を短縮すると、測定された1.3倍のスピードアップでモノトニックなスピード-アグリメントフロンティアとほぼ正確に一致する。
初期診断は、dLLM-CacheとLaViDaでも見られるが、dLLM-Cacheは、両方のキャッシュが強化された後にのみ合意を回復する。
独立的なプロンプトとイメージは閾値不感度とリフレッシュリカバリを再現する。
対象監査は、50組のローアグリメントペアの半分で真のコンテンツ置換を見つける。
個別の盲目2アノテーション評価では、プール化されたアクセラレーション・ミナス・ベースラインの事実・エラー差は0.00(95% CI [-0.17,+0.17])である。
最後に、テストされたアダプティブまたはスムーズなリフレッシュ変種は、一致した計算で固定間隔を上回りません。
当社のコントリビューションは、ペア診断と実装スコープによる一貫性制御であり、正確性や安全性の保証ではありません。
関連論文リスト
- Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition [0.9297355862757838]
PRISM-AHはA/Hを時間とともに展開するマルチモーダルコンフリクトとして扱うフレームワークである。
知識誘導型大規模言語モデルは、データセットの専門的な分類法を用いて、構造化された証拠を理由づける。
525ビデオのラベル付き公開テストパーティションでは、PRISM-AHは0.2827のゼロショットベースラインと比較して0.6133のマクロF1を達成する。
論文 参考訳(メタデータ) (2026-07-28T16:44:38Z) - Accelerating Rectified Flow Models via Trajectory-Aware Caching [35.13071059415995]
我々は,スキップ・then-compensateパラダイムに従って,トレーニング不要なアクセラレーションフレームワークであるTACacheを提案する。
Trajectory-Aware Cacheは、テキスト・ツー・イメージ・ジェネレーションで最大4.14スピードアップ、テキスト・ツー・ビデオ・ジェネレーションで2.11スピードアップを達成する。
論文 参考訳(メタデータ) (2026-05-16T03:44:58Z) - Frequency-Aware Error-Bounded Caching for Accelerating Diffusion Transformers [11.772150619675527]
ディフュージョントランスフォーマー(DiT)は高品質な画像生成とビデオ生成の主要なアーキテクチャとして登場してきた。
既存のキャッシュ手法は、タイムステップ間で中間計算を再利用することで、DiTを加速するが、それらは共通の制限を共有している。
本稿では、時間認識動的スケジューリング(TADS)、累積誤差予算(CEB)、周波数分解キャッシング(FDC)からなる統合キャッシュフレームワークであるSpectralCacheを提案する。
論文 参考訳(メタデータ) (2026-03-05T15:58:06Z) - InvarDiff: Cross-Scale Invariance Caching for Accelerated Diffusion Models [2.6735992385049663]
InvarDiffは、時間ステップスケールと層スケールの相対時間的不変性を利用する、トレーニング不要な加速度法である。
実験によると、InvarDiffは標準品質の指標に最小限の影響を伴って、エンドツーエンドのスピードアップで2~3ドルを達成している。
論文 参考訳(メタデータ) (2025-11-29T02:34:23Z) - CDLM: Consistency Diffusion Language Models For Faster Sampling [54.886467592798]
拡散言語モデル(DLM)は有望な並列生成パラダイムを提供するが、推論が遅い。
本稿では,両方のボトルネックに同時に対処するトレーニングベースの加速度法CDLMを紹介する。
実験では、CDLMは3.6x-14.5倍のレイテンシを実現し、数学やコーディングタスクの競合精度を維持している。
論文 参考訳(メタデータ) (2025-11-24T16:21:25Z) - dParallel: Learnable Parallel Decoding for dLLMs [77.24184219948337]
拡散大言語モデル(dLLM)は並列トークン予測と低推論遅延を提供する。
既存のオープンソースモデルは、パフォーマンスを確保するためにトークン長のデコードステップをほとんど必要としています。
高速サンプリングのためにdLLMs固有の並列性を解き放つシンプルで効果的な方法であるdParallelを導入する。
論文 参考訳(メタデータ) (2025-09-30T16:32:52Z) - ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion [30.897215456167753]
拡散モデルは、本質的に反復的推論プロセスのため、かなりの計算オーバーヘッドに悩まされる。
我々は、両方のエラータイプを共同で修正する原則的なキャッシュフレームワークであるERTACacheを提案する。
ERTACacheは最大2倍の推論スピードアップを実現します。
論文 参考訳(メタデータ) (2025-08-27T10:37:24Z) - Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding [51.711605076319216]
拡散に基づく大規模言語モデル (Diffusion LLM) は、並列復号機能を持つ非自己回帰テキスト生成を約束している。
本稿では,双方向拡散モデルに適したブロック単位で近似したKVキャッシュ機構を提案する。
本稿では,信頼しきい値を超えるトークンを選択的に復号し,依存関係違反を軽減し,生成品質を維持できる信頼度対応並列復号方式を提案する。
論文 参考訳(メタデータ) (2025-05-28T17:39:15Z) - dKV-Cache: The Cache for Diffusion Language Models [53.85291644298835]
Diffusion Language Models (DLMs) は自己回帰型言語モデルにとって有望な競合と見なされている。
本稿では,DLMの復調過程に対するKVキャッシュ機構,遅延KVキャッシュを提案する。
我々のアプローチは、異なるトークンが拡散過程を通して異なる表現力学を持つという観察によって動機付けられている。
論文 参考訳(メタデータ) (2025-05-21T17:32:10Z) - Few-Step Diffusion via Score identity Distillation [67.07985339442703]
拡散蒸留は, テキスト・ツー・イメージ(T2I)拡散モデルを促進するための有望な戦略として浮上している。
既存の方法は、高分解能T2I拡散モデルを蒸留する際に、実像や教師合成画像に頼っている。
教師のCFGを無効にし、偽スコアネットワークでテキストコンディショニングを除去するZero-CFGと、偽スコアネットワークで否定的なCFGを適用するAnti-CFGの2つの新しいガイダンス戦略を提案する。
論文 参考訳(メタデータ) (2025-05-19T03:45:16Z) - Boosting Continuous Sign Language Recognition via Cross Modality
Augmentation [135.30357113518127]
連続手話認識は不整合のビデオテキストペアを扱う。
クロスモーダル拡張を用いた新しいアーキテクチャを提案する。
提案するフレームワークは、既存のCTCベースの連続SLRアーキテクチャに容易に拡張できる。
論文 参考訳(メタデータ) (2020-10-11T15:07:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。