論文の概要: Next-Dense-Stride Prediction for Multimodal Autoregressive Visual Modeling
- arxiv url: http://arxiv.org/abs/2607.09892v1
- Date: Fri, 10 Jul 2026 18:32:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.240182
- Title: Next-Dense-Stride Prediction for Multimodal Autoregressive Visual Modeling
- Title(参考訳): マルチモーダル自己回帰型ビジュアルモデリングのための次密度傾き予測
- Authors: Chicago Y. Park, Jialin Mao, Xiaojian Xu, Taha Kass-Hout, Ulugbek S. Kamilov, Cao Xiao,
- Abstract要約: DenseARは, 自己回帰画像生成を粗いnddense-stride予測として再構成する新しい生成パラダイムである。
我々の重要な洞察は、一スケールの潜水格子を徐々に密度を増し、自然に世界構造から細部への遷移を捉えているということである。
- 参考スコア(独自算出の注目度): 22.020464703520148
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce DenseAR, a new generative paradigm that reformulates autoregressive image generation as coarse-to-fine next-dense-stride prediction using a compact single-scale tokenizer. Our key insight is that traversing a single-scale latent grid with progressively denser strides naturally captures the transition from global structure to fine detail. This addresses two limitations of existing autoregressive models at once: the slow inference of raster-order autoregression, which DenseAR avoids by predicting multiple tokens in parallel, and the heavy cost of multi-scale approaches, which need long, multi-resolution token sequences to achieve coarse-to-fine prediction. Building on our efficient framework and the flexibility of autoregressive modeling, we further extend DenseAR to a unified model that handles multiple modalities and imaging tasks within a single backbone. We validate DenseAR on both medical and natural images. On multi-contrast brain MRI, a single DenseAR model unifies cross-modal translation, modality-conditioned generation, and tumor segmentation, while remaining competitive with task-specific methods. On ImageNet, DenseAR improves class-conditional generation quality (FID and IS) over both a single-grid baseline without stride ordering and a multi-scale tokenizer-based baseline.
- Abstract(参考訳): DenseARは,コンパクトな単一スケールトークン化器を用いて,自己回帰画像生成を粗大なnd-Dense-stride予測として再構成する新しい生成パラダイムである。
我々の重要な洞察は、一スケールの潜水格子を徐々に密度を増し、自然に世界構造から細部への遷移を捉えているということである。
これは、DenseARが並列に複数のトークンを予測することで回避するラスターオーダーの自動回帰の遅い推論と、粗大な予測を達成するために長いマルチレゾリューショントークンシーケンスを必要とするマルチスケールアプローチの重いコストという、既存の自己回帰モデルの2つの制限に対処する。
効率的なフレームワークと自己回帰モデリングの柔軟性に基づいて、DenseARを複数のモダリティやイメージタスクを単一のバックボーン内で処理する統一モデルに拡張する。
医用画像と自然画像の両方でDenseARを検証する。
マルチコントラスト脳MRIでは、単一のDenseARモデルがクロスモーダル翻訳、モダリティ条件付き生成、腫瘍セグメンテーションを統一する一方で、タスク固有の手法と競合する。
ImageNetでは、DenseARはストライド順序のない単一グリッドベースラインとマルチスケールトークンライザベースラインの両方で、クラス条件生成品質(FIDとIS)を改善している。
関連論文リスト
- Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification [80.62512020268626]
UniARは統合された自己回帰フレームワークであり、単一のビジュアルトークン化器が理解と生成の鍵となる。
UniARは、マルチレベル特徴融合とルックアップフリービットワイド量子化スキームを備えた事前訓練されたビジョンエンコーダを適応する。
拡散に基づく視覚デコーダは、離散的な視覚トークンで高忠実度画像をデコードする。
論文 参考訳(メタデータ) (2026-06-16T17:59:22Z) - ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation [64.84095852784714]
Residual Tokenizer (ResTok)は、画像トークンと潜在トークンの両方の階層的残基を構築する1Dビジュアルトークンライザである。
視覚的トークン化における階層的残差の復元はAR画像生成を著しく改善し,ImageNet-256ではわずか9ステップで2.34gFIDを達成した。
論文 参考訳(メタデータ) (2026-01-07T14:09:18Z) - OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation [91.45421429922506]
OneCATは、理解、生成、編集をシームレスに統合する統合マルチモーダルモデルである。
我々のフレームワークは、推論中に視覚変換器(ViT)や視覚トークン化器などの外部コンポーネントを不要にする。
論文 参考訳(メタデータ) (2025-09-03T17:29:50Z) - CycleVAR: Repurposing Autoregressive Model for Unsupervised One-Step Image Translation [9.628074306577851]
現在の条件付き自己回帰画像生成手法は有望な結果を示しているが、実際の教師なし画像翻訳領域では、その可能性はほとんど解明されていない。
臨界制限は、伝統的なベクトル量子化に基づくフレームワークに固有の離散量子化に由来する。
我々は,連続確率混合プロセスとしてコードブックの選択を再構成する新しい手法であるSoftmax Relaxed Quantizationを提案する。
論文 参考訳(メタデータ) (2025-06-29T17:43:04Z) - Frequency Autoregressive Image Generation with Continuous Tokens [31.833852108014312]
本稿では、周波数プログレッシブ自己回帰(textbfFAR)パラダイムを導入し、連続トークン化器を用いてFARをインスタンス化する。
我々は、ImageNetデータセットの総合的な実験を通して、FARの有効性を実証する。
論文 参考訳(メタデータ) (2025-03-07T10:34:04Z) - FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching [34.112157859384645]
本稿では,合理化スケール設計を特徴とする次世代のスケール予測手法であるFlowARを紹介する。
これにより、VARの複雑なマルチスケール残留トークン化器が不要になる。
課題であるImageNet-256ベンチマークにおけるFlowARの有効性を検証する。
論文 参考訳(メタデータ) (2024-12-19T18:59:31Z) - MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling [64.09238330331195]
本稿では,MMAR(Multi-Modal Auto-Regressive)確率モデルフレームワークを提案する。
離散化の手法とは異なり、MMARは情報損失を効率的に回避するために、連続的に評価された画像トークンを取り入れている。
また,数値安定性問題に対処する理論的に実証された手法と,タスク目標の生成と理解のバランスをとるトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2024-10-14T17:57:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。