論文の概要: SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models
- arxiv url: http://arxiv.org/abs/2606.23041v1
- Date: Mon, 22 Jun 2026 08:48:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 00:36:16.444049
- Title: SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models
- Title(参考訳): SPAR: 統一マルチモーダルモデルのためのセマンティック・ピクセルの自己アライメントと適応ルーティング
- Authors: Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen,
- Abstract要約: 我々はtextbfSemantic-textbfPixel の自己アライメントと textbfRouting (textbfSPAR) を備えた新しい統合マルチモーダルフレームワークを提案する。
画素レベルの再構成とセマンティック認識を一致させるため,非対称な二重ストリーム統一トークン化器を導入する。軽量なセマンティックストリームは識別的特徴をアンカーし,トランスフォーマー拡張されたピクセルストリームは細粒度の視覚的詳細をコンパクトな潜在空間に復元する。
- 参考スコア(独自算出の注目度): 31.77829987533264
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) have achieved remarkable success in visual understanding but remain constrained in visual generation due to the fundamental feature discrepancy between semantic perception and pixel-level reconstruction. Bridging this gap requires overcoming two core challenges: endowing semantic encoders with high-fidelity reconstruction capabilities, and effectively aligning generative models with semantic spaces without relying on external teachers. To this end, we propose a novel unified multimodal framework featuring \textbf{S}emantic-\textbf{P}ixel self-alignment and \textbf{A}daptive \textbf{R}outing (\textbf{SPAR}). First, to reconcile semantic perception with pixel-level reconstruction, we introduce an asymmetric dual-stream unified tokenizer. A lightweight semantic stream anchors discriminative features, while a Transformer-augmented pixel stream recovers fine-grained visual details into a unified compact latent space. Second, to eliminate external dependencies, we propose a self-aligned generation paradigm that natively leverages this optimized tokenizer as an internal alignment teacher for the diffusion model. Furthermore, to facilitate flexible multimodal interaction within this unified space, we introduce Dynamic Token Routing, which enables each token to adaptively aggregate multi-layer MLLM features based on its distinct semantic demands. Extensive experiments demonstrate that SPAR establishes the state-of-the-art for unified architectures, achieving exceptional generation and reconstruction quality while preserving foundational visual understanding capabilities.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、視覚的理解において顕著な成功を収めてきたが、意味認識と画素レベルの再構成の基本的な特徴の相違により、視覚生成において制約を受け続けている。
このギャップを埋めるには、セマンティックエンコーダに高忠実度再構成能力を与えることと、外部教師に頼らずに生成モデルとセマンティック空間を効果的に整合させることの2つの主要な課題を克服する必要がある。
そこで本研究では, \textbf{S}emantic-\textbf{P}ixel self-alignment と \textbf{A}daptive \textbf{R}outing (\textbf{SPAR})を特徴とする新しい統一型マルチモーダルフレームワークを提案する。
まず、意味認識と画素レベルの再構成を照合するために、非対称な二重ストリーム統一トークン化器を導入する。
軽量なセマンティックストリームは識別機能をアンカーし、Transformerの拡張されたピクセルストリームはきめ細かい視覚的詳細を統一されたコンパクトな潜在空間に復元する。
第二に、外部依存をなくすために、この最適化されたトークン化器を拡散モデルの内部アライメント教師としてネイティブに活用する自己整合生成パラダイムを提案する。
さらに,この統合空間内でのフレキシブルなマルチモーダルインタラクションを容易にするために,動的トークンルーティングを導入し,各トークンが,その異なるセマンティック要求に基づいて,多層MLLM特徴を適応的に集約することを可能にする。
大規模な実験は、SPARが統一アーキテクチャの最先端を確立し、基礎的な視覚的理解能力を維持しながら、例外的な生成と再構築品質を達成することを実証している。
関連論文リスト
- Semantic Generative Tuning for Unified Multimodal Models [62.18894352635965]
統一マルチモーダルモデル(UMM)は、単一のアーキテクチャ内で視覚的理解と視覚的生成を統合する。
訓練パラダイムは 独立して テキスト信号を通して 理解を最適化する 密集したピクセルの目的を通して 生成する
本研究は,UMMの分離を橋渡しするための生成プロキシとして階層的視覚タスクを定式化する,生成後学習に関する最初の体系的な研究である。
論文 参考訳(メタデータ) (2026-05-18T17:46:46Z) - FF3R: Feedforward Feature 3D Reconstruction from Unconstrained views [34.14517479047999]
本稿では,制約のないマルチビュー画像シーケンスから幾何学的および意味論的推論を統一する,完全なアノテーションのないフィードフォワードフレームワークであるFF3Rを紹介する。
従来の方法とは異なり、FF3Rはカメラのポーズや深度マップ、セマンティックラベルを必要としない。
i) 意味的文脈で意味的文脈で幾何学的トークンを豊かにするToken-wise Fusion Moduleと(ii) 局所コヒーレンスのための意味的認識ボクセル化とグローバル一貫性のための幾何学的特徴ワープを組み合わせたセマンティック・ジオメトリ相互ブースティング機構である。
論文 参考訳(メタデータ) (2026-04-10T19:45:24Z) - PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation [58.1914505657064]
本稿では,クラスレベルのセマンティクスと空間コンテキスト間の知識干渉の課題を軽減するために,単純な並列コストアグリゲーション(PCA-Seg)パラダイムを提案する。
8つのベンチマークの実験では、PCA-Segの各並列ブロックは0.35万のパラメータしか追加せず、最先端のOSPS性能を実現している。
論文 参考訳(メタデータ) (2026-03-18T09:26:43Z) - Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models [84.78794648147608]
永続的な幾何学的異常であるモダリティギャップが残っている。
このギャップを埋める以前のアプローチは、過度に単純化された等方的仮定によってほとんど制限されている。
固定フレームモダリティギャップ理論(英語版)を提案し、モダリティギャップを安定バイアスと異方性残差に分解する。
次に、トレーニング不要なモダリティアライメント戦略であるReAlignを紹介します。
論文 参考訳(メタデータ) (2026-02-02T13:59:39Z) - Learning Sparse Visual Representations via Spatial-Semantic Factorization [37.169502692169196]
自己教師付き学習(SSL)は、意味理解と画像再構成の根本的な対立に直面している。
本稿では,視覚的特徴を意味概念とその空間分布の低ランクな製品に分解するフレームワークSTELLARを紹介する。
この分解された形の下で16個のスパーストークンが同時に高品質な再構成(2.60 FID)をサポートし、高密度バックボーンのセマンティック性能(79.10% ImageNet精度)に適合することを示す。
論文 参考訳(メタデータ) (2026-02-02T10:12:17Z) - Both Semantics and Reconstruction Matter: Making Representation Encoders Ready for Text-to-Image Generation and Editing [62.94394079771687]
急成長する傾向は、表現エンコーダの高次元特徴を生成的潜伏剤として採用することである。
生成タスクに理解指向のエンコーダ機能を適用するための体系的フレームワークを提案する。
提案手法は,テキスト・トゥ・イメージ(T2I)と画像編集タスクにおいて,最先端の再構築,収束の高速化,大幅な性能向上を実現する。
論文 参考訳(メタデータ) (2025-12-19T18:59:57Z) - Growing Visual Generative Capacity for Pre-Trained MLLMs [60.826355079902505]
Bridgeは純粋な自己回帰統合MLLMであり、学習済みの視覚的理解モデルを生成能力で強化する。
本稿では,コンパクトなセマンティックトークンと微細なピクセルトークンを統合するセマンティック・ツー・ピクセルの離散表現を提案する。
論文 参考訳(メタデータ) (2025-10-02T00:40:02Z) - UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception [54.53657134205492]
UniAlignmentは単一の拡散変換器内での統一されたマルチモーダル生成フレームワークである。
固有モード意味アライメントとクロスモーダル意味アライメントの両方を組み込むことで、モデルのクロスモーダル一貫性と命令追従ロバスト性を高める。
本稿では、複雑なテキスト命令下でのマルチモーダルなセマンティック一貫性を評価するために設計された新しいベンチマークであるSemGen-Benchを紹介する。
論文 参考訳(メタデータ) (2025-09-28T09:11:30Z) - Cross Paradigm Representation and Alignment Transformer for Image Deraining [40.66823807648992]
クロスパラダイム表現・アライメント変換器(CPRAformer)を提案する。
その中心となる考え方は階層的な表現とアライメントであり、両方のパラダイムの強みを活用して画像再構成を支援する。
トランスフォーマーブロックでは,スパースプロンプトチャネル自己アテンション(SPC-SA)と空間画素改善自己アテンション(SPR-SA)の2種類の自己アテンションを使用する。
論文 参考訳(メタデータ) (2025-04-23T06:44:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。