論文の概要: Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering
- arxiv url: http://arxiv.org/abs/2607.26411v1
- Date: Wed, 29 Jul 2026 02:46:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.527302
- Title: Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering
- Title(参考訳): 統一型マルチモーダルモデルは一つの空間で考えるか? クロスブランチステアリングによるレンズ
- Authors: Yu Wang, Sharon Li,
- Abstract要約: 一方の枝から意味的方向を抽出し,他方の枝に応用する介入型フレームワークであるEmphcross-branchセマンティックステアリングを導入する。
理解分岐から学習したステアリングベクトルが生成に遷移し、制御可能な画像合成を可能にし、意味的忠実性を向上させることができることを示す。
この結果から,アーキテクチャ統合は意味的アライメントを保証せず,マルチモーダル表現を探索するための実用的なツールとしてクロスブランチステアリングを確立することが判明した。
- 参考スコア(独自算出の注目度): 7.62772056485722
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Unified multimodal models (UMMs) aim to integrate understanding and generation within a single architecture, yet it remains unclear whether these capabilities share a unified and transferable semantic space. This question is fundamentally challenging, as the two branches operate over heterogeneous representations (text tokens vs.\ visual latents) and distinct training objectives, making direct comparison difficult. To address this, we introduce \emph{cross-branch semantic steering}, an intervention-based framework that extracts semantic directions from one branch and applies them to the other. We show that steering vectors learned from the understanding branch can transfer to generation, enabling controllable image synthesis and improved semantic faithfulness. In contrast, the reverse direction consistently shows limited effectiveness. Our analysis suggests that this asymmetry may be related to a practical representational mismatch: understanding-derived vectors capture transferable, object-centric semantics, while generation-derived vectors primarily encode low-level appearance features. Our results reveal that architectural unification does not guarantee semantic alignment, and establish cross-branch steering as a practical tool for probing multimodal representations.
- Abstract(参考訳): 統一マルチモーダルモデル(UMM)は、単一のアーキテクチャ内で理解と生成を統合することを目的としている。
この問題は、2つのブランチが異種表現(テキストトークン vs. テキストトークン)上で動作するため、基本的に難しい。
視覚的潜伏者)と異なる訓練目標があり、直接比較が難しい。
これを解決するために,あるブランチから意味的方向を抽出し,他方に適用する介入ベースのフレームワークである \emph{cross-branch semantic steering} を紹介した。
理解分岐から学習したステアリングベクトルが生成に遷移し、制御可能な画像合成を可能にし、意味的忠実性を向上させることができることを示す。
対照的に、逆方向は一貫して有効性を示す。
この非対称性は現実的な表現ミスマッチに関係している可能性が示唆されている: 理解由来ベクトルは伝達可能なオブジェクト中心のセマンティクスをキャプチャし、生成由来ベクトルは主として低レベルな外観特徴を符号化する。
この結果から,アーキテクチャ統合は意味的アライメントを保証せず,マルチモーダル表現を探索するための実用的なツールとしてクロスブランチステアリングを確立することが判明した。
関連論文リスト
- SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models [31.77829987533264]
我々はtextbfSemantic-textbfPixel の自己アライメントと textbfRouting (textbfSPAR) を備えた新しい統合マルチモーダルフレームワークを提案する。
画素レベルの再構成とセマンティック認識を一致させるため,非対称な二重ストリーム統一トークン化器を導入する。軽量なセマンティックストリームは識別的特徴をアンカーし,トランスフォーマー拡張されたピクセルストリームは細粒度の視覚的詳細をコンパクトな潜在空間に復元する。
論文 参考訳(メタデータ) (2026-06-22T08:48:19Z) - Improving Relative Representations with Learned Anchors and Whitened Inner Products [0.0]
独立に訓練されたニューラルモデルは一般に非互換な潜在表現に収束する。
相対表現(RR)は、絶対座標を共通アンカー点と類似性によって定義される共有空間にマッピングすることでこの問題に対処する。
従来の実装はランダムにサンプリングされたアンカーとコサインの類似性に依存している。
本稿では,2つの改良点に基づくクロスモデル通信のためのロバストなフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-28T21:43:53Z) - Semantic Generative Tuning for Unified Multimodal Models [62.18894352635965]
統一マルチモーダルモデル(UMM)は、単一のアーキテクチャ内で視覚的理解と視覚的生成を統合する。
訓練パラダイムは 独立して テキスト信号を通して 理解を最適化する 密集したピクセルの目的を通して 生成する
本研究は,UMMの分離を橋渡しするための生成プロキシとして階層的視覚タスクを定式化する,生成後学習に関する最初の体系的な研究である。
論文 参考訳(メタデータ) (2026-05-18T17:46:46Z) - UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception [54.53657134205492]
UniAlignmentは単一の拡散変換器内での統一されたマルチモーダル生成フレームワークである。
固有モード意味アライメントとクロスモーダル意味アライメントの両方を組み込むことで、モデルのクロスモーダル一貫性と命令追従ロバスト性を高める。
本稿では、複雑なテキスト命令下でのマルチモーダルなセマンティック一貫性を評価するために設計された新しいベンチマークであるSemGen-Benchを紹介する。
論文 参考訳(メタデータ) (2025-09-28T09:11:30Z) - SemFlow: Binding Semantic Segmentation and Image Synthesis via Rectified Flow [94.90853153808987]
セマンティックセグメンテーション(Semantic segmentation)とセマンティックイメージ合成(Semantic image synthesis)は、視覚知覚と生成において代表的なタスクである。
我々は、統一されたフレームワーク(SemFlow)を提案し、それらを2つの逆問題としてモデル化する。
実験の結果,セマンティックセグメンテーションとセマンティック画像合成タスクにおいて,セマンティックセグメンテーションと競合する結果が得られた。
論文 参考訳(メタデータ) (2024-05-30T17:34:40Z) - Latent Space Translation via Semantic Alignment [29.2401314068038]
我々は、異なるニューラルモジュールから学んだ表現が、異なる事前学習されたネットワーク間でどのように変換されるかを示す。
提案手法は, 与えられた2つの潜在空間間の変換を直接推定することにより, 付加的な訓練を伴わずに, エンコーダとデコーダを効果的に縫合できる。
特に、ゼロショットテクストテキストエンコーダやビジョンデコーダ、あるいはリバーサがいかに可能かを示し、このマルチモーダル環境で驚くほど優れた分類性能が得られることを示す。
論文 参考訳(メタデータ) (2023-11-01T17:12:00Z) - Making LLaMA SEE and Draw with SEED Tokenizer [69.1083058794092]
大規模言語モデルにSEEとDrawの能力を持たせるための精巧な画像トークンであるSEEDを紹介します。
SEEDトークンを使うことで、LLMはオリジナルのトレーニングレシピの下でスケーラブルなマルチモーダルオートレグレスを実行することができる。
SEED-LLaMAはマルチターン・イン・コンテクスト・マルチモーダル生成のような合成創発的能力を示す。
論文 参考訳(メタデータ) (2023-10-02T14:03:02Z) - Image-to-image Mapping with Many Domains by Sparse Attribute Transfer [71.28847881318013]
教師なし画像と画像の変換は、2つの領域間の一対のマッピングを、ポイント間の既知のペアワイズ対応なしで学習することで構成される。
現在の慣例は、サイクル一貫性のあるGANでこのタスクにアプローチすることです。
そこで本研究では,ジェネレータを直接,潜在層における単純なスパース変換に制限する代替手法を提案する。
論文 参考訳(メタデータ) (2020-06-23T19:52:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。