論文の概要: Transferability Between Understanding and Generation in Unified Multimodal Models
- arxiv url: http://arxiv.org/abs/2607.04423v2
- Date: Tue, 07 Jul 2026 07:27:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 14:37:43.255558
- Title: Transferability Between Understanding and Generation in Unified Multimodal Models
- Title(参考訳): 統一マルチモーダルモデルにおける理解と生成の伝達可能性
- Authors: Jiwon Kang, Heeji Yoon, Jaewoo Jung, Jaewon Min, Minkyeong Jeon, Biyeon Hwang, Sangwon Jung, Seungryong Kim,
- Abstract要約: Unified Multimodal Models (UMM) は、画像の理解と生成を単一のアーキテクチャに統合する。
我々は,一方のタスクにおける能力の訓練が他方のタスクにおける能力を改善するかどうかを,明示的な監督なしに検討する。
- 参考スコア(独自算出の注目度): 35.84666508890256
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Unified Multimodal Models (UMMs) integrate image understanding and generation within a single architecture, yet how the two tasks interact remains understudied. We investigate $\boldsymbol{\mathsf{transferability}}$ in UMMs: whether training a capability on one task improves the same capability on the other without explicit supervision. Through controlled experiments, we empirically find that transferability depends on architecture-models with fully shared transformer backbone and a unified visual encoder exhibit consistent cross-task transfer, while loosely coupled designs show little or none. Leveraging this transferability, we propose a practical training strategy. The most straightforward way to improve a target generative capability (e.g., counting) is to fine-tune generation directly, but this can degrade visual quality due to distribution shift. Instead, we train the corresponding understanding task and let it transfer into generation, which improves capability-specific generative performance while minimizing distribution shift. We validate this across three capabilities-counting, spatial relation, and text recognition/generation-showing that cross-task transferability can be systematically exploited in UMMs.
- Abstract(参考訳): 統一マルチモーダルモデル(UMM)は、イメージ理解と生成を単一のアーキテクチャに統合するが、2つのタスクがどのように相互作用するかはまだ検討されていない。
UMMにおける$\boldsymbol{\mathsf{transferability}}$について検討する。
制御された実験により、トランスファビリティは、完全に共有されたトランスフォーマーバックボーンと一貫した視覚エンコーダを持つアーキテクチャモデルに依存し、疎結合な設計はほとんどあるいは全く示さないことがわかった。
この伝達性を活用して,実践的なトレーニング戦略を提案する。
ターゲット生成能力を改善する最も簡単な方法(例:カウント)は、微調整生成を直接行うことだが、これは分布シフトによって視覚的品質を低下させる可能性がある。
代わりに、対応する理解タスクをトレーニングし、それを生成に移行させ、分散シフトを最小限に抑えながら、機能固有の生成性能を向上させる。
我々はこれを、3つの機能計数、空間関係、およびテキスト認識/生成にまたがって検証し、マルチタスクトランスファービリティをUMMで体系的に活用できることを示す。
関連論文リスト
- OneRank: Unified Transformer-Native Ranking Architecture for Multi-Task Recommendation [28.67407481470947]
マルチタスク学習は,多様なユーザフィードバックの相補的な学習を可能にするために,レコメンデーションシステムにおいて不可欠である。
OneRankはトランスフォーマー中心のマルチタスクランキングフレームワークで、エンコーダと予測的分離を排除する。
OneRankは、大規模産業データセットのオフラインおよびオンライン実験において、最先端のベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2026-06-15T15:16:17Z) - Steering Visual Generation in Unified Multimodal Models with Understanding Supervision [42.765106450407814]
統一マルチモーダルモデルは、理解と生成のギャップを埋めるために考えられている。
本稿では, 個別のタスクとしてだけでなく, 生成表現を制御するための直接監督信号として, より軽量なフレームワークである「理解指向ポストトレーニング(UNO)」を提案する。
論文 参考訳(メタデータ) (2026-05-07T07:20:04Z) - UV-M3TL: A Unified and Versatile Multimodal Multi-Task Learning Framework for Assistive Driving Perception [71.19234323863314]
運転者の行動、運転者の感情、車両の行動、交通状況を同時に認識する枠組みを提案する。
本フレームワークは,デュアルブランチ空間チャネルのマルチモーダル埋め込みと適応的特徴分離型マルチタスク損失の2つのコアコンポーネントを組み込んでいる。
提案手法をAIDEデータセット上で評価し,UV-M3TLが4つのタスクすべてにおいて最先端の性能を達成することを示す実験結果を得た。
論文 参考訳(メタデータ) (2026-02-02T03:35:24Z) - SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards [55.99492656542475]
textbfSDER (textbfSelf-improving textbfUnified LMMs with textbfDual stextbfElf-textbfRewards) を提案する。
論文 参考訳(メタデータ) (2025-06-09T17:38:45Z) - Transforming Vision Transformer: Towards Efficient Multi-Task Asynchronous Learning [59.001091197106085]
Vision TransformerのためのMulti-Task Learning (MTL)は、複数のタスクを同時に処理することでモデル能力を向上させることを目的としている。
最近の研究は、Mixture-of-Experts(MoE)構造の設計とローランド適応(LoRA)によるマルチタスク学習の効率化に重点を置いている。
本稿では,事前学習した視覚変換器を効率的なマルチタスク学習器に変換することで,EMTAL(Efficient Multi-Task Learning)と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2025-01-12T17:41:23Z) - Exploring the Transferability of Visual Prompting for Multimodal Large Language Models [47.162575147632396]
Transferable Visual Prompting (TVP) は、異なるモデルに転送可能な視覚的プロンプトを生成するためのシンプルで効果的なアプローチである。
本稿では,既存の視覚的プロンプト手法のクロスモデル特徴劣化問題に対処し,学習したプロンプトの伝達可能性を高めるための2つの戦略を提案する。
論文 参考訳(メタデータ) (2024-04-17T09:39:07Z) - An Efficient General-Purpose Modular Vision Model via Multi-Task
Heterogeneous Training [79.78201886156513]
本稿では、複数の視覚タスクを実行でき、他の下流タスクに効率的に適応できるモデルを提案する。
提案手法は,単一タスク状態モデルに匹敵する結果を達成し,下流タスクの強力な一般化を実証する。
論文 参考訳(メタデータ) (2023-06-29T17:59:57Z) - InvPT++: Inverted Pyramid Multi-Task Transformer for Visual Scene
Understanding [11.608682595506354]
マルチタスクシーン理解は、複数のシーン理解タスクを1つの多目的モデルで同時に予測できるモデルを設計することを目的としている。
従来の研究は通常、より局所的な方法でマルチタスクの特徴を処理するため、空間的にグローバルな相互作用とクロスタスクの相互作用を効果的に学習することはできない。
異なるタスクの空間的特徴間の相互タスク相互作用をグローバルな文脈でモデル化できる逆ピラミッドマルチタスク変換器を提案する。
論文 参考訳(メタデータ) (2023-06-08T00:28:22Z) - Effective Adaptation in Multi-Task Co-Training for Unified Autonomous
Driving [103.745551954983]
本稿では,3つの下流タスクにおけるMoCoやSimCLRなど,多種多様な自己監督手法の転送性能について検討する。
彼らのパフォーマンスは、サブ最適か、あるいはシングルタスクベースラインよりもはるかに遅れていることに気付きました。
汎用マルチタスクトレーニングのための,単純かつ効果的な事前訓練-適応-ファインチューンパラダイムを提案する。
論文 参考訳(メタデータ) (2022-09-19T12:15:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。