論文の概要: Enhancing Alignment for Unified Multimodal Models via Semantically-Grounded Supervision
- arxiv url: http://arxiv.org/abs/2603.19807v1
- Date: Fri, 20 Mar 2026 09:45:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:39.092963
- Title: Enhancing Alignment for Unified Multimodal Models via Semantically-Grounded Supervision
- Title(参考訳): セマンティック・グラウンドド・スーパービジョンによる統一マルチモーダルモデルのアライメント向上
- Authors: Jiyeong Kim, Yerim So, Hyesong Choi, Uiwon Hwang, Dongbo Min,
- Abstract要約: Unified Multimodal Models (UMM) は、統一モデリングフレームワークにマルチモーダル理解と生成を統合する有望なパラダイムとして登場した。
提案するSemantically-Grounded Supervision(SeGroS)は,UMMにおけるミスマッチと監督冗長性を解決するための微調整フレームワークである。
- 参考スコア(独自算出の注目度): 22.12941574057318
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unified Multimodal Models (UMMs) have emerged as a promising paradigm that integrates multimodal understanding and generation within a unified modeling framework. However, current generative training paradigms suffer from inherent limitations. We present Semantically-Grounded Supervision (SeGroS), a fine-tuning framework designed to resolve the granularity mismatch and supervisory redundancy in UMMs. At its core, we propose a novel visual grounding map to construct two complementary supervision signals. First, we formulate semantic Visual Hints to compensate for the sparsity of text prompts. Second, we generate a semantically-grounded Corrupted Input to explicitly enhance the supervision of masking-based UMMs by restricting the reconstruction loss to core text-aligned regions. Extensive evaluations on GenEval, DPGBench, and CompBench demonstrate that SeGroS significantly improves generation fidelity and cross-modal alignment across various UMM architectures.
- Abstract(参考訳): Unified Multimodal Models (UMM) は、統一モデリングフレームワークにマルチモーダル理解と生成を統合する有望なパラダイムとして登場した。
しかし、現在の生成的トレーニングパラダイムは固有の制限に悩まされている。
本稿では,UMMにおける粒度ミスマッチと監督冗長性を解決するための微調整フレームワークSeGroSを提案する。
そこで本研究では,2つの補完的な監視信号を構成する視覚的接地マップを提案する。
まず、テキストプロンプトの間隔を補うために、意味論的視覚ヒントを定式化する。
第2に,基本テキスト整列領域への再構成損失を抑えることで,マスキングに基づくUMMの監督を明確化するために,意味的に接地されたCorrupted Inputを生成する。
GenEval, DPGBench, CompBench の広範囲な評価により, SeGroS は様々な UMM アーキテクチャにおける生成忠実度と相互モーダルアライメントを大幅に改善することが示された。
関連論文リスト
- UniG2U-Bench: Do Unified Models Advance Multimodal Understanding? [50.92401586025528]
統一マルチモーダルモデルは、最近強力な生成能力を示したが、生成が理解を改善したかどうかはまだ不明である。
提案するUniG2U-Benchは,G2U(Generation-to-understanding)評価を7つのシステマと30のサブタスクに分類する総合ベンチマークである。
論文 参考訳(メタデータ) (2026-03-03T18:36:16Z) - Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation [53.18286807225952]
統一マルチモーダルモデル(UMM)は、視覚的理解と生成の両方を単一のフレームワークに統合する。
単純なアーキテクチャに依存しないポストトレーニング手法であるUniMRG(Unified Multi-Representation Generation)を提案する。
提案手法は, 微粒化知覚を高め, 幻覚を低減し, 空間的理解を向上し, 同時に生成能力を向上する。
論文 参考訳(メタデータ) (2026-01-29T08:42:25Z) - SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models [44.79249920949795]
Unified Multimodal Models (UMM) は、視覚言語の生成と理解機能を単一のフレームワークに統合する。
モデルはユーザの指示に基づいてイメージを正しく理解するが、テキストプロンプトから忠実なイメージを生成することはできない。
SRUMは,様々な設計の既存のUMMに直接適用可能な,自己回帰型ポストトレーニングフレームワークである。
論文 参考訳(メタデータ) (2025-10-14T17:56:11Z) - UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception [54.53657134205492]
UniAlignmentは単一の拡散変換器内での統一されたマルチモーダル生成フレームワークである。
固有モード意味アライメントとクロスモーダル意味アライメントの両方を組み込むことで、モデルのクロスモーダル一貫性と命令追従ロバスト性を高める。
本稿では、複雑なテキスト命令下でのマルチモーダルなセマンティック一貫性を評価するために設計された新しいベンチマークであるSemGen-Benchを紹介する。
論文 参考訳(メタデータ) (2025-09-28T09:11:30Z) - MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces [23.447713697204225]
MAGEは、革新的なアライメント機構を通じて視覚とテキストの意味空間をブリッジする新しいフレームワークである。
我々は、クロスエントロピーと平均二乗誤差を組み合わせたトレーニング戦略を採用し、アライメント効果を著しく向上させる。
提案するマルチモーダル大規模モデルアーキテクチャであるMAGEは,様々な評価ベンチマークにおける類似の手法と比較して,性能が大幅に向上した。
論文 参考訳(メタデータ) (2025-07-29T12:17:46Z) - SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards [55.99492656542475]
textbfSDER (textbfSelf-improving textbfUnified LMMs with textbfDual stextbfElf-textbfRewards) を提案する。
論文 参考訳(メタデータ) (2025-06-09T17:38:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。