論文の概要: When Does Visual Generation Help Visual Understanding in Unified Multimodal Models?
- arxiv url: http://arxiv.org/abs/2608.22174v2
- Date: Tue, 25 Aug 2026 04:03:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.041613
- Title: When Does Visual Generation Help Visual Understanding in Unified Multimodal Models?
- Title(参考訳): 視覚生成は統合マルチモーダルモデルにおける視覚的理解に役立つか?
- Authors: Yubo Zhu, Zhehan Kan, Jingyi Yang, Miaolin Chen, Jinbo Xing, Kai Zhu, Zijian Wang, Sheng Zhong, Wei Tong,
- Abstract要約: 本稿では,視覚生成支援理解のためのきめ細かい評価フレームワークであるVGAU-Diagを紹介する。
生成した視覚支援がインスタンスの簡易化に役立ちながら、推論の複雑さが増大するにつれて信頼性が低下することを示す。
また、効果的な視覚生成は、より多くの推論ステップを追加するのではなく、視覚的理解のボトルネックを目標とすべきであることを示す。
- 参考スコア(独自算出の注目度): 16.175191237910916
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unified multimodal models (UMMs) can perform both understanding and generation, raising a central question: can visual generation improve understanding? Existing evaluations provide mixed evidence, but confound task difficulty, reasoning paradigms, and the closed-loop interaction between generation and understanding. We introduce VGAU-Diag, a fine-grained evaluation framework for vision generation-assisted understanding. It stratifies samples by difficulty, enables unified evaluation of multiple reasoning paradigms, and uses Oracle-Assisted Reference Protocols. Our analysis shows that generated visual aids help on easier instances but become unreliable as reasoning complexity increases. Oracle-assisted diagnosis further reveals that the main bottleneck often lies on the visual-understanding side rather than the visual-generation side, as current UMMs struggle to leverage even faithful visual aids. We also show that effective visual generation should target visual-understanding bottlenecks rather than add more reasoning steps, and identify a three-stage transition from task-irrelevant noise, to misleading plausible guidance, and finally to useful assistance. These findings would be useful to guide the development of better UMMs.
- Abstract(参考訳): 統一マルチモーダルモデル(UMM)は、理解と生成の両方を実行することができ、中心的な疑問を提起する。
既存の評価は混在する証拠を提供するが、タスクの難易度、推論パラダイム、生成と理解の間の閉ループ相互作用は相反する。
本稿では,視覚生成支援理解のためのきめ細かい評価フレームワークであるVGAU-Diagを紹介する。
サンプルを難易度で階層化し、複数の推論パラダイムの統一的な評価を可能にし、Oracle補助参照プロトコルを使用する。
我々の分析では、生成した視覚的援助はインスタンスの容易化に役立ちますが、推論の複雑さが増大するにつれて信頼性が低下します。
Oracleが支援する診断は、現在のUMMが、忠実なビジュアルエイズを活用するのに苦労しているため、視覚的生成側よりも視覚的理解側にあることが多いことを、さらに明らかにしている。
また、効果的な視覚生成は、より多くの推論ステップを付加するのではなく、視覚的なボトルネックを目標とし、タスク非関連ノイズから3段階の遷移を識別し、妥当なガイダンスを導出し、最終的に有用な支援を行うことも示している。
これらの知見は、より良いUMMの開発を導くのに役立つだろう。
関連論文リスト
- Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models [34.560908829375585]
本稿では、視覚生成が明示的な中間的推論ステップとなるG2Uシナジーを提案する。
本フレームワークは,詳細な拡張やコンテキスト拡張,構造的視覚化といった,制御された生成行為をモデルで実行し,自己生成的な視覚的思考を創出することを可能にする。
生成的忠実度は知覚的利得を束縛し、編集の異なる家族が転送効率を左右することを示す。
この研究は、統一認知における欠落するメカニズムを明らかにし、想像力は理解の終わりではなく、その始まりであることを示唆している。
論文 参考訳(メタデータ) (2026-05-15T09:48:46Z) - Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models [98.8608163448532]
統一マルチモーダルモデル(UMM)は、視覚的理解と生成の統合において顕著な進歩を遂げた。
本稿では,UMMを教師と学生として同時に機能させる,トークンレベルの固有テキスト画像アライメント報酬機構GvUを提案する。
提案手法により,UMMの生成が大幅に向上し,視覚的理解の微粒化が促進されることを示す。
論文 参考訳(メタデータ) (2026-03-06T08:56:14Z) - Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities? [61.533560295383786]
Unified Multimodal Large Language Models (U-MLLM) は、単一のアーキテクチャ内で理解と生成を統合する。
我々は,U-MLLMが画像のモダリティにおいて同じ結果をレンダリングするために必要な場合,意味的等価性を維持することができないことを観察する。
VGUBenchは、推論ロジックを生成の忠実性から切り離すためのフレームワークである。
論文 参考訳(メタデータ) (2026-02-27T06:23:56Z) - MentisOculi: Revealing the Limits of Reasoning with Mental Imagery [63.285794947638614]
視覚的解決が可能な多段階推論問題の組である MentisOculi を開発した。
遅延トークンから明示的な生成画像まで,視覚的戦略を評価すると,一般的にはパフォーマンス向上に失敗する。
以上の結果から,視覚的思考がモデル推論の恩恵を受けていないことが示唆された。
論文 参考訳(メタデータ) (2026-02-02T18:49:06Z) - Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation [53.18286807225952]
統一マルチモーダルモデル(UMM)は、視覚的理解と生成の両方を単一のフレームワークに統合する。
単純なアーキテクチャに依存しないポストトレーニング手法であるUniMRG(Unified Multi-Representation Generation)を提案する。
提案手法は, 微粒化知覚を高め, 幻覚を低減し, 空間的理解を向上し, 同時に生成能力を向上する。
論文 参考訳(メタデータ) (2026-01-29T08:42:25Z) - Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models [51.900488744931785]
視覚抽象化のためのAIシステムの能力を評価し改善するためのビジュアルグラフアリーナ(VGA)を導入する。
人間はタスク間でほぼ完璧な精度を達成し、モデルは同型検出で完全に失敗し、パス/サイクルタスクにおいて限られた成功を示した。
表現不変推論の課題を分離することにより、VGAは、AIビジュアルモデルにおける人間のような概念化に向けた前進を促進するためのフレームワークを提供する。
論文 参考訳(メタデータ) (2025-06-06T17:06:25Z) - Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models [26.14137626882127]
大規模マルチモーダルモデル(LMM)は、視覚言語と視覚中心のタスクの両方において、目覚しい視覚的理解性能を示す。
本稿では,LMMが複雑な構成問題を解くための統一的な視覚推論機構を提案する。
トレーニングされたモデルであるGriffon-Rには、エンドツーエンドの自動理解、自己思考、推論の回答能力があります。
論文 参考訳(メタデータ) (2025-05-27T05:50:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。