論文の概要: A Model-Internal Protocol for Assessing Multimodal Models as Integrated Systems
- arxiv url: http://arxiv.org/abs/2608.11907v2
- Date: Thu, 20 Aug 2026 16:45:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 14:00:35.279317
- Title: A Model-Internal Protocol for Assessing Multimodal Models as Integrated Systems
- Title(参考訳): 統合システムとしてのマルチモーダルモデル評価のためのモデル内部プロトコル
- Abstract要約: 現在の評価プロトコルは、生成的および識別的能力を個別のタスクとして扱う。
本稿では、セマンティッククローズドループチャレンジを通じて統一モデルの統合能力を探索する自己生成理解(SGU)を提案する。
このパイプラインは、UMMを統一システムとして評価するのに適した、統合されたパフォーマンススコアを提供するゼロコストテストベッドを提供する。
- 参考スコア(独自算出の注目度): 19.780193072520575
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As Large Vision-Language Models increasingly aim to integrate visual generation and understanding within a single parameter space, evaluating such structural unification in a cohesive manner remains a critical challenge. Current evaluation protocols predominantly treat generative and discriminative capabilities as separate tasks, leaving a gap in system-level evaluation for unified multimodal models (UMMs). In this work, we propose Self-Generative-Understanding (SGU), a novel, annotation-free evaluation framework that probes the integrated capabilities of unified models through a semantic closed-loop challenge. Without requiring new annotations, SGU leverages the dual understanding-and-generation abilities of UMMs by asking them to first perceive an image and produce a textual description, subsequently reconstruct a visual context based on that description, and finally perform reasoning over the self-generated output. This pipeline provides a zero-cost testbed that yields an integrated performance score specifically tailored for evaluating UMMs as unified systems. Extensive experiments show that even high-performing UMMs often struggle to reason over their own generated contexts, revealing limitations that are not captured by separate evaluations of understanding or generation alone. Our work provides a complementary holistic evaluation framework and offers a foundation for benchmarking the development of next-generation unified multimodal models.
- Abstract(参考訳): 大きな視覚・言語モデルは、単一のパラメータ空間内で視覚生成と理解を統合することを目指しているため、そのような構造的統一を凝集的に評価することは、依然として重要な課題である。
現在の評価プロトコルは、主に生成的および識別的能力を個別のタスクとして扱い、統一マルチモーダルモデル(UMM)に対するシステムレベルの評価のギャップを残している。
本研究では、セマンティック・クローズドループ・チャレンジを通じて統一モデルの統合能力を探索する、新しいアノテーションなし評価フレームワークであるSelf-Generative-Understanding (SGU)を提案する。
新たなアノテーションを必要とせずに、SGUは、まずイメージを認識してテキスト記述を生成し、その後、その記述に基づいて視覚的コンテキストを再構築し、最終的に自己生成出力に対する推論を実行することで、UMMの二重理解世代能力を活用する。
このパイプラインは、UMMを統一システムとして評価するのに適した、統合されたパフォーマンススコアを提供するゼロコストテストベッドを提供する。
大規模な実験では、ハイパフォーマンスなUMMでさえ、自分自身が生成したコンテキストを推論するのに苦労し、理解や生成のみの別個の評価によって捉えられない制限を明らかにしている。
我々の研究は補完的な総合評価フレームワークを提供し、次世代統合マルチモーダルモデルの開発をベンチマークするための基盤を提供する。
関連論文リスト
- Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation [80.99003754614365]
統一マルチモーダルモデルにおける共同理解と生成を評価するためのベンチマークであるUnisonを紹介する。
Unisonは2,169の高品質な統合タスクサンプルで構成されている。
また,人間の判断に適合した評価モデルであるUnison-Judgeを紹介する。
論文 参考訳(メタデータ) (2026-06-25T12:58:54Z) - Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models [12.660879089125684]
統一マルチモーダルモデル(uMM)は、共有表現内で視覚的理解と視覚的生成の両方をサポートすることを目的としている。
既存の評価プロトコルは、これらの2つの機能を独立して評価し、それらが意味的に整合しているかどうかを検査しない。
XTC-Benchは,タスク間の視覚的セマンティック一貫性を計測する,シーングラフによる評価フレームワークである。
論文 参考訳(メタデータ) (2026-04-27T23:57:29Z) - Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding [20.397510070808238]
統一マルチモーダルモデル(UMM)は、視覚的理解と生成を単一の構造に統合することを目的としている。
UMMは、その理解能力が世代を著しく上回る、顕著な能力ミスマッチを示す。
そこで我々は,UniRect-CoT(UniRect-CoT)を提案する。
論文 参考訳(メタデータ) (2026-04-15T06:41:56Z) - Pitfalls in Evaluating Interpretability Agents [91.49742416116635]
我々は,実験を反復的に設計し,仮説を洗練するエージェントシステムを構築した。
我々の研究は、複雑な自動解釈可能性システムを評価する上での根本的な課題を実証している。
論文 参考訳(メタデータ) (2026-03-20T16:27:17Z) - Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models [98.8608163448532]
統一マルチモーダルモデル(UMM)は、視覚的理解と生成の統合において顕著な進歩を遂げた。
本稿では,UMMを教師と学生として同時に機能させる,トークンレベルの固有テキスト画像アライメント報酬機構GvUを提案する。
提案手法により,UMMの生成が大幅に向上し,視覚的理解の微粒化が促進されることを示す。
論文 参考訳(メタデータ) (2026-03-06T08:56:14Z) - UniG2U-Bench: Do Unified Models Advance Multimodal Understanding? [50.92401586025528]
統一マルチモーダルモデルは、最近強力な生成能力を示したが、生成が理解を改善したかどうかはまだ不明である。
提案するUniG2U-Benchは,G2U(Generation-to-understanding)評価を7つのシステマと30のサブタスクに分類する総合ベンチマークである。
論文 参考訳(メタデータ) (2026-03-03T18:36:16Z) - Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities? [61.533560295383786]
Unified Multimodal Large Language Models (U-MLLM) は、単一のアーキテクチャ内で理解と生成を統合する。
我々は,U-MLLMが画像のモダリティにおいて同じ結果をレンダリングするために必要な場合,意味的等価性を維持することができないことを観察する。
VGUBenchは、推論ロジックを生成の忠実性から切り離すためのフレームワークである。
論文 参考訳(メタデータ) (2026-02-27T06:23:56Z) - Endogenous Reprompting: Self-Evolving Cognitive Alignment for Unified Multimodal Models [23.128973540926552]
内因性再増殖は、モデルの理解を明確な生成的推論ステップに変換する。
評価精度,再現効率,生成品質において,SEERは一貫して最先端のベースラインを上回っていることを示す。
論文 参考訳(メタデータ) (2026-01-28T06:54:36Z) - UmniBench: Unified Understand and Generation Model Oriented Omni-dimensional Benchmark [46.85189386884927]
UmniBenchは、全次元評価を備えた統一マルチモーダルモデルに適したベンチマークである。
13の主要ドメインと200以上の概念をカバーし、UMMの徹底的な検査を保証する。
UmniBenchをベースとして、UMMと単一機能大モデルを含む24の人気のあるモデルをベンチマークする。
論文 参考訳(メタデータ) (2025-12-19T03:20:59Z) - Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark [69.8473923357969]
統一マルチモーダルモデルは、視覚的理解と生成を共同で行うことを目的としているが、現在のベンチマークでは、その真の統合を検査することはめったにない。
提案するUni-MMMUは、8つの推論中心領域にまたがる生成と理解の双方向の相乗効果を拡大する総合的なベンチマークである。
論文 参考訳(メタデータ) (2025-10-15T17:10:35Z) - RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark [71.3555284685426]
本稿では,双方向機能相乗効果を評価するためのベンチマークであるRealUnifyを紹介する。
RealUnifyは、10のカテゴリと32のサブタスクにまたがる、細心の注意を払ってアノテートされた1000のインスタンスで構成されている。
現在の統一モデルは、効果的な相乗効果を達成するのに依然として苦労しており、アーキテクチャの統一だけでは不十分であることを示している。
論文 参考訳(メタデータ) (2025-09-29T15:07:28Z) - SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards [55.99492656542475]
textbfSDER (textbfSelf-improving textbfUnified LMMs with textbfDual stextbfElf-textbfRewards) を提案する。
論文 参考訳(メタデータ) (2025-06-09T17:38:45Z) - UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation [15.938314589086914]
追加モデルや画像,アノテーションを使わずに,統一マルチモーダルモデル用に設計された最初の評価フレームワークであるUniEvalを紹介する。
このフレームワークには、UniBenchという総合的なベンチマークと、対応するUniScoreメトリックが含まれている。
我々はまた、SoTAの統一および視覚生成モデルについても広範囲に評価し、Univeralのユニークな値に対する新たな洞察を明らかにした。
論文 参考訳(メタデータ) (2025-05-15T16:34:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。