論文の概要: UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation
- arxiv url: http://arxiv.org/abs/2609.12397v1
- Date: Fri, 11 Sep 2026 03:40:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.598336
- Title: UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation
- Title(参考訳): UFO:マルチモード画像生成におけるOmniコンディションアライメントのチェイン・オブ・アライメント
- Abstract要約: 本報告では,同調同時評価のための一貫したフレームワークであるUFOを提案する。
UFOは人間の評価に最も高い相関性を示し,平均15.25%の改善を実現している。
また,既存のカスタマイズモデルの性能を総合的に評価するベンチマークであるUFO-Benchを提案する。
- 参考スコア(独自算出の注目度): 31.518005154770176
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-modal image generation, particularly subject-driven customization, has garnered growing attention in recent years. Despite the rapid advancement of generative models, their evaluation remains largely lagging. Existing methods, whether embedding-based or Multi-modal Large Language Model (MLLM)-based, evaluate alignment with each modal condition in isolation, which contradicts the simultaneous condition alignment objective of multi-modal image generation, leading to poor consistency with human judgments. To address this challenge, we propose UFO, the first unified framework for omni-condition alignment simultaneous evaluation. Specifically, UFO introduces a novel Atomized Chain-of-Evaluation paradigm, \emph{i.e.}, it first decomposes omni-condition alignment into a sequential chain of fine-grained, disentangled Atomic Evaluation Units (AEUs), categorizes them into distinct modality-relevance classes, and then employs general or dedicated functional calls for accurate verification of different AEU types. Experimental results demonstrate that UFO achieves the highest correlation with human evaluation preferences, delivering an average improvement of 15.25\%. Furthermore, we present UFO-Bench, a dedicated benchmark designed to holistically evaluate the performance of existing customization models under the diverse mutual interactions of textual and visual conditions.
- Abstract(参考訳): マルチモーダル画像生成、特に被写体駆動のカスタマイズは近年注目を集めている。
生成モデルの急速な進歩にもかかわらず、その評価は大半が遅れている。
埋め込みベースかマルチモーダル大言語モデル(MLLM)ベースの既存の手法は、複数のモーダル画像生成の同時条件アライメント目標と矛盾する、各モーダル条件とのアライメントを独立に評価し、人間の判断との整合性を損なう。
この課題に対処するため,オムニコンアライメント同時評価のための最初の統合フレームワークであるUFOを提案する。
具体的には、UFO は、新しいAtomized Chain-of-Evaluation パラダイムである \emph{i.e.} を導入し、まずオムニ条件アライメントを、細粒度で不整合な原子評価ユニット(AEU)のシーケンシャルな連鎖に分解し、それらを異なるモダリティ関連クラスに分類し、次に異なるAEUタイプの正確な検証のために一般または専用の関数呼び出しを使用する。
実験の結果、UFOは人間の評価の嗜好と最も高い相関を達成し、平均15.25\%の改善をもたらすことが示された。
さらに,既存のカスタマイズモデルの性能を,テキストと視覚条件の相互相互作用の多様さで総合的に評価する専用のベンチマークであるUFO-Benchを提案する。
関連論文リスト
- Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Interaction Analysis [55.78822230833247]
We present Inter-X++, a comprehensive and large-scale benchmark designed to empower useful HHI analysis。
インターX++は11,388個の高忠実な相互作用シーケンスと8.1Mフレームを提供する。
インタラクションの再構築と意味理解を協調的に最適化する,単一かつ統一されたHHI表現とモデリングフレームワークOpenHHIを提案する。
論文 参考訳(メタデータ) (2026-08-20T17:51:48Z) - Unified Hallucination Fuzzing for Multimodal Large Language Models [44.4785399881315]
マルチモーダル大言語モデル(MLLM)に対する幻覚は依然として永続的な課題である
既存の評価は、主に静的なベンチマークに基づいており、狭い分類範囲と急速な性能飽和に悩まされている。
本稿では,総合的なベンチマークと自己進化型ストレステストを統合するシステム評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-15T17:57:37Z) - Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation [80.99003754614365]
統一マルチモーダルモデルにおける共同理解と生成を評価するためのベンチマークであるUnisonを紹介する。
Unisonは2,169の高品質な統合タスクサンプルで構成されている。
また,人間の判断に適合した評価モデルであるUnison-Judgeを紹介する。
論文 参考訳(メタデータ) (2026-06-25T12:58:54Z) - Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment [48.882448108261826]
赤外線可視画像融合(IVIF)は、熱情報と詳細な空間構造を単一の融合画像に統合し、知覚を高めることを目的としている。
近年のIVIF報酬モデリングの取り組みは人間の評価から学ぶが、集計されたスコアにスカラー回帰を用いる。
本稿では,MLLMを用いて人間の視覚知覚を再現し,連続的な品質スコアを生成するFuScoreを紹介する。
論文 参考訳(メタデータ) (2026-05-07T21:38:09Z) - UAVReason: A Unified, Large-Scale Benchmark for Multimodal Aerial Scene Reasoning and Generation [22.090256033688124]
UAVReasonは,Nadir-view UAVシナリオ専用の,最初の大規模マルチモーダルベンチマークである。
273K以上のVQA(Visual Question Answering)ペアを統合し、詳細なキャプションを持つ23.6Kのシングルフレーム、68.2Kの2フレームの時間シーケンス、および188.8Kのクロスモーダル生成サンプルを含む。
ベンチマークでは、空間的および時間的軸にわたる22種類の推論タイプを調査し、同時にRGB、深さ、セグメンテーションのモダリティにわたる高忠実度生成を評価した。
論文 参考訳(メタデータ) (2026-04-07T03:23:30Z) - Multi-Feature Fusion Approach for Generative AI Images Detection [3.16770435670322]
3つの異なる空間からの相補的手がかりを組み合わせた多機能融合フレームワークを検討・評価する。
個々の特徴空間は、異なるジェネレータ間で大きな性能変動を示すことを示す。
最先端の手法と比較して、提案するフレームワークは、評価されたすべてのデータセットに対して一貫してパフォーマンスを向上する。
論文 参考訳(メタデータ) (2026-03-31T14:25:10Z) - From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space [78.36537400975298]
グループ相対政策最適化(GRPO)は、テキスト・ツー・イメージ(T2I)フローモデルにおいて、優先順位調整のための強力なフレームワークとして登場した。
条件空間を拡大することで関係探索を強化する新しい手法であるMulti-View GRPOを提案する。
MV-GRPOは最先端手法よりも優れたアライメント性能を実現する。
論文 参考訳(メタデータ) (2026-03-13T04:35:13Z) - MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation [48.84450712826316]
MSVBenchは、マルチショットビデオ生成に適した階層的なスクリプトと参照イメージを備えた最初の包括的なベンチマークである。
本稿では,大規模マルチモーダルモデルの高レベルな意味推論と,ドメイン固有のエキスパートモデルの微粒な知覚的厳密さを相乗化するハイブリッド評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-27T12:26:34Z) - UNO: Unified Self-Supervised Monocular Odometry for Platform-Agnostic Deployment [22.92093036869778]
多様な環境にまたがるロバストかつ姿勢推定を可能にする統合ビジュアル・オドメトリー・フレームワークであるUNOを提案する。
われわれのアプローチは、自動運転車、ドローン、移動ロボット、ハンドヘルドデバイスなど、さまざまな現実のシナリオを効果的に一般化する。
提案手法を3つの主要なベンチマークデータセット上で広範囲に評価する。
論文 参考訳(メタデータ) (2025-06-08T06:30:37Z) - M3-AGIQA: Multimodal, Multi-Round, Multi-Aspect AI-Generated Image Quality Assessment [65.3860007085689]
M3-AGIQAは、AI生成画像のより人間らしく総合的な評価を可能にする包括的なフレームワークである。
モデル出力を人間の判断とより密接に整合させることで、M3-AGIQAは堅牢で解釈可能な品質スコアを提供する。
論文 参考訳(メタデータ) (2025-02-21T03:05:45Z) - GAS: Generative Avatar Synthesis from a Single Image [54.95198111659466]
本研究では,1枚の画像から一対一かつ時間的にコヒーレントなアバターを合成する枠組みを提案する。
提案手法は, 回帰に基づく3次元再構成と拡散モデルの生成能力を組み合わせたものである。
論文 参考訳(メタデータ) (2025-02-10T19:00:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。