論文の概要: MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation
- arxiv url: http://arxiv.org/abs/2607.01383v1
- Date: Wed, 01 Jul 2026 18:44:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.556712
- Title: MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation
- Title(参考訳): MIBE:パーソナライズされた画像生成のためのマルチオブジェクトインタラクションベンチマークと評価器
- Authors: Zhihan Chen, Yuhuan Zhao, Yijie Zhu, Xinyu Yao, Mengcong Ren, Suwen Wang, Qiuyang Yin, Yuchen Sun, Qin Wang, Lu Xin,
- Abstract要約: マルチオブジェクトインタラクションベンチマーク(MIB)とマルチオブジェクトインタラクション評価器(MIE)を組み合わせた統合フレームワークを提案する。
MIBは、疎結合データ構造を通じて、多様な関係タイプとシーンの複雑さを体系的にカバーする。
MIEはゴールドセットに強いクロスジェネレータの一般化を示し、人間の好みに対して一対の精度で0.922を達成している。
- 参考スコア(独自算出の注目度): 12.891921839026432
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Multi-subject personalized image generation requires the precise rendering of all requested reference identities and their specified interactions based on a guiding prompt. However, state-of-the-art models still struggle with this process, frequently omitting subjects, failing to preserve reference appearances, or misattributing interactions. Furthermore, existing metrics designed primarily for single-subject fidelity cannot reliably capture these errors, suffering severe degradation in ranking separability and failing to align with human preference as the subject count increases. To address this gap, we introduce Multi-subject Interaction Benchmark and Evaluator (MIBE), a unified framework comprising a Multi-subject Interaction Benchmark (MIB) and a Multi-subject Interaction Evaluator (MIE). MIB systematically covers diverse relation types and scene complexities through a decoupled data regime. This consists of a 60K-pair VLM-labeled Silver Set for scalable metric training and a 4K-pair double-blind Human Evaluation Gold Set covering a diverse range of state-of-the-art generators, with the Silver Set reaching 95.1% cross-VLM preference agreement. To demonstrate the utility of this benchmark, we present MIE, a lightweight, reference-conditioned evaluator trained exclusively on the Silver Set with a dual-head ranking and diagnosis objective. MIE exhibits strong cross-generator generalization on the Gold Set, achieving 0.922 overall pairwise accuracy against human preference, including 0.982 on seen generators and 0.884 on unseen generators. By outperforming a broad spectrum of baseline metrics, including CLIP and DINO variants, MIE demonstrates that diagnostic supervision can preserve ranking separability and human alignment where traditional evaluators collapse.
- Abstract(参考訳): マルチオブジェクトのパーソナライズされた画像生成には、要求されたすべての参照IDとその特定のインタラクションをガイドプロンプトに基づいて正確にレンダリングする必要がある。
しかし、最先端のモデルは依然としてこのプロセスに苦戦しており、しばしば主題を省略し、参照の外観を保たず、あるいは誤帰的な相互作用を防いでいる。
さらに、単一対象の忠実度を主目的とする既存の指標では、これらの誤りを確実に捉えることができず、ランキングの分離性が著しく低下し、被写体数が増加するにつれて人間の嗜好と一致しない。
このギャップを解決するために、MIBE(Multi-subject Interaction Benchmark and Evaluator)という、MIB(Multi-subject Interaction Benchmark)とMIE(Multi-subject Interaction Evaluator)を組み合わせた統合フレームワークを導入する。
MIBは、疎結合データ構造を通じて、多様な関係タイプとシーンの複雑さを体系的にカバーする。
これは、スケーラブルなメトリックトレーニングのための60KペアのVLMラベルのシルバーセットと、多種多様な最先端のジェネレータをカバーする4KペアのHuman Evaluation Gold Setで構成され、シルバーセットは95.1%のクロスVLM設定契約に達した。
本ベンチマークの有用性を実証するため,本ベンチマークでは,デュアルヘッドのランク付けと診断を目標とした,Silver Set専用にトレーニングされた軽量な基準条件付き評価器MIEを提案する。
MIEはゴールドセットに強いクロスジェネレータの一般化を示し、見知らぬジェネレータに0.982、目に見えないジェネレータに0.884を含む、全体的な人間の嗜好に対して0.922の精度を達成している。
MIEは、CLIPやDINOの変種を含む幅広いベースラインの指標より優れていることから、診断監督が従来の評価指標が崩壊する際のランキングセパビリティと人間のアライメントを維持できることを実証している。
関連論文リスト
- PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - DualEval: Joint Model-Item Calibration for Unified LLM Evaluation [67.99119926012686]
DualEvalは、モデルと評価項目を共有空間で表現する潜在モデルイテムキャリブレーションフレームワークである。
我々はDualEvalを、コーディング、数学、雑多なドメイン知識タスク、汎用的な日常的なユーザクエリの4つの領域にまたがって適用する。
論文 参考訳(メタデータ) (2026-06-24T22:40:46Z) - Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty? [59.923111838399144]
本稿では,視覚的審美性ベンチマーク (VAB) を提案する。
VABには400のタスクと1,195のイメージが芸術、写真、イラストに含まれており、ラベルはタスクごとに10人の独立した専門家審査員のコンセンサスから導かれる。
最強のシステムは、人間の専門家が達成した68.9%よりもはるかに低い26.5%のタスクで、候補順の3つのランダムな順で、最良の画像と最悪の画像の両方を正しく識別する。
論文 参考訳(メタデータ) (2026-05-12T19:33:28Z) - Enhancing Value Alignment of LLMs with Multi-agent system and Combinatorial Fusion [5.97790552623697]
マルチエージェント融合アライメントを運用するフレームワークを提案する。
複数のエージェントにまたがる対立や冗長性を緩和し、人間の価値をよりよく反映する応答を生み出す。
論文 参考訳(メタデータ) (2026-03-11T14:57:51Z) - MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation [48.84450712826316]
MSVBenchは、マルチショットビデオ生成に適した階層的なスクリプトと参照イメージを備えた最初の包括的なベンチマークである。
本稿では,大規模マルチモーダルモデルの高レベルな意味推論と,ドメイン固有のエキスパートモデルの微粒な知覚的厳密さを相乗化するハイブリッド評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-27T12:26:34Z) - GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks? [29.804627410258732]
我々は、ペアワイズ比較パラダイムを活用する統一評価フレームワークを導入し、安定的かつ人道的な評価を確実にする。
提案手法は,評価精度を20%以上向上し,信頼性の高いLMArenaリーダボードとSpearmanの0.86の相関性を実現する。
論文 参考訳(メタデータ) (2026-02-05T18:52:48Z) - Relative Classification Accuracy: A Calibrated Metric for Identity Consistency in Fine-Grained K-pop Face Generation [0.0]
Denoising Diffusion Probabilistic Models (DDPM) は高忠実度画像生成において顕著な成功を収めた。
FID や Inception Score (IS) のような標準メトリクスは、そのような特殊なコンテキストにおけるアイデンティティの不一致を検出するのに失敗することが多い。
K-pop idol face generation (32x32) のクラス・コンディショナルDDPMについて検討した。
論文 参考訳(メタデータ) (2026-01-22T00:58:59Z) - KG-EDAS: A Meta-Metric Framework for Evaluating Knowledge Graph Completion Models [0.0]
知識グラフ(KG)を評価する上での大きな課題は、複数のデータセットとメトリクスのパフォーマンスを比較することだ。
我々は,平均解からの距離に基づくKG評価を提案し,マルチメトリック・マルチデータセットのパフォーマンスを統一的なランキングに組み込む。
EDASは、より情報のあるモデル選択をサポートし、データセット間の評価において公平性を促進するグローバルな視点を提供する。
論文 参考訳(メタデータ) (2025-08-21T08:37:35Z) - MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models [71.36392373876505]
我々は、LVLM(Large Vision-Language Models)において、インターリーブされたマルチモーダル理解と生成を評価するための大規模ベンチマークであるMMIEを紹介する。
MMIEは、数学、コーディング、物理学、文学、健康、芸術を含む3つのカテゴリ、12のフィールド、102のサブフィールドにまたがる20Kの厳密にキュレートされたマルチモーダルクエリで構成されている。
インターリーブされたインプットとアウトプットの両方をサポートし、多様な能力を評価するために、複数選択とオープンな質問フォーマットの混合を提供する。
論文 参考訳(メタデータ) (2024-10-14T04:15:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。