論文の概要: MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation
- arxiv url: http://arxiv.org/abs/2607.14189v1
- Date: Wed, 15 Jul 2026 16:02:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.858104
- Title: MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation
- Title(参考訳): MultiRef-Compass:Multi-Reference-to-Audio-Video 生成の総合評価に向けて
- Authors: Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li,
- Abstract要約: MR2AV(Multi-Reference-to-audio-video)生成は,複数の参照とテキスト命令を条件としたコヒーレントなオーディオビデオコンテンツを生成することを目的としている。
既存のベンチマークは主にテキスト駆動生成、単一参照主題保存、孤立したオーディオビデオアライメントに焦点を当てている。
MR2AV生成のための統合ベンチマークであるMultiRef-を導入する。
- 参考スコア(独自算出の注目度): 27.198976547095565
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-reference-to-audio-video (MR2AV) generation aims to generate coherent audio-video content conditioned on multiple references and textual instructions. Existing benchmarks mainly focus on text-driven generation, single-reference subject preservation, or isolated audio-video alignment, leaving the emerging MR2AV setting largely unexplored. Compared with these settings, MR2AV requires models to jointly reason over multiple references while generating synchronized visual and audio content. Models must not only preserve each reference faithfully but also correctly bind and compose multiple referenced entities into coherent audio-visual events. To address this gap, we introduce MultiRef-Compass, a unified benchmark for MR2AV generation. It comprises $350$ carefully curated samples constructed through a scalable and controllable asset-composition pipeline, covering multi-view subject preservation, multi-entity binding, and human-object-scene composition. To provide interpretable assessment, MultiRef-Compass defines an evaluation protocol with four dimensions: Basic Quality, Reference Consistency, Audio-Visual Consistency, and Instruction Following, using 14 sub-metrics. MultiRef-Compass integrates automatic metrics with a rejudging-enhanced MLLM-as-a-Judge framework, enabling scalable and auditable evaluation of both perceptual fidelity and reference-conditioned composition. Extensive experiments on eight representative MR2AV systems reveal substantial room for improvement across multiple evaluation dimensions, underscoring the need for a comprehensive benchmark and positioning MultiRef-Compass as a foundation for future MR2AV research.
- Abstract(参考訳): MR2AV(Multi-Reference-to-audio-video)生成は,複数の参照とテキスト命令を条件としたコヒーレントなオーディオビデオコンテンツを生成することを目的としている。
既存のベンチマークは主にテキスト駆動生成、単一参照主題保存、孤立したオーディオビデオアライメントに焦点を当てており、新興のMR2AV設定はほとんど探索されていない。
これらの設定と比較すると、MR2AVは、同期された視覚的およびオーディオコンテンツを生成しながら、複数の参照を共同で推論するモデルを必要とする。
モデルは、それぞれの参照を忠実に保存するだけでなく、複数の参照エンティティをコヒーレントなオーディオ視覚イベントにバインドして構成する。
MR2AV生成のための統一ベンチマークであるMultiRef-Compassを導入する。
これは、スケーラブルで制御可能なアセット・コンポジション・パイプラインを通じて構築された350ドル(約3万3000円)の精巧なキュレートされたサンプルから成り、マルチビューの主題保存、マルチエンタリティ・バインディング、ヒューマン・オブジェクト・シーンの合成をカバーしている。
解釈可能な評価のために、MultiRef-Compassは、14のサブメトリックを用いて、基本品質、参照整合性、オーディオ・ビジュアル整合性、指示追従の4次元の評価プロトコルを定義する。
MultiRef-Compassは、自動メトリクスを補充強化MLLM-as-a-Judgeフレームワークと統合し、知覚の忠実さと参照条件の両方をスケーラブルかつ監査可能な評価を可能にする。
8つの代表的なMR2AVシステムに対する大規模な実験により、複数の評価次元にまたがる大幅な改善の余地が示され、総合的なベンチマークの必要性と将来のMR2AV研究の基礎としてMultiRef-Compassが位置づけられている。
関連論文リスト
- LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV [39.241237759347825]
LongAV-は、マイクロ・オーディオ・ビジュアル・ジェネレーションのための体系的なベンチマークである。
テキスト・トゥ・オーディオ・ビデオ(T2AV)、画像・トゥ・オーディオ・ビデオ(I2AV)、ビデオ・トゥ・オーディオ・ビデオ(V2AV)にまたがる284のテストケースで構成されている。
このフレームワークは、音質、断面積の整合性、大域的な物語のコヒーレンス、セマンティックアライメント、オーディオ視覚アライメントをカバーする20以上のきめ細かい寸法を評価する。
論文 参考訳(メタデータ) (2026-05-25T18:12:09Z) - AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation [42.157453071865056]
AVGen-Benchは、T2AV生成のためのタスク駆動ベンチマークである。
軽量スペシャリストモデルとマルチモーダル大言語モデル(MLLM)を組み合わせた多言語評価フレームワークを提案する。
評価の結果,テキストレンダリングの持続的失敗,音声のコヒーレンス,物理的推論,音声ピッチ制御の普遍的破壊など,強い視覚的美学と弱い意味的信頼性のギャップが明らかとなった。
論文 参考訳(メタデータ) (2026-04-09T17:59:39Z) - MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering [51.19392014547221]
検索型マルチモーダル文書QAは,視覚的にリッチな文書から複雑なマルチモーダル構造を持つ関連情報を識別し,統合することを目的としている。
現在のアプローチは、サージェントなコンテンツを見渡すクエリに依存しないドキュメント表現に依存しています。
本稿では,クエリ適応生成を導入したMultimodal Adaptive Retrieval-Augmented (MARA)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-01T12:27:40Z) - UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG [82.84014669683863]
マルチモーダル検索拡張生成(MM-RAG)は,大規模言語モデルを現実世界の知識ベースに適用するための重要なアプローチである。
UniDoc-Benchは、70万の現実世界のPDFページから構築されたMM-RAGのための最初の大規模で現実的なベンチマークである。
実験により,マルチモーダルテキスト画像融合RAGシステムは,非モーダルおよび共同マルチモーダル埋め込みに基づく検索において一貫して優れていた。
論文 参考訳(メタデータ) (2025-10-04T04:30:13Z) - Recurrence Meets Transformers for Universal Multimodal Retrieval [59.92546492752452]
ReT-2は画像とテキストの両方からなるマルチモーダルクエリをサポートする統合検索モデルである。
検索構成の異なるM2KRとM-BEIRのベンチマークでReT-2を評価する。
検索強化された生成パイプラインに統合されると、ReT-2はEncyclopedic-VQAとInfoSeekデータセットのダウンストリームのパフォーマンスも向上する。
論文 参考訳(メタデータ) (2025-09-10T18:00:29Z) - MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks [67.31276358668424]
AV-HaystacksQAという新しいタスクを導入し、クエリに応答して、異なるビデオにまたがる有能なセグメントを識別し、それらをリンクして最も有意義な回答を生成する。
AVHaystacksは、マルチビデオ検索および時間的グラウンドタスクにおけるLMMの能力を評価するために設計された3100の注釈付きQAペアからなるオーディオビジュアルベンチマークである。
提案するAVHaystackのQAタスクにおけるBLEU@4およびGPT評価スコアの基準値よりも89%と65%の相対的な改善を実現し、モデルに依存しないマルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-08T06:34:29Z) - Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes [11.575313825919205]
参照音声・視覚的伝統(Ref-AVS)と呼ばれる新しいタスクを導入する。
Ref-AVSはマルチモーダルキューを含む式に基づいてオブジェクトをセグメント化する。
本稿では,マルチモーダルキューを適切に活用し,正確なセグメンテーションガイダンスを提供する手法を提案する。
論文 参考訳(メタデータ) (2024-07-15T17:54:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。