論文の概要: Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models
- arxiv url: http://arxiv.org/abs/2607.09091v1
- Date: Fri, 10 Jul 2026 04:19:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.781005
- Title: Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models
- Title(参考訳): 時間シフトを超えて:Omni-LLMを参照自由評価器として適応する
- Abstract要約: クロスモーダル同期は、生成されたコンテンツの世界のダイナミクスと因果関係の一貫性を評価するための重要なプロキシである。
既存の評価指標は、構造的正当性を推定し、同期を単に時間的アライメントに還元する。
本研究では,相対的人間の知覚を連続的かつグローバルに一貫した計量に蒸留する枠組みを提案する。
- 参考スコア(独自算出の注目度): 29.611813571399097
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As audio-visual generative models evolve into world simulators, cross-modal synchronization stands as a critical proxy for assessing the consistency of world dynamics and causality in generated content. However, existing evaluation metrics presume structural correctness, reducing synchronization to mere temporal alignment. Consequently, they fail on generative outputs, especially when exhibiting structural hallucinations and asymmetric cross-modal relations, which currently \textbf{mandate expert human annotation to assess synchronization.} This dependency introduces a critical paradox: \emph{human evaluators rely on relative, reference-dependent comparisons, whereas automated metrics require reference-free, absolute scalars.} We resolve this paradox by proposing a framework that distills relative human perception into a continuous, globally consistent metric. First, we introduce SynthSync, a dataset of generative failures ranked via pairwise human annotations. Second, we adapt the Omni-LLM equipped with a continuous latent projection to translate relative human rankings into continuous absolute values. Third, we propose Real-Valued Group Relative Policy Optimization ($\mathbb{R}$-GRPO) to internalize the global causal structure of synchronization via listwise score distributions. Empirically, our metric achieves state-of-the-art human preference alignment. We leverage this estimator to establish a standardized benchmark, advancing AV-Gen assessment from low-level signal correlation to visually grounded causality.
- Abstract(参考訳): 音声・視覚生成モデルが世界シミュレータへと進化するにつれて、クロスモーダル同期は、生成されたコンテンツにおける世界ダイナミクスと因果関係の一貫性を評価する重要なプロキシとして機能する。
しかし、既存の評価指標は構造的正当性を推定し、同期を単に時間的アライメントに還元する。
その結果、特に構造的な幻覚と非対称な相互関係を示す際には、生成出力に失敗し、これは現在、同期を評価するためにtextbf{mandate expert human アノテーションである。
関連スポンサーコンテンツ この依存関係は、クリティカルなパラドックスを導入します。 \emph{ Human Evaluatorは、相対的、参照に依存した比較に依存しますが、自動化されたメトリクスは、参照不要で絶対的なスカラーが必要です。
相対的な人間の知覚を連続的に一貫した計量に蒸留する枠組みを提案することで、このパラドックスを解消する。
まず、SynthSyncを紹介します。これは、ペアワイズなヒューマンアノテーションによってランク付けされた生成障害のデータセットです。
第二に,Omni-LLMは連続的な潜在射影を備えるので,相対的な人格を連続的な絶対値に変換する。
第3に,実値群相対政策最適化(\mathbb{R}$-GRPO)を提案する。
実証的に、我々の測定基準は最先端の人間の嗜好アライメントを達成する。
我々はこの推定器を利用して標準化されたベンチマークを確立し、低レベルの信号相関から視覚的に基底付けられた因果関係へのAV-Gen評価を推し進める。
関連論文リスト
- Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Interaction Analysis [55.78822230833247]
We present Inter-X++, a comprehensive and large-scale benchmark designed to empower useful HHI analysis。
インターX++は11,388個の高忠実な相互作用シーケンスと8.1Mフレームを提供する。
インタラクションの再構築と意味理解を協調的に最適化する,単一かつ統一されたHHI表現とモデリングフレームワークOpenHHIを提案する。
論文 参考訳(メタデータ) (2026-08-20T17:51:48Z) - Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation [28.732587811107777]
既存の評価プロトコルは主に、生成されたビデオと参照ビデオの間の厳密な時間対応を前提としたフレーム単位のメトリクスに依存している。
我々は、Soft Dynamic Time Warpingを確立された評価パイプラインに統合する統合シーケンスレベルの再構成を導入する。
フレームワイド評価は、厳密なアライメントの下では特別なケースとみなすことができ、一方、シーケンスレベルのアライメントは、安定性の向上、タイミング差に対する感度の低下、モデリングパラダイム間のより明確な分離を提供する。
論文 参考訳(メタデータ) (2026-05-31T05:44:42Z) - Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs [84.3271821505699]
カオス・オブ・モダリティ(Chain of Modality, CoM)は、マルチモーダル融合を受動的結合から動的オーケストレーションに移行するエージェントフレームワークである。
CoMはトレーニングフリーまたはデータ効率のSFT設定で動作し、様々なベンチマークで堅牢で一貫した一般化を実現する。
論文 参考訳(メタデータ) (2026-04-16T01:21:14Z) - Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces [81.41397370235102]
我々はOmniBehaviorを紹介した。OmniBehaviorは実世界のデータから構築された最初のユーザシミュレーションベンチマークである。
現在のモデルでは,コンテキストウィンドウが拡大しても,複雑な振る舞いを正確にシミュレートすることが困難であることを示す。
この結果、個人差や長い尾の挙動が失われ、将来の高忠実度シミュレーション研究における重要な方向性が浮き彫りになる。
論文 参考訳(メタデータ) (2026-04-09T15:26:21Z) - Collaborative Temporal Feature Generation via Critic-Free Reinforcement Learning for Cross-User Sensor-Based Activity Recognition [16.776182784171713]
ウェアラブル慣性センサーを用いたヒューマンアクティビティ認識は、医療モニタリング、フィットネス分析、コンテキスト認識コンピューティングの基礎となる。
既存のドメインの一般化アプローチは、センサーストリームの時間的依存関係を無視したり、非現実的なターゲットドメインアノテーションに依存したりする。
我々は、強化学習によって制御される協調的な逐次生成プロセスとして、一般化可能な特徴抽出をモデル化する新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2026-03-17T01:03:21Z) - Navigating the Synchrony-Stability Frontier in Adaptive Chatbots [0.0]
コア設計の緊張を明示する計算評価フレームワークを提案する。
人間のログデータセットに対する明示的な適応ポリシーをシミュレートし比較する。
限定されたポリシーは、同期に控えめなコストで、安定性の大幅な向上を実現している。
我々は、フロンティアポリシーが命令のチャーンを減らし、ジャリングレジスタのフリップを減らしたことを示す「素早い正当性」を定量化する。
論文 参考訳(メタデータ) (2025-09-30T22:50:30Z) - Kuramoto Orientation Diffusion Models [67.0711709825854]
指紋やテクスチャなどのオリエンテーションに富んだ画像は、しばしばコヒーレントな角模様を示す。
生体系における位相同期の役割を動機として,スコアベース生成モデルを提案する。
一般的な画像ベンチマークで競合する結果を実装し,指紋やテクスチャなどの指向性データセットの生成品質を大幅に向上する。
論文 参考訳(メタデータ) (2025-09-18T18:18:49Z) - Time-series Generation by Contrastive Imitation [87.51882102248395]
モーメントマッチングの目的によってモチベーションされ、複合的エラーを軽減し、局所的(しかし前方的な)遷移ポリシーを最適化する。
推論において、学習されたポリシーは反復的なサンプリングのジェネレータとして機能し、学習されたエネルギーはサンプルの品質を評価するための軌道レベル尺度として機能する。
論文 参考訳(メタデータ) (2023-11-02T16:45:25Z) - Edge Continual Learning for Dynamic Digital Twins over Wireless Networks [68.65520952712914]
デジタルツイン(DT)は、現実世界とメタバースの間の重要なリンクを構成する。
本稿では,物理的双生児とそれに対応するサイバー双生児の親和性を正確にモデル化する新しいエッジ連続学習フレームワークを提案する。
提案するフレームワークは,破滅的忘れ込みに対して頑健な,高精度かつ同期的なCTモデルを実現する。
論文 参考訳(メタデータ) (2022-04-10T23:25:37Z) - From Deterioration to Acceleration: A Calibration Approach to
Rehabilitating Step Asynchronism in Federated Optimization [13.755421424240048]
我々は,局所的な方向を予測的グローバルな方向に調整する新しいアルゴリズムであるtexttFedaGracを提案する。
理論的には、texttFedaGrac は最先端のアプローチよりも収束率の向上を証明している。
論文 参考訳(メタデータ) (2021-12-17T07:26:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。