論文の概要: Refining Multidimensional Video Reward Models via Disentangled Influence Functions
- arxiv url: http://arxiv.org/abs/2605.28203v1
- Date: Wed, 27 May 2026 09:26:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.927357
- Title: Refining Multidimensional Video Reward Models via Disentangled Influence Functions
- Title(参考訳): 遠方の影響関数による多次元映像リワードモデルの精細化
- Authors: Muyao Wang, Zeke Xie, Hideki Nakayama,
- Abstract要約: 本稿では,次元別監視リスクを効率的に見積もるアンタングルの影響フレームワークを提案する。
極端に高リスクなサンプルを除去する次元差分法と、高リスクの監督をソフトに下方修正する次元差分法という2つの次元差分法を導入する。
- 参考スコア(独自算出の注目度): 23.990715388650557
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As Text-to-Video (T2V) generation models continue to evolve, the complexity of video evaluation necessitates a fine-grained assessment across various axes. To address this, recent works have focused on developing Multidimensional Video Reward Models (MVRMs), which decompose the evaluation process to better align with the multifaceted nature of human visual perception. However, training effective MVRMs is fundamentally challenged by the complex nature of video data. In this work, we identify a critical phenomenon termed Dimensional Heterogeneity: the reliability of a training sample can vary substantially across evaluation dimensions, meaning that a sample may provide reliable supervision for one objective while inducing high supervision risk for another. Consequently, prevailing data-centric methods that filter based on global scalar metrics are ill-posed for T2V tasks. To address this, we propose a disentangled influence framework that that efficiently estimates dimension-specific supervision risk. Leveraging this framework, we introduce two dimension-disentangled refinement strategies: Dimension-Disentangled Pruning, which removes extreme high-risk samples, and Dimension-Disentangled Reweighting, which softly down-weights high-risk supervision. Extensive experiments demonstrate that our disentangled strategies significantly outperform global filtering baselines, yielding reward models with superior alignment to ground truth.
- Abstract(参考訳): テキスト・トゥ・ビデオ(T2V)生成モデルは進化し続けており、ビデオ評価の複雑さは様々な軸にわたってきめ細かな評価を必要とする。
この問題に対処するために、近年の研究では、人間の視覚知覚の多面的性質をよりよく整合させるために、評価プロセスを分解する多次元ビデオリワードモデル(MVRM)の開発に焦点が当てられている。
しかし、ビデオデータの複雑な性質により、有効なMVRMの訓練は基本的には困難である。
本研究は, 次元不均一性と呼ばれる臨界現象を同定し, トレーニングサンプルの信頼性は, 評価次元によって大きく異なる可能性がある。
したがって、グローバルスカラーメトリクスに基づいてフィルタリングする一般的なデータ中心の手法は、T2Vタスクには不適当である。
そこで本稿では,次元依存型監視リスクを効率的に見積もる不整合影響フレームワークを提案する。
この枠組みを応用して、極端に高リスクなサンプルを除去する次元ディスタングルドプルーニング(Dimension-Disentangled Pruning)と、ハイリスクな監督をソフトに下方修正する次元ディケンタングルドリウェイト(Dimension-Disentangled Reweighting)という2つのディメンジョンディスタングルド洗練戦略を導入する。
広汎な実験により、我々の絡み合った戦略は、グローバルなフィルタリングベースラインを著しく上回り、地上の真実に優れたアライメントを持つ報酬モデルが得られることを示した。
関連論文リスト
- World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry [82.93104394404781]
汎用世界モデルは、スケーラブルなポリシー評価、最適化、計画を約束します。
本稿では,世界モデルによる予測誤りと自己改善を識別するフレームワークであるWorld Action Verifier(WAV)を提案する。
論文 参考訳(メタデータ) (2026-04-02T12:48:36Z) - RISE-Video: Can Video Generators Decode Implicit World Rules? [71.92434352963427]
テキスト画像合成(TI2V)の先駆的推論指向ベンチマークであるRISE-Videoを提案する。
RISE-Videoは、8つの厳格なカテゴリにまたがる、細心の注意深い人手によるサンプル467種からなる。
本研究では,LMM(Large Multimodal Models)を利用して人中心評価をエミュレートする自動パイプラインを提案する。
論文 参考訳(メタデータ) (2026-02-05T18:36:10Z) - UniSH: Unifying Scene and Human Reconstruction in a Feed-Forward Pass [83.7071371474926]
UniSHは、統合されたフィードフォワードフレームワークで、共同でメートルスケールの3Dシーンと人間の再構築を行う。
我々のフレームワークは、シーン再構築とHMRとの違いを強く橋渡しします。
本モデルは,人間中心のシーン再構築における最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-01-03T16:06:27Z) - GradID: Adversarial Detection via Intrinsic Dimensionality of Gradients [0.1019561860229868]
本稿では,モデルの入力損失景観の幾何学的特性について検討する。
提案手法の基盤となる自然データと逆データに対するIDの相違点を明らかにした。
我々の検出器は、CWやAutoAttackを含む様々な攻撃に対して既存の手法を大幅に上回り、CIFAR-10では92%以上の検出率を達成した。
論文 参考訳(メタデータ) (2025-12-14T20:16:03Z) - On Evaluating the Adversarial Robustness of Foundation Models for Multimodal Entity Linking [11.268639885321884]
敵攻撃シナリオの相違により,メインストリームMELモデルのロバスト性を総合的に評価する。
5つのデータセットの実験では、LCM-RetLinkはMELの精度を0.4%-35.7%改善している。
この研究は、MELのロバスト性に関する未調査の側面を強調し、最初のMEL逆例データセットを構築し、リリースする。
論文 参考訳(メタデータ) (2025-08-21T11:57:37Z) - A Unified Virtual Mixture-of-Experts Framework:Enhanced Inference and Hallucination Mitigation in Single-Model System [9.764336669208394]
GPTやBERTのような生成モデルは、テキスト生成や要約といったタスクのパフォーマンスを大幅に改善した。
しかし、「モデルが非現実的または誤解を招くコンテンツを生成する場所」という幻覚は、特に小規模アーキテクチャでは問題となる。
本稿では,単一のQwen 1.5 0.5Bモデルにおいて,推論性能を高め,幻覚を緩和する仮想ミックス・オブ・エクササイズ(MoE)融合戦略を提案する。
論文 参考訳(メタデータ) (2025-04-01T11:38:01Z) - Controlling Risk of Retrieval-augmented Generation: A Counterfactual Prompting Framework [77.45983464131977]
我々は、RAGモデルの予測が誤りであり、現実のアプリケーションにおいて制御不能なリスクをもたらす可能性がどの程度あるかに焦点を当てる。
本研究は,RAGの予測に影響を及ぼす2つの重要な潜伏要因を明らかにする。
我々は,これらの要因をモデルに誘導し,その応答に与える影響を解析する,反実的プロンプトフレームワークを開発した。
論文 参考訳(メタデータ) (2024-09-24T14:52:14Z) - Inter-slice Super-resolution of Magnetic Resonance Images by Pre-training and Self-supervised Fine-tuning [49.197385954021456]
臨床実践では、2次元磁気共鳴(MR)シーケンスが広く採用されている。個々の2次元スライスを積み重ねて3次元ボリュームを形成できるが、比較的大きなスライスススペーシングは可視化とその後の解析タスクに課題をもたらす可能性がある。
スライス間隔を低減するため,ディープラーニングに基づく超解像技術が広く研究されている。
現在のほとんどのソリューションは、教師付きトレーニングのために、かなりの数の高解像度と低解像度の画像を必要とするが、通常は現実のシナリオでは利用できない。
論文 参考訳(メタデータ) (2024-06-10T02:20:26Z) - Exploring the Physical World Adversarial Robustness of Vehicle Detection [13.588120545886229]
アドリアックは現実世界の検知モデルの堅牢性を損なう可能性がある。
CARLAシミュレータを用いた革新的なインスタントレベルデータ生成パイプラインを提案する。
本研究は, 逆境条件下での多種多様なモデル性能について考察した。
論文 参考訳(メタデータ) (2023-08-07T11:09:12Z) - Towards General Visual-Linguistic Face Forgery Detection [95.73987327101143]
ディープフェイクは現実的な顔操作であり、セキュリティ、プライバシー、信頼に深刻な脅威をもたらす可能性がある。
既存の方法は、このタスクを、デジタルラベルまたはマスク信号を使用して検出モデルをトレーニングするバイナリ分類として扱う。
本稿では, 微粒な文レベルのプロンプトをアノテーションとして用いた, VLFFD (Visual-Linguistic Face Forgery Detection) という新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2023-07-31T10:22:33Z) - A Comprehensive Evaluation Framework for Deep Model Robustness [44.20580847861682]
ディープニューラルネットワーク(DNN)は、幅広いアプリケーションで顕著なパフォーマンスを達成しています。
彼らは敵の防御を動機付ける敵の例に弱い。
本稿では,包括的で厳密で一貫性のある評価指標を含むモデル評価フレームワークを提案する。
論文 参考訳(メタデータ) (2021-01-24T01:04:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。