論文の概要: HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement
- arxiv url: http://arxiv.org/abs/2607.18217v1
- Date: Mon, 20 Jul 2026 17:51:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.728372
- Title: HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement
- Title(参考訳): HOMIE:マルチモーダル・インテリジェンス・エンハンスメントによる人間対象のCentric Videoパーソナライズ
- Abstract要約: 人間中心型ビデオパーソナライゼーション(HOCVP)は、主観駆動型ビデオ生成における中核的な課題である。
我々は,オブジェクト間の入力設定とオブジェクト内入力設定の両方を統一的に扱うHOCVPフレームワークHOMIEを提案する。
本稿では,MLLMに基づく意味的特徴とVAEトークンとの整合性を向上するために,自己注意の中でグローバルなマルチモーダルガイダンスを導入する。
- 参考スコア(独自算出の注目度): 49.760248537839715
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human-object centric video personalization (HOCVP) is a core task within subject-driven video generation. However, existing methods suffer from two key limitations. First, most approaches focusing on inter-subject personalization still struggle to strike a balance between high subject fidelity and accurate interaction patterns between humans and diverse objects, especially when objects represent abstract concepts such as logos. Second, while intra-subject references (e.g., OCR maps, multi-view inputs) are expected to enhance subject fidelity, most existing works lack mechanisms to understand such latent correspondence. To address both challenges, we propose HOMIE, an HOCVP framework that tackles both inter- and intra-subject input settings in a unified manner. Compared to previous approaches, HOMIE proposes a better MLLM integration strategy to extract knowledge of reference-level relationships without compromising the controllability of text encoders or incurring costly re-alignment. Specifically, we introduce global multimodal guidance within self-attention to better align MLLM-derived semantic features with VAE tokens. Furthermore, we propose modality-reference embedding to differentiate tokens from MLLM features and VAE tokens and associate intra-subject reference image tokens. Extensive experiments validate that our method achieves state-of-the-art performance across various HOCVP tasks. Project Page: https://yiyangcai.github.io/homie-page.github.io/
- Abstract(参考訳): 人間中心型ビデオパーソナライゼーション(HOCVP)は、主観駆動型ビデオ生成における中核的な課題である。
しかし、既存の手法には2つの重要な制限がある。
第一に、オブジェクト間のパーソナライゼーションに焦点を当てたほとんどのアプローチは、特にロゴのような抽象概念を表現する場合、高主観的忠実度と人間と多様なオブジェクトとの正確な相互作用パターンのバランスを取るのに苦慮している。
第二に、オブジェクト内参照(OCRマップ、マルチビューインプットなど)は主観的忠実度を高めることが期待されているが、既存の作業ではそのような潜時対応を理解するメカニズムが欠如している。
両課題に対処するため,HOCVPフレームワークであるHOMIEを提案する。
従来の手法と比較して,HOMIEはテキストエンコーダの制御性を損なうことなく参照レベル関係の知識を抽出したり,コストのかかる再アライメントを伴わない,より優れたMLLM統合戦略を提案する。
具体的には、MLLMに基づく意味的特徴とVAEトークンとの整合性を改善するために、自己注意の中でグローバルなマルチモーダルガイダンスを導入する。
さらに、MLLMの特徴とVAEトークンとを区別し、オブジェクト内参照画像トークンを関連付けるためのモダリティ参照埋め込みを提案する。
大規模実験により,HOCVPタスク間の最先端性能が得られた。
Project Page: https://yyangcai.github.io/homie-page.github.io/
関連論文リスト
- Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment [20.811984469709508]
Auraは、高忠実でアイデンティティに一貫性のあるビデオ生成のための統一されたフレームワークである。
本稿では,映像コンテンツの密度と構造を記述したAIディレクターレベルのキャプションを紹介する。
専用データ構築パイプラインを通じて高品質なビデオオブジェクト画像データセットを構築する。
論文 参考訳(メタデータ) (2026-07-05T13:54:33Z) - Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models [40.30801020339839]
VisionToMは、タスク認識推論を強化するために設計された視覚指向の介入フレームワークである。
視覚表現を正しいセマンティックターゲットと整列する介入ベクトルを計算する。
このガイダンスにより、モデルが突発的な言語的先行への依存を減らすことができる。
論文 参考訳(メタデータ) (2026-03-25T16:24:50Z) - RefAtomNet++: Advancing Referring Atomic Video Action Recognition using Semantic Retrieval based Multi-Trajectory Mamba [86.47790050206306]
RefAVA++は290万フレームと75.1kの注釈付き人で構成される。
RefAtomNet++は、多階層的なセマンティックアラインなクロスアテンションメカニズムを通じて、クロスモーダルトークンアグリゲーションを前進させる。
実験によると、RefAtomNet++は新しい最先端の結果を確立している。
論文 参考訳(メタデータ) (2025-10-18T10:41:19Z) - Harmonizing Visual Representations for Unified Multimodal Understanding and Generation [53.01486796503091]
我々は,共有MARエンコーダによる理解と生成タスクを調和させる統合自己回帰フレームワークであるemphHarmonを提案する。
HarmonはGenEval、MJHQ30K、WISEベンチマークで最先端の画像生成結果を達成する。
論文 参考訳(メタデータ) (2025-03-27T20:50:38Z) - Cognitive Disentanglement for Referring Multi-Object Tracking [28.325814292139686]
本稿では,CDRMT(Cognitive Disentanglement for Referring Multi-Object Tracking)フレームワークを提案する。
CDRMTは人間の視覚処理システムからRMOTタスクへの"What"と"where"の経路を適応させる。
異なるベンチマークデータセットの実験では、CDRMTが最先端のメソッドよりも大幅に改善されていることが示されている。
論文 参考訳(メタデータ) (2025-03-14T15:21:54Z) - Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs [7.03771340666549]
MLLM(Multimodal Large Language Models)における視覚言語ミスアライメントは重要な課題である。
本稿では,MMA(Modality-mutual attention)に因果的注意を開放し,画像トークンがテキストトークンに参加することを可能にする新しいMLLMであるMapleLeaf AKIを提案する。
我々のMMA設計は汎用的であり、様々なモダリティにまたがるアプリケーションを可能にし、多様なマルチモーダルシナリオに対応できるようにスケーラブルである。
論文 参考訳(メタデータ) (2025-03-04T13:18:33Z) - ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives [109.11714588441511]
Ego-Exoオブジェクト対応タスクは,セグメンテーションを通じて,ego-Exoパースペクティブ間のオブジェクト関係を理解することを目的としている。
最近提案されたセグメンテーション手法であるPSALMは、このタスクでデモされたゼロショット能力を例外として挙げている。
我々は、マルチモーダルコンディションフュージョンとSSLベースのクロスビューオブジェクトアライメントという、2つの重要なモジュールを特徴とする新しいアプローチであるObjectRelatorを提案する。
論文 参考訳(メタデータ) (2024-11-28T12:01:03Z) - Detecting Any Human-Object Interaction Relationship: Universal HOI
Detector with Spatial Prompt Learning on Foundation Models [55.20626448358655]
本研究では,ビジョン・ランゲージ(VL)基礎モデルと大規模言語モデル(LLM)を用いて,オープンワールド環境におけるユニバーサルインタラクション認識について検討する。
我々の設計にはHO Prompt-guided Decoder (HOPD) が含まれており、基礎モデルにおける高次関係表現と画像内の様々なHOペアとの結合を容易にする。
オープンカテゴリの対話認識では,対話文と解釈文の2つのタイプがサポートされている。
論文 参考訳(メタデータ) (2023-11-07T08:27:32Z) - Object Segmentation by Mining Cross-Modal Semantics [68.88086621181628]
マルチモーダル特徴の融合と復号を導くために,クロスモーダル・セマンティックスをマイニングする手法を提案する。
具体的には,(1)全周減衰核融合(AF),(2)粗大デコーダ(CFD),(3)多層自己超越からなる新しいネットワークXMSNetを提案する。
論文 参考訳(メタデータ) (2023-05-17T14:30:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。