論文の概要: PEARL: Personalized Streaming Video Understanding Model
- arxiv url: http://arxiv.org/abs/2603.20422v1
- Date: Fri, 20 Mar 2026 18:47:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:38.904109
- Title: PEARL: Personalized Streaming Video Understanding Model
- Title(参考訳): PEARL:パーソナライズされたストリーミングビデオ理解モデル
- Authors: Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu Zhang, Haodong Li, Qintong Zhang, Renrui Zhang, Guopeng Li, Yifan Zhang, Yuheng Li, Wentao Zhang,
- Abstract要約: マルチモーダルパーソナライズ法は、主に静的画像やオフラインビデオに限られる。
PEARL-Benchはこの困難な設定を評価するために特別に設計された最初の包括的なベンチマークである。
PEARLは8つのオフラインおよびオンラインモデルにわたる最先端のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 50.273809779498464
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human cognition of new concepts is inherently a streaming process: we continuously recognize new objects or identities and update our memories over time. However, current multimodal personalization methods are largely limited to static images or offline videos. This disconnects continuous visual input from instant real-world feedback, limiting their ability to provide the real-time, interactive personalized responses essential for future AI assistants. To bridge this gap, we first propose and formally define the novel task of Personalized Streaming Video Understanding (PSVU). To facilitate research in this new direction, we introduce PEARL-Bench, the first comprehensive benchmark designed specifically to evaluate this challenging setting. It evaluates a model's ability to respond to personalized concepts at exact timestamps under two modes: (1) Frame-level, focusing on a specific person or object in discrete frames, and (2) a novel Video-level, focusing on personalized actions unfolding across continuous frames. PEARL-Bench comprises 132 unique videos and 2,173 fine-grained annotations with precise timestamps. Concept diversity and annotation quality are strictly ensured through a combined pipeline of automated generation and human verification. To tackle this challenging new setting, we further propose PEARL, a plug-and-play, training-free strategy that serves as a strong baseline. Extensive evaluations across 8 offline and online models demonstrate that PEARL achieves state-of-the-art performance. Notably, it brings consistent PSVU improvements when applied to 3 distinct architectures, proving to be a highly effective and robust strategy. We hope this work advances vision-language model (VLM) personalization and inspires further research into streaming personalized AI assistants. Code is available at https://github.com/Yuanhong-Zheng/PEARL.
- Abstract(参考訳): 私たちは新しい物体やアイデンティティを継続的に認識し、時間の経過とともに記憶を更新します。
しかし、現在のマルチモーダルパーソナライズ手法は静的画像やオフラインビデオに限られている。
これにより、リアルタイムで対話的なパーソナライズされた応答を、将来のAIアシスタントに不可欠なものにする能力を制限することができる。
このギャップを埋めるために、我々はまずパーソナライズされたストリーミングビデオ理解(PSVU)の新しいタスクを提案し、正式に定義する。
PEARL-Benchは、この挑戦的な設定を評価するために設計された最初の総合的なベンチマークである。
1)個別のフレームで特定の人物や物体に焦点をあてるフレームレベルと,(2)連続のフレームに展開するパーソナライズされたアクションに焦点をあてるビデオレベルという2つのモードで,パーソナライズされた概念に正確に対応できるモデルの能力を評価する。
PEARL-Benchは132のユニークなビデオと2,173の細かいアノテーションと正確なタイムスタンプで構成されている。
概念の多様性とアノテーションの品質は、自動生成と人間の検証を組み合わせたパイプラインを通じて厳密に保証される。
この挑戦的な新しい設定に取り組むために、より強力なベースラインとして機能するプラグアンドプレイのトレーニングフリー戦略であるPEARLを提案する。
8つのオフラインおよびオンラインモデルにわたる大規模な評価は、PEARLが最先端のパフォーマンスを達成することを示す。
特に、3つの異なるアーキテクチャに適用された場合、一貫したPSVUの改善がもたらされ、非常に効果的で堅牢な戦略であることが証明された。
この研究が視覚言語モデル(VLM)のパーソナライズを促進し、パーソナライズされたAIアシスタントのストリーミングに関するさらなる研究を促すことを願っている。
コードはhttps://github.com/Yuanhong-Zheng/PEARL.comで公開されている。
関連論文リスト
- KlingAvatar 2.0 Technical Report [43.949604396366425]
本モデルは,マルチモーダル・アライメントの長めの高解像度ビデオ生成における課題を効果的に解決する。
視覚的明瞭度の向上、正確な唇同期によるリアルな唇歯のレンダリング、強力なアイデンティティ保存、そしてコヒーレントなマルチモーダル・インストラクションを提供する。
論文 参考訳(メタデータ) (2025-12-15T13:30:51Z) - STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits [44.82339975771063]
STARCasterは、音声駆動のポートレートアニメーションとフリーポイントのトーキングポートレートの両方に対処する、アイデンティティを意識したビデオ拡散モデルである。
モデルは推論時に生成されたものよりも長い時間的文脈から学習し、既存の自己回帰的アプローチに共通する過度に静的なアニメーションを緩和する。
論文 参考訳(メタデータ) (2025-12-15T11:59:01Z) - Skeletons Speak Louder than Text: A Motion-Aware Pretraining Paradigm for Video-Based Person Re-Identification [8.135364788458423]
マルチモーダル・プレトレーニングは視覚的理解に革命をもたらしたが、人に基づく人物再識別(ReID)への影響はいまだ未発見である。
既存のアプローチはビデオとテキストのペアに依存することが多いが、(1)真のマルチモーダル事前学習の欠如、(2)テキストが微妙な時間運動を捉えにくいという2つの基本的な制限に悩まされている。
ReIDのための最初のスケルトン駆動事前学習フレームワークを導入することで、テキストベースのパラダイムから大胆に離れる。
論文 参考訳(メタデータ) (2025-11-17T08:59:41Z) - Privacy Beyond Pixels: Latent Anonymization for Privacy-Preserving Video Understanding [56.369026347458835]
本稿では,ビデオ基盤モデルにおける視覚的プライバシ保護の新たな定式化について紹介する。
入力ピクセルレベルの匿名化に関する現在のプライバシー保護手法では、ユーティリティビデオモデル全体を再トレーニングする必要がある。
軽量な Anonym Adapter Module (AAM) は、一般的なタスクユーティリティを維持しながら、ビデオ機能からプライベート情報を除去する。
論文 参考訳(メタデータ) (2025-11-11T18:56:27Z) - Eyes Wide Open: Ego Proactive Video-LLM for Streaming Video [36.94345183020698]
我々は、egoストリーミングビデオ入力を前提として、多種多様な質問に積極的に答える革新的なタスクに焦点をあてる。
このタスクは、(1)プロアクティブコヒーレンス、(2)ジャスト・イン・タイム・レスポンシブネス、(3)シンクロナイズド・効率の3つの重要な特性を具現化する。
この課題に対処するための総合的な技術パイプラインを提案する。
論文 参考訳(メタデータ) (2025-10-16T11:11:13Z) - Understanding Long Videos via LLM-Powered Entity Relation Graphs [51.13422967711056]
GraphVideoAgentは、ビデオシーケンスを通して視覚的エンティティ間の進化する関係をマップし、監視するフレームワークである。
当社の手法は,業界ベンチマークと比較した場合,顕著な効果を示す。
論文 参考訳(メタデータ) (2025-01-27T10:57:24Z) - Multi-subject Open-set Personalization in Video Generation [110.02124633005516]
我々は、マルチオブジェクトでオープンなパーソナライズ機能を備えたビデオモデルとして、Video Alchemist $-$を提示する。
本モデルは,各条件付き参照画像と対応する主観レベルテキストプロンプトを融合するDiffusion Transformerモジュール上に構築されている。
本手法は,定量評価と定性評価の両方において,既存のパーソナライズ手法を著しく上回っている。
論文 参考訳(メタデータ) (2025-01-10T18:59:54Z) - Video-based Person Re-identification with Long Short-Term Representation
Learning [101.62570747820541]
ビデオベースの人物再識別(V-ReID)は、オーバーラップしないカメラで撮影した生のビデオから特定の人物を回収することを目的としている。
本稿では,V-ReIDのためのLong Short-Term Representation Learning(LSTRL)という新しいディープラーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-07T16:22:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。