論文の概要: I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning
- arxiv url: http://arxiv.org/abs/2608.07417v1
- Date: Fri, 07 Aug 2026 17:02:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.571007
- Title: I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning
- Title(参考訳): ビデオで見る:個人中心のビデオ推論のためのアイデンティティの要求されたクェリ
- Abstract要約: 実世界のビデオ推論は、しばしばマルチモーダルなマルチソース入力を伴う。
本稿では,ISYV(I Seek You in Videos, I Seek You in Videos)について述べる。
ISYVは、統合されたタスク定義、スケーラブルなデータセット/ベンチマーク、人中心のビデオ推論のための洞察のモデリングを提供する。
- 参考スコア(独自算出の注目度): 26.356216111197224
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-world video reasoning often involves multimodal, multi-source inputs, whereas existing video reasoning tasks typically assume a simplified video-text setting, limiting identity matching and person-centric reasoning. To bridge this gap, we introduce the Identity-conditioned Queries (ICQ) task, in which models are required to jointly associate and interpret an input video and a reference image of a person, and leverage this conditioning to address identity grounding, behavior understanding, and temporal reasoning, among other challenges. Building on ICQ, we present ISYV (I Seek You in Videos), a systematic solution comprising three components: (1) ISYV-Bench, a challenging evaluation benchmark with 1,377 real-world complex videos and 1,377 question-answer pairs, organized into six difficulty levels spanning capabilities from identity recognition to causal reasoning; (2) ISYV-75K, a large-scale training set of 75K high-quality samples constructed via automated annotation, multi-stage verification, and manual review; and (3) ISYV-Framework, containing an ICQ-oriented model and training strategy for learning to exploit informative video shots without additional shot-level annotations. Extensive experiments show that both mainstream closed-source and open-source MLLMs struggle on ISYV-Bench, especially in cross-domain identity matching and long-horizon tracking. ISYV-Model outperforms strong baselines and in some aspects approaches closed-source performance. Overall, ISYV provides a unified task definition, scalable datasets/benchmarks, and modeling insights for person-centric video reasoning.
- Abstract(参考訳): 実世界のビデオ推論は、しばしばマルチモーダルでマルチソースな入力を伴うが、既存のビデオ推論タスクは、通常、単純化されたビデオテキスト設定、アイデンティティマッチングの制限、個人中心の推論を前提としている。
このギャップを埋めるために、我々はICQ(Identity- Conditioned Queries)タスクを導入し、入力されたビデオと人の参照画像とを協調的に関連づけ、解釈し、この条件を利用してアイデンティティの基盤、行動理解、時間的推論に対処する。
ICQ上に構築したISYV(I Seek You in Videos)は,(1)実世界の複合ビデオ1,377件と質問応答ペア1,377件の難易度評価ベンチマークであるISYV-Bench,(2)自動アノテーション,多段階検証,手動による75Kの高品質なサンプルからなる大規模トレーニングセットであるISYV-75K,(3)ICQ指向のモデルとトレーニング戦略を含む,3つのコンポーネントからなる体系的ソリューションである。
大規模な実験により、メインストリームのクローズドソースとオープンソースMLLMの両方がISYV-Bench、特にクロスドメインIDマッチングとロングホライゾントラッキングに苦戦していることが明らかとなった。
ISYV-Modelは強力なベースラインを上回り、いくつかの面でクローズドソースパフォーマンスにアプローチする。
全体としてISYVは、統合されたタスク定義、スケーラブルなデータセット/ベンチマーク、人中心のビデオ推論のための洞察のモデリングを提供する。
関連論文リスト
- VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding [73.10050069618302]
VideoGAIAは、汎用人工知能アシスタントのためのエージェントビデオ理解ベンチマークである。
VideoGAIAには、多様で複雑な現実世界のシナリオをカバーする、モデルと人間の共同設計タスクが271個含まれている。
GPT-5.5やKim-K3のようなフロンティアモデルを含む全ての評価されたMLLMは、ビデオGAIAで60%未満の精度を実現している。
論文 参考訳(メタデータ) (2026-08-12T03:24:44Z) - Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding [98.3098451637867]
Video-MME-v2は、ビデオ理解の堅牢性と忠実さを厳格に評価するために設計された総合的なベンチマークである。
データ品質を保証するため、Video-MME-v2は厳格に制御された人間のアノテーションパイプラインを通して構築される。
論文 参考訳(メタデータ) (2026-04-06T17:59:56Z) - A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding [69.31609753061137]
マルチモーダルな大規模言語モデルはシングルビデオ理解において高いパフォーマンスを達成しているが、複数のビデオにまたがる推論能力は依然として限られている。
既存のアプローチでは、複数のビデオを1つの入力にまとめて直接推論を行い、トレーニングと推論のミスマッチを導入する。
現在のマルチビデオベンチマークでは、主にイベントレベルの比較を強調しており、アイデンティティレベルのマッチング、きめ細かい識別、構造化されたマルチステップ推論が過小評価されている。
視覚ツール,タスク固有のスキル,コンフリクト対応検証機構を統合した,多視点理解のためのスキル強化型エージェントフレームワークSAMAを提案する。
論文 参考訳(メタデータ) (2026-03-16T02:09:48Z) - Agentic Video Intelligence: A Flexible Framework for Advanced Video Exploration and Understanding [43.785571875867]
本稿では,システムレベルの設計と最適化によって人間の映像理解を反映できるフレキシブルでトレーニング不要なフレームワークであるエージェントビデオインテリジェンス(AVI)を提案する。
AVIは、(1)人間にインスパイアされた3相推論プロセス(Retrieve-Perceive-Review)、(2)エンティティグラフによって構成された構造化ビデオ知識ベース、(3)軽量CVモデルとVLMを組み合わせたオープンソースのモデルアンサンブルの3つの重要なイノベーションを紹介している。
論文 参考訳(メタデータ) (2025-11-18T12:43:15Z) - ID-Composer: Multi-Subject Video Synthesis with Hierarchical Identity Preservation [48.59900036213667]
大規模なデータセットで事前訓練されたビデオ生成モデルは高品質なビデオを生成することができるが、テキストや単一の画像に条件付けされることも多い。
本稿では,テキストプロンプトと参照画像から多目的映像を生成する新しいフレームワークであるID-Composerを紹介する。
論文 参考訳(メタデータ) (2025-11-01T11:29:14Z) - Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models [78.32948112203228]
ビデオ理解はコンピュータビジョンにおける最も困難なフロンティアである。
近年,映像理解タスクにおいて,映像多時間モデルが顕著に出現している。
Surveyは、ビデオ-LMM能力を向上するための統一的なフレームワークを研究者や実践者に提供することを目的としている。
論文 参考訳(メタデータ) (2025-10-06T17:10:44Z) - CVBench: Evaluating Cross-Video Synergies for Complex Multimodal Understanding and Reasoning [11.478276629279526]
CVBenchは,ビデオ間のリレーショナル推論を厳格に評価するために設計された,最初の総合的なベンチマークである。
CVBenchは、クロスビデオオブジェクトアソシエーション、クロスビデオイベントアソシエーション、クロスビデオ複合推論の3層にまたがる1000の質問応答ペアで構成されている。
5つのドメインの異なるビデオクラスタから構築されたこのベンチマークは、ダイナミックな視覚的コンテキストにまたがる情報を合成するモデルに挑戦する。
論文 参考訳(メタデータ) (2025-08-27T03:29:35Z) - VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering [14.039561301034848]
ビデオ間の質問応答は、従来のシングルビデオ理解以上の大きな課題を提示する。
我々は、人による階層的推論を通じてこれらの課題に対処する、新しいフレームワークであるVideoForestを紹介する。
提案手法では,ビデオ間の自然なブリッジポイントとして人間レベルの特徴を活用し,エンドツーエンドのトレーニングを必要とせず,効果的にビデオ間の理解を可能にする。
論文 参考訳(メタデータ) (2025-08-05T03:33:24Z) - DeepQAMVS: Query-Aware Hierarchical Pointer Networks for Multi-Video
Summarization [127.16984421969529]
DeepQAMVSと呼ばれるマルチビデオ要約のための新しいQuery-Aware階層型ポインタネットワークを紹介します。
DeepQAMVSは強化学習で訓練され、代表性、多様性、クエリ適応性、時間的コヒーレンスを捉えた報酬を取り入れている。
MVS1Kデータセットで最新の結果を達成し、入力されたビデオフレームの数と線形に推論時間をスケーリングします。
論文 参考訳(メタデータ) (2021-05-13T17:33:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。