論文の概要: Beyond Visual Boundaries: Rethinking Scene Segmentation for Movie RAG
- arxiv url: http://arxiv.org/abs/2608.28699v1
- Date: Thu, 27 Aug 2026 14:25:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.719095
- Title: Beyond Visual Boundaries: Rethinking Scene Segmentation for Movie RAG
- Title(参考訳): ビジュアル境界を超えて:映画RAGのシーンセグメンテーションを再考
- Abstract要約: 検索拡張世代(RAG)は、グラウンドドジェネレーションのための関連ビデオセグメントを選択的に検索することで、有望な中間層を提供する。
映画理解のためのRAGについて検討し,何時間ものコンテンツにまたがるキャラクター,イベント,物語の弧について,ストーリーレベルの推論を求める。
物語中心のシーンセグメンテーションデータセットであるNarraSceneを紹介する。
- 参考スコア(独自算出の注目度): 26.7662002828488
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Understanding long-form video remains a fundamental challenge for multimodal large language models (MLLMs). Sparse frame sampling fails to capture fine-grained visual details, while dense sampling quickly exceeds context length limits. Retrieval-augmented generation (RAG) offers a promising middle ground by selectively retrieving relevant video segments for grounded generation, yet its effectiveness critically depends on the quality of the video segments used as retrieval units. In this paper, we investigate RAG for movie understanding, which demands story-level reasoning over characters, events, and narrative arcs spanning hours of content. Scene segmentation, a long-studied problem that partitions movies into semantically coherent units, is a natural candidate for defining such retrieval units. We reexamine whether existing methods actually serve this role through comprehensive evaluation on downstream movie understanding tasks, and find that they consistently fail to outperform naive uniform temporal chunking. Our audit of the most standard scene segmentation benchmarks reveals why: current annotations prioritize visually salient transitions over narrative event structure. Motivated by this mismatch, we introduce NarraScene, a narrative-centric scene segmentation dataset annotated with a three-level cognitive taxonomy spanning physical, character, and narrative change, where every valid boundary requires a narrative-level shift. When used as retrieval units, these narrative-grounded segments outperform uniform chunking on downstream movie understanding tasks, suggesting that the central challenge for scene segmentation in movie RAG is not detecting boundaries, but identifying the narrative event units that matter for movie understanding.
- Abstract(参考訳): 長大なビデオを理解することは、マルチモーダル大言語モデル(MLLM)の根本的な課題である。
スパースフレームサンプリングはきめ細かな視覚的詳細を捉えるのに失敗するが、密集サンプリングは文脈長制限を超える。
Retrieval-augmented Generation (RAG) は、グラウンドドジェネレーションのための関連ビデオセグメントを選択的に検索することで、有望な中間層を提供するが、その有効性は検索ユニットとして使用されるビデオセグメントの品質に大きく依存する。
本稿では,映画理解のためのRAGについて検討し,何時間ものコンテンツにまたがるキャラクタ,イベント,物語のアークに対して,ストーリーレベルの推論を要求する。
シーンセグメンテーション(Scene segmentation)は、映画を意味的に一貫性のある単位に分割する長年研究されてきた問題であり、このような検索単位を定義するための自然な候補である。
我々は、下流の映画理解タスクを総合的に評価することで、既存の手法が実際にこの役割を果たすかどうかを再検討する。
現在のアノテーションは、物語のイベント構造よりも視覚的に健全な遷移を優先しています。
このミスマッチに動機づけられたNarraSceneは、身体、性格、物語の変化にまたがる3段階の認知分類を付加した、物語中心のシーンセグメンテーションデータセットである。
検索ユニットとして使用すると、これらの物語的セグメントは下流の映画理解タスクにおいて一様にチャンクし、映画のRAGにおけるシーンセグメンテーションにおける中心的な課題は境界の検出ではなく、映画理解にとって重要な物語イベントユニットを特定することである。
関連論文リスト
- Explainable Forensics of Manipulated Segments in Untrimmed Long Videos [50.190474724159465]
時間的AI生成セグメンテーションの局所化と説明のタスクを定式化する。
多様な操作パターンと豊富なアノテーション信号を備えた12,472の未トリミングビデオからなる大規模ベンチマークであるTASLEを紹介する。
そこで本稿では,MLLMに基づく精密な境界ローカライゼーションと解釈可能な推論のためのリファインメントモジュールと,効率的な長ビデオスキャンのためのバウンダリ感性提案生成モジュールを組み合わせた,粗大な法医学ベースラインであるMSLocを提案する。
論文 参考訳(メタデータ) (2026-06-01T15:48:38Z) - Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark [13.365117498062565]
この研究はシーンを、視覚的コンテキストと意味的コンテキストの両方が一貫したビデオのコヒーレントなセグメントとして定義する。
我々は、シーンレベルの課題を提供するために設計された新しいベンチマークであるSceneBenchを紹介した。
Scene-RAGはVLMの性能を+2.50%改善し、現在のモデルが長いコンテキスト保持に苦戦していることを確認した。
論文 参考訳(メタデータ) (2026-03-28T12:44:19Z) - VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding [40.699624658181456]
VideoDetectiveは、長いビデオ質問応答において効果的な手がかり探しのために、クエリ・ツー・セグメンテーションの関連性とセグメンション間の親和性を統合するフレームワークである。
提案手法は,ビデオMME-longで最大7.5%の精度向上を実現し,MLLMの多種多様な性能向上を実現している。
論文 参考訳(メタデータ) (2026-03-23T17:59:51Z) - Temporal Prompting Matters: Rethinking Referring Video Object Segmentation [64.82333675385802]
Referring Video Object (RVOS) は、クエリ文によって参照されるオブジェクトをビデオにセグメントすることを目的としている。
既存のほとんどの方法は、密集したマスクアノテーションによるエンドツーエンドのトレーニングを必要とする。
本稿では,参照要因とビデオ要因に対処するテンポラル・プロンプト生成・選択(テネ)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-08T17:59:57Z) - SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding [6.980340270823506]
SceneRAGは,映像を物語に一貫性のあるシーンに分割するフレームワークである。
各シーンについて、このフレームワークは視覚とテキストの両方のモダリティから情報を融合し、エンティティ関係を抽出する。
LongerVideosベンチマークの実験では、134時間以上の多様なコンテンツがあり、SceneRAGが以前のベースラインを大幅に上回っていることを確認した。
論文 参考訳(メタデータ) (2025-06-09T10:00:54Z) - CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos [59.391265901911005]
本稿では,MLLMのゼロショット・チェーン・オブ・ソート(CoT)機能を利用して,時間-意味的推論による複雑な問題に対処する新しいフレームワークであるCoT-RVSを提案する。
CoT-RVSは、言語クエリ(セマンティック)にマッチする可能性のある特定のフレーム内の可視オブジェクトを分析し、すべてのフレーム(一時)の中で、懸命に観察できる各オブジェクトに対して対応するオブジェクトを選択する。
当社のフレームワークのトレーニングフリー機能は,テスト時にCoTを使用して,よりよいターゲットが出現し始めると関心の対象を更新するオンラインビデオストリーム処理の拡張も可能にしています。
論文 参考訳(メタデータ) (2025-05-24T07:01:31Z) - ViLLa: Video Reasoning Segmentation with Large Language Model [48.75470418596875]
ViLLa: 大規模言語モデルを用いたビデオ推論セグメンテーションを提案する。
ViLLaは、複数のコアイノベーションを通じて、これらの課題に対処しています。
長ビデオの効率的な処理を可能にするために、Villaは(3)長ビデオを短いが意味的に密度の高いセグメントに適応的に分割し、冗長性を低下させるキーセグメントサンプリングを組み込んでいる。
論文 参考訳(メタデータ) (2024-07-18T17:59:17Z) - A Hierarchical Multi-Modal Encoder for Moment Localization in Video
Corpus [31.387948069111893]
テキストクエリにセマンティックにマッチする長いビデオにおいて、短いセグメントを識別する方法を示す。
この問題に対処するために、粗いクリップレベルと微調整フレームレベルの両方でビデオをエンコードするHierArchical Multi-Modal EncodeR (HAMMER)を提案する。
我々は、ActivityNet CaptionsとTVRデータセット上のビデオコーパスにおけるモーメントローカライゼーションのモデルを評価するために、広範囲にわたる実験を行った。
論文 参考訳(メタデータ) (2020-11-18T02:42:36Z) - A Local-to-Global Approach to Multi-modal Movie Scene Segmentation [95.34033481442353]
我々は、150本の映画から21Kの注釈付きシーンセグメントを含む大規模なビデオデータセット、MovieScenesを構築した。
本稿では,クリップ,セグメント,映画の3段階にわたるマルチモーダル情報を統合するローカル・グローバルシーンセグメンテーションフレームワークを提案する。
実験の結果,提案するネットワークは,映画を高い精度でシーンに分割し,従来手法より一貫した性能を発揮することがわかった。
論文 参考訳(メタデータ) (2020-04-06T13:58:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。