論文の概要: CausalChapter: Improving Long-Video Chaptering with Interventional Dependency Modeling
- arxiv url: http://arxiv.org/abs/2609.08686v1
- Date: Tue, 08 Sep 2026 12:54:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.651277
- Title: CausalChapter: Improving Long-Video Chaptering with Interventional Dependency Modeling
- Title(参考訳): CausalChapter: インターベンショナル依存性モデリングによる長ビデオチャプティングの改善
- Abstract要約: 長い形式の指導ビデオは、ブラウジング、ナビゲーション、知識アクセスをサポートするために自動チャプティングを必要とする。
最近の長文言語モデルは、テキスト化されたビデオ入力から章を作成できるが、長い書き起こし、スムーズな話題遷移、詳細な章のアウトプットを持つコンテンツ密度の講義ビデオには、コストがかかり、脆弱である。
拡張性のあるセグメント・テーマ・キャプションのパラダイムは、このコストを削減するが、境界誤差の伝搬とフラグメント化されたクロスチャプタコンテキストという2つの新しい課題を導入する。
textbfCausalChapter は,軽量マスキングと除去による予測レベルの影響を推定する長期ビデオチャプターのための介入型フレームワークである。
- 参考スコア(独自算出の注目度): 32.8404351380861
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-form instructional videos require automatic chaptering to support browsing, navigation, and knowledge access. Recent long-context language models can perform chaptering from textualized video inputs, but they remain costly and brittle for content-dense lecture videos with long transcripts, smooth topic transitions, and detailed chapter outputs. A scalable segment-then-caption paradigm reduces this cost, but introduces two new challenges: boundary error propagation and fragmented cross-chapter context. We propose \textbf{CausalChapter}, an intervention-inspired framework for long-video chaptering that estimates prediction-level influence through lightweight masking and removal interventions. For boundary localization, our Local Dependency Shift module detects drops in predictive dependency between adjacent temporal windows; for chapter description generation, our Cross-Segment Support Selection module reranks historical contexts according to their support for the current prediction. Experiments on long-video chaptering benchmarks show that CausalChapter improves boundary localization, chapter description quality, and cross-chapter coherence.
- Abstract(参考訳): 長い形式の指導ビデオは、ブラウジング、ナビゲーション、知識アクセスをサポートするために自動チャプティングを必要とする。
最近の長文言語モデルは、テキスト化されたビデオ入力から章を作成できるが、長い書き起こし、スムーズな話題遷移、詳細な章のアウトプットを持つコンテンツ密度の講義ビデオには、コストがかかり、脆弱である。
拡張性のあるセグメント・テーマ・キャプションのパラダイムは、このコストを削減するが、境界誤差の伝搬とフラグメント化されたクロスチャプタコンテキストという2つの新しい課題を導入する。
マスクの軽量化と除去操作による予測レベルの影響を推定する,長期ビデオチャプターのための介入に着想を得たフレームワークである,‘textbf{CausalChapter} を提案する。
境界ローカライゼーションのため,我々のローカル依存性シフトモジュールは,隣接する時間窓間の予測依存性の低下を検出する。
長ビデオチャプティングベンチマークの実験では、CausalChapterは境界ローカライゼーション、章記述品質、クロスチャプタコヒーレンスを改善している。
関連論文リスト
- Online Reasoning Video Object Segmentation [26.75863941739301]
ビデオオブジェクトセグメンテーションの推論は、自然言語クエリからビデオ中のピクセルレベルのマスクを予測する。
オンライン推論ビデオオブジェクト(ORVOS)について検討し、過去のフレームと現在のフレームのみを用いて、モデルを漸進的に解釈する。
ORVOSBは、フレームレベルの因果アノテーションと参照シフトラベルを備えたベンチマークで、210の動画、12,907の注釈付きフレーム、および512の推論カテゴリからなる。
論文 参考訳(メタデータ) (2026-04-13T12:55:56Z) - Toward General Semantic Chunking: A Discriminative Framework for Ultra-Long Documents [10.682600460180174]
長期文書トピックセグメンテーションは,情報検索や文書理解において重要な役割を担っている。
従来の識別モデルは固定ウィンドウによって制約されており、文書レベルの意味論をモデル化することはできない。
生成可能な大言語モデルは段落境界を出力することができるが、推論は高価であり、長い入力はサポートし難い。
論文 参考訳(メタデータ) (2025-12-23T16:16:51Z) - ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries [77.41072125938636]
ARC-Chapterは100万以上のビデオチャプターで訓練された最初の大規模ビデオチャプターモデルである。
ASRの書き起こし、シーンテキスト、ビジュアルキャプションを、短いタイトルから長い要約まで、複数レベルのアノテーションに統一する。
F1得点は14.0%、SODA得点は11.3%で前年最多となった。
論文 参考訳(メタデータ) (2025-11-18T10:53:14Z) - Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding [56.45689495743107]
Vgentは、長いビデオ理解のためにLVLMを強化するグラフベースの検索推論拡張生成フレームワークである。
我々は,3つの長ビデオ理解ベンチマークを用いて,様々なオープンソースLVLMを用いてフレームワークの評価を行った。
論文 参考訳(メタデータ) (2025-10-15T19:14:58Z) - Mixture of Contexts for Long Video Generation [72.96361488755986]
我々は長文ビデオ生成を内部情報検索タスクとして再放送する。
本稿では,学習可能なスパークアテンション・ルーティング・モジュールであるMixture of Contexts (MoC) を提案する。
データをスケールしてルーティングを徐々に分散させていくと、そのモデルは計算を適切な履歴に割り当て、アイデンティティ、アクション、シーンを数分のコンテンツで保存する。
論文 参考訳(メタデータ) (2025-08-28T17:57:55Z) - Chapter-Llama: Efficient Chaptering in Hour-Long Videos with LLMs [59.854331104466254]
ビデオチャプティングの課題、すなわち、長いビデオタイムラインを意味単位に分割し、対応するチャプティングタイトルを生成する。
本稿では,音声書き起こし内容に基づく軽量な音声誘導フレーム選択手法を提案し,その利点を実験的に示す。
以上の結果から,最新のVidChapters-7Mベンチマークでは,技術の現状よりも大幅な改善が見られた。
論文 参考訳(メタデータ) (2025-03-31T17:41:29Z) - MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval [53.417646562344906]
Video Moment Retrieval (VMR) は、自然言語クエリが与えられた未トリミング長ビデオ内の特定の時間セグメントをローカライズすることを目的としている。
既存の方法は、しばしば不十分なトレーニングアノテーションに悩まされる。つまり、文は通常、単語の多様性が制限された前景の顕著なビデオ内容のごく一部と一致する。
この本質的なモダリティの不均衡は、視覚情報のかなりの部分がテキストと一致しないまま残されている。
本研究では,MLLMをビデオナレーターとして用いて,ビデオのテキスト記述を多用し,モダリティの不均衡を緩和し,時間的局所化を促進させる。
論文 参考訳(メタデータ) (2024-06-25T18:39:43Z) - Contrastive Language-Action Pre-training for Temporal Localization [64.34349213254312]
ロングフォームビデオ理解には、時間的に活動や言語をローカライズできるアプローチが必要である。
これらの制限は、クラスアノテーションによって管理される時間的にトリミングされたビデオの大きなデータセットを事前トレーニングすることで対処できる。
本研究では,アクセプションの形で活動,背景ビデオクリップ,言語間の視覚・言語的関係を捉えるために,マスク付きコントラスト学習損失を導入する。
論文 参考訳(メタデータ) (2022-04-26T13:17:50Z) - ChapterBreak: A Challenge Dataset for Long-Range Language Models [36.54750186213335]
章境界で終わる物語から長いセグメントのLRLMを提供する挑戦データセットである章Breakを紹介します。
詳細な人間のアノテーションから、私たちのデータセットには多くの複雑な章の遷移が含まれていることが分かる。
ChapterBreakの実験では、既存のLRLMは長距離コンテキストを効果的に活用できないことが示されている。
論文 参考訳(メタデータ) (2022-04-22T18:20:23Z) - Topical Change Detection in Documents via Embeddings of Long Sequences [4.13878392637062]
テキストセグメンテーションのタスクを独立した教師付き予測タスクとして定式化する。
類似セクションの段落を微調整することで、学習した特徴がトピック情報をエンコードすることを示すことができます。
文レベルで操作する従来のアプローチとは異なり、我々は常により広いコンテキストを使用します。
論文 参考訳(メタデータ) (2020-12-07T12:09:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。