論文の概要: OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
- arxiv url: http://arxiv.org/abs/2604.11102v1
- Date: Mon, 13 Apr 2026 07:19:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.392301
- Title: OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
- Title(参考訳): OmniScript: ロングフォームシネマティックビデオのためのオーディオビジュアルスクリプト生成を目指す
- Authors: Junfu Pu, Yuxin Chen, Teng Wang, Ying Shan,
- Abstract要約: 本稿では,階層的なシーン・バイ・シーンのスクリプトを生成することを目的とした,新しいV2Sタスクを提案する。
長文の物語理解に適した8Bパラメータ omni-modal (audio-visual) 言語モデルであるOmniScriptを提案する。
- 参考スコア(独自算出の注目度): 59.391671069156274
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current multimodal large language models (MLLMs) have demonstrated remarkable capabilities in short-form video understanding, yet translating long-form cinematic videos into detailed, temporally grounded scripts remains a significant challenge. This paper introduces the novel video-to-script (V2S) task, aiming to generate hierarchical, scene-by-scene scripts encompassing character actions, dialogues, expressions, and audio cues. To facilitate this, we construct a first-of-its-kind human-annotated benchmark and propose a temporally-aware hierarchical evaluation framework. Furthermore, we present OmniScript, an 8B-parameter omni-modal (audio-visual) language model tailored for long-form narrative comprehension. OmniScript is trained via a progressive pipeline that leverages chain-of-thought supervised fine-tuning for plot and character reasoning, followed by reinforcement learning using temporally segmented rewards. Extensive experiments demonstrate that despite its parameter efficiency, OmniScript significantly outperforms larger open-source models and achieves performance comparable to state-of-the-art proprietary models, including Gemini 3-Pro, in both temporal localization and multi-field semantic accuracy.
- Abstract(参考訳): 現在のマルチモーダル大言語モデル(MLLM)は、ショートフォームの映像理解において顕著な能力を示したが、ロングフォームのシネマティックなビデオを詳細な時間的基盤のスクリプトに変換することは大きな課題である。
本稿では、文字アクション、対話、表現、オーディオキューを含む階層的なシーン・バイ・シーンのスクリプトを生成することを目的とした、新しいV2Sタスクを提案する。
これを容易にするために,まず,人間による注釈付きベンチマークを構築し,時間的に認識可能な階層的評価フレームワークを提案する。
さらに,長文の物語理解に適した8Bパラメータ・オムニモーダル言語モデルであるOmniScriptを提案する。
OmniScriptはプロットとキャラクタ推論のためにチェーンオブソートによる微調整を活用するプログレッシブパイプラインを通じてトレーニングされ、続いて時間分割された報酬を使用して強化学習が行われる。
パラメータ効率にもかかわらず、OmniScriptは大規模なオープンソースモデルよりも優れており、時間的ローカライゼーションとマルチフィールドセマンティック精度の両方において、Gemini 3-Proを含む最先端のプロプライエタリモデルに匹敵するパフォーマンスを実現している。
関連論文リスト
- TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions [64.27159505605312]
提案するOmni Captioningは,明示的なタイムスタンプによる連続的,きめ細かな,構造化された視覚的物語を生成するために設計された新しいタスクである。
密接なセマンティックカバレッジを確保するため、私たちは6次元構造スキーマを導入し、"script-like"キャプションを作成します。
大規模な実験により、TimeChat-Captioner-7BはGemini-2.5-Proを抜いて最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2026-02-09T14:21:58Z) - The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation [95.18045807704284]
対話・シネマティック・ビデオ生成のためのエンドツーエンドのエージェント・フレームワークを提案する。
ScripterAgentは粗い対話を微粒で実行可能なシネマティックスクリプトに変換するように訓練されている。
本フレームワークは,テスト対象のすべてのビデオモデルに対して,スクリプトの忠実度と時間的忠実度を大幅に向上させる。
論文 参考訳(メタデータ) (2026-01-25T08:10:28Z) - Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models [10.585096070697348]
本稿では,ビデオキャプションを高密度に生成する新しいトレーニングフリーパイプラインであるVideoNarratorを紹介する。
VideoNarratorは、既製のMLLMとビジュアル言語モデルがキャプションジェネレータとして機能する柔軟なパイプラインを活用することで、課題に対処する。
実験の結果,これらの成分の相乗的相互作用はビデオナレーションの品質と精度を著しく向上させることが示された。
論文 参考訳(メタデータ) (2025-07-22T22:16:37Z) - MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval [53.417646562344906]
Video Moment Retrieval (VMR) は、自然言語クエリが与えられた未トリミング長ビデオ内の特定の時間セグメントをローカライズすることを目的としている。
既存の方法は、しばしば不十分なトレーニングアノテーションに悩まされる。つまり、文は通常、単語の多様性が制限された前景の顕著なビデオ内容のごく一部と一致する。
この本質的なモダリティの不均衡は、視覚情報のかなりの部分がテキストと一致しないまま残されている。
本研究では,MLLMをビデオナレーターとして用いて,ビデオのテキスト記述を多用し,モダリティの不均衡を緩和し,時間的局所化を促進させる。
論文 参考訳(メタデータ) (2024-06-25T18:39:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。