論文の概要: REFRAMED: Towards Realistic Audio Description Generation for Movies
- arxiv url: http://arxiv.org/abs/2608.09765v1
- Date: Mon, 10 Aug 2026 15:55:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.357087
- Title: REFRAMED: Towards Realistic Audio Description Generation for Movies
- Title(参考訳): REFRAMED:映画のためのリアルなオーディオ記述生成を目指して
- Abstract要約: オーディオ記述(Audio Description、AD)は、ビデオにおける重要な視覚的内容の言葉によるナレーションであり、視覚障害のある聴衆へのアクセスを可能にする。
既存のアプローチは、記述の内容とタイミングの両方を事前に指定した人工的な環境でAD生成を定式化する。
我々は、モデルが何を記述し、いつ実行するかを共同で決めなければならないAD生成の新しい定式化を導入する。
- 参考スコア(独自算出の注目度): 53.11641004249926
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Audio Description (AD) is a verbal narration of key visual content in videos, enabling access for visually impaired audiences. Unlike standard video captioning, AD is a structured editorial task: descriptions must be inserted into gaps in dialogue and must convey only what is needed to understand the narrative being told. However, existing approaches formulate AD generation in an artificial setting where both the content and timing of descriptions are pre-specified, reducing the task to clip-level captioning. They further rely on noisy transcription and alignment pipelines, and lack the rich parallel data required for modeling narrative context. We introduce a new formulation of AD generation in which models must jointly decide what to describe and when to do it. To support this, we present REFRAMED, a high-quality dataset of 2,023 videos that span 3,302 scenes from 206 movies, with professional AD transcripts (both American and British versions), professional subtitles and aligned screenplays. We also provide a manually curated challenge set that pairs full movies with multiple AD references, together with evaluation protocols that leverage dialogue gaps and multi-reference comparisons. Experiments with state-of-the-art AD systems and multimodal LLMs show that they outperform trivial baselines but fall far short of expert human performance. Our dataset and benchmark establish a new foundation for research on video understanding.
- Abstract(参考訳): オーディオ記述(Audio Description、AD)は、ビデオにおける重要な視覚的内容の言葉によるナレーションであり、視覚障害のある聴衆へのアクセスを可能にする。
標準的なビデオキャプションとは異なり、ADは構造化された編集作業であり、説明は対話の隙間に挿入されなければならない。
しかし、既存のアプローチは、記述の内容とタイミングの両方を事前に指定した人工的な環境でAD生成を定式化し、クリップレベルのキャプションにタスクを短縮する。
さらにノイズの多い書き起こしとアライメントパイプラインに依存しており、物語のコンテキストをモデル化するのに必要となる豊富な並列データがない。
我々は、モデルが何を記述し、いつ実行するかを共同で決めなければならないAD生成の新しい定式化を導入する。
これをサポートするために、206本の映画から3,302シーンに及ぶ2,023本の高品質なデータセットであるREFRAMEDを紹介します。
また、複数のAD参照とフルフィルムをペアリングする手作業によるチャレンジセットと、対話ギャップとマルチ参照比較を利用する評価プロトコルも提供する。
最先端のADシステムとマルチモーダルLLMを用いた実験では、それらは自明なベースラインよりも優れているが、熟練した人間のパフォーマンスには程遠いことが示されている。
我々のデータセットとベンチマークは、ビデオ理解研究のための新しい基盤を確立する。
関連論文リスト
- StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description [2.26752781534698]
本稿では,ストーリーアウェアな長文音声記述のための学習自由フレームワークを提案する。
StoryTellerは検証済みの物語記憶を維持しており、シーン全体でストーリー関連情報を転送している。
論文 参考訳(メタデータ) (2026-07-13T16:50:03Z) - DANTE-AD: Dual-Vision Attention Network for Long-Term Audio Description [19.14915136673913]
DANTE-ADは、デュアルビジョントランスフォーマーアーキテクチャを利用した拡張ビデオ記述モデルである。
そこで本研究では,音素の微粒な記述生成のためのコンテキストグラウンド化を実現するために,シーケンシャルなクロスアテンションのための新しい最先端手法を提案する。
論文 参考訳(メタデータ) (2025-03-31T13:49:43Z) - DistinctAD: Distinctive Audio Description Generation in Contexts [62.58375366359421]
本研究では,より優れた物語を生成するために,特徴性を重視した音声記述を生成するためのフレームワークであるDistinctADを提案する。
ドメインギャップに対処するために、追加のADコーパスを必要としないCLIP-AD適応戦略を導入する。
ステージIIでは、DistinctADは2つの重要なイノベーションを取り入れている: (i) コンテクスト予測最大化注意(EMA)モジュールは、連続するビデオクリップから共通のベースを抽出することで冗長性を低減し、 (ii) コンテキスト内の繰り返し単語をフィルタリングする明確な単語予測損失である。
論文 参考訳(メタデータ) (2024-11-27T09:54:59Z) - AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description [92.72058446133468]
本研究の目的は,映画とテレビシリーズのオーディオ記述(AD)を無訓練で生成することである。
市販のビジュアル言語モデル(VLM)と大規模言語モデル(LLM)のパワーを利用する。
当社のアプローチであるAutoAD-Zeroは、映画とテレビシリーズのAD生成において優れたパフォーマンスを示し、最先端のCRITICスコアを達成しています。
論文 参考訳(メタデータ) (2024-07-22T17:59:56Z) - Contextual AD Narration with Interleaved Multimodal Sequence [50.240534605090396]
このタスクは、視覚障害者が映画のような長めのビデオコンテンツにアクセスするのを助けるために、視覚障害者のための視覚要素の記述を作成することを目的としている。
ビデオ機能、テキスト、文字バンク、コンテキスト情報を入力として、生成されたADは名前で文字に対応することができる。
我々は、ADを生成するためのシンプルで統一されたフレームワークを通じて、事前訓練された基礎モデルを活用することを提案する。
論文 参考訳(メタデータ) (2024-03-19T17:27:55Z) - AutoAD: Movie Description in Context [91.98603496476215]
本稿では,映画を取り込み,ADをテキスト形式で出力する自動音声記述(AD)モデルを提案する。
我々は、GPTやCLIPといった事前訓練された基礎モデルのパワーを活用し、視覚的に条件付けられたテキスト生成のために2つのモデルをブリッジするマッピングネットワークをトレーニングするのみである。
論文 参考訳(メタデータ) (2023-03-29T17:59:58Z) - QuerYD: A video dataset with high-quality text and audio narrations [85.6468286746623]
ビデオの検索とイベントのローカライゼーションのための大規模データセットQuerYDを紹介する。
データセットのユニークな特徴は、ビデオ毎に2つのオーディオトラック(オリジナルオーディオと高品質な音声記述)が利用可能であることです。
YouDescribeは、既存のYouTubeビデオに音声ナレーションを付加することで視覚障害者を支援するボランティアプロジェクトだ。
論文 参考訳(メタデータ) (2020-11-22T17:33:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。