論文の概要: CineSubBench: Evaluating LLMs on Long-Form Narrative and Cultural Understanding from Multilingual Movie Subtitles
- arxiv url: http://arxiv.org/abs/2609.36218v1
- Date: Mon, 28 Sep 2026 20:16:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.998729
- Title: CineSubBench: Evaluating LLMs on Long-Form Narrative and Cultural Understanding from Multilingual Movie Subtitles
- Title(参考訳): CineSubBench:多言語映画字幕からの長期物語・文化理解のためのLLMの評価
- Abstract要約: CineSubBenchは、多言語映画字幕から長文映画理解を評価するためのベンチマークである。
CineSubBenchには1012本の映画があり、6つの言語で完全な字幕カバーがあり、6,072曲と8.13Mのタイムスタンプ付き字幕エントリがある。
- 参考スコア(独自算出の注目度): 11.436935167128546
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are increasingly evaluated in specialized domains such as law, medicine, software engineering, and cybersecurity, yet film remains comparatively underexplored despite requiring long-form narrative integration, multilingual interpretation, and culturally situated audience judgments. We introduce CineSubBench, a benchmark for evaluating long-context film understanding from multilingual movie subtitles. A subtitle track represents a film as thousands of short, temporally ordered utterances from which models must reconstruct characters, relationships, events, causal progression, and themes without explicit scene or event structure. CineSubBench contains 1,012 films with complete subtitle coverage in six languages, yielding 6,072 tracks and 8.13M timestamped subtitle entries. It provides a matched multi-task, multilingual, and multicultural (MultiX) evaluation setting: seven tasks span narrative reconstruction and abstraction, genre prediction, age suitability, country-specific motion-picture ratings across ten national classification systems, and subtitle-grounded language safety. Across nine LLMs, plot premises are recovered more reliably than event-complete synopses; cross-lingual consistency varies substantially across models and languages; national rating systems expose distinct calibration patterns; and strong profanity is far easier to ground than mild obscenity. CineSubBench establishes film as a long-context LLM evaluation domain and provides a unified benchmark for measuring narrative, multilingual, cultural, and evidence-grounding capabilities.
- Abstract(参考訳): 大規模言語モデルは、法律、医学、ソフトウェア工学、サイバーセキュリティなどの専門分野においてますます評価されているが、長文の物語の統合、多言語解釈、文化的に位置する聴衆の判断を必要とするにもかかわらず、映画は比較的過小評価されている。
CineSubBenchは、多言語映画字幕から長文映画理解を評価するためのベンチマークである。
サブタイトルトラック(英: subtitle track)とは、キャラクター、関係、出来事、因果進行、テーマを明示的なシーンやイベント構造なしで再構築しなければならない数千の短い時間順の発話である。
CineSubBenchには1012本の映画があり、6つの言語で完全な字幕カバーがあり、6,072曲と8.13Mのタイムスタンプ付き字幕エントリがある。
7つのタスクは、物語の再構築と抽象化、ジャンルの予測、年齢順応性、10の国別分類システムにおける国固有のモーションピクチャー評価、サブタイトル付き言語の安全性にまたがる。
プロットの前提は、イベント完備のシナプスよりも信頼性が高く、言語間の整合性はモデルや言語によって大きく異なる。
CineSubBenchは、長文LLM評価領域としてフィルムを確立し、物語、多言語、文化的、エビデンスグラウンド機能を測定するための統一ベンチマークを提供する。
関連論文リスト
- WorldBench: Culturally Grounded Benchmark for Multilingual Agents [69.76002914143531]
既存のベンチマークでは、状態の保存、言語間のパフォーマンス、現実的な根拠のあるシナリオへのアプリケーションをテストすることはめったにない。
We present WorldBench: a comprehensive, multilingual benchmark, where agent can act in a sandbox via structured action。
WorldBenchは、7つの言語と8つの文化にまたがる1,600のタスクで構成され、人間のアノテータからのフィードバックによってフィルタリングされ洗練されている。
論文 参考訳(メタデータ) (2026-09-01T10:53:07Z) - Towards Visually-Guided Movie Subtitle Translation for Indic Languages [29.64914026807588]
映画の字幕翻訳は本質的にマルチモーダルであるが、テキストのみのシステムは感情、行動、社会的ニュアンスを伝えるのに必要な視覚的手がかりを見逃すことが多い。
本稿では,5本のフル長フィルムをケーススタディとして,2つの軽量視覚接地戦略を比較した。
論文 参考訳(メタデータ) (2026-05-12T11:43:57Z) - Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches [69.57389826203699]
本研究は,文脈内プロンプトだけで,意味論的に関連性があり,良好なリアルタイムコメント生成をサポートできるかどうかを考察する。
提案手法は,1)固定区間法,2)動的区間法に基づく復号法である。
日本語と英語の競馬ゲームデータセットを用いた実験により,動的間隔に基づく復号化は,プロンプトのみを用いて,人間の発話タイミングや内容とより密に一致した注釈を生成できることが示されている。
論文 参考訳(メタデータ) (2026-03-03T06:39:04Z) - STAGE: A Benchmark for Knowledge Graph Construction, Question Answering, and In-Script Role-Playing over Movie Screenplays [16.069095458601588]
本稿では,フル長の映画画面上での物語理解のためのベンチマークであるSTAGE(Screenplay Text, Agents, Graphs and Evaluation)を紹介する。
STAGEは、ナレッジグラフの構成、シーンレベルのイベント要約、長文のスクリーンプレイ質問応答、インスクリプトのキャラクターロールプレイングの4つのタスクを、すべて共有された物語の世界表現に基づいて定義している。
このベンチマークは、クリーン化されたスクリプト、キュレートされた知識グラフ、および英語と中国語の150本の映画に対するイベント中心および文字中心のアノテーションを提供し、世界表現の構築、物語の抽象化と検証、長い物語の推論、そして生成を可能にする。
論文 参考訳(メタデータ) (2026-01-13T12:50:58Z) - MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval [53.417646562344906]
Video Moment Retrieval (VMR) は、自然言語クエリが与えられた未トリミング長ビデオ内の特定の時間セグメントをローカライズすることを目的としている。
既存の方法は、しばしば不十分なトレーニングアノテーションに悩まされる。つまり、文は通常、単語の多様性が制限された前景の顕著なビデオ内容のごく一部と一致する。
この本質的なモダリティの不均衡は、視覚情報のかなりの部分がテキストと一致しないまま残されている。
本研究では,MLLMをビデオナレーターとして用いて,ビデオのテキスト記述を多用し,モダリティの不均衡を緩和し,時間的局所化を促進させる。
論文 参考訳(メタデータ) (2024-06-25T18:39:43Z) - Multilingual Synopses of Movie Narratives: A Dataset for Vision-Language Story Understanding [19.544839928488972]
我々はM-SYMON(Multilingual Synopses of Movie Narratives)という大規模多言語ビデオストーリーデータセットを構築した。
M-SYMONには、7つの言語からの13,166本の映画要約ビデオと、101.5時間のビデオの詳細なビデオテキスト対応のマニュアルアノテーションが含まれている。
SyMoNからの注釈付きデータのトレーニングは、Clip AccuracyとSentence IoUのスコアでそれぞれ15.7と16.2でSOTA法を上回ります。
論文 参考訳(メタデータ) (2024-06-18T22:44:50Z) - Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding [112.3913646778859]
簡単なビデオ言語モデリングフレームワークであるS-ViLMを提案する。
これには、学習領域オブジェクトのアライメントと時間認識機能を促進するために、クリップ間の空間的接地と、クリップ内の時間的グループ化という、2つの新しい設計が含まれている。
S-ViLMは4つの下流タスクにおいて、最先端の手法を大幅に超えている。
論文 参考訳(メタデータ) (2023-03-28T22:45:07Z) - Temporal Perceiving Video-Language Pre-training [112.1790287726804]
本研究は、時間的・意味的な微粒なアライメントを可能にする、新しいテキスト-ビデオのローカライゼーション・プレテキストタスクを導入する。
具体的には、テキスト-ビデオのローカライゼーションは、テキスト記述が与えられたビデオの開始と終了の境界を予測するモーメント検索から成っている。
提案手法は,細粒度フレーム表現と単語表現を結合し,単一モードにおける異なるインスタンスの表現を暗黙的に区別する。
論文 参考訳(メタデータ) (2023-01-18T12:15:47Z) - Understanding Chinese Video and Language via Contrastive Multimodal
Pre-Training [79.88705563918413]
VICTORという新しいビデオ言語理解フレームワークを提案します。VICTORは対比mulTimOdal pRe-trainingによる視覚言語理解の略です。
VICTORは、対応する高品質のテキスト記述を備えた1000万以上の完全なビデオを含む大規模な中国のビデオ言語データセットで訓練されています。
論文 参考訳(メタデータ) (2021-04-19T15:58:45Z) - MuST-Cinema: a Speech-to-Subtitles corpus [16.070428245677675]
TED字幕から構築した多言語音声翻訳コーパスである MuST-Cinema について述べる。
コーパスを用いて文を字幕に効率的に分割するモデルを構築することができることを示す。
本稿では,既存の字幕を字幕の字幕にアノテートする手法を提案する。
論文 参考訳(メタデータ) (2020-02-25T12:40:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。