論文の概要: Andha-Dhun: A First Look at Audio Descriptions in Hindi
- arxiv url: http://arxiv.org/abs/2607.06457v1
- Date: Tue, 07 Jul 2026 16:15:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.585191
- Title: Andha-Dhun: A First Look at Audio Descriptions in Hindi
- Title(参考訳): Andha-Dhun:ヒンディー語でのオーディオ記述を初めて見る
- Authors: Ritabrata Chakraborty, Divy Kala, Nisheeth Bhooshan Gupta, Ganji Sreeram, Pailla Balakrishna Reddy, Makarand Tapaswi,
- Abstract要約: 映画やテレビ番組ではAD(Audio Descriptions)を中心に勢いが増しているが、インド語でADを生成する作品はない。
今回紹介するAndha-Dhunは、8本のフル長の映画から収集されたHindi ADの最初のデータセットだ。
我々は、英語とヒンディー語によるADの両方を持つ映画を分析し、ナイーブ翻訳がアーティファクトを導入し、オリジナルのヒンディー語ADと比較して多様性を狭めることを発見した。
- 参考スコア(独自算出の注目度): 14.265452179849825
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Audio Descriptions (ADs) narrate visual content for Blind and Low Vision (BLV) audiences during gaps in audiovisual media. There is growing momentum around ADs in movies and TV shows, and with mandates from India's Central Board of Film Certification (CBFC), there is a need to expand ADs beyond English. Yet, there is no work that generates ADs for any Indian language. To address this gap, we present the first systematic study of ADs in Hindi, contributing to aspects such as data, generation, and evaluation. We introduce Andha-Dhun, the first dataset of human-authored Hindi ADs collected from 8 full-length movies. We explore two approaches for generating ADs in Hindi: (i) directly from English dense video descriptions, and (ii) translating English ADs into Hindi. We evaluate these approaches using perplexity and LLM-as-a-judge metrics to assess fluency and quality respectively. We also analyze movies that have both English and Hindi human-authored ADs and find that naive translation introduces artifacts and narrows diversity compared to original Hindi ADs. Direct machine translation fails to adapt cultural references, while human-translated ADs do better but still fall short. Our findings emphasize that the purpose of Hindi ADs is accessibility for Indian BLV audiences, and that this requires adapting content for the audience more than strict fidelity to the source.
- Abstract(参考訳): オーディオ記述(AD)は、視覚メディアのギャップの中で、ブラインドとロービジョン(BLV)の聴衆の視覚的コンテンツをナレーションする。
映画やテレビ番組ではADを中心に勢いが増しており、インドのCBFC(Central Board of Film Certification)の委任により、ADを英語以上に拡張する必要がある。
しかし、いかなるインド語にもADを生成する仕事はない。
このギャップに対処するため、ヒンディー語におけるADに関する最初の体系的研究を行い、データ、生成、評価などの側面に寄与する。
今回紹介するAndha-Dhunは、8本のフル長の映画から収集されたHindi ADの最初のデータセットだ。
我々はヒンディー語でADを生成するための2つのアプローチを探求する。
(i)英語の濃密なビデオ記述から直接、そして
(二)英語のADをヒンディー語に翻訳すること。
我々はこれらの手法を,流速と品質をそれぞれ評価するために,難易度とLCM-as-a-judge測定値を用いて評価した。
また、英語版とヒンディー語版の両方のADを収録した映画を分析したところ、ナイーブな翻訳によって人工物が紹介され、ヒンディー語版と比較して多様性が狭まることがわかった。
直接機械翻訳は文化的な基準に適合しないが、人間の翻訳されたADは良いが、それでも不足している。
Hindi ADsの目的はインドのBLVオーディエンスへのアクセシビリティであり、ソースへの厳格な忠実性以上のコンテンツ適応が必要であることを強調した。
関連論文リスト
- MCAD: Multimodal Context-Aware Audio Description Generation For Soccer [8.83668236549788]
我々は,映画以外のAD生成をスポーツ分野に拡張するエンドツーエンドパイプライン MCAD を提案する。
公開映画ADデータセット上でビデオ大言語モデルを微調整し、ADの物語構造と慣習を学習する。
生成したADの品質を正確に評価するための新しい評価指標ARGE-ADを導入する。
論文 参考訳(メタデータ) (2025-11-12T16:05:05Z) - What You See is What You Ask: Evaluating Audio Descriptions [27.76958202277314]
数分間のコヒーレントなビデオセグメントでADを評価するQAベンチマークであるADQAを提案する。
現在のAD生成手法は、人間が作成したADよりもはるかに遅れていることを示す。
論文 参考訳(メタデータ) (2025-10-01T12:14:15Z) - ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection [57.29614630309265]
オーディオディープフェイク検出(ADD)は、高忠実度音声生成モデルの台頭と誤用の可能性により、ますます重要になっている。
ALLM4ADD, ALLM-driven framework for ADDを提案する。具体的には, ADDタスクを音声質問応答問題として再構成し, モデルに「この音声は偽物か本物か?」という疑問を提起する。
提案手法は,特にデータスカースシナリオにおいて,偽音声検出において優れた性能が得られることを示す実験を行った。
論文 参考訳(メタデータ) (2025-05-16T10:10:03Z) - DistinctAD: Distinctive Audio Description Generation in Contexts [62.58375366359421]
本研究では,より優れた物語を生成するために,特徴性を重視した音声記述を生成するためのフレームワークであるDistinctADを提案する。
ドメインギャップに対処するために、追加のADコーパスを必要としないCLIP-AD適応戦略を導入する。
ステージIIでは、DistinctADは2つの重要なイノベーションを取り入れている: (i) コンテクスト予測最大化注意(EMA)モジュールは、連続するビデオクリップから共通のベースを抽出することで冗長性を低減し、 (ii) コンテキスト内の繰り返し単語をフィルタリングする明確な単語予測損失である。
論文 参考訳(メタデータ) (2024-11-27T09:54:59Z) - Hindi audio-video-Deepfake (HAV-DF): A Hindi language-based Audio-video Deepfake Dataset [11.164272928464879]
ヒンディー語でのフェイクビデオやスピーチは、農村部や半都市部に多大な影響を及ぼす可能性がある。
本論文は,Hindi Audio-video-Deepfake'(HAV-DF)という,ヒンディー語による新しいディープフェイクデータセットを作成することを目的とする。
論文 参考訳(メタデータ) (2024-11-23T05:18:43Z) - AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description [92.72058446133468]
本研究の目的は,映画とテレビシリーズのオーディオ記述(AD)を無訓練で生成することである。
市販のビジュアル言語モデル(VLM)と大規模言語モデル(LLM)のパワーを利用する。
当社のアプローチであるAutoAD-Zeroは、映画とテレビシリーズのAD生成において優れたパフォーマンスを示し、最先端のCRITICスコアを達成しています。
論文 参考訳(メタデータ) (2024-07-22T17:59:56Z) - AutoAD III: The Prequel -- Back to the Pixels [96.27059234129788]
本稿では,映像データを用いたADデータセット構築のための2つのアプローチと,これを用いたトレーニングと評価データセットの構築を提案する。
我々は,凍結した事前学習されたビジュアルエンコーダと大規模言語モデルを用いて,生動画を取り込み,ADを生成するQ-formerベースのアーキテクチャを開発した。
人間のパフォーマンスによく適合したAD品質をベンチマークするために、新しい評価指標を提供する。
論文 参考訳(メタデータ) (2024-04-22T17:59:57Z) - AutoAD: Movie Description in Context [91.98603496476215]
本稿では,映画を取り込み,ADをテキスト形式で出力する自動音声記述(AD)モデルを提案する。
我々は、GPTやCLIPといった事前訓練された基礎モデルのパワーを活用し、視覚的に条件付けられたテキスト生成のために2つのモデルをブリッジするマッピングネットワークをトレーニングするのみである。
論文 参考訳(メタデータ) (2023-03-29T17:59:58Z) - Bridging the Domain Gap for Stance Detection for the Zulu language [6.509758931804479]
文献で誤情報と戦うための既存のAIベースのアプローチは、自動姿勢検出を成功への不可欠な第一歩として示唆している。
そこで本研究では,ドメイン間のギャップを減らすために,ドメイン適応の手法を利用するブラックボックス非侵入手法を提案する。
これにより、英語で見られるように、この研究のターゲット言語であるズールー語に対するスタンス検出において、同様の結果を迅速に得ることができる。
論文 参考訳(メタデータ) (2022-05-06T11:44:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。