論文の概要: Audio-Based Understanding of Audiobook Narration Appeal
- arxiv url: http://arxiv.org/abs/2607.02473v1
- Date: Thu, 02 Jul 2026 17:43:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.956205
- Title: Audio-Based Understanding of Audiobook Narration Appeal
- Title(参考訳): 音声によるナレーションアピールの理解
- Authors: Shahar Elisha, Mariano Beguerisse-Díaz, Emmanouil Benetos,
- Abstract要約: この研究は、ナレーションの質がオーディオブックの魅力をいかに形成するかを探求し、その効果がジャンル、タイトル、オーディエンスによって異なることを指摘した。
事前学習した音声モデルを用いて、LibriVoxから発声・音響特性を抽出し、消費データとの関係を解析する。
タイトル効果を考慮に入れた場合でも,音響情報だけでは魅力に強く結びついていることが判明した。
- 参考スコア(独自算出の注目度): 14.012504180195073
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Narration is central to the audiobook listening experience, shaping how listeners engage with and understand the content. This work explores how narration qualities shape an audiobook's appeal, noting that their effects can vary by genre, title, and audience. We extract vocal and acoustic features (e.g., tone, pace, loudness) from LibriVox using pre-trained audio models and analyse their relationship with consumption data (specifically, view-rate) and their interplay with genre and title. Despite limited consumption data, we find that acoustic information alone has a robust association with appeal, even after accounting for title effects. We further validate these findings using more nuanced proprietary engagement metrics. To our knowledge, this is the first systematic computational study linking narration qualities, genre, title, and audiobook consumption, highlighting the potential of data-driven insights to improve audiobook personalisation and narrator casting.
- Abstract(参考訳): ナレーションはオーディオブックのリスニング体験の中心であり、リスナーがコンテンツと関わり、理解する方法を形成する。
この研究は、ナレーションの質がオーディオブックの魅力をいかに形成するかを探求し、その効果がジャンル、タイトル、オーディエンスによって異なることを指摘した。
事前学習した音声モデルを用いて、LibriVoxから音声・音響特徴(例えば、トーン、ペース、ラウドネス)を抽出し、消費データ(特に視聴率)とジャンルやタイトルとの相互作用を分析する。
限られた消費データにもかかわらず、タイトル効果を考慮に入れた場合でも、音響情報だけでは魅力と堅牢な関係があることが判明した。
さらに、よりニュアンスなプロプライエタリなエンゲージメントメトリクスを使用して、これらの結果を検証する。
我々の知る限り、ナレーションの質、ジャンル、タイトル、オーディオブックの消費を結びつける最初の体系的な計算研究であり、オーディオブックのパーソナライゼーションとナレーターキャスティングを改善するためのデータ駆動型洞察の可能性を強調している。
関連論文リスト
- Learning Audio Concepts from Counterfactual Natural Language [34.118579918018725]
本研究では,音声領域における因果推論と反事実解析を紹介する。
本モデルは,人間の注釈付き参照テキストからの音響特性と音源情報について考察する。
具体的には、オープンエンド言語に基づく音声検索タスクにおけるトップ1の精度が43%以上向上した。
論文 参考訳(メタデータ) (2024-01-10T05:15:09Z) - Prosody Analysis of Audiobooks [8.929189891250134]
言語モデルを用いた物語テキストから韻律予測特性を改良したモデルを提案する。
我々の予測韻律特性は、最先端の商用TSシステムによる結果よりも、人間のオーディオブックの読み方とよく相関している。
論文 参考訳(メタデータ) (2023-10-10T18:33:47Z) - AdVerb: Visually Guided Audio Dereverberation [49.958724234969445]
本稿では,新しいオーディオ・ビジュアル・デバーベレーション・フレームワークであるAdVerbを紹介する。
残響音に加えて視覚的手がかりを用いてクリーンオーディオを推定する。
論文 参考訳(メタデータ) (2023-08-23T18:20:59Z) - Language-Guided Audio-Visual Source Separation via Trimodal Consistency [64.0580750128049]
この課題の鍵となる課題は、発音対象の言語的記述と、その視覚的特徴と、音声波形の対応する成分とを関連付けることである。
2つの新たな損失関数を通して擬似目標管理を行うために、既成の視覚言語基盤モデルを適用する。
3つの音声・視覚的分離データセットに対する自己教師型アプローチの有効性を実証する。
論文 参考訳(メタデータ) (2023-03-28T22:45:40Z) - Epic-Sounds: A Large-scale Dataset of Actions That Sound [64.24297230981168]
EPIC-SOUNDSには78.4kの分類された音声イベントとアクションがあり、44のクラスと39.2kの非分類セグメントに分散している。
我々は、オーディオのみの手法とオーディオ視覚的手法の両方において、データセット上で最先端の音声認識および検出モデルを訓練し、評価する。
論文 参考訳(メタデータ) (2023-02-01T18:19:37Z) - Visually-Aware Audio Captioning With Adaptive Audio-Visual Attention [54.4258176885084]
曖昧な音を正確に認識する方法は、音声キャプションにとって大きな課題である。
本稿では,視覚情報を利用して不明瞭な音の物体の記述を支援する視覚認識型音声キャプションを提案する。
提案手法は,機械翻訳メトリクスの最先端結果を実現する。
論文 参考訳(メタデータ) (2022-10-28T22:45:41Z) - Exploiting Audio-Visual Consistency with Partial Supervision for Spatial
Audio Generation [45.526051369551915]
本論文では,モノラル映像を音声と視覚の要素間の関係を利用して変換するオーディオ空間化フレームワークを提案する。
ベンチマークデータセットに関する実験では,半教師ありシナリオと完全教師ありシナリオの両方において,提案フレームワークの有効性を確認した。
論文 参考訳(メタデータ) (2021-05-03T09:34:11Z) - Learning Speech Representations from Raw Audio by Joint Audiovisual
Self-Supervision [63.564385139097624]
生音声波形から自己教師付き音声表現を学習する手法を提案する。
音声のみの自己スーパービジョン(情報的音響属性の予測)と視覚的自己スーパービジョン(音声から発話顔を生成する)を組み合わせることで生音声エンコーダを訓練する。
本研究は,音声表現学習におけるマルチモーダル・セルフ・スーパービジョンの可能性を示すものである。
論文 参考訳(メタデータ) (2020-07-08T14:07:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。