論文の概要: Authorship Verification of Transcribed German-Language Videos
- arxiv url: http://arxiv.org/abs/2607.29168v1
- Date: Fri, 31 Jul 2026 08:47:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 16:35:22.226447
- Title: Authorship Verification of Transcribed German-Language Videos
- Title(参考訳): ドイツ語字幕ビデオのオーサリング検証
- Authors: Oren Halvani, Sophie Titze,
- Abstract要約: 著者検証(AV)は、デジタルテキスト法医学の重要なサブフィールドである。
多くのAV研究は、言語は文字だけでなく、ビデオのような音声形式でも表現されているにもかかわらず、テキストに焦点を絞っている。
これらの研究ギャップに対処するため,ドイツ語ビデオの書き起こしという形で,音声言語にAVを適用した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Authorship Verification (AV) represents an important subfield of digital text forensics and addresses the fundamental question of whether two texts were written by the same author. Although the field has made substantial progress over the past two decades, several important challenges remain unresolved or underexplored. For instance, most AV research has focused on written texts, despite the fact that language is expressed not only in written but also in spoken form, such as in videos. Moreover, existing AV studies have predominantly concentrated on English, while other languages, including German, have received comparatively little attention. To address these research gaps, we apply AV to spoken language in the form of transcripts of German-language videos and examine the effectiveness of established AV methods in verifying a speaker's identity across video pairs. Our experimental evaluation, based on a total of ten AV methods applied to three self-compiled corpora comprising 300 videos from 150 speakers, shows that the best performance (up to 88% accuracy and 90% AUC) is achieved by traditional AV approaches based on simple character- and token n-gram representations. In contrast, more modern transformer-based approaches perform significantly worse on all evaluated corpora. Our results therefore suggest that traditional methods in the field of AV remain both competitive and relevant.
- Abstract(参考訳): 著者検証(AV)は、デジタルテキスト鑑定学の重要なサブフィールドであり、2つのテキストが同一著者によって書かれたかどうかという根本的な問題に対処する。
過去20年間、この分野はかなり進歩してきたが、いくつかの重要な課題は未解決のままであり、未解決のままである。
例えば、ほとんどのAV研究はテキストに焦点を合わせてきたが、言語は文字だけでなく、ビデオのような音声形式でも表現されている。
さらに、既存のAV研究は主に英語に集中しているが、ドイツ語を含む他の言語は比較的あまり注目されていない。
これらの研究ギャップに対処するため,ドイツ語ビデオの書き起こし形式で音声言語にAVを適用し,ビデオペア間の話者の同一性を検証する上で,確立されたAV手法の有効性を検討する。
実験では,150人の話者から300本の動画を収録した3つの自己コンパイルコーパスに対して,合計10個のAV手法を応用し,従来のAV手法(最大88%の精度と90%のAUC)が,単純な文字とトークンn-gram表現に基づいて達成されていることを示す。
対照的に、より現代的なトランスフォーマーベースのアプローチは、評価された全てのコーパスに対して著しく悪化する。
以上の結果から,AV分野における従来の手法は競争力と関連性の両方を保っていることが示唆された。
関連論文リスト
- Layover or Direct Flight: Rethinking Audio-Guided Image Segmentation [65.7990140284317]
対象の接地、すなわち、人間の言葉による指示に基づく視覚的シーンへの関心対象の定位に焦点を当てる。
この可能性を探るため、単一単語音声命令の接地に着目してタスクを簡素化する。
以上の結果から,音声からの直接的接地は実現可能であるだけでなく,場合によっては書き起こしに基づく手法よりも優れていることが示唆された。
論文 参考訳(メタデータ) (2025-11-27T02:00:28Z) - ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction [88.41471266579333]
本稿では,大規模言語モデル(LLM)からの言語知識をAV-TSEモデルに組み込む新しいフレームワークであるELEGANCEを提案する。
2つのAV-TSEバックボーン上でのRoBERTa、Qwen3-0.6B、Qwen3-4Bによる総合的な実験は大幅に改善された。
論文 参考訳(メタデータ) (2025-11-09T08:50:11Z) - The \textit{Questio de aqua et terra}: A Computational Authorship Verification Study [49.56191463229252]
本研究は, クエシオの真正性について, 数値的オーサシップ検証(AV)を用いて検討する。
AVシステムのファミリーを構築し、13世紀と14世紀のラテン文字のコーパスを組み立てます。
AVシステムのクエチオへの応用は、その真正性に関する非常に確実な予測を返す。
論文 参考訳(メタデータ) (2025-01-07T18:42:05Z) - Take the Hint: Improving Arabic Diacritization with
Partially-Diacritized Text [4.863310073296471]
本稿では,任意のダイアクリティカルティクスを効果的にサポートするマルチソースモデルである2SDiacを提案する。
また、ランダムマスキングのレベルが異なる入力において、与えられたダイアクリティカルを活用できるトレーニングスキームであるガイドドラーニングを導入する。
論文 参考訳(メタデータ) (2023-06-06T10:18:17Z) - Language-Guided Audio-Visual Source Separation via Trimodal Consistency [64.0580750128049]
この課題の鍵となる課題は、発音対象の言語的記述と、その視覚的特徴と、音声波形の対応する成分とを関連付けることである。
2つの新たな損失関数を通して擬似目標管理を行うために、既成の視覚言語基盤モデルを適用する。
3つの音声・視覚的分離データセットに対する自己教師型アプローチの有効性を実証する。
論文 参考訳(メタデータ) (2023-03-28T22:45:40Z) - Text-Aware End-to-end Mispronunciation Detection and Diagnosis [17.286013739453796]
誤認識検出・診断(MDD)技術はコンピュータ支援発音訓練システム(CAPT)の鍵となる要素である
本稿では,関係のないテキスト情報を抑えつつ,関連する音声特徴をより重要視するゲーティング戦略を提案する。
論文 参考訳(メタデータ) (2022-06-15T04:08:10Z) - Self-Supervised Speech Representation Learning: A Review [105.1545308184483]
自己教師付き表現学習法は、幅広いタスクやドメインに利益をもたらす単一の普遍的モデルを約束する。
音声表現学習は、生成的、コントラスト的、予測的という3つの主要なカテゴリで同様の進歩を経験している。
本稿では,自己指導型音声表現学習のアプローチと,他の研究領域との関係について述べる。
論文 参考訳(メタデータ) (2022-05-21T16:52:57Z) - A Step Towards Interpretable Authorship Verification [0.0]
オーサシップ検証(英: Authorship verification、AV)は、デジタルテキスト法医学の分野における研究分野である。
多くのアプローチでは、文書のトピックに関連するか、影響を受けている機能を活用している。
分類決定における話題に依存しない特徴のみを考慮した代替的なAVアプローチを提案する。
論文 参考訳(メタデータ) (2020-06-22T16:44:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。