論文の概要: Split and Conquer Partial Deepfake Speech
- arxiv url: http://arxiv.org/abs/2604.02913v1
- Date: Fri, 03 Apr 2026 09:33:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 17:20:24.431028
- Title: Split and Conquer Partial Deepfake Speech
- Title(参考訳): スプリット・コンカレントディープフェイク音声
- Authors: Inbal Rimon, Oren Gal, Haim Permuter,
- Abstract要約: 部分的なディープフェイク音声検出は、他のボナフッド発話の短い時間的部分で発生する可能性のある操作された領域を特定する必要がある。
本稿では,境界検出とセグメントレベルの分類という2つの段階に分解する,分割・分散型フレームワークを提案する。
partialSpoofベンチマークの実験では、複数の時間分解能および発話レベルでの最先端性能が示されている。
- 参考スコア(独自算出の注目度): 1.8949616457421692
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Partial deepfake speech detection requires identifying manipulated regions that may occur within short temporal portions of an otherwise bona fide utterance, making the task particularly challenging for conventional utterance-level classifiers. We propose a split-and-conquer framework that decomposes the problem into two stages: boundary detection and segment-level classification. A dedicated boundary detector first identifies temporal transition points, allowing the audio signal to be divided into segments that are expected to contain acoustically consistent content. Each resulting segment is then evaluated independently to determine whether it corresponds to bona fide or fake speech. This formulation simplifies the learning objective by explicitly separating temporal localization from authenticity assessment, allowing each component to focus on a well-defined task. To further improve robustness, we introduce a reflection-based multi-length training strategy that converts variable-duration segments into several fixed input lengths, producing diverse feature-space representations. Each stage is trained using multiple configurations with different feature extractors and augmentation strategies, and their complementary predictions are fused to obtain improved final models. Experiments on the PartialSpoof benchmark demonstrate state-of-the-art performance across multiple temporal resolutions as well as at the utterance level, with substantial improvements in the accurate detection and localization of spoofed regions. In addition, the proposed method achieves state-of-the-art performance on the Half-Truth dataset, further confirming the robustness and generalization capability of the framework.
- Abstract(参考訳): 部分的なディープフェイク音声検出は、他のボナファイド発話の短い時間的部分で発生する可能性のある操作された領域を識別する必要があるため、従来の発声レベル分類器では特に難しい。
本稿では,境界検出とセグメントレベルの分類という2つの段階に分解する,分割・分散型フレームワークを提案する。
専用境界検出器は、まず時間遷移点を識別し、音響的に一貫した内容を含むと期待されるセグメントにオーディオ信号を分割する。
得られた各セグメントは独立して評価され、それがボナ・フェイドか偽の音声に該当するかが決定される。
この定式化は、時間的局所化を信頼度評価から明確に分離することで学習目的を単純化し、各コンポーネントが明確に定義されたタスクに集中できるようにする。
さらにロバスト性を向上させるために,変数分割セグメントを複数の固定された入力長に変換し,多様な特徴空間表現を生成するリフレクションベースのマルチ長トレーニング戦略を導入する。
各ステージは、異なる特徴抽出器と拡張戦略を備えた複数の構成を用いて訓練され、それらの補完的予測は、改良された最終モデルを得るために融合される。
partialSpoofベンチマークの実験では、複数の時間分解能および発話レベルでの最先端性能が実証され、スプーフ領域の正確な検出とローカライゼーションが大幅に改善された。
さらに,提案手法はハーフ・トゥルース・データセット上での最先端性能を実現し,フレームワークの堅牢性と一般化性をさらに確認する。
関連論文リスト
- Multi-modal Deepfake Detection and Localization with FPN-Transformer [21.022230340898556]
FPN変換器(Feature Pyramid-Transformer)に基づくマルチモーダルディープフェイク検出およびローカライゼーションフレームワークを提案する。
マルチスケールな特徴ピラミッドは、R-TLMブロックと局所的な注意機構によって構築され、コンテキスト間の時間的依存関係の結合解析を可能にする。
我々は,IJCAI'25 DDL-AVベンチマークの試験セットに対するアプローチを評価し,最終スコア0.7535で良好な性能を示した。
論文 参考訳(メタデータ) (2025-11-11T09:33:39Z) - Frame-level Temporal Difference Learning for Partial Deepfake Speech Detection [16.923285534924116]
不自然な時間変動を識別する部分的な深度検出を再定義する時間差注意モジュール(TDAM)を提案する。
二重レベルの階層的差分表現は、微細なスケールと粗いスケールの両方で時間的不規則性を捕捉する一方、適応的な平均プーリングは、情報損失を最小限に抑えるために、可変長入力における必須パターンを保存する。
当社のTDAM-AvgPoolモデルは,PartialSpoofデータセットで0.59%,HADデータセットで0.03%,最先端のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2025-07-20T19:46:23Z) - Context-aware TFL: A Universal Context-aware Contrastive Learning Framework for Temporal Forgery Localization [60.73623588349311]
本研究では,時間的フォージェリーローカライゼーションのための共通文脈対応コントラスト学習フレームワーク (UniCaCLF) を提案する。
提案手法は教師付きコントラスト学習を利用して,異常検出による偽造瞬間の検出と同定を行う。
実物と偽物との間における特徴の識別可能性の限界をさらに押し上げるために、効率的な文脈対応コントラスト符号化を導入する。
論文 参考訳(メタデータ) (2025-06-10T06:40:43Z) - Text-Queried Audio Source Separation via Hierarchical Modeling [53.94434504259829]
本研究では,HSM-TSSという階層的分解フレームワークを提案し,そのタスクをグローバルな意味誘導特徴分離と構造保存音響再構成に分解する。
Q-Audioアーキテクチャは、事前訓練されたグローバルセマンティックエンコーダとして機能するオーディオとテキストのモダリティを調整するために使用される。
本手法は,複雑な聴覚シーンにおけるクエリとのセマンティック一貫性を保ちながら,データ効率のトレーニングによる最先端の分離性能を実現する。
論文 参考訳(メタデータ) (2025-05-27T11:00:38Z) - Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization [60.899082019130766]
本稿では、フレームレベル検出ネットワーク(FDN)と、音声の時間的偽造検出とローカライゼーションのための改良ネットワーク(PRN)を提案する。
FDNは、偽のフレーム間で情報的不整合の手がかりを抽出し、偽の領域を大まかに示すのに有用な識別的特徴を得る。
PRNは、FDNから派生した粗粒度の提案を洗練するために、信頼スコアと回帰オフセットを予測する責任がある。
論文 参考訳(メタデータ) (2024-07-23T15:07:52Z) - Action Quality Assessment with Temporal Parsing Transformer [84.1272079121699]
行動品質評価(AQA)は、作業の理解と解決に重要である。
本稿では,時間的部分表現に包括的特徴を分解する時間的パーシング変換器を提案する。
提案手法は,3つの公開AQAベンチマークにおける先行研究よりもかなりのマージンで優れていた。
論文 参考訳(メタデータ) (2022-07-19T13:29:05Z) - Separator-Transducer-Segmenter: Streaming Recognition and Segmentation
of Multi-party Speech [9.217215329418629]
重なり合う音声による多人数会話のストリーミング認識とセグメンテーションは、次世代音声アシスタントアプリケーションにとって不可欠である。
本研究では,従来のマルチターンリカレントニューラルネットワークトランスデューサ(MT-RNN-T)における課題を,新たなアプローチであるセパレータ-トランスデューサ-セグメンタ(STS)を用いて解決する。
最良モデルでは、4.6%の abs. turn counting accuracy improve と 17% rel. word error rate (WER) improve on LibriCSS dataset than the previously published work。
論文 参考訳(メタデータ) (2022-05-10T22:40:39Z) - Analysis of Joint Speech-Text Embeddings for Semantic Matching [3.6423306784901235]
ペア音声と書き起こし入力の距離を最小化することにより,セマンティックマッチングのために訓練された共同音声テキスト埋め込み空間について検討する。
我々は,事前学習とマルチタスクの両方のシナリオを通じて,音声認識を組み込む方法を拡張した。
論文 参考訳(メタデータ) (2022-04-04T04:50:32Z) - Real-Time Scene Text Detection with Differentiable Binarization and
Adaptive Scale Fusion [62.269219152425556]
セグメンテーションに基づくシーンテキスト検出手法はシーンテキスト検出分野において大きな注目を集めている。
本稿では,二項化処理をセグメンテーションネットワークに統合する分散二項化(DB)モジュールを提案する。
アダプティブ・スケール・フュージョン (ASF) モジュールは, 異なるスケールの特徴を適応的に融合させることにより, スケールのロバスト性を向上させる。
論文 参考訳(メタデータ) (2022-02-21T15:30:14Z) - FragmentVC: Any-to-Any Voice Conversion by End-to-End Extracting and
Fusing Fine-Grained Voice Fragments With Attention [66.77490220410249]
本稿では、Wav2Vec 2.0から、音源話者からの発声の潜在音声構造を求めるFragmentVCを提案する。
FragmentVCは、ターゲット話者発話からきめ細かい音声断片を抽出し、所望の発話に融合することができる。
提案手法は, コンテンツと話者情報との絡み合いを考慮せずに, 再構成損失を学習する。
論文 参考訳(メタデータ) (2020-10-27T09:21:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。