論文の概要: ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection
- arxiv url: http://arxiv.org/abs/2609.03620v2
- Date: Mon, 07 Sep 2026 05:41:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:41.883651
- Title: ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection
- Title(参考訳): ToolDF:Mixed-Authenticity Audio Deepfake Detectionのためのツール統合推論
- Abstract要約: 混合音響ディープフェイク検出のためのツール統合推論フレームワークであるToolDFを提案する。
ToolDFは、教師付きツール使用トラジェクトリでトレーニングされたオーケストレータとして、オーディオ大言語モデルを採用している。
実験結果から,ToolDFは複合型検出において最高の総合的な性能を発揮することがわかった。
- 参考スコア(独自算出の注目度): 6.542096247633459
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audio deepfake detection is commonly formulated as clip-level binary classification of single-domain audio. However, real-world manipulated audio can exhibit mixed authenticity, where genuine and manipulated cues coexist across temporal transitions, overlapping sources, or both. This setting requires not only detecting manipulated audio but also localizing the components that provide evidence for the decision. We propose ToolDF, a tool-integrated reasoning framework for mixed-authenticity audio deepfake detection. ToolDF employs an audio large language model as an orchestrator trained with supervised tool-use trajectories. It adaptively analyzes the audio scene, selectively performs source separation, routes components to domain-specific experts, and aggregates their evidence into an interpretable verdict. We further introduce a mixed-authenticity ADD benchmark covering temporal transitions, acoustic overlaps, and hybrid mixtures. Experimental results show that ToolDF achieves the best overall performance on composite-type detection, achieving macro-F1 gains of 3.72 and 14.39 points over the strongest monolithic baseline and a fixed pipeline, respectively, while providing interpretable evidence localized to temporal regions and acoustic sources. Our source code and dataset are publicly available online.
- Abstract(参考訳): オーディオディープフェイク検出は、通常、クリップレベルの単一ドメインオーディオのバイナリ分類として定式化される。
しかし、実世界の操作されたオーディオは、真偽と操作されたキューが時間的遷移、重なり合うソース、あるいは両方にわたって共存する混合の認証を示す可能性がある。
この設定では、操作されたオーディオを検出するだけでなく、決定の証拠を提供するコンポーネントをローカライズする必要がある。
混合音響ディープフェイク検出のためのツール統合推論フレームワークであるToolDFを提案する。
ToolDFは、教師付きツール使用トラジェクトリでトレーニングされたオーケストレータとして、オーディオ大言語モデルを採用している。
オーディオシーンを適応的に分析し、ソース分離を選択的に行い、コンポーネントをドメイン固有の専門家にルーティングし、それらの証拠を解釈可能な判断に集約する。
さらに, 時相遷移, 音響重なり, ハイブリッド混合を対象とする混合音響ADDベンチマークを導入する。
実験の結果,ToolDFは複合型検出において最高の総合的な性能を達成し,最強のモノリシックベースラインと固定パイプラインで3.72点,14.39点のマクロF1ゲインを達成するとともに,時間領域と音響源に局在した解釈可能なエビデンスを提供することができた。
ソースコードとデータセットはオンラインで公開されています。
関連論文リスト
- MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection [18.1593708805924]
音声と環境音を異なる音響成分として扱う最初のベンチマークであるMADBenchを紹介する。
我々は、統一されたプロトコルの下で、最先端検出器とマルチモーダルな大規模言語モデルをベンチマークする。
実験の結果,環境音声操作は汎用エンコーダを用いた合成音声よりも検出しやすいことがわかった。
論文 参考訳(メタデータ) (2026-08-10T13:27:09Z) - SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment [74.05278327933006]
SAVeは,音声・視覚深度検出フレームワークで,映像の完全学習を行う。
SAVEは、タグ付けアーティファクトをエミュレートするために、オンザフライ、アイデンティティ保存、地域対応の自明な擬似操作を生成する。
クロスモーダルな証拠を捉えるために、SAVeはリップ音声同期もモデル化している。
論文 参考訳(メタデータ) (2026-03-26T08:01:35Z) - SAM Audio: Segment Anything in Audio [55.50609519820557]
一般的なオーディオソース分離は、マルチモーダルAIシステムにとって重要な機能である。
本稿では,一般的な音声分離のための基礎モデルであるSAM Audioを紹介する。
テキスト、ビジュアル、タイムスパンを単一のフレームワーク内で統合する。
論文 参考訳(メタデータ) (2025-12-19T22:14:23Z) - High-Quality Sound Separation Across Diverse Categories via Visually-Guided Generative Modeling [65.02357548201188]
DAVIS(Diffusion-based Audio-VIsual separation framework)を提案する。
本フレームワークは、混合音声入力と関連する視覚情報に基づいて、ノイズ分布から直接、所望の分離音スペクトルを合成することによって機能する。
論文 参考訳(メタデータ) (2025-09-26T08:46:00Z) - AUDDT: Audio Unified Deepfake Detection Benchmark Toolkit [7.279026980203529]
既存の28のオーディオディープフェイクデータセットを体系的にレビューし、AUDDTと呼ばれるオープンソースのベンチマークツールキットを提示する。
このツールキットの目的は、これらの28のデータセットにわたる事前訓練された検出器の評価を自動化することであり、ディープフェイク検出器の利点と欠点を直接フィードバックすることである。
論文 参考訳(メタデータ) (2025-09-25T21:09:40Z) - Unleashing the Power of Natural Audio Featuring Multiple Sound Sources [54.38251699625379]
ユニバーサルサウンド分離は、混合音声から異なるイベントに対応するクリーンなオーディオトラックを抽出することを目的としている。
複雑な混合音声を複数の独立したトラックに分解するために,データエンジンを利用するフレームワークであるClearSepを提案する。
実験では、ClearSepは複数の音分離タスクで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-04-24T17:58:21Z) - Separate This, and All of these Things Around It: Music Source Separation via Hyperellipsoidal Queries [53.30852012059025]
音源分離は音声から音声までの検索作業である。
音楽ソース分離における最近の研究は、固定状態パラダイムに挑戦し始めている。
本稿では,超楕円体領域をクエリとして使用することにより,ターゲット(位置)とスプレッドの両方を指定するための直感的かつ容易にパラメトリザブルなアプローチを提案する。
論文 参考訳(メタデータ) (2025-01-27T16:13:50Z) - Analyzing the Impact of Splicing Artifacts in Partially Fake Speech Signals [15.595136769477614]
我々は,信号の結合による音声トラックの解析を行い,それらのアーティファクトを調査し,既存のデータセットにバイアスが生じているかどうかを評価する。
その結果,スプライシングアーティファクトを解析することにより,ArialSpoofデータセットとHADデータセットでそれぞれ6.16%,7.36%のEERを検出できることがわかった。
論文 参考訳(メタデータ) (2024-08-25T09:28:04Z) - Detecting Audio-Visual Deepfakes with Fine-Grained Inconsistencies [11.671275975119089]
空間領域と時間領域の両方において微妙なアーティファクトを検出するためのきめ細かいメカニズムを提案する。
まず,音声との不整合が生じやすい小さな空間領域を撮影できる局所視覚モデルを提案する。
第2に、トレーニングセットに微妙な時間的不整合を取り入れたサンプルを含む、時間的に局所的な擬似フェイク増強を導入する。
論文 参考訳(メタデータ) (2024-08-13T09:19:59Z) - AVTENet: A Human-Cognition-Inspired Audio-Visual Transformer-Based Ensemble Network for Video Deepfake Detection [49.81915942821647]
本研究では、ディープフェイクビデオを検出するために、オーディオ・ヴィジュアル・トランスフォーマー・ベースのアンサンブルネットワーク(AVTENet)を導入する。
評価には、最近リリースされたマルチモーダルオーディオビデオFakeAVCelebデータセットを使用する。
AVTENetとその変種およびいくつかの既存手法をFakeAVCelebデータセットの複数のテストセット上で評価する。
論文 参考訳(メタデータ) (2023-10-19T19:01:26Z) - An Efficient Temporary Deepfake Location Approach Based Embeddings for
Partially Spoofed Audio Detection [4.055489363682199]
本稿では,時間的ディープフェイク位置(TDL)という,きめ細かな部分スプーフ音声検出手法を提案する。
提案手法は, 類似モジュールの埋め込みと時間的畳み込み操作という2つの新しい部分を含む。
提案手法は, ASVspoof 2019 partial Spoof データセットのベースラインモデルより優れ, クロスデータセットシナリオにおいても優れた性能を示す。
論文 参考訳(メタデータ) (2023-09-06T14:29:29Z) - Separate Anything You Describe [53.30484933564858]
言語クエリオーディオソース分離(LASS)は,CASA(Computer auditory scene analysis)の新しいパラダイムである
AudioSepは、自然言語クエリによるオープンドメインオーディオソース分離の基礎モデルである。
論文 参考訳(メタデータ) (2023-08-09T16:09:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。