論文の概要: Audio-Anchored Fusion of Multi-Ratio DiT Reconstruction Residuals for Cross-Domain Audio Deepfake Detection
- arxiv url: http://arxiv.org/abs/2607.26472v1
- Date: Wed, 29 Jul 2026 04:55:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.542696
- Title: Audio-Anchored Fusion of Multi-Ratio DiT Reconstruction Residuals for Cross-Domain Audio Deepfake Detection
- Title(参考訳): クロスドメインオーディオディープフェイク検出のためのマルチ比誘電体再構成残像のオーディオアンコール融合
- Abstract要約: 凍結再構成プローブとして拡散変圧器(DiT)を訓練する。
再構成残差はドメインに敏感であるため,我々のオーディオアンコール検出器は予測された凍結WavLMの聴覚表現を融合和に渡す。
その結果,ASVspoof 5-ITW転送における補足的証拠として再建遺残を支持し,非競合的聴覚経路を動機づけた。
- 参考スコア(独自算出の注目度): 20.35414652585611
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Audio deepfake detectors often degrade when generators, corpora, or recording conditions change. We use a Diffusion Transformer (DiT), trained only on bona fide speech, as a frozen reconstruction probe. Reconstructions at masking ratios 0.5, 0.75, and 0.9 yield explicit multi-ratio residual maps. Because these residuals are domain sensitive, our audio-anchored detector passes the projected frozen-WavLM auditory representation into the fusion sum without gate-based attenuation and uses residuals only as a scalar-gated additive correction. The pre-specified seed-42 run obtains 6.5442% EER / 0.18456 min-DCF on ASVspoof 5 Eval and 13.8372% / 0.36921 on ITW Full; three-seed means are 6.8885 (0.3308)% and 15.3328 (2.0719)%. The latter is below a separately optimized WavLM-ResNet18 reference under both supervision settings. Auxiliary supervision raises dynamic competitive fusion from 18.4007% to 25.2968% mean ITW EER, worsening all three seeds. The results support reconstruction residuals as complementary evidence and motivate a non-competitive auditory path for ASVspoof 5-to-ITW transfer, without claiming a componentwise causal ablation of anchoring alone.
- Abstract(参考訳): オーディオディープフェイク検出器は、ジェネレータ、コーパス、記録条件が変化すると劣化することが多い。
拡散変換器(DiT)を凍結再構成プローブとして用いる。
マスキング比0.5、0.75、0.9での再構成は明示的な多重比残差写像を生成する。
これらの残差はドメインに敏感なため、我々のオーディオアンカレッド検出器は、投射した凍結WavLMの聴覚表現をゲートによる減衰のない融合和にパスし、スカラーゲート付加補正としてのみ残差を用いる。
ASVspoof 5 Evalで6.5442% EER / 0.18456 min-DCF、ITW Fullで13.8372% / 0.36921、三種平均で6.8885 (0.3308)%、および15.3328 (2.0719)%である。
後者はWavLM-ResNet18参照を2つの監視設定で個別に最適化したものである。
補助的監督は、動的競合融合を18.4007%から25.2968%に引き上げ、ITW EERを意味し、3つの種全てを悪化させる。
その結果, ASVspoof 5-to-ITWトランスファーにおける補足的証拠として再建遺残が支持され, ASVspoof 5-ITWトランスファーの非競合的聴覚経路のモチベーションが得られた。
関連論文リスト
- From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs [46.76277198630859]
大規模な音声言語モデル (LALM) は多様な音声入力を理解する強力な能力を示している。
この多様性には、人間には聞こえない低周波信号が含まれているが、それでもモデルに入り、その生成に影響を与えることができる。
ブラックボックス設定における普遍的な波形テンプレートを用いて,このリスクを評価可能な赤信号抽出手法である Intermittent Low-Frequency Lockout (ILL) を提案する。
論文 参考訳(メタデータ) (2026-08-10T06:09:50Z) - Level, Sharpness, and Corpus: Why Zero-Shot OOD Detector Rankings Do Not Transfer [36.02174685737611]
各検出器は、少なくとも1つのドメインで80%$ FPR95 を超え、所望の検出器は、分配データと基礎となる VLM の両方に依存する。
本稿では, ベース検出器, レベル, シャープネスの非補償融合により, 補完的証拠を保存する検出器非依存ラッパーであるComplementary Evidence Guard(CEG)を紹介する。
論文 参考訳(メタデータ) (2026-07-29T08:00:49Z) - Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits [47.668752416295185]
条件付き共アブレーションは、各単位のアブレーション効果が一次集合が取り除かれたときにどれだけ増大するかを問う。
GPT-2の小型IOI回路では、CoAxはバックアップヘッドのリカバリを0.33から0.91 ROC-AUCに引き上げる。
論文 参考訳(メタデータ) (2026-07-02T09:32:57Z) - How Fragile Are Training-Free AI-Generated Image Detectors? A Controlled Audit of Score Direction, Preprocessing, and Compression [6.3999417080764225]
オートエンコーダ・リコンストラクションスコア(AEROBLADE-style)とノイズ摂動特徴相似スコア(RIGID-style)の2つの代表的なトレーニングフリースコアを監査する。
監査は3つの注意深い結果をもたらす。
論文 参考訳(メタデータ) (2026-06-18T17:05:51Z) - How Much Capacity Does EEG Denoising Need? Ultra-Compact Networks reveal Benchmark Saturation and Metric-Utility Gap [0.0]
深層学習EEG(Deep Learning EEG Denoising Architectures)は、数万から数千万のパラメータに拡張されているが、実験変数としてモデルキャパシティを分離した以前の研究はない。
アーキテクチャ,損失,データ分割,トレーニングレシピの両ギャップに対処し,最小限の深さ分離可能な畳み込みU-Netで1.05Kから40.26Kパラメータまでのチャネル幅を網羅する。
論文 参考訳(メタデータ) (2026-06-07T12:17:25Z) - CRMA: A Spectrally-Bounded Backbone for Modular Continual Fine-Tuning of LLMs [0.0]
我々は、内部混合行列 M がシンクホーン正規化による全ての前方通過において二重確率である残留アダプタ CRMA を紹介する。
5つのドメインにまたがるMistral-7Bでは、モジュラー・パー・タスクのLoRAは、+42.96%+/-5.5(ナイーブ微調整)から-0.17%+/-0.17までのバックボーンの損失相対的ドリフトを仲介する。
論文 参考訳(メタデータ) (2026-05-29T21:50:23Z) - Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense [37.10272384523361]
我々は、各検出器のサンプルごとの信頼性と遅延を、同様の過去の入力に対する動作から予測するためのフレームワークを開発する。
SCOUT-450は、古いプロンプトインジェクションが表現下にある構造的に複雑でエージェント対応のインジェクションをキャプチャするベンチマークである。
SCOUT-450では、安全指向の動作点が攻撃発生率を46%減らし、壁時計全体の40%減らした。
論文 参考訳(メタデータ) (2026-05-29T04:49:20Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Low-Rank Adaptation Reduces Catastrophic Forgetting in Sequential Transformer Encoder Fine-Tuning: Controlled Empirical Evidence and Frozen-Backbone Representation Probes [3.305265383862785]
コンパニオン表現プローブを用いたシーケンシャルトランスフォーマーエンコーダにおけるローランド適応(LoRA)の実証的研究について述べる。
RTE->MRPC->CoLA->SST-2配列上の5つのフルバリデーションBERTベースでは、フル微調整の収率は19.9%+/-で、標準のLoRA(r、クエリ/バリューモジュール)は0.6%+/-1.4%である。
論文 参考訳(メタデータ) (2026-03-29T14:14:36Z) - D3R-Net: Dual-Domain Denoising Reconstruction Network for Robust Industrial Anomaly Detection [0.0]
非教師付き異常検出(UAD)は、現代の製造において、自動視覚検査の鍵となる要素である。
本稿では、D3R-Netについて紹介する。D3R-Netは、自己教師型「癒し」タスクと周波数認識正規化を結合したデュアルドメイン・デノベーション・コンストラクションフレームワークである。
空間平均二乗誤差に加えて、周波数領域の整合性を促進するFast Fourier Transform (FFT) 等級損失を用いる。
論文 参考訳(メタデータ) (2026-01-27T23:21:59Z) - ReDDiT: Rehashing Noise for Discrete Visual Generation [53.813067778912]
離散拡散変圧器(終端型ReDDiT)のためのリハッシングノイズアプローチを提案する。
我々は、吸収状態を拡張し、離散拡散モデルの表現能力を向上させることを目的としている。
実験の結果、ReDDiTはベースラインモデルよりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-05-26T08:17:20Z) - End-to-End Multi-speaker Speech Recognition with Transformer [88.22355110349933]
音声認識モデルにおけるRNNベースのエンコーダデコーダをトランスフォーマーアーキテクチャに置き換える。
また、計算量を削減するために、シーケンス全体ではなくセグメントに制限されるセルフアテンションコンポーネントを変更します。
論文 参考訳(メタデータ) (2020-02-10T16:29:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。