論文の概要: From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake Detection
- arxiv url: http://arxiv.org/abs/2609.08899v2
- Date: Wed, 09 Sep 2026 06:27:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.685379
- Title: From Scores to Evidence: Auditable Decisions Can Improve Speech Deepfake Detection
- Title(参考訳): スコアからエビデンスへ:聴覚決定は音声深度検出を改善する
- Authors: Mengzhe Geng, Yujia Lu, Patrick Littell, Manuela Kunz, Xie Chen,
- Abstract要約: 音声のディープフェイクは、聞き手や自動化されたシステムを騙すのに十分な説得力のある話者の声を模倣することができる。
ほとんどの検出器は発話ごとに1点のスコアで終わるが、なぜ境界線アイテムが信頼されるべきなのか、延期されたのか、あるいはレビューされるべきなのかは、ほとんど語っていない。
この疑問に答えるには、4つの整列した手がかりを後期校正ステップに伝達する監査可能な決定記録がある。
- 参考スコア(独自算出の注目度): 12.159476982130286
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speech deepfakes can mimic a speaker's voice convincingly enough to deceive listeners and automated systems. This has driven strong progress in speech deepfake detection, but most detectors still end with one score per utterance. That score is useful for ranking systems, yet it says little about why a borderline item should be trusted, deferred, or reviewed. Two utterances can fall in the same score band for different reasons, for example because passive and retrieval evidence disagree or because the keyed probe is unavailable. We ask whether the final decision can remain scalar without discarding that provenance. We answer this question with an auditable decision record that carries four aligned cues into a late calibration step: a passive detector score, a conditional keyed-probe score on a marked derivative, retrieval support, and a speaker-profile margin, together with explicit disagreement coordinates. On the 4,080-example ASVspoof 5 Track 1 matched subset, the fixed retrieval-augmented rule improves on retrieval-only evidence, reducing equal error rate (EER) from 15.84% to 11.91%, and late calibration over the full record reaches 8.43% EER. At a 33.75% review budget, the exposed cue union covers 82.85% of the calibrated model's errors. The best passive WavLM run still reaches 6.71% EER, so we do not present the decision record as a stronger standalone detector. Its contribution is to preserve the evidence behind each surfaced utterance while still producing one operating score for thresholding and review.
- Abstract(参考訳): 音声のディープフェイクは、聞き手や自動化されたシステムを騙すのに十分な説得力のある話者の声を模倣することができる。
これは音声のディープフェイク検出において大きな進歩をもたらしたが、ほとんどの検出器は発話毎に1点のスコアで終わる。
このスコアはランキングシステムに有用だが、なぜ境界項目を信頼するか、延期するか、あるいはレビューすべきかについてはほとんど語っていない。
例えば、受動的および検索的証拠が一致しなかったり、キープローブが利用できないために、2つの発話が異なる理由で同じスコアバンドに落ちることがある。
最終的な決定は、その証明を捨てることなく、スカラーのままでいられるかどうかを問う。
本稿では, 4つの列列列のキューを, 受動検出器スコア, 有意な導関数に対する条件付きキー付きプローブスコア, 検索支援, 話者注目率スコア, および明示的な不一致座標を含む, 遅延校正ステップに導出する可聴性決定レコードを用いて回答する。
4,080サンプルのASVspoof 5 Track 1が一致したサブセットでは、固定された検索強化ルールが検索専用エビデンスを改善し、EERは15.84%から11.91%に減少し、完全なレコードに対する遅延キャリブレーションは8.43%に達した。
33.75%の予算で、露出したキューユニオンは、校正されたモデルのエラーの82.85%をカバーしている。
最高の受動WavLMは依然として6.71%のEERに達するため、より強力なスタンドアロン検出器としての決定記録は提示しない。
その貢献は、各発話の背後にある証拠を保存しつつ、しきい値と評価のための1つの操作スコアを生成することである。
関連論文リスト
- Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does [27.909684871924004]
本稿では,テキストと音声アシスタントの統一評価プロトコルであるHear2Actを紹介する。
我々は、転写、音声、および関心状態アクセスに基づく意思決定を評価する。
語彙的証拠が不十分な場合には韻律が重要であることを示す。
論文 参考訳(メタデータ) (2026-08-20T00:16:36Z) - Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency [0.025718125188898048]
我々は,現時点のタスクを個別に保持するプロセスベンチトレースに対して,擬似アラームを計測する。
完了した監査 -> モデルのコンテキストにすでにある修復エピソードは、15のモデルxワードの組み合わせのうち15の偽のアラームを低くする。
論文 参考訳(メタデータ) (2026-08-17T01:41:43Z) - Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation [41.01488608247856]
アウトカム検証器は、完了した推論トレースをスコアするが、中間トークンにクレジットを割り当てない。
原始的な自己蒸留は、モデル自身のロールアウトをトレーニング専用の情報で再現することで、このギャップを埋めようとする。
スコアがより良い行動を追跡するか、フィードバック構築が比較対象を変えるか、トレーニング損失が強化されるか、という3つの質問を分離する。
論文 参考訳(メタデータ) (2026-08-10T08:18:48Z) - When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs [42.32694162421078]
CALVERは、パールの因果基準に対して構造化されたトレースをスコアする訓練不要なシンボル検証器である。
CALVERは、複数のグラフ正解を許容するCLEAR検索1価クエリにおいて、報酬モデル、LLM審査員、モデルの信頼性が30%近く残っている42.1%に達する。
論文 参考訳(メタデータ) (2026-08-04T11:45:46Z) - Auditable Release Control for Pedagogical Leakage in LLM Tutors [0.0]
大規模な言語モデルチューターは、その開示が承認される前に答えや決定的な推論を明らかにするのに役立ちます。
我々は、この状態および行動依存的障害を、教育的漏洩認識認可として定式化し、完全修復境界を導入する。
グローバルA1は0の多数と54のユーティリティフラグを獲得し、自動安全と実用性において適合Qを上回っている。
論文 参考訳(メタデータ) (2026-08-01T08:24:30Z) - Voice Memory for Agentic Speech Recognition [66.69623133635868]
エージェント音声認識のための推論専用スキームであるVoice Memoryを提案する。
同期的に、スコア付き例は、境界編集を通じてそのファイルを更新する。
10のHyPoradiseドメインにオープン修正器、Voice Memory、重み付き単語エラー率8.36%から7.52%の10のドメインがある。
論文 参考訳(メタデータ) (2026-07-29T02:42:56Z) - Proactive for Uncertainty: Cause-Aware Error Diagnosis and Interactive Clarification for Spoken Dialogue Systems [40.265250435329456]
本稿では,SDSにおけるロバスト性を根本的に再考する原因認識型エラー回復パラダイムを提案する。
従来の信頼度フィルタリングとは異なり、我々は小さな精度に焦点を絞った検出器群を導入している。
この微細な診断知能は、LLMがターゲットとするマルチターンの明確化戦略を編成する権限を与える。
論文 参考訳(メタデータ) (2026-05-25T03:57:38Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。