論文の概要: DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization
- arxiv url: http://arxiv.org/abs/2608.21176v1
- Date: Fri, 21 Aug 2026 14:46:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.58905
- Title: DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization
- Title(参考訳): DAMOS: 明示的歪み局所化による音声品質評価の学習
- Abstract要約: 音声品質評価は、人間の主観的知覚と一致した平均オピニオンスコアを予測することを目的としている。
音声品質評価のための補助知識として,明示的な歪み局所化を導入する。
歪みを考慮した音声品質評価フレームワークDAMOSを提案する。
- 参考スコア(独自算出の注目度): 17.0840895033126
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automatic speech quality assessment aims to predict Mean Opinion Scores (MOS) consistent with human subjective perception and is essential for evaluating speech generation, enhancement, and communication systems. For speech signals, especially synthetic speech, distortions often occur locally, and overall perceptual quality is usually dominated by a small number of perceptually salient distortion regions. However, most existing methods are primarily optimized with utterance-level MOS, which provides only coarse-grained supervision and offer no explicit indication of where perceptually important distortions occur. To address this limitation, we introduce explicit distortion localization as auxiliary knowledge for speech quality assessment. We construct the first partially distorted speech dataset with frame-level distortion annotations and train a localization model to generate distortion cues. Building on these cues, we propose DAMOS, a distortion-aware speech quality assessment framework that integrates localization information into the MOS prediction pipeline. Experiments on multiple public benchmarks demonstrate that DAMOS consistently outperforms existing methods and exhibits strong cross-dataset generalization, validating the effectiveness of explicit distortion localization for speech quality assessment.
- Abstract(参考訳): 自動音声品質評価は、人間の主観的知覚と整合した平均オピニオンスコア(MOS)を予測することを目的としており、音声生成、強調、コミュニケーションシステムの評価に不可欠である。
音声信号、特に合成音声では、歪みは局所的に発生することが多く、全体的な知覚品質は、通常少数の知覚的に有意な歪み領域によって支配される。
しかし、既存のほとんどの手法は、主に発話レベルのMOSで最適化されており、粗いきめ細かな監督のみを提供し、知覚的に重要な歪みが発生する場所を明確に示さない。
この制限に対処するために、音声品質評価のための補助知識として、明示的な歪み局所化を導入する。
フレームレベルの歪みアノテーションを用いた最初の部分歪み音声データセットを構築し、局所化モデルを訓練して歪みキューを生成する。
そこで本研究では,MOS予測パイプラインにローカライズ情報を統合する,歪みを考慮した音声品質評価フレームワークであるDAMOSを提案する。
複数の公開ベンチマークの実験では、DAMOSは既存の手法を一貫して上回り、強いデータセットの一般化を示し、音声品質評価における明示的な歪み局所化の有効性を検証している。
関連論文リスト
- Calibration-Reasoning Framework for Descriptive Speech Quality Assessment [55.51206474234095]
本稿では,多次元推論のための基礎的大規模言語モデルに適したポストトレーニング手法を提案する。
多次元のQuariSpeechベンチマークで0.71の平均PCCスコアが得られた。
我々の細かいGRPO報酬は、時間内にオーディオアーティファクトを特定・分類するモデルの能力を大幅に向上させます。
論文 参考訳(メタデータ) (2026-03-10T19:14:17Z) - Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs [22.8529107367745]
音声編集は、グローバルな知覚自然性を維持しながら、元の発話に対してきめ細かいセグメントレベルの操作を行うことで意味的インバージョンを実現する。
既存の検出研究は主に、明示的なスプライシングアーティファクトによる手作業による音声編集に焦点を当てており、新たなエンドツーエンドの音声編集技術に対処するのに苦労している。
本稿では,音声質問応答タスクとして定式化することによって,音声編集検出とコンテンツローカライゼーションを統一する,最初の大規模モデルフレームワークPELMを提案する。
論文 参考訳(メタデータ) (2026-01-29T09:39:28Z) - On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation [88.77441715819366]
大規模生音声で事前訓練された生成音声言語モデルは、適切な内容で音声プロンプトを継続することができる。
本稿では,グローバルトークンの難易度に代えて,多種多様な可能性・生成的評価手法を提案する。
論文 参考訳(メタデータ) (2026-01-09T22:01:56Z) - $C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction [80.57232374640911]
我々はMask-And-Recover (MAR)と呼ばれるモデルに依存しない戦略を提案する。
MARは、モダリティ間およびモダリティ間コンテキスト相関を統合し、抽出モジュール内の大域的推論を可能にする。
各サンプルの難易度を向上するために, 精細信頼スコア(FCS)モデルを導入する。
論文 参考訳(メタデータ) (2025-04-01T13:01:30Z) - Anomaly Detection and Localization for Speech Deepfakes via Feature Pyramid Matching [8.466707742593078]
音声ディープフェイク(英: Speech Deepfakes)は、ターゲット話者の声を模倣できる合成音声信号である。
音声のディープフェイクを検出する既存の方法は教師あり学習に依存している。
本稿では,音声深度検出を異常検出タスクとして再設定する,新しい解釈可能な一クラス検出フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-23T11:15:22Z) - Assessing the Generalization Gap of Learning-Based Speech Enhancement
Systems in Noisy and Reverberant Environments [0.7366405857677227]
目に見えない条件への一般化は、通常、新しい音声、雑音または部屋のインパルス応答データベースでシステムをテストすることで評価される。
本研究では,テスト条件に基づいてトレーニングした参照モデルを用いた一般化評価フレームワークを提案する。
提案手法を用いて,フィードフォワードニューラルネットワーク(FFNN),ConvTasNet,DCCRN,MANNERの一般化ポテンシャルを評価する。
論文 参考訳(メタデータ) (2023-09-12T12:51:12Z) - Weakly-supervised forced alignment of disfluent speech using
phoneme-level modeling [10.283092375534311]
重み付き有限状態変換器を用いたアライメントグラフの構成法を提案する。
提案手法は, 強制アライメントのための音声不一致の動詞的書き起こしの必要性を軽減する。
TIMITテストセットとUCLASSデータセットの劣化バージョンについて評価したところ,大幅な改善が見られた。
論文 参考訳(メタデータ) (2023-05-30T09:57:36Z) - MOSRA: Joint Mean Opinion Score and Room Acoustics Speech Quality
Assessment [12.144133923535714]
本稿では,非侵入的多次元音声品質指標であるMOSRAについて述べる。
室内音響パラメータと音声品質の総合平均評価スコア(MOS)を同時に予測することができる。
また,この共同学習手法により,室内音響のブラインド推定が向上することを示す。
論文 参考訳(メタデータ) (2022-04-04T09:38:15Z) - Improving Distortion Robustness of Self-supervised Speech Processing
Tasks with Domain Adaptation [60.26511271597065]
音声歪みは、視覚的に訓練された音声処理モデルの性能を劣化させる長年の問題である。
音声処理モデルのロバスト性を向上して、音声歪みに遭遇する際の良好な性能を得るには、時間を要する。
論文 参考訳(メタデータ) (2022-03-30T07:25:52Z) - Discretization and Re-synthesis: an alternative method to solve the
Cocktail Party Problem [65.25725367771075]
この研究は、初めて合成に基づくアプローチがこの問題にうまく対応できることを示した。
具体的には,離散シンボルの認識に基づく音声分離/強調モデルを提案する。
離散シンボルの入力による合成モデルを利用することで、離散シンボル列の予測後、各ターゲット音声を再合成することができる。
論文 参考訳(メタデータ) (2021-12-17T08:35:40Z) - LDNet: Unified Listener Dependent Modeling in MOS Prediction for
Synthetic Speech [67.88748572167309]
本稿では,平均世論スコア(MOS)予測のための統合フレームワークLDNetを提案する。
より安定した結果と効率的な計算を提供する2つの推論手法を提案する。
論文 参考訳(メタデータ) (2021-10-18T08:52:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。