論文の概要: ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling
- arxiv url: http://arxiv.org/abs/2606.10233v1
- Date: Mon, 08 Jun 2026 22:46:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-10 15:40:58.220463
- Title: ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling
- Title(参考訳): ANCHOR:多解音声品質モデリングのための自動回帰非侵入チョーク整形
- Authors: Zhuoyan Tao, Jiatong Shi, Hye-jin Shim, Shinji Watanabe,
- Abstract要約: ストリーミングと生成システムは、部分的なオーディオから漸進的な推定を必要とする。
多分解能オートレタスクとしてインクリメンタルアセスメントを改良したANCHORを提案する。
2秒プレフィックスの48%のPLCMOSエラー削減を含む、部分入力下でのかなりの堅牢性を示す実験。
- 参考スコア(独自算出の注目度): 62.983372215479925
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While speech quality is typically assessed on complete utterances, streaming and generative systems require incremental estimation from partial audio. Existing predictors assume full context, degrading on prefix-constrained inputs. Extending ARECHO, we propose ANCHOR, reformulating incremental assessment as a multi-resolution autoregressive task. It models chunk- and utterance-level quality within a single decoder using dual-resolution tokens and a resolution-aware hierarchy for coarse-to-fine refinement. Experiments show substantial robustness under partial input, including a 48% PLCMOS error reduction on 2-second prefixes. Convergence analysis reveals a 4-6 s effective perceptual context horizon. A stress test further isolates structured extrapolation biases under localized corruption. Results demonstrate that hierarchical supervision improves incremental prediction and elucidates how perceptual quality accumulates over time.
- Abstract(参考訳): 音声品質は通常、完全な発話に基づいて評価されるが、ストリーミングと生成システムは部分的な音声から漸進的な推定を必要とする。
既存の予測器は、プレフィックス制約された入力を劣化させ、完全なコンテキストを仮定する。
ARECHOを拡張して,多分解能自己回帰タスクとしての漸進的評価を再構成するANCHORを提案する。
チャンクレベルと発話レベルの品質を、二重分解能トークンと粗い微細化のための分解能認識階層を使って、単一のデコーダ内でモデル化する。
2秒プレフィックスの48%のPLCMOSエラー削減を含む、部分入力下でのかなりの堅牢性を示す実験。
収束解析により、4-6sの有効知覚コンテキスト水平線が明らかになった。
ストレステストは、局所的な腐敗の下で構造化された外挿バイアスをさらに分離する。
その結果、階層的な監督は漸進的な予測を改善し、知覚的品質が時間とともにどのように蓄積されるかを明らかにする。
関連論文リスト
- DiffuSent: Towards a Unified Diffusion Framework for Aspect-Based Sentiment Analysis [4.022262570915779]
非自己回帰拡散フレームワークであるDiffuSentは、すべてのABSAサブタスクを境界分解拡散過程として定式化する。
また,Diffusentは多語三重項に対して有意な増加を示し,平均値2.48 F1を達成し,複数の感情三重項を含む文の頑健な抽出精度を維持した。
論文 参考訳(メタデータ) (2026-05-31T16:15:03Z) - Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation [50.139984798361375]
遅延不一致による冗長性を除去する学習自由フレームワークを提案する。
LD-Pruningは、Infinity-8Bの最大2.35倍のスピードアップを実現し、高い生成品質を維持しながら推論を大幅に削減する。
論文 参考訳(メタデータ) (2026-05-29T19:34:39Z) - Quality-Aware Robust Multi-View Clustering for Heterogeneous Observation Noise [12.720216418233795]
QARMVC(Quality-Aware Robust Multi-View Clustering)と呼ばれる新しいフレームワークを提案する。
QARMVCは、ビュー再構成に固有のセマンティクスを抽出するために、情報ボトルネック機構を採用している。
5つのベンチマークデータセットの実験では、QARMVCは一貫して最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-02-26T03:16:44Z) - What Does It Take to Build a Performant Selective Classifier? [30.90225954725644]
ベイズノイズ,近似誤差,ランキング誤差,統計的ノイズ,実装またはシフト誘起スラックについて検討した。
我々は,合成2モードデータと実世界のビジョンと言語ベンチマークを用いて,その分解を検証した。
その結果, (i)ベイズノイズとモデル容量の制限は, 実質的なギャップを考慮し, (ii) よりリッチで特徴を考慮したキャリブレータのみを有意義に改善し, (iii) データシフトは, 分散的に堅牢なトレーニングを必要とするスラックを別々に導入することを確認した。
論文 参考訳(メタデータ) (2025-10-23T05:48:40Z) - Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization [72.30168853571216]
マルチモーダルな言語モデルは、視覚知覚と象徴的推論を統合するタスクに優れています。
CapPO は,(1) 原画像上の条件付き応答とキャプション上の条件付き応答のばらつきを最小限に抑えるキャプションベース整合性正規化,(2) KL 重み付き優位性推定スキームを適応的に拡張して知覚整合性トラジェクトリを強化するキャプションベース整合性正規化という2つの重要なメカニズムを統合した。
論文 参考訳(メタデータ) (2025-09-26T04:32:26Z) - $C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction [80.57232374640911]
我々はMask-And-Recover (MAR)と呼ばれるモデルに依存しない戦略を提案する。
MARは、モダリティ間およびモダリティ間コンテキスト相関を統合し、抽出モジュール内の大域的推論を可能にする。
各サンプルの難易度を向上するために, 精細信頼スコア(FCS)モデルを導入する。
論文 参考訳(メタデータ) (2025-04-01T13:01:30Z) - DASA: Difficulty-Aware Semantic Augmentation for Speaker Verification [55.306583814017046]
本稿では,話者認証のための難易度認識型セマンティック拡張(DASA)手法を提案する。
DASAは、話者埋め込み空間における多様なトレーニングサンプルを、無視できる余分な計算コストで生成する。
最も良い結果は、CN-Celeb評価セット上でのEER測定値の14.6%の相対的な減少を達成する。
論文 参考訳(メタデータ) (2023-10-18T17:07:05Z) - Doubly Robust Off-Policy Actor-Critic: Convergence and Optimality [131.45028999325797]
ディスカウント型MDPのための2倍堅牢なオフポリチックAC(DR-Off-PAC)を開発した。
DR-Off-PACは、俳優と批評家の両方が一定のステップで同時に更新される単一のタイムスケール構造を採用しています。
有限時間収束速度を研究し, dr-off-pac のサンプル複雑性を特徴とし, $epsilon$-accurate optimal policy を得る。
論文 参考訳(メタデータ) (2021-02-23T18:56:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。