論文の概要: dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model
- arxiv url: http://arxiv.org/abs/2608.02673v1
- Date: Sun, 02 Aug 2026 15:03:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.883502
- Title: dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model
- Title(参考訳): dots.tts.edit:連続自己回帰モデルによる精密制御音声編集
- Authors: Hankun Wang, Bohan Li, Shi Lian, Xiaoyu Gu, Jing Peng, Da Zheng, Colin Zhang, Kai Yu,
- Abstract要約: 本稿では,XMLスタイルのタグを用いた音声編集のための,正確で明示的なインタフェースについて検討する。
dots.tts.editは継続的自己回帰型dots.tts基盤モデルから適応したエディタである。
doteBenchはバイリンガル・アセスメント・スイートで, 正確な指示の追従, 局所保存, 音質を計測する。
- 参考スコア(独自算出の注目度): 17.615596275551358
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Speech editing for content creation requires precise control over both what an edit should do and where it should apply. Free-form natural language provides a flexible interface for expressing edit requests, but its ambiguity may leave the intended operation, parameters, or target region underspecified. We study a precise and explicit interface for speech editing: a transcript-grounded structural edit instruction with XML-style tags explicitly specifies typed operations and localizes them to transcript spans or boundaries. This semantic timeline avoids explicit timestamp alignment and provides an externally inspectable contract for compositional edits. We instantiate the interface in dots.tts.edit, an editor adapted from the continuous autoregressive dots.tts foundation model. Four representative speech-creation controls cover lexical content, affective expression, pitch and speaking-rate delivery, and temporal phrasing through text, emotion, prosody, and pause editing. Task-specific data pipelines construct operation- and scope-controlled pairs while retaining source-derived context outside each target region. We further introduce doteBench, a bilingual evaluation suite that measures precise instruction following, local preservation, and audio quality across the four controls and their composition. Experiments show leading overall instruction following and local preservation across its five editing categories, while audio quality remains comparable to existing open-source systems. Across three Seed-TTS-Eval shards, the model shows negligible differences from the base model in zero-shot TTS recognition error rate and speaker similarity. The code and model will be released soon.
- Abstract(参考訳): コンテンツ作成のための音声編集には、編集がすべきことや適用すべき場所の両方を正確に制御する必要がある。
自由形式の自然言語は、編集要求を表現するフレキシブルなインタフェースを提供するが、その曖昧さは意図された操作、パラメータ、あるいはターゲット領域を未特定のままにしておく可能性がある。
音声編集のための精密で明示的なインターフェースについて検討する。XMLスタイルのタグを付加した転写された構造的編集命令は、入力された操作を明示的に指定し、それらを転写されたスパンやバウンダリにローカライズする。
このセマンティックタイムラインは明示的なタイムスタンプアライメントを回避し、コンポジション編集のための外部検査可能なコントラクトを提供する。
dots.tts.editは継続的自己回帰型dots.tts基盤モデルから適応したエディタである。
4つの代表的音声生成制御は、語彙内容、感情表現、ピッチと発話率の伝達、テキスト、感情、韻律、編集の一時停止をカバーしている。
タスク固有のデータパイプラインは、ターゲット領域の外でソース由来のコンテキストを維持しながら、操作とスコープ制御のペアを構築する。
さらに,4つの制御とその構成に対して,正確な指示の追従,局所保存,音質を測定するバイリンガル評価スイートであるdoteBenchを紹介する。
実験では、5つの編集カテゴリにまたがる全体的な指導と局所的な保存が示され、一方、オーディオの品質は既存のオープンソースシステムに匹敵する。
3つのSeed-TTS-Evalシャードにまたがって、ゼロショットTS認識誤差率と話者類似度において、ベースモデルと無視できる違いを示す。
コードとモデルはまもなくリリースされる予定だ。
関連論文リスト
- Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing [55.211537893248675]
本稿では,2つの補完コンポーネントを中心に構築された暗黙の推論ビデオ編集用DiTフレームワークであるRVEDiTを提案する。
RVEDiTは最先端のベースラインを一貫して上回り、特にローカライズされた編集や構成的な編集において大きな利益を得ている。
論文 参考訳(メタデータ) (2026-05-23T17:22:14Z) - InstructAudio: Unified speech and music generation with natural language instruction [52.76518112649456]
InstructAudioは、音響属性の命令ベースの制御を可能にする統一的なフレームワークである。
英語と中国語で表現力のある音声、音楽、対話生成をサポートする。
論文 参考訳(メタデータ) (2025-11-23T15:15:21Z) - FluentEditor2: Text-based Speech Editing by Modeling Multi-Scale Acoustic and Prosody Consistency [40.95700389032375]
テキストベースの音声編集(TSE)により、ユーザーは元の録音を変更することなく、対応するテキストを直接修正して音声を編集できる。
現在のTSE技術は、学習中に生成された音声と編集領域における参照の相違を最小限に抑えることに焦点を当てていることが多い。
従来のtextitFluentEditor モデルである textittextbfFluentEditor2 をベースとした新しい流速音声編集手法を提案する。
論文 参考訳(メタデータ) (2024-09-28T10:18:35Z) - FluentEditor: Text-based Speech Editing by Considering Acoustic and
Prosody Consistency [44.7425844190807]
テキストベースの音声編集(TSE)技術は、ユーザが音声自体の代わりに入力テキストの書き起こしを変更することで出力オーディオを編集できるように設計されている。
本稿では,TSE訓練における流速を考慮した訓練基準を考慮し,流速音声編集モデルであるtextitFluentEditorを提案する。
VCTKの主観的および客観的な実験結果から,本論文のテキストFluentEditorは,自然性や流布性の観点から,すべての高度なベースラインを上回ります。
論文 参考訳(メタデータ) (2023-09-21T01:58:01Z) - CampNet: Context-Aware Mask Prediction for End-to-End Text-Based Speech
Editing [67.96138567288197]
本稿では,コンテキスト認識型マスク予測ネットワーク(CampNet)と呼ばれる,エンドツーエンドのテキストベースの音声編集手法を提案する。
モデルは、音声の一部をランダムにマスキングしてテキストベースの音声編集プロセスをシミュレートし、音声コンテキストを感知してマスキング領域を予測する。
編集された領域における不自然な韻律を解き、テキスト中の不明瞭な単語に対応する音声を合成することができる。
論文 参考訳(メタデータ) (2022-02-21T02:05:14Z) - Zero-Shot Text-to-Speech for Text-Based Insertion in Audio Narration [62.75234183218897]
話者の訓練データなしで自然かつ一貫性のあるターゲット音声を生成する一段階の文脈認識フレームワークを提案する。
変換器をベースとしたデコーダを用いて,編集音声のメルスペクトルを生成する。
これは最近のゼロショット TTS エンジンを大きなマージンで上回っている。
論文 参考訳(メタデータ) (2021-09-12T04:17:53Z) - Context-Aware Prosody Correction for Text-Based Speech Editing [28.459695630420832]
現在のシステムの主な欠点は、編集された地域の周りの韻律のミスマッチのために、編集された録音がしばしば不自然に聞こえることです。
音声のより自然な音声編集のための新しい文脈認識手法を提案する。
論文 参考訳(メタデータ) (2021-02-16T18:16:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。