論文の概要: TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models
- arxiv url: http://arxiv.org/abs/2609.01277v1
- Date: Tue, 01 Sep 2026 14:12:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.723542
- Title: TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models
- Title(参考訳): TimeSteer:ジョイントオーディオ・ビジュアル拡散モデルにおける推測時間音声スケジューリング
- Authors: Chao Zhou, Yiling Chen, Qi Chu, Tao Gong, Nenghai Yu, Tianyi We,
- Abstract要約: インセンジェンス時音声スケジューリングは、ユーザが指定した始終区間内に、合成された音声と視覚的調音を配置する新しいタスクである。
我々は、各発話のソーススパンをローカライズするトレーニング不要のフレームワークである textbfTimeSteer を提案する。
TimeSteerは、競争力のある全体的な生成品質を維持しながら、トレーニング不要のベースラインに対するインターバル制御性を著しく改善する。
- 参考スコア(独自算出の注目度): 49.44322041671119
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Although pretrained joint audio-visual diffusion models offer rich control over \emph{what} to generate, they provide no explicit control over \emph{when} an utterance should occur. To address this, we study \emph{inference-time speech scheduling}, a novel task that places coupled speech and visual articulation within user-specified begin--end intervals without finetuning the backbone model. We uncover two intrinsic properties of the denoising process that enable this task. First, a timing-sensitive text-to-audio cross-attention head exposes each utterance's model-implied source span along the latent timeline. Second, the predicted clean latent already organizes coupled speech and visual articulation, allowing their temporal placement to be edited without regenerating the content. Building on these discoveries, we propose \textbf{TimeSteer}, a training-free framework that localizes each utterance's source span through \textbf{Source Span Localization} and transfers the associated audio-visual latent content from the source interval to the specified target interval through \textbf{Region-Aware Latent Remapping}. We further introduce \textbf{SpeechShift}, the first benchmark for interval-level speech scheduling in joint audio-visual generation. Experiments across two representative backbones show that TimeSteer substantially improves interval controllability over training-free baselines while maintaining competitive overall generation quality.
- Abstract(参考訳): 事前訓練された共同音声-視覚拡散モデルでは、生成するために \emph{what} をリッチに制御できるが、発声が起こるべき \emph{when} を明示的に制御するものではない。
そこで本稿では,ユーザが指定した音声と視覚的調音を,バックボーンモデルを微調整することなく,ユーザ指定の開始区間内に配置する新しいタスクである「emph{inference-time speech schedule」について検討する。
この課題を実現するために,2つの本質的特性を解明した。
第一に、タイミングに敏感なテキスト・ツー・オーディオのクロスアテンションヘッドは、潜時タイムラインに沿って各発話のモデルに実装されたソーススパンを露出する。
第二に、予測されたクリーン潜伏剤は、既に音声と視覚の合成を整理しており、コンテンツを再生成することなく、時間的配置を編集することができる。
これらの発見に基づいて、各発話のソースを \textbf{Source Span Localization} を通じてローカライズし、関連するオーディオ視覚潜在コンテンツを、ソースインターバルから指定されたターゲットインターバルへ、 \textbf{Region-Aware Latent Remapping} を介して転送する、トレーニング不要のフレームワークである \textbf{TimeSteer} を提案する。
さらに,共同音声・視覚生成における区間レベルの音声スケジューリングのための最初のベンチマークである‘textbf{SpeechShift} も紹介する。
2つの代表的なバックボーンを用いた実験により、TimeSteerはトレーニング不要のベースラインに対するインターバル制御性を大幅に改善し、全体的な生成品質の競争性を維持している。
関連論文リスト
- Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation [58.79612575170589]
既存の手法では、重なり合う音響イベントと視覚的インスタンスをマッチングし、音声視覚力学を扱うのに苦労している。
本稿では,2つのメカニズムを用いて,これらの課題に対処するH2Sを提案する。
論文が受け入れられたら、コードはオープンソースになる。
論文 参考訳(メタデータ) (2026-08-04T07:35:57Z) - Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation [113.24577778437295]
Batonは、共同ビデオオーディオ生成に明示的なセマンティックプランニングを導入するフレームワークである。
我々の重要な洞察は、粗いテキストガイダンスを意味的にリッチでモダリティを意識したトークンで補完することで、細かなセマンティックディテールを同時に復元できるということです。
ベンチマークの実験は、バトンの有効性を質的にも定量的にも示している。
論文 参考訳(メタデータ) (2026-05-24T17:55:11Z) - Frame-Level Internal Tool Use for Temporal Grounding in Audio LMs [48.50855715191533]
大規模な音声言語モデルは、複雑な音声理解タスクにますます使われている。
彼らは、単語アライメントや話者ダイアリゼーションのような正確な時間的根拠を必要とする時間的タスクに苦労する。
本稿では,フレームレベルの内部ツール使用法を提案する。これは,内部の音声表現を用いて時間的グラウンドを直接行うように音声LMを訓練する手法である。
論文 参考訳(メタデータ) (2026-02-10T19:19:52Z) - Shared Latent Representation for Joint Text-to-Audio-Visual Synthesis [57.5830191022097]
Text-to-VecモジュールはテキストからWav2Vec2埋め込みを生成する。
We adopt a two-stage training: Pretraining on Wav2Vec2 embeddeddings and finetuning on TTS outputs。
実験により、TS予測潜伏特性の条件付けはカスケードパイプラインよりも優れていることが示された。
論文 参考訳(メタデータ) (2025-11-07T17:07:56Z) - CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization [15.861700882671418]
本稿では,新たな弱教師付き設定(W-DAVELタスク)の下でDAVELを探索する。
我々は、弱い監督下でよく予測される信頼性の高いタイムスタンプとして定義されるテキストクロスモーダルなサリエントアンカーを利用する。
我々は、UnAV-100とActivityNet1.3データセットの両方でW-DAVELのベンチマークを構築した。
論文 参考訳(メタデータ) (2025-08-06T15:49:53Z) - Temporal and cross-modal attention for audio-visual zero-shot learning [38.02396786726476]
ビデオ分類のための一般的なゼロショット学習では、音声と視覚情報の関係を理解する必要がある。
本稿では,マルチモーダル・テンポラル・クロスアテンション・フレームワーク(modelName)を提案する。
本稿では, 時間的特徴を取り入れたフレームワークが, UCf, vgg, アクティビティベンチマークにおいて, ゼロショット学習のための最先端性能をもたらすことを示す。
論文 参考訳(メタデータ) (2022-07-20T15:19:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。