論文の概要: StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring
- arxiv url: http://arxiv.org/abs/2608.01643v1
- Date: Mon, 03 Aug 2026 03:25:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.312753
- Title: StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring
- Title(参考訳): StreamTalk: Key-Pose Anchoringによる共同音声ジェスチャ生成
- Abstract要約: リアルタイムの共同音声ジェスチャ生成は、音声が到着するにつれて、クリップごとに3Dモーションクリップを生成する必要がある。
既存のストリーミングメソッドはオープンループで、各クリップは過去のコンテキストに依存するが、モデルはその軌跡をチェックしたり修正したりすることはできない。
本稿では,周期的生成-検索-再定義サイクルを持つクローズドループフレームワークStreamTalkを提案する。
- 参考スコア(独自算出の注目度): 7.1813422225776256
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-time co-speech gesture generation must produce 3D motion clip by clip as speech arrives. Existing streaming methods are open-loop: each clip depends on past context, but the model cannot check or correct its trajectory. Small errors therefore accumulate and cause drift over long sequences. We observe that this failure is mainly caused by the lack of a forward constraint rather than poor short-clip quality. A plausible key pose at the end of each clip provides a destination anchor that limits drift. Based on this observation, we propose StreamTalk, a closed-loop framework with a periodic generate-retrieve-refine cycle. Streaming Pose-Guided Generation first predicts a coarse clip, retrieves a plausible tail pose from a speaker-specific motion database, and refines the clip using this pose before continuing to the next window. During training, Stochastic Anchor Masking randomly masks pose and translation frames, teaching the model to recover complete motion from sparse boundary conditions. A part-aware DiT separates hand, body, and translation streams to reduce interference between global displacement and local articulation. On BEAT2, StreamTalk achieves state-of-the-art FGD, reduces long-horizon drift relative to open-loop baselines, and runs in real time at 76 FPS. Project page: https://xiangyue-zhang.github.io/StreamTalk/.
- Abstract(参考訳): リアルタイムの共同音声ジェスチャ生成は、音声が到着するにつれて、クリップごとに3Dモーションクリップを生成する必要がある。
既存のストリーミングメソッドはオープンループで、各クリップは過去のコンテキストに依存するが、モデルはその軌跡をチェックしたり修正したりすることはできない。
そのため、小さなエラーが蓄積され、長い列に漂流する。
この失敗の主な原因は,短絡品質の低下ではなく,前方制約の欠如にある。
各クリップの端にある有望なキーポーズは、ドリフトを制限する宛先アンカーを提供する。
本稿では,周期的生成-検索-再定義サイクルを持つクローズドループフレームワークStreamTalkを提案する。
Streaming Pose-Guided Generationは、まず粗いクリップを予測し、スピーカー固有のモーションデータベースから可塑性テールポーズを検索し、次のウィンドウに進む前にこのポーズを使用してクリップを洗練する。
訓練中、確率アンカー・マスキングはランダムにマスクのポーズと翻訳のフレームを示し、スパース境界条件から完全な動きを復元するようモデルに教える。
部分認識のDiTは手、体、翻訳ストリームを分離し、大域的な変位と局所的な調音の干渉を減らす。
BEAT2では、StreamTalkは最先端のFGDを実現し、オープンループベースラインと比較して長い水平ドリフトを低減し、76 FPSでリアルタイムに実行することができる。
プロジェクトページ: https://xiangyue-zhang.github.io/StreamTalk/.com
関連論文リスト
- LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time [26.186924581106087]
本稿では,リアルタイムストリーミングと安定な長周期生成を10億スケールで組み合わせたアニメーションシステムを提案する。
LiveAnimateは、最初の30秒から最終分まで、知覚品質とアイデンティティをほぼ一定に維持する。
これらの結果は、インタラクティブなフルボディアニメーションのための品質、レイテンシ、持続時間において、新たな操作ポイントを確立する。
論文 参考訳(メタデータ) (2026-08-12T07:35:52Z) - Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming [24.73791931334844]
Vorch-Streamerは、リアルタイム・ロングフォームのText-to-Audio-Video(T2AV)ストリーミングを可能にするポストトレーニングフレームワークである。
12~21秒にまたがる80Kアバタークリップの合成コーパスを構築し、まず教師強制と拡散強制を混合した因果生成器を訓練する。
コンテキスト境界と4段階のデノベーションにより、Vorch-Streamerはテキストから27.12 FPSで音声とビデオを共同生成し、24-FPSのリアルタイム再生速度を超える。
論文 参考訳(メタデータ) (2026-08-06T07:00:37Z) - Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding [69.296913137409]
オンラインビデオ理解のための新しいパラダイム: SVLS(Streaming Video-Language Synchrony)を紹介する。
LyraVは、2つのコアイノベーションを備えた階層的なコントロールフレームワーク上に構築されたライブストリーミングアシスタントである。
まず、フレーム駆動トランジションコントローラ(FDTC)は、いつ話を続けるか、新しいレスポンスを開始するか、沈黙を保つか、といった、高レベルのセマンティックな決定を行います。
第二に、プラグアンドプレイの軽量予測モジュールであるStreaming Token Pacer (SToP)は、動的に言語生成率に適応し、視覚的コンテンツのペースにマッチする。
論文 参考訳(メタデータ) (2026-06-05T07:29:20Z) - SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer [4.205766319033597]
一段階拡散変換器を用いた一段ビデオ字幕消去手法SEDiTを提案する。
ターゲット字幕の直接消去を可能にするマスクフリー推論手法を提案する。
提案手法は,ワンステップ,チャンクワイドのストリーミング推論により,ネイティブな1440p動画を無限長で効率的に処理できる。
論文 参考訳(メタデータ) (2026-05-14T14:37:54Z) - CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives [117.85963914353904]
CausalCineはインタラクティブな自動回帰フレームワークで、マルチショットビデオ生成をオンラインのディレクティブプロセスに変換する。
CausalCineはショット変更を因果的に生成し、動的プロンプトをオンザフライで受け付け、以前のショットを再生することなくコンテキストを再利用する。
論文 参考訳(メタデータ) (2026-05-12T17:59:51Z) - LongStream: Long-Sequence Streaming Autoregressive Visual Geometry [18.46781332515933]
LongStreamは、計量スケールのシーン再構成のための新しいゲージ分離型ストリーミングビジュアルジオメトリモデルである。
長距離外挿を定距離局所的なタスクに再構成する。
安定して18FPSで、キロメートルスケールのシークエンスで安定してメートルスケールの再構築を行う。
論文 参考訳(メタデータ) (2026-02-13T18:30:51Z) - MotionStream: Real-Time Video Generation with Interactive Motion Controls [60.403597895657505]
単一GPU上で最大29FPSのストリーミング生成が可能なサブ秒レイテンシを実現するMotionStreamを提案する。
提案手法は,グローバルなテキストプロンプトとローカルなモーションガイダンスに準拠する高品質なビデオを生成するが,リアルタイムでは推論を行わないモーションコントロールによるテキスト・ツー・ビデオモデルの拡張から始まる。
我々のモデルでは、動きの追従と映像の質を2桁高速化し、無限長のストリーミングを可能にする。
論文 参考訳(メタデータ) (2025-11-03T06:37:53Z) - Rolling Forcing: Autoregressive Long Video Diffusion in Real Time [86.40480237741609]
Rolling Forcingは、エラーの最小限の蓄積で長いビデオをストリーミングできる、新しいビデオ生成技術である。
転がり強制力には3つの新しい設計が伴う。第一に、エラー伝播を加速する個別のフレームを反復的にサンプリングする代わりに、共同演示方式を設計する。
第2に,アテンションシンク機構を長軸ストリームビデオ生成タスクに導入し,初期フレームのキー値状態をグローバルなコンテキストアンカーとして保持する。
第3に,大半が拡張された遮音窓上での無段蒸留を可能にする効率的な訓練アルゴリズムを設計する。
論文 参考訳(メタデータ) (2025-09-29T17:57:14Z) - InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing [66.48064661467781]
我々は、アイデンティティ、象徴的なジェスチャー、カメラ軌跡を維持するために参照を戦略的に保存する新しいパラダイムであるスパースフレームビデオダビングを導入する。
無限長長列ダビング用に設計されたストリーミングオーディオ駆動型ジェネレータであるInfiniteTalkを提案する。
HDTF、CelebV-HQ、EMTDデータセットの総合評価は、最先端の性能を示している。
論文 参考訳(メタデータ) (2025-08-19T17:55:23Z) - CoNo: Consistency Noise Injection for Tuning-free Long Video Diffusion [15.013908857230966]
ルークバック機構は、異なるビデオクリップ間の微粒なシーン遷移を促進する。
長期の整合性正規化は、拡張ビデオクリップの予測ノイズと元のノイズとの画素幅距離を明示的に最小化することに焦点を当てる。
単文および複数文のプロンプト条件下で長ビデオ生成を行うことによる戦略の有効性を示す実験を行った。
論文 参考訳(メタデータ) (2024-06-07T16:56:42Z) - Contrastive Language-Action Pre-training for Temporal Localization [64.34349213254312]
ロングフォームビデオ理解には、時間的に活動や言語をローカライズできるアプローチが必要である。
これらの制限は、クラスアノテーションによって管理される時間的にトリミングされたビデオの大きなデータセットを事前トレーニングすることで対処できる。
本研究では,アクセプションの形で活動,背景ビデオクリップ,言語間の視覚・言語的関係を捉えるために,マスク付きコントラスト学習損失を導入する。
論文 参考訳(メタデータ) (2022-04-26T13:17:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。