論文の概要: GestureFAR: Streaming Co-Speech Gesture Generation with Flow Autoregression
- arxiv url: http://arxiv.org/abs/2609.21576v1
- Date: Fri, 18 Sep 2026 10:07:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:17.002393
- Title: GestureFAR: Streaming Co-Speech Gesture Generation with Flow Autoregression
- Title(参考訳): GestureFAR:フローオートレグレッションによる音声同時ジェスチャ生成
- Abstract要約: GestureFARは、音声合成を行うためのフロー自動回帰フレームワークである。
トランスフォーマーを使用して、ストリーミングオーディオモーションコンテキストをモデル化する。
整合性および分布整合性を用いて,多段階毎のフローヘッドを単一ネットワーク評価に蒸留する。
- 参考スコア(独自算出の注目度): 13.860849260172685
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generating natural co-speech gestures from streaming speech is essential for embodied conversational agents, where motion must be produced while a user is still speaking. Recent streaming gesture systems make online generation possible by autoregressing over discrete motion tokens, but this design compresses high-dimensional continuous motion into finite codebooks and can limit the realism and diversity of generated gestures. To preserve both causality and continuous expressiveness, we propose \textbf{GestureFAR}, a flow-autoregressive framework for streaming co-speech gesture generation. First, GestureFAR autoregresses over causal continuous motion latents, using a transformer to model streaming audio-motion context and a per-token flow-matching head to sample the next latent from a continuous distribution. Second, we introduce a head-only flow distillation strategy that freezes the causal backbone and distills the multi-step per-token flow head into a single network evaluation using consistency and distribution-matching objectives. This keeps the model token-causal while removing the main latency bottleneck for live interaction. Experiments on BEAT2 show that GestureFAR significantly improves the quality--latency trade-off among streaming-capable methods, preserving strong gesture quality while enabling real-time token-causal generation. Project Page: https://andypinxinliu.github.io/GestureFAR
- Abstract(参考訳): ストリーミング音声から自然な音声合成ジェスチャを生成することは、ユーザーが話している間、動きを発生させなければならない会話エージェントの具体化に不可欠である。
近年のストリーミングジェスチャーシステムは、離散的な動きトークンを自動回帰することでオンライン生成を可能にするが、この設計では、高次元連続的な動きを有限のコードブックに圧縮し、生成されたジェスチャーの現実性と多様性を制限することができる。
因果性と連続表現性を両立させるため,共同音声ジェスチャ生成のためのフロー自動回帰フレームワークである \textbf{GestureFAR} を提案する。
まず、GestureFARは、ストリーミングオーディオモーションコンテキストをモデル化するトランスフォーマーと、フローマッチングヘッドを使用して、連続分布から次のラテントをサンプリングする。
第2に,尾骨を凍結する頭部のみの流動蒸留戦略を導入し,整合性および分布整合性を用いて多段階のトケンフローヘッドを単一ネットワーク評価に蒸留する。
これにより、モデルトークンの因果関係を維持しながら、ライブインタラクションの主な遅延ボトルネックを取り除くことができる。
BEAT2の実験では、GestureFARはストリーミング可能なメソッド間の品質-レイテンシのトレードオフを大幅に改善し、強力なジェスチャー品質を維持しながら、リアルタイムトークン・カジュアル生成を可能にしている。
Project Page: https://andypinxinliu.github.io/GestureFAR
関連論文リスト
- LiveGesture Streamable Co-Speech Gesture Generation Model [15.008891901028333]
LiveGestureは、音声駆動のフルボディジェスチャー生成フレームワークである。
ルックアヘッドはゼロで動作し、任意のシーケンス長をサポートする。
一貫性があり、多様性があり、ビート同期のフルボディジェスチャーをリアルタイムで生成する。
論文 参考訳(メタデータ) (2026-04-13T02:54:07Z) - OmniForcing: Unleashing Real-time Joint Audio-Visual Generation [51.031726911410594]
最近のジョイントオーディオ・視覚拡散モデルは、優れた生成品質を実現するが、高いレイテンシーに悩まされる。
OmniForcingは、オフラインの双方向拡散モデルを高忠実度ストリーミングオートレジェネレータに蒸留する最初のフレームワークである。
論文 参考訳(メタデータ) (2026-03-12T08:17:36Z) - MIBURI: Towards Expressive Interactive Gesture Synthesis [62.45332399212876]
Embodied Conversational Agents (ECA) は、音声、ジェスチャー、表情を通じて人間の対面相互作用をエミュレートすることを目的としている。
既存のECAの解は、人間のような相互作用には適さない剛性で低多様性の運動を生み出す。
MIBURIは,リアルタイム音声対話と同期した表現力のあるフルボディジェスチャーと表情を生成するための,最初のオンライン因果的フレームワークである。
論文 参考訳(メタデータ) (2026-03-03T18:59:51Z) - MotionStream: Real-Time Video Generation with Interactive Motion Controls [60.403597895657505]
単一GPU上で最大29FPSのストリーミング生成が可能なサブ秒レイテンシを実現するMotionStreamを提案する。
提案手法は,グローバルなテキストプロンプトとローカルなモーションガイダンスに準拠する高品質なビデオを生成するが,リアルタイムでは推論を行わないモーションコントロールによるテキスト・ツー・ビデオモデルの拡張から始まる。
我々のモデルでは、動きの追従と映像の質を2桁高速化し、無限長のストリーミングを可能にする。
論文 参考訳(メタデータ) (2025-11-03T06:37:53Z) - Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling [76.23539797803681]
既存の手法は主に、自然なストリーミング音声合成を実現するために、将来のテキストに依存するルックメカニズムを使用している。
本稿では,高品質な音声フレームをフレーム単位で生成するためのストリーミングフレームワークLEを提案する。
実験結果から,LEは現行のストリーミングTTS法より優れ,文レベルのTSシステムよりも高い性能を実現していることがわかった。
論文 参考訳(メタデータ) (2025-05-26T08:25:01Z) - MAG: Multi-Modal Aligned Autoregressive Co-Speech Gesture Generation without Vector Quantization [8.605691647343065]
既存の手法では,ジェスチャ生成にベクトル量子化トークンを伴って自己回帰モデルを用いるのが一般的である。
我々は、離散トークン化に頼ることなく、高品質で多様な音声合成のための新しいマルチモーダルアライメントフレームワークMAGを提案する。
論文 参考訳(メタデータ) (2025-03-18T09:02:02Z) - HoloGest: Decoupled Diffusion and Motion Priors for Generating Holisticly Expressive Co-speech Gestures [8.50717565369252]
HoleGestは、高品質で表現力のある共同音声ジェスチャーの自動生成のための、新しいニューラルネットワークフレームワークである。
本システムでは,音声依存度が低く,モーション依存度が高く,より安定した大域的動作と詳細な指の動きが可能である。
我々のモデルは、没入感のあるユーザー体験を提供するために、真実に近い現実主義のレベルを達成する。
論文 参考訳(メタデータ) (2025-03-17T14:42:31Z) - DisCoRD: Discrete Tokens to Continuous Motion via Rectified Flow Decoding [29.643549839940025]
本稿では、DisCoRD: Rectified Flow Decodingによる連続運動への離散トークンの導入について紹介する。
私たちの中核となる考え方は、条件生成タスクとしてトークンデコーディングをフレーム化することです。
DisCoRDは、HumanML3Dで0.032、KIT-MLで0.169、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2024-11-29T07:54:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。