論文の概要: OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars
- arxiv url: http://arxiv.org/abs/2607.23023v2
- Date: Tue, 28 Jul 2026 02:01:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 14:13:57.669364
- Title: OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars
- Title(参考訳): OmniMate: 対話型アバターのためのオープンソースのリアルタイムストリーミングオーディオ生成
- Authors: Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo,
- Abstract要約: オープン・エンド・リアルタイム・インタラクティブ・オーディオ・ビジュアル・アバター生成のための統合フレームワークを提案する。
OmniMateは視覚的内容、音声、音響効果をリアルタイムで合成し、自然と没入的なマルチターンインタラクションを可能にする。
我々は,OmniMateが高品質で低レイテンシなストリーミングを実現すると同時に,長時間の音声・視覚的整合性を維持していることを示す。
- 参考スコア(独自算出の注目度): 13.53343552751081
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in diffusion-based generative models have enabled real-time audio-driven avatar generation and unified audio-visual synthesis, providing a promising foundation for interactive avatar systems. However, extending unified audio-visual synthesis to real-time interactive streaming remains challenging, as the generation horizon is unknown in advance and the generated identity may drift over long-term generation. To address these challenges, we propose OmniMate, a unified framework for open-ended real-time interactive audio-visual avatar generation. OmniMate jointly synthesizes visual content, speech, and sound effects in real time, enabling natural and immersive multi-turn interactions. To achieve adaptive response progression, we introduce a Generation Progress Controller (GPC) that explicitly models the generation progress of each streaming chunk, allowing the model to complete responses according to the desired progress and achieve seamless transitions between execution and listening states. To preserve long-term cross-modal identity consistency, we propose a Multi-Reference Conditioning Module (MRCM), which leverages multiple reference images and a reference speech segment to provide persistent visual and speaker identity cues throughout long-duration streaming interactions. Extensive experiments on an interaction-oriented adaptation of VerseBench demonstrate that OmniMate achieves high-quality, low-latency streaming generation while maintaining strong long-term audio-visual consistency. The results further show that OmniMate supports realistic, coherent, and responsive interactive avatar experiences over extended multi-turn conversations.
- Abstract(参考訳): 拡散型生成モデルの最近の進歩により、リアルタイムオーディオ駆動アバター生成と統合オーディオ視覚合成が可能となり、対話型アバターシステムのための有望な基盤となった。
しかし、音声-視覚合成をリアルタイムのインタラクティブストリーミングに拡張することは、生成地平線が事前に不明であり、生成したアイデンティティが長期間にわたって漂流する可能性があるため、依然として困難である。
これらの課題に対処するため,オープン・エンド・リアルタイム・インタラクティブ・オーディオ・ビジュアル・アバター生成のための統合フレームワークであるOmniMateを提案する。
OmniMateは視覚的内容、音声、音響効果をリアルタイムで合成し、自然と没入的なマルチターンインタラクションを可能にする。
適応的な応答進行を実現するために,各ストリーミングチャンクの生成進捗を明示的にモデル化し,所望の進捗に応じて応答を完了し,実行状態とリスニング状態のシームレスな遷移を実現するジェネレーションプログレスコントローラ(GPC)を導入する。
本稿では,複数参照画像と参照音声セグメントを併用したMRCM(Multi-Reference Conditioning Module)を提案する。
VerseBenchの対話指向適応に関する大規模な実験は、OmniMateが高品質で低レイテンシなストリーミング生成を実現し、長期間の音声・視覚的整合性を維持していることを示している。
さらに,OmniMateは,マルチターン会話よりもリアル,コヒーレント,レスポンシブな対話型アバター体験をサポートすることを示した。
関連論文リスト
- InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars [39.5461462800725]
本研究では、視覚的に一貫したアバター映像生成と意図認識インタラクションをサポートするリアルタイム無限ストリーミングビデオ生成フレームワークを提案する。
自己回帰蒸留により、InteractiveAvatarは、任意に長い期間にわたって、人間のアバターのリアルタイムなストレーミング生成を達成する。
提案手法は,リアルタイムに複雑なユーザ・アバターインタラクションを実現するとともに,長周期生成における最先端の視覚的整合性を実現する。
論文 参考訳(メタデータ) (2026-06-22T06:41:17Z) - EchoAvatar: Real-time Generative Avatar Animation from Audio Streams [31.328378976492775]
本稿では,低レイテンシでストリーミング音声と音楽から連続的でコヒーレントなフルボディモーションを生成するための新しいフレームワークを提案する。
この制御性とストリーム音声駆動合成を組み合わせることで,音声エージェントを対話型ヒューマノイドアバターに変換するためのプラグアンドプレイソリューションとして機能する。
論文 参考訳(メタデータ) (2026-05-27T10:18:16Z) - U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation [48.6868174403074]
我々は,高知能マルチモーダル対話のための最初の統一システムであるU-Mindを紹介する。
リアルタイム生成と共同モデル言語、音声、モーション、ビデオ合成をサポートする。
U-Mindは様々なマルチモーダルインタラクションタスクにおいて最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-02-27T07:07:02Z) - X-Streamer: Unified Human World Modeling with Audiovisual Interaction [36.50697656708077]
X-Streamerは、テキスト、音声、ビデオ間の無限の相互作用が可能なデジタルヒューマンエージェントを構築するためのフレームワークである。
中心となるのは、マルチモーダル理解と生成を統一するThinker-Actorデュアルトランスフォーマーアーキテクチャである。
X-Streamerは2つのA100 GPU上でリアルタイムに動作し、一貫したビデオチャット体験を数時間持続する。
論文 参考訳(メタデータ) (2025-09-25T20:53:27Z) - OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions [62.19092662469285]
Online Multimodal Conversational Response Generation (OMCRG) は、オンラインの音声と非言語からのフィードバックを同時生成する新しいタスクである。
我々は,OmniResponseを提案する。OmniResponseはマルチモーダル大言語モデル(MLLM)であり,正確なマルチモーダルリスナー応答を自動回帰的に生成する。
ResponseNetは、696の詳細なダイアディックインタラクションのデータセットで、同期化された分割画面ビデオ、マルチチャンネルオーディオ、トランスクリプト、注釈付き顔行動が特徴です。
論文 参考訳(メタデータ) (2025-05-27T20:12:46Z) - AsynFusion: Towards Asynchronous Latent Consistency Models for Decoupled Whole-Body Audio-Driven Avatars [71.90109867684025]
全体オーディオ駆動型アバターポーズと表現生成は、生命に似たデジタル人間を作るための重要なタスクである。
本稿では,拡散変換器を応用し,結合表現とジェスチャ合成を実現する新しいフレームワークAsynFusionを提案する。
AsynFusionは、リアルタイムで同期された全身アニメーションを生成する際に最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-05-21T03:28:53Z) - OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking [22.337906095079198]
我々はOmniTalkerについて述べる。OmniTalkerは、入力テキストから同期音声ビデオコンテンツを共同で生成する統合フレームワークである。
本フレームワークは,2分岐拡散変換器(DiT)アーキテクチャを採用し,一方は音声生成に,もう一方はビデオ合成に用いている。
論文 参考訳(メタデータ) (2025-04-03T09:48:13Z) - Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation [29.87407471246318]
この研究は、顔の動きを同期させ、視覚的に魅力的で時間的に一貫したアニメーションを作成する複雑さを掘り下げている。
我々の革新的なアプローチは、エンドツーエンドの拡散パラダイムを採用し、階層的な音声駆動視覚合成モジュールを導入しています。
提案した階層型音声駆動視覚合成は、表現の適応的な制御と多様性のポーズを提供し、異なるアイデンティティに合わせてより効果的なパーソナライゼーションを可能にする。
論文 参考訳(メタデータ) (2024-06-13T04:33:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。