論文の概要: Talk, Render, Act: Integrating Social Gesture and Digital Face with Synchronized Speech for Conversational Humanoid Robot
- arxiv url: http://arxiv.org/abs/2610.06153v1
- Date: Mon, 05 Oct 2026 11:28:11 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:29:46.180855
- Title: Talk, Render, Act: Integrating Social Gesture and Digital Face with Synchronized Speech for Conversational Humanoid Robot
- Title(参考訳): 対話型ヒューマノイドロボットにおけるソーシャル・ジェスチャとデジタル・フェイスの統合
- Abstract要約: 表現力のあるヒューマノイド相互作用は、コヒーレントな応答を形成するために、音声、顔のアニメーション、身体のジェスチャーを必要とする。
本研究では, 移動原子構築, 対話生成, 動き計画, 顔アニメーションの特殊エージェントからなるエージェントベースフレームワークである Talk, Render, Act (TRABot) を紹介する。
- 参考スコア(独自算出の注目度): 19.910364463971064
- License:
- Abstract: Expressive humanoid interaction requires speech, facial animation, and body gestures to form a coherent response. However, many full-body humanoid robots produce speech and gestures without a visually expressive face, while talking-face animation and robot gesture generation are typically developed separately. We present Talk, Render, Act (TRABot), an agent-based framework comprising specialized agents for motion-atom construction, dialogue generation, motion planning, and facial animation. First, to produce natural and semantically meaningful gestures, we construct Robot-Ready Semantic Motion Atoms by segmenting long-form, G1-retargeted BEAT2 motion into units with natural gesture boundaries, human-verified communicative functions, and feasible trajectories. Second, to preserve semantic order and coordinate body motion with the spoken response, we introduce a Semantic-Conditioned Compositional Planner. Given an ordered semantic function sequence and an estimated response duration, the planner selects approved atoms to realize the longest feasible action sequence while accounting for transitions and neutral recovery. Finally, we deploy a Streaming Face-Speech-Body Integration system on a physical G1 humanoid, combining streaming dialogue audio, audio-driven facial animation, and semantically planned body motion in a unified real-time interaction loop. Quantitative and qualitative experiments demonstrate that TRAbot achieves the best overall performance among all compared conditions in terms of naturalness, expressiveness, and multimodal coherence.
- Abstract(参考訳): 表現力のあるヒューマノイド相互作用は、コヒーレントな応答を形成するために、音声、顔のアニメーション、身体のジェスチャーを必要とする。
しかしながら、多くのフルボディのヒューマノイドロボットは、視覚的に表現的な顔のない音声とジェスチャーを生成する一方、話し顔アニメーションとロボットジェスチャー生成は、通常別々に開発されている。
本研究では, 移動原子構築, 対話生成, 動き計画, 顔アニメーションの特殊エージェントからなるエージェントベースフレームワークである Talk, Render, Act (TRABot) を紹介する。
まず, 自然的, 意味的に意味のあるジェスチャーを生成するために, ロボット可読セマンティック・モーション・アトムを, 自然なジェスチャー境界, 人間の確認されたコミュニケーション機能, 実現可能な軌道に分割して構築する。
次に,セマンティック・コンディション・コンポジション・プランナーを導入する。
順序付けられたセマンティック関数シーケンスと推定応答期間を与えられたプランナーは、遷移と中立回復を考慮しつつ、最長の実行可能なアクションシーケンスを実現するために承認された原子を選択する。
最後に,物理G1ヒューマノイド上に,ストリーミング対話音声,音声駆動型顔アニメーション,セマンティックに計画された身体動作を,統合されたリアルタイム対話ループで組み合わせて展開する。
定量的および定性的な実験により、TRAbotは自然性、表現性、マルチモーダルコヒーレンスの観点から比較された全ての条件の中で最高の総合的な性能を達成することが示された。
関連論文リスト
- From Social Reasoning to Embodied Interaction: An Agentic Framework for Social Robots [57.257033382353804]
ARISEはソフィア・ヒューマノイド・ロボットにエージェント・リソンとインタラクティブ・ソーシャル・エボディメントを橋渡しする。
ARISEは、マルチモーダルなコンテキスト理解、長期記憶、リアクティブとプロアクティブな相互作用を統合して、いつ、何を通信すべきかを決定する。
論文 参考訳(メタデータ) (2026-10-05T08:15:21Z) - SocialHumanoid: Towards Expressive Humanoid Behavior via One-Step Co-Speech Motion Generation [42.12237975843325]
ソーシャルヒューマノイド(SocialHumanoid)は、一段階の音声合成による人型行動を表現するシステムである。
シングルフォワードパスで各フルボディのモーションウインドウを生成し、モーション・ヒストリー・コンディショニングを通じて連続したウインドウを接続する。
生成された人間の動きは、さらにオンラインでエンボディ互換のロボット参照に変換され、身体的実行のための全身コントローラによって追跡される。
論文 参考訳(メタデータ) (2026-09-27T07:24:33Z) - ReFree: Towards Realistic Co-Speech Video Generation via Reward-Free RL and Multilevel Speech Guidance [50.482989497576476]
音声による会話キャラクタアニメーションは、自然な会話行動を伝えるライフライクなポートレートビデオを生成する。
既存のアプローチは通常、動的表情や頭部の動きに対して正確な音素間同期をオフにする。
本稿では,事前学習したビデオ生成モデルに基づく,フローマッチング型音声-画像間アニメーションフレームワークReFree-S2Vを提案する。
論文 参考訳(メタデータ) (2026-06-11T13:00:58Z) - MIBURI: Towards Expressive Interactive Gesture Synthesis [62.45332399212876]
Embodied Conversational Agents (ECA) は、音声、ジェスチャー、表情を通じて人間の対面相互作用をエミュレートすることを目的としている。
既存のECAの解は、人間のような相互作用には適さない剛性で低多様性の運動を生み出す。
MIBURIは,リアルタイム音声対話と同期した表現力のあるフルボディジェスチャーと表情を生成するための,最初のオンライン因果的フレームワークである。
論文 参考訳(メタデータ) (2026-03-03T18:59:51Z) - EMOTION: Expressive Motion Sequence Generation for Humanoid Robots with In-Context Learning [10.266351600604612]
本稿では,ヒューマノイドロボットにおける表現型動き列を生成するためのEMOTIONというフレームワークを提案する。
本研究では,EMOTIONが生成する動作の自然性と理解性を比較したオンラインユーザ研究を行い,その人間フィードバックバージョンであるEMOTION++について述べる。
論文 参考訳(メタデータ) (2024-10-30T17:22:45Z) - Speech2UnifiedExpressions: Synchronous Synthesis of Co-Speech Affective Face and Body Expressions from Affordable Inputs [67.27840327499625]
本稿では,デジタル文字の表情と上半身ジェスチャーを同時に合成するマルチモーダル学習手法を提案する。
提案手法は, 映像データから直接推定される, まばらな顔のランドマークと上体関節から学習し, もっともらしい感情的性格運動を生成する。
論文 参考訳(メタデータ) (2024-06-26T04:53:11Z) - Driving Animatronic Robot Facial Expression From Speech [7.8799497614708605]
本稿では,音声入力からアニマトロニクスロボットの表情を駆動する,新しいスキン中心のアプローチを提案する。
提案手法は線形スキン (LBS) を統一表現として用い, エンボディメント設計とモーション合成の両面での革新を導く。
このアプローチは、1台のNvidia GTX 4090上で4000fps以上のリアルタイムにアニマトロニクスの顔に非常にリアルな表情を生成する能力を示す。
論文 参考訳(メタデータ) (2024-03-19T12:11:57Z) - Task-Oriented Human-Object Interactions Generation with Implicit Neural
Representations [61.659439423703155]
TOHO: 命令型ニューラル表現を用いたタスク指向型ヒューマンオブジェクトインタラクション生成
本手法は時間座標のみでパラメータ化される連続運動を生成する。
この研究は、一般的なヒューマン・シーンの相互作用シミュレーションに向けて一歩前進する。
論文 参考訳(メタデータ) (2023-03-23T09:31:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。