論文の概要: RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction
- arxiv url: http://arxiv.org/abs/2608.28693v1
- Date: Thu, 27 Aug 2026 02:13:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.715569
- Title: RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction
- Title(参考訳): Robo Gesture:ヒューマノイドインタラクションのためのリアルタイムセマンティック・アライメント・コ音声ジェスチャ生成
- Authors: Zifan Wang, Ziang Ren, Pengyang Shi, Zirui Wang, Chenghuai Lin, Tianze Wang, Zekun Qi, Liangliang Zhao, He Wang, Li Yi,
- Abstract要約: RoboGestureは、完全に対話的な人間-ヒューマノイドシステムを動かすために、データ、モデリング、制御を共同設計するロボット中心のフレームワークである。
まず,300以上のジェスチャーカテゴリを備えたRoboGestureデータセットを構築し,大規模オーディオモーションペアを合成する自動パイプラインを開発した。
Unitree G1のヒューマノイドの実験では、RoboGestureは最先端のベースラインに比べて安全で、よりリズミカルで、セマンティックに適切な応答を生成する。
- 参考スコア(独自算出の注目度): 33.04319504310729
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Enabling humanoid robots to respond to human speech with synchronized and semantically meaningful gestures is fundamental to natural human-robot interaction. However, this task faces three critical barriers: the scarcity of semantically rich datasets, the "modality eclipse" where models ignore audio cues in favor of kinematic inertia, and the sim-to-real gap regarding physical safety. We propose RoboGesture, a robot-centric framework that co-designs data, modeling, and control to power a complete interactive human-humanoid system in which the robot listens, responds, and gestures in real time. We first establish the RoboGesture dataset featuring over 300 gesture categories and develop an automated pipeline to synthesize large-scale collision-free, robot-specific audio-motion pairs. Our architecture features a Hierarchical Semantic-Acoustic Aligner that extracts multi-granular prosodic and semantic cues directly from raw audio tokens. These cues drive a Streaming Conditional Motion Generator based on a diffusion transformer with conditional flow matching. To ensure high responsiveness, we introduce Anti-Inertia CFG Masking, which prevents the model from collapsing into repetitive historical patterns by compelling it to proactively mine control signals from the audio modality. Finally, an MPC-based safety filter ensures real-time, collision-free execution on physical hardware. Experiments on a Unitree G1 humanoid demonstrate that RoboGesture generates safer, more rhythmic, and more semantically appropriate responses compared to state-of-the-art baselines.
- Abstract(参考訳): 人型ロボットは、人間とロボットの自然な相互作用に基本となる、同期的で意味のあるジェスチャーで人間の音声に反応する。
しかし、このタスクは3つの重要な障壁に直面している:意味的に豊かなデータセットの不足、モデルが運動的慣性(kinematic inertia)を支持するオーディオキューを無視した「モダリティの日食(modality eclipse)」、物理的安全性に関するシミュレートと現実のギャップである。
本稿ではロボット中心のフレームワークであるRoboGestureを提案する。RoboGestureは、ロボットがリアルタイムで聴き、反応し、ジェスチャーを行う完全な対話型人間-ヒューマノイドシステムを実現するために、データ、モデリング、制御を共設計する。
まず,300以上のジェスチャーカテゴリを備えたRoboGestureデータセットを構築し,大規模衝突のないロボット固有の音声-モーションペアを合成する自動パイプラインを開発した。
我々のアーキテクチャは階層型セマンティック・アコースティック・アリグナーを備えており、生音声トークンから直接多粒質の韻律と意味の手がかりを抽出する。
これらのキューは、条件流整合を有する拡散変圧器に基づいて、ストリーミング条件運動発生器を駆動する。
高応答性を確保するために,音質から制御信号を積極的にマイニングするように促すことにより,モデルが繰り返し歴史的なパターンに崩壊することを防止した反慣性CFGマスキングを導入する。
最後に、MPCベースの安全フィルタにより、物理ハードウェア上でリアルタイムで衝突のない実行が保証される。
Unitree G1のヒューマノイドの実験では、RoboGestureは最先端のベースラインに比べて安全で、よりリズミカルで、セマンティックに適切な応答を生成する。
関連論文リスト
- RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction [51.76737991200891]
H2R(Human-to-robot)オブジェクトハンドオーバは、人間とロボットのコラボレーションの基本的な能力である。
本稿では,RGB-DビデオデータセットであるHand2Botを紹介する。
ハンドオブジェクトの一貫性を確保しつつ,現実的なハンドオーバシーケンスを合成する生成パイプラインであるPassGenを提案する。
論文 参考訳(メタデータ) (2026-08-13T09:55:59Z) - Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control [0.0]
セマンティックオーディオ駆動型ヒューマノイド制御のための新しいマルチモーダルオーケストレーションフレームワークを提案する。
システムは、連続したオーディオストリームを処理し、それらを音楽または音声ブランチにルーティングする。
音楽入力は音声フィンガープリントとセマンティック埋め込みによって処理され、トラックのアイデンティティと時間的アライメントを取得する。
音声入力は、模倣学習スキルの個別ライブラリに基礎を置いており、直接人間とロボットの相互作用を可能にする。
論文 参考訳(メタデータ) (2026-07-15T14:24:00Z) - LLM-Powered Interactive Robotic Action Synthesis from Multimodal Speech, Gestures, and Music [1.7188280334580195]
本稿では,マルチモーダルな人間入力の豊富なタペストリーから複雑なロボット動作を合成する新しいフレームワークを提案する。
システムアーキテクチャは,音声の書き起こしモデル,ジェスチャー認識モジュール,ビート検出のための信号処理パイプラインを統合している。
このフレームワークは、音声からのセマンティックコマンド、ジェスチャーからのディスティック情報、音楽からのリズミカルキューを解釈し、融合する機能を備えている。
論文 参考訳(メタデータ) (2026-06-30T05:35:26Z) - TEXEDO : Test Time Scaling for Controller-aware Language-conditioned Humanoid Motion Generation [48.72797830886802]
我々はヒューマノイドモーション生成のためのテスト時間スケーリングフレームワークであるTEXEDOを紹介する。
基礎となる強力な発電機を必要とせず、運動の質を向上させる。
追跡忠実度とテキストアライメントの両方を継続的に改善することを示す。
論文 参考訳(メタデータ) (2026-06-22T08:14:35Z) - WaveSync: Constrained Wavefront Optimization for Synchronized Co-Speech Gestures in Humanoid Robots [2.0424038686449006]
自然な人間とロボットの相互作用には表現力のある共同音声ジェスチャーが不可欠であるが、物理的ヒューマノイドロボットではそれらを生成することは困難である。
大規模言語モデルが対話応答を構造化セマンティックスキーマに分解するハイブリッドフレームワークである textbfWaveSync を提案する。
提案手法は,高同期精度を実現し,主観的評価と主観的評価の両面において3つのベースラインを上回っていることを示す。
論文 参考訳(メタデータ) (2026-06-15T11:47:30Z) - MIBURI: Towards Expressive Interactive Gesture Synthesis [62.45332399212876]
Embodied Conversational Agents (ECA) は、音声、ジェスチャー、表情を通じて人間の対面相互作用をエミュレートすることを目的としている。
既存のECAの解は、人間のような相互作用には適さない剛性で低多様性の運動を生み出す。
MIBURIは,リアルタイム音声対話と同期した表現力のあるフルボディジェスチャーと表情を生成するための,最初のオンライン因果的フレームワークである。
論文 参考訳(メタデータ) (2026-03-03T18:59:51Z) - Semantic Co-Speech Gesture Synthesis and Real-Time Control for Humanoid Robots [5.531678625546847]
本稿では,意味論的に意味のある共同音声ジェスチャーを合成し,人間型ロボット上でリアルタイムに展開する,革新的なエンドツーエンドフレームワークを提案する。
私たちの中核的なイノベーションは、セマンティックスを意識したジェスチャー合成モジュールの巧妙な統合にあります。
本システムでは, セマンティックに適切かつリズミカルにコヒーレントなジェスチャーを生成する。
論文 参考訳(メタデータ) (2025-12-19T02:55:10Z) - XR-DT: Extended Reality-Enhanced Digital Twin for Agentic Mobile Robots [10.083050242188422]
本稿では,エージェント移動ロボットのためのeXtended Reality-enhanced Digital TwinフレームワークであるXR-DTを提案する。
人間の意図,環境力学,ロボット認知をXR-DTフレームワークに組み込むことで,本システムは解釈可能,信頼性,適応的HRIを実現する。
論文 参考訳(メタデータ) (2025-12-04T21:49:14Z) - From Language to Locomotion: Retargeting-free Humanoid Control via Motion Latent Guidance [55.31807046722006]
既存の言語誘導型ヒューマノイドパイプラインは面倒で信頼できない。
本稿では,言語を基盤とした動作潜伏者に対してヒューマノイドポリシーを規定する言語フリーフレームワークであるRoboGhostを紹介する。
我々は,RoboGhostがデプロイメントの遅延を大幅に低減し,成功率と精度を向上し,スムーズでセマンティックに整合したヒューマノイドを生成することを示す。
論文 参考訳(メタデータ) (2025-10-16T17:57:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。