論文の概要: Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control
- arxiv url: http://arxiv.org/abs/2607.14182v1
- Date: Wed, 15 Jul 2026 14:24:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.855769
- Title: Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control
- Title(参考訳): 動的ヒューマノイド全身制御のための意味的音声駆動型理解
- Abstract要約: セマンティックオーディオ駆動型ヒューマノイド制御のための新しいマルチモーダルオーケストレーションフレームワークを提案する。
システムは、連続したオーディオストリームを処理し、それらを音楽または音声ブランチにルーティングする。
音楽入力は音声フィンガープリントとセマンティック埋め込みによって処理され、トラックのアイデンティティと時間的アライメントを取得する。
音声入力は、模倣学習スキルの個別ライブラリに基礎を置いており、直接人間とロボットの相互作用を可能にする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in humanoid robotics and reinforcement learning have enabled the acquisition of highly expressive whole-body motion policies. However, most robotic performances remain based on pre-scripted sequences or externally triggered behaviors, limiting autonomy and responsiveness to dynamic environments. In this work, we introduce a novel multi-modal orchestration framework for semantic audio-driven humanoid control, enabling robots to autonomously select and execute appropriate motion skills in real time. The system processes continuous audio streams and routes them into music or speech branches. Music input is handled via audio fingerprinting and semantic embeddings to retrieve track identity and temporal alignment, allowing dynamic mapping between musical segments and motion policies. Speech input is grounded into a discrete library of imitation-learned skills, enabling direct human-robot interaction. Both modalities share a unified interface that schedules skill execution over a reinforcement learning control pipeline. We validate the approach in simulation and on a Unitree G1 humanoid, showing robust sim-to-real transfer and consistent audio-conditioned policy selection. Supplementary materials are available at the following site: https://lab-rococo-sapienza.github.io/semantic-WBC/
- Abstract(参考訳): 近年のヒューマノイドロボットと強化学習の進歩により、表現力の高い全身運動ポリシーの獲得が可能となった。
しかしながら、ほとんどのロボットのパフォーマンスは、事前に記述されたシーケンスや外部にトリガされた振る舞いに基づいており、動的環境に対する自律性と応答性を制限する。
本研究では,ロボットが自律的に適切な動作スキルをリアルタイムで選択・実行できるようにする,セマンティックオーディオ駆動型ヒューマノイド制御のための新しいマルチモーダルオーケストレーションフレームワークを提案する。
システムは、連続したオーディオストリームを処理し、それらを音楽または音声ブランチにルーティングする。
音楽入力は音声フィンガープリントとセマンティック埋め込みによって処理され、トラックのアイデンティティと時間的アライメントを検索し、音楽セグメントとモーションポリシーの動的マッピングを可能にする。
音声入力は模倣学習スキルの個別ライブラリに基礎を置いており、直接人間とロボットの相互作用を可能にする。
両方のモダリティは、強化学習制御パイプライン上でのスキル実行をスケジュールする統一インターフェースを共有している。
本手法をシミュレーションおよびUnitree G1ヒューマノイド上で検証し,ロバストなsim-to-real転送と一貫したオーディオ条件付きポリシー選択を示す。
追加資料は以下のサイトにある。 https://lab-rococo-sapienza.github.io/semantic-WBC/
関連論文リスト
- RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction [33.04319504310729]
RoboGestureは、完全に対話的な人間-ヒューマノイドシステムを動かすために、データ、モデリング、制御を共同設計するロボット中心のフレームワークである。
まず,300以上のジェスチャーカテゴリを備えたRoboGestureデータセットを構築し,大規模オーディオモーションペアを合成する自動パイプラインを開発した。
Unitree G1のヒューマノイドの実験では、RoboGestureは最先端のベースラインに比べて安全で、よりリズミカルで、セマンティックに適切な応答を生成する。
論文 参考訳(メタデータ) (2026-08-27T02:13:46Z) - LLM-Powered Interactive Robotic Action Synthesis from Multimodal Speech, Gestures, and Music [1.7188280334580195]
本稿では,マルチモーダルな人間入力の豊富なタペストリーから複雑なロボット動作を合成する新しいフレームワークを提案する。
システムアーキテクチャは,音声の書き起こしモデル,ジェスチャー認識モジュール,ビート検出のための信号処理パイプラインを統合している。
このフレームワークは、音声からのセマンティックコマンド、ジェスチャーからのディスティック情報、音楽からのリズミカルキューを解釈し、融合する機能を備えている。
論文 参考訳(メタデータ) (2026-06-30T05:35:26Z) - Co-policy: Responsive Human-Robot Co-Creation for Musical Performances [58.92814200971293]
Co-policyは、人間とロボットの共創のためのフレームワークである。
意味的意図の接地、制約のある音楽的変化、そしてビズーモータ実行を分離する。
拡散ポリティクスおよびアブレーションベースラインよりも,意図整合性,実行精度,応答周波数が向上した。
論文 参考訳(メタデータ) (2026-06-18T08:08:16Z) - EchoAvatar: Real-time Generative Avatar Animation from Audio Streams [31.328378976492775]
本稿では,低レイテンシでストリーミング音声と音楽から連続的でコヒーレントなフルボディモーションを生成するための新しいフレームワークを提案する。
この制御性とストリーム音声駆動合成を組み合わせることで,音声エージェントを対話型ヒューマノイドアバターに変換するためのプラグアンドプレイソリューションとして機能する。
論文 参考訳(メタデータ) (2026-05-27T10:18:16Z) - TextOp: Real-time Interactive Text-Driven Humanoid Robot Motion Generation and Control [62.93681680333618]
TextOpはリアルタイムテキスト駆動型ヒューマノイドモーション生成および制御フレームワークである。
ストリーミング言語コマンドと実行中のオンザフライ命令修正をサポートする。
対話型モーション生成を堅牢な全身制御でブリッジすることで、TextOpは自由形式のインテント表現をアンロックする。
論文 参考訳(メタデータ) (2026-02-07T08:42:11Z) - Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control [52.83779852397341]
現在のヒューマノイドロボットには表現力のある即興能力がなく、事前に定義された動きやスパースコマンドに限られている。
音声から音楽駆動ダンスと音声駆動の音声合成ジェスチャーを直接生成できる,最初の統合型音声-音声合成フレームワークであるRoboPerformを提案する。
RoboPerformは、多様な動きパターンに適応するためのResMoEポリシーと、オーディオスタイル注入のための拡散ベースの学生ポリシーを実現している。
論文 参考訳(メタデータ) (2025-12-29T17:59:24Z) - MOSPA: Human Motion Generation Driven by Spatial Audio [83.31594478750682]
本稿では,多種多様で高品質な空間音声・動きデータを含む,空間音声駆動型人体運動データセットについて紹介する。
本研究では,身体運動と空間音声の関係を忠実に把握する,MOSPAと呼ばれるスパティアルオーディオによって駆動される人間の運動生成のためのフレームワークを開発する。
本手法は,本課題における最先端性能を実現する。
論文 参考訳(メタデータ) (2025-07-16T06:33:11Z) - Human-Object Interaction via Automatically Designed VLM-Guided Motion Policy [30.43930233035367]
VLM(Vision-Language Models)を利用した最初の統合物理ベースのHOフレームワークを紹介する。
VLM-Guided Relative Movement Dynamics (RMD)を導入する。これは、強化学習のための目標状態と報酬関数を自動的に構築する、微細な時間的二部運動表現である。
提案手法をサポートするために,何千もの長期の静的および動的相互作用計画を持つ新しいデータセットであるInterplayを提案する。
論文 参考訳(メタデータ) (2025-03-24T05:18:04Z) - Learning to Listen: Modeling Non-Deterministic Dyadic Facial Motion [89.01668641930206]
本稿では,対話における対話コミュニケーションをモデル化するための枠組みを提案する。
我々は、対応するリスナー動作の複数の可能性を自動回帰的に出力する。
本手法は,非言語的ダイアド相互作用の多モーダルおよび非決定論的性質を有機的に捕捉する。
論文 参考訳(メタデータ) (2022-04-18T17:58:04Z) - Neural Dynamic Policies for End-to-End Sensorimotor Learning [51.24542903398335]
感覚運動制御における現在の主流パラダイムは、模倣であれ強化学習であれ、生の行動空間で政策を直接訓練することである。
軌道分布空間の予測を行うニューラル・ダイナミック・ポリシー(NDP)を提案する。
NDPは、いくつかのロボット制御タスクにおいて、効率と性能の両面で、これまでの最先端よりも優れている。
論文 参考訳(メタデータ) (2020-12-04T18:59:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。