論文の概要: Co-policy: Responsive Human-Robot Co-Creation for Musical Performances
- arxiv url: http://arxiv.org/abs/2606.19914v1
- Date: Thu, 18 Jun 2026 08:08:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.722451
- Title: Co-policy: Responsive Human-Robot Co-Creation for Musical Performances
- Title(参考訳): Co-policy: 音楽演奏に責任を負う人間とロボットのコクレーション
- Authors: Xuetao Li, Wenke Huang, Mang Ye, Zijian Liu, Jinhua Xie, Jifeng Xuan, Miao Li,
- Abstract要約: Co-policyは、人間とロボットの共創のためのフレームワークである。
意味的意図の接地、制約のある音楽的変化、そしてビズーモータ実行を分離する。
拡散ポリティクスおよびアブレーションベースラインよりも,意図整合性,実行精度,応答周波数が向上した。
- 参考スコア(独自算出の注目度): 58.92814200971293
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Art has long stood as a pivotal expression of human creativity. Embodied artificial intelligence offers a route for generative models to participate in that creativity through physical action rather than disembodied digital content. In robotic music co-creation, it is challenging to connect semantic musical understanding with real-time and physically executable performance. We present Co-policy, a framework for human-robot musical co-creation that separates semantic intent grounding, constrained musical variation, and visuomotor execution. To ground musical semantics, Co-policy uses pre-inference semantic anchors and a fine-tuned Qwen-vl planner (F-Qwen) to transform speech, live musical seeds, and visual observations into structured co-creation plans. To support low-latency execution, Co-policy introduces a Gaussian-Mixture Visuomotor Policy (GMP), implemented as a conditional mixture-density policy that maps target notes and visual context to multimodal robot actions in a single forward pass. Unlike robotic playback systems that merely reproduce user-specified notes, Co-policy generates complementary musical responses under both musical and physical constraints. Real-robot chime experiments, ablations, and expert evaluation show improved intent alignment, execution accuracy, and response frequency over diffusion-policy and ablated baselines, supporting physically grounded action generation as a key requirement for embodied human-AI co-creation.
- Abstract(参考訳): 芸術は人類の創造性の重要な表現として長い間存在してきた。
人工人工知能(Embodied AI)は、人工的なデジタルコンテンツではなく、物理的な行動を通じて創造的モデルが創造性に参加するための道筋を提供する。
ロボット音楽の共同創造において,意味的音楽理解と実時間および物理的に実行可能な演奏を結びつけることは困難である。
本稿では,人間ロボットによる音楽共創の枠組みであるCo-policyについて述べる。
音楽意味論の基盤となるために、コポリシーは、事前参照セマンティックアンカーと微調整されたQwen-vlプランナー(F-Qwen)を使用して、音声、ライブ音楽シード、視覚的観察を構造化されたコクリエーションプランに変換する。
低レイテンシ実行をサポートするために、Co-policyは、目標音符と視覚コンテキストを単一の前方パスでマルチモーダルロボットアクションにマッピングする条件付き混合密度ポリシーとして実装されたGMP(Gaussian-Mixture Visuomotor Policy)を導入する。
ユーザーが指定した音符を単に再生するロボット再生システムとは異なり、コポリティクスは音楽と身体の両方の制約の下で補完的な音楽応答を生成する。
リアルロボットのチャイム実験、アブレーション、専門家による評価は、拡散ポリティクスおよびアブレーションベースラインに対する意図アライメント、実行精度、応答頻度の改善を示し、人間とAIの共創を具現化するための重要な要件として、物理的に接地されたアクション生成をサポートする。
関連論文リスト
- Selective Imperfection as a Generative Framework for Analysis, Creativity and Discovery [1.3537117504260623]
音が科学的プローブとしてどのように機能し,聴取が視聴のモードとなり,作曲が物質に対する青写真となるかを示す。
我々は,科学と芸術は制約の下での世界構築の創造的な行為であり,振動はスケールをまたいだ共有文法組織構造であることを示す。
論文 参考訳(メタデータ) (2025-12-30T11:14:51Z) - Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control [52.83779852397341]
現在のヒューマノイドロボットには表現力のある即興能力がなく、事前に定義された動きやスパースコマンドに限られている。
音声から音楽駆動ダンスと音声駆動の音声合成ジェスチャーを直接生成できる,最初の統合型音声-音声合成フレームワークであるRoboPerformを提案する。
RoboPerformは、多様な動きパターンに適応するためのResMoEポリシーと、オーディオスタイル注入のための拡散ベースの学生ポリシーを実現している。
論文 参考訳(メタデータ) (2025-12-29T17:59:24Z) - Semantic Co-Speech Gesture Synthesis and Real-Time Control for Humanoid Robots [5.531678625546847]
本稿では,意味論的に意味のある共同音声ジェスチャーを合成し,人間型ロボット上でリアルタイムに展開する,革新的なエンドツーエンドフレームワークを提案する。
私たちの中核的なイノベーションは、セマンティックスを意識したジェスチャー合成モジュールの巧妙な統合にあります。
本システムでは, セマンティックに適切かつリズミカルにコヒーレントなジェスチャーを生成する。
論文 参考訳(メタデータ) (2025-12-19T02:55:10Z) - The Ghost in the Keys: A Disklavier Demo for Human-AI Musical Co-Creativity [59.78509280246215]
Aria-Duetは、人間のピアニストと最先端のジェネレーティブモデルであるAriaのリアルタイム音楽デュエットを容易にするインタラクティブシステムである。
音楽学的な観点からシステムのアウトプットを分析し,そのモデルがスタイリスティックなセマンティクスを維持でき,コヒーレントなフレーズのアイデアを発達させることができることを発見した。
論文 参考訳(メタデータ) (2025-11-03T15:26:01Z) - PhysHSI: Towards a Real-World Generalizable and Natural Humanoid-Scene Interaction System [67.2851799763138]
PhysHSIはシミュレーショントレーニングパイプラインと現実世界のデプロイメントシステムで構成される。
シミュレーションでは,自然のヒューマノイドとシーンの相互作用データを模倣するために,逆運動に基づくポリシー学習を採用する。
実世界の展開には、LiDARとカメラ入力を組み合わせた粗粒度オブジェクトローカライズモジュールを導入する。
論文 参考訳(メタデータ) (2025-10-13T07:11:37Z) - Towards Immersive Human-X Interaction: A Real-Time Framework for Physically Plausible Motion Synthesis [51.95817740348585]
Human-Xは、様々な実体をまたいだ没入的で物理的に妥当なヒューマンインタラクションを可能にするために設計された、新しいフレームワークである。
本手法は, 自己回帰型反応拡散プランナを用いて, リアルタイムに反応と反応を同時予測する。
我々のフレームワークは、人間とロボットのインタラクションのための仮想現実インターフェースを含む、現実世界のアプリケーションで検証されている。
論文 参考訳(メタデータ) (2025-08-04T06:35:48Z) - Flat latent manifolds for music improvisation between human and machine [9.571383193449648]
相互即興化が新たな体験につながるような環境では,音楽生成アルゴリズムを人間の音楽家に対抗するものとみなす。
学習モデルでは、潜在空間の定量化により新しい音楽系列を生成する。
そこで我々は,音楽実験を通じて提案手法の実証的証拠を提供し,プロのドラマーと対話的なジャムセッションのためのモデルを展開した。
論文 参考訳(メタデータ) (2022-02-23T09:00:17Z) - RL-Duet: Online Music Accompaniment Generation Using Deep Reinforcement
Learning [69.20460466735852]
本稿では,オンライン伴奏生成のための深層強化学習アルゴリズムを提案する。
提案アルゴリズムは人体に応答し,メロディック,ハーモニック,多種多様な機械部品を生成する。
論文 参考訳(メタデータ) (2020-02-08T03:53:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。