論文の概要: MIRA: Real-Time Full-Duplex Human-Robot Interaction for Embodied Companions
- arxiv url: http://arxiv.org/abs/2609.24547v2
- Date: Tue, 22 Sep 2026 14:11:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.659431
- Title: MIRA: Real-Time Full-Duplex Human-Robot Interaction for Embodied Companions
- Title(参考訳): MIRA: 身体障害者のためのリアルタイムフルダブル・ヒューマン・ロボットインタラクション
- Abstract要約: リアルタイムエンボディード・コンパニオン・インタラクションでは、ストリーミング音声からのユーザ意図をロボットがタイムリーな応答を生成する必要がある。
リアルタイム・フルタイム・エンボディ・アソシエイト・インタラクションのための統合フレームワークを提案する。
MIRAはAstribot S1のヒューマノイドロボット評価にデプロイされる。
- 参考スコア(独自算出の注目度): 27.12492233362043
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: % !TEX root = ../main.tex Real-time embodied companion interaction requires a robot to infer user intent from streaming speech, generate timely responses, and execute expressive, interruptible motions. Existing systems typically decouple dialogue orchestration from gesture synthesis, relying on offline motion generation from complete audio. This separation leaves open how a deployed robot can dynamically synchronize response content, prosodic timing, and physical safety under incremental inputs and uncertain turn boundaries. We present MIRA, a unified framework for real-time full-duplex embodied companion interaction. Given streaming user speech, dialogue history, and vocal affect, MIRA predicts both the response text and an explicit embodiment cue that routes the response to the appropriate physical behavior. Discrete social behaviors (\eg listening and greeting) are mapped to validated robot trajectories, while speaking responses are accompanied by streaming, generative co-speech motion. For co-speech motion generation, we propose ROSCO, a prefix-conditioned diffusion model for streaming audio-to-joint motion generation. We further design RHPC, an inference scheme that maintains a sufficiently long temporal context for motion prediction while bounding physical commitment to a short, interruptible prefix. At the interaction level, we design CORTEX, a dual-timescale interaction policy that combines low-latency barge-in preemption and streaming response generation with deliberative turn decisions, backed by a robot-side execution layer that enforces physical safety constraints during execution. MIRA is deployed on an Astribot S1 humanoid robot. Quantitative evaluations demonstrate competitive audio-motion alignment relative to state-of-the-art motion-generation baselines, while real-robot deployment measurements characterize streaming responsiveness and interruption handling.
- Abstract(参考訳): %であった。
TEX root = 。
main.tex Real-time embodied interactionには、音声ストリーミングからユーザの意図を推測し、タイムリーな応答を生成し、表現的で中断可能な動作を実行するロボットが必要である。
既存のシステムは、通常、ジェスチャー合成から対話オーケストレーションを分離し、完全なオーディオからオフラインのモーション生成に依存する。
この分離は、デプロイされたロボットがインクリメンタル入力と不確実なターンバウンダリの下で、応答内容、韻律タイミング、物理的安全性を動的に同期する方法を開放する。
MIRAは,リアルタイムなフルダブル・コンパニオン・インタラクションのための統合フレームワークである。
ストリーミングユーザ音声、対話履歴、発声の影響を考慮し、MIRAは応答テキストと、適切な物理的な振る舞いに応答をルーティングする明示的な実施キューの両方を予測する。
離散的な社会的行動(偏見聴取と挨拶)は、検証されたロボット軌道にマッピングされ、発話応答には、ストリーミング、生成的共同音声動作が伴う。
共同音声の動作生成を行うために, ROSCO という, 音声と関節の動作生成をストリーミングするためのプレフィックス条件付き拡散モデルを提案する。
さらに、短時間で中断可能なプレフィックスに物理的コミットメントを束縛しながら、動き予測のための十分な時間的文脈を維持する推論スキームであるRHPCを設計する。
インタラクションレベルでは,低遅延バージインプリエンプションとストリーミング応答生成と,実行中の物理的な安全制約を強制するロボット側実行層を背景とした検討的なターン決定を組み合わせた,デュアルタイムのインタラクションポリシであるCORTEXを設計する。
MIRAはAstribot S1のヒューマノイドロボットに搭載されている。
定量的評価では、最先端のモーションジェネレーションベースラインに対して競合するオーディオ-モーションアライメントが示され、実際のロボット配置計測では、ストリーミング応答性と割り込みハンドリングが特徴的である。
関連論文リスト
- RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction [33.04319504310729]
RoboGestureは、完全に対話的な人間-ヒューマノイドシステムを動かすために、データ、モデリング、制御を共同設計するロボット中心のフレームワークである。
まず,300以上のジェスチャーカテゴリを備えたRoboGestureデータセットを構築し,大規模オーディオモーションペアを合成する自動パイプラインを開発した。
Unitree G1のヒューマノイドの実験では、RoboGestureは最先端のベースラインに比べて安全で、よりリズミカルで、セマンティックに適切な応答を生成する。
論文 参考訳(メタデータ) (2026-08-27T02:13:46Z) - Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control [0.0]
セマンティックオーディオ駆動型ヒューマノイド制御のための新しいマルチモーダルオーケストレーションフレームワークを提案する。
システムは、連続したオーディオストリームを処理し、それらを音楽または音声ブランチにルーティングする。
音楽入力は音声フィンガープリントとセマンティック埋め込みによって処理され、トラックのアイデンティティと時間的アライメントを取得する。
音声入力は、模倣学習スキルの個別ライブラリに基礎を置いており、直接人間とロボットの相互作用を可能にする。
論文 参考訳(メタデータ) (2026-07-15T14:24:00Z) - LLM-Powered Interactive Robotic Action Synthesis from Multimodal Speech, Gestures, and Music [1.7188280334580195]
本稿では,マルチモーダルな人間入力の豊富なタペストリーから複雑なロボット動作を合成する新しいフレームワークを提案する。
システムアーキテクチャは,音声の書き起こしモデル,ジェスチャー認識モジュール,ビート検出のための信号処理パイプラインを統合している。
このフレームワークは、音声からのセマンティックコマンド、ジェスチャーからのディスティック情報、音楽からのリズミカルキューを解釈し、融合する機能を備えている。
論文 参考訳(メタデータ) (2026-06-30T05:35:26Z) - MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction [76.4461698685681]
Mini-o 4.5は、人間レベルのリアルタイムストリーミングインタラクションに向けた最新の取り組みです。
Omni-CPMは、オムニモードの知覚と出力を共有時間軸に沿って整列する統合ストリーミングフレームワークである。
合計9Bパラメータで、Mini-o 4.5は視力計算能力においてGemini 2.5 Flashにアプローチし、最先端のオープンな計算性能を提供する。
論文 参考訳(メタデータ) (2026-04-30T04:05:43Z) - MIBURI: Towards Expressive Interactive Gesture Synthesis [62.45332399212876]
Embodied Conversational Agents (ECA) は、音声、ジェスチャー、表情を通じて人間の対面相互作用をエミュレートすることを目的としている。
既存のECAの解は、人間のような相互作用には適さない剛性で低多様性の運動を生み出す。
MIBURIは,リアルタイム音声対話と同期した表現力のあるフルボディジェスチャーと表情を生成するための,最初のオンライン因果的フレームワークである。
論文 参考訳(メタデータ) (2026-03-03T18:59:51Z) - TextOp: Real-time Interactive Text-Driven Humanoid Robot Motion Generation and Control [62.93681680333618]
TextOpはリアルタイムテキスト駆動型ヒューマノイドモーション生成および制御フレームワークである。
ストリーミング言語コマンドと実行中のオンザフライ命令修正をサポートする。
対話型モーション生成を堅牢な全身制御でブリッジすることで、TextOpは自由形式のインテント表現をアンロックする。
論文 参考訳(メタデータ) (2026-02-07T08:42:11Z) - Real-Time Synchronized Interaction Framework for Emotion-Aware Humanoid Robots [0.5156484100374058]
音声韻律と全体ジェスチャーを同期するNAOロボットのためのリアルタイムフレームワークを提案する。
シームレスな感覚運動調整を可能にすることにより、コンテキスト認識型社会ロボットの展開が促進される。
論文 参考訳(メタデータ) (2026-01-24T03:53:09Z) - Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control [52.83779852397341]
現在のヒューマノイドロボットには表現力のある即興能力がなく、事前に定義された動きやスパースコマンドに限られている。
音声から音楽駆動ダンスと音声駆動の音声合成ジェスチャーを直接生成できる,最初の統合型音声-音声合成フレームワークであるRoboPerformを提案する。
RoboPerformは、多様な動きパターンに適応するためのResMoEポリシーと、オーディオスタイル注入のための拡散ベースの学生ポリシーを実現している。
論文 参考訳(メタデータ) (2025-12-29T17:59:24Z) - Semantic Co-Speech Gesture Synthesis and Real-Time Control for Humanoid Robots [5.531678625546847]
本稿では,意味論的に意味のある共同音声ジェスチャーを合成し,人間型ロボット上でリアルタイムに展開する,革新的なエンドツーエンドフレームワークを提案する。
私たちの中核的なイノベーションは、セマンティックスを意識したジェスチャー合成モジュールの巧妙な統合にあります。
本システムでは, セマンティックに適切かつリズミカルにコヒーレントなジェスチャーを生成する。
論文 参考訳(メタデータ) (2025-12-19T02:55:10Z) - Ready-to-React: Online Reaction Policy for Two-Character Interaction Generation [82.73098356401725]
本稿では,過去観測された動きに基づいて次のキャラクターのポーズを生成するためのオンライン反応ポリシーであるReady-to-Reactを提案する。
各キャラクターは独自の反応ポリシーを「脳」として持っており、実際の人間のようにストリーミングで対話することができる。
われわれのアプローチはスパース信号で制御でき、VRや他のオンラインインタラクティブ環境にも適している。
論文 参考訳(メタデータ) (2025-02-27T18:40:30Z) - Interaction Transformer for Human Reaction Generation [61.22481606720487]
本稿では,時間的,空間的両方の注意を持つトランスフォーマーネットワークからなる対話型トランスフォーマー(InterFormer)を提案する。
我々の手法は一般的であり、より複雑で長期的な相互作用を生成するのに利用できる。
論文 参考訳(メタデータ) (2022-07-04T19:30:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。