論文の概要: Human-robot conversation with multiple participants in noisy public spaces
- arxiv url: http://arxiv.org/abs/2609.00648v1
- Date: Tue, 01 Sep 2026 03:25:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.26842
- Title: Human-robot conversation with multiple participants in noisy public spaces
- Title(参考訳): 騒音の多い公共空間における複数参加者との人間ロボット会話
- Authors: Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes, Kazushi Kato, Shota Fujiki, Zihao Chi, Masaya Iwasaki, Taiken Shintani, Megumi Kawata, Kazuki Sakai, Koji Inoue, Yuicihiro Yoshikawa, Tatsuya Kawahara,
- Abstract要約: 本研究は,遠隔操作者へのクリーン音声として音声認識や伝送に使用できる音声システムを提案する。
第1のシナリオはアンドロイドERICAによる注意深い聴取システムであり、第2のシナリオはモバイルテレコロボットによる会話支援システムである。
本稿では, 雑音の多い環境下での複数の話者の発話を向上するだけでなく, アバターに基づく会話対話において, より没入感を増すような空間的音声を提供する。
- 参考スコア(独自算出の注目度): 15.265544600480068
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: For noisy real-world environments such as those in open public spaces, spoken dialogue systems for both autonomous robots and avatars should be carefully designed to provide enhanced speech signals. These signals can be used either for speech recognition or, in the case of an avatar system, transmitted as clean speech to a remote operator. This work proposes an audio system that can be used for both these scenarios and was demonstrated as a proof-of-concept at the 2025 World Expo in Osaka. The first scenario is an attentive listening system with the android ERICA, and the second is a conversation support system with mobile Teleco robots, with one of them acting as an avatar for a remote operator. Both systems feature multi-party conversation and use a single multi-channel microphone array. We describe how our audio system not only enhances the speech of multiple speakers in a noisy environment, but provides a form of spatial audio which allows for more immersiveness in avatar-based conversational interactions.
- Abstract(参考訳): オープンな公共空間のような騒々しい現実環境においては、自律ロボットとアバターの両方のための音声対話システムは、音声信号の強化のために慎重に設計されるべきである。
これらの信号は音声認識やアバターシステムの場合、遠隔操作者にクリーンな音声として送信される。
本研究は,両シナリオで使用可能な音声システムを提案し,大阪で開催された2025年世界博覧会で概念実証として実証された。
第1のシナリオはアンドロイドERICAによる注意深い聴取システムであり、第2のシナリオは移動式テレコロボットによる会話支援システムであり、そのうちの1つは遠隔操作者のアバターとして機能する。
どちらのシステムも多人数会話を備え、単一のマルチチャネルマイクロホンアレイを使用する。
本稿では, 雑音の多い環境下での複数の話者の発話を向上するだけでなく, アバターに基づく会話対話において, より没入感を増すような空間的音声を提供する。
関連論文リスト
- Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO [18.561388308227556]
雑音の多い社会環境における多話者音声対話モデリングのための音声フレームワークであるCocktail-Talkerを紹介する。
Cocktail-Talkerは教師付き微調整と強化学習によって訓練され、適切なアクショントークンを生成する。
また,LLMベースのデータパイプラインであるCocktail-DialogGenを開発した。
論文 参考訳(メタデータ) (2026-07-30T06:53:15Z) - TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation [72.46711449668814]
本稿では,対話型顔と会話型音声の両方を同期的に生成する統合フレームワークであるTAVIDを紹介する。
本システムの評価は, 顔のリアリズム, 頭部の応答性, ダイアディック相互作用, 音声品質の4つの側面にまたがる。
論文 参考訳(メタデータ) (2025-12-23T12:04:23Z) - Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation [55.043492250775294]
本稿では,新しい対面音声対話モデルを提案する。
ユーザ入力から音声視覚音声を処理し、応答として音声視覚音声を生成する。
また,最初の大規模マルチモーダル音声対話コーパスであるMultiDialogを紹介する。
論文 参考訳(メタデータ) (2024-06-12T04:48:36Z) - AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation [58.72068260933836]
システムの入力と出力はマルチモーダル(音声と視覚)である
私たちは、自分の主要言語を利用することで、仮想ミーティングで世界中の個人とリアルタイムな会話を行うことができます。
音声モダリティのみを翻訳する音声音声合成(A2A)とは対照的に,提案したAV2AVは音声・視覚音声を直接翻訳する。
論文 参考訳(メタデータ) (2023-12-05T05:36:44Z) - A Real-time Speaker Diarization System Based on Spatial Spectrum [14.189768987932364]
本稿では,話者ダイアリゼーションタスクにおける長年の課題に対処するための,新しい体系的アプローチを提案する。
まず, 指向性指向性マイクロホンアレイを用いたアプローチを用いて, 遠距離環境下でターゲット話者の声を捕捉する。
第2に,話者位置追跡のためのオンライン話者位置連成クラスタリング手法を提案する。
第3に、重複した音声を分離するメカニズムをトリガーするインスタント話者数検出器を開発する。
論文 参考訳(メタデータ) (2021-07-20T08:25:23Z) - Self-supervised reinforcement learning for speaker localisation with the
iCub humanoid robot [58.2026611111328]
人の顔を見ることは、ノイズの多い環境での音声のフィルタリングに人間が依存するメカニズムの1つである。
スピーカーに目を向けるロボットを持つことは、挑戦的な環境でのASRのパフォーマンスに恩恵をもたらす可能性がある。
本稿では,人間の初期発達に触発された自己指導型強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2020-11-12T18:02:15Z) - I can attend a meeting too! Towards a human-like telepresence avatar
robot to attend meeting on your behalf [8.512048419752047]
遠隔会議に参加することができるテレプレゼンスロボットに焦点をあてる。
より優れた会議体験を実現するため、ロボットは話者をローカライズし、話者を視角の中央に持ってくる必要がある。
本稿では,テレプレゼンス会議シナリオにおけるアテンションシフト方式の検討と実装について述べる。
論文 参考訳(メタデータ) (2020-06-28T16:43:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。