論文の概要: Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems
- arxiv url: http://arxiv.org/abs/2607.11792v1
- Date: Mon, 13 Jul 2026 16:45:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.559345
- Title: Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems
- Title(参考訳): すべてをオンラインAPIサービスにキャストする : ロボットシステムにおける局所音声認識モデルの統合に関する調査
- Abstract要約: 音声認識(ASR)は現代のロボットシステムにおいて重要な要素となっている。
この記事では、AIR技術がさまざまなインテリジェントなロボットやマシンにどのように統合されているかの概要を紹介する。
本稿では、最先端のディープラーニングモデルに対する確立されたアプローチからの音声認識の進化について論じる。
- 参考スコア(独自算出の注目度): 10.911604748351516
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automatic speech recognition (ASR) has become a critical component of modern robotic systems because it is one of the most natural and intuitive ways for humans to interact with robots. A commonly used method is to directly use API services online. But is that all we can do? This article provides an overview of how ASR technologies are integrated into various intelligent robots and machines. We discuss the evolution of speech recognition from established approaches to state-of-the-art deep learning models, such as OpenAI's Whisper. We also list large-scale datasets and open source toolkits that have been widely used in both industry and academia. We structure the survey around ASR model families, deployment strategies in robotics (especially ROS-based, cloud-based, and hybrid solutions), and several real-world robotic platforms. Finally, we outline the challenges of deploying robust speech recognition in robots and discuss future directions, including multimodal interaction in diverse and dynamic environments. This paper can help social robotics researchers better navigate the emerging domain of language-based natural human-robot interaction.
- Abstract(参考訳): 自動音声認識(ASR)は、人間がロボットと対話する最も自然で直感的な方法の1つであるため、現代のロボットシステムにおいて重要なコンポーネントとなっている。
一般的に使われている方法は、APIサービスをオンラインで直接使用することである。
しかし、それは私たちができることなのですか?
この記事では、AIR技術がさまざまなインテリジェントなロボットやマシンにどのように統合されているかの概要を紹介する。
我々は,OpenAIのWhisperのような最先端のディープラーニングモデルに対する,既存のアプローチからの音声認識の進化について論じる。
また、業界と学術の両方で広く使われている大規模なデータセットやオープンソースツールキットもリストアップしています。
ASRモデルファミリーに関する調査、ロボット工学(特にROSベース、クラウドベース、ハイブリッドソリューション)におけるデプロイメント戦略、およびいくつかの実世界のロボットプラットフォームに関する調査を構造化する。
最後に,ロボットに頑健な音声認識を展開させる上での課題を概説し,多様な動的環境におけるマルチモーダルインタラクションを含む今後の方向性について議論する。
本稿では,社会ロボティクス研究者が,言語に基づく自然な人間-ロボットインタラクションの新たな領域をナビゲートする上で有効である。
関連論文リスト
- Dexterity from Smart Lenses: Multi-Fingered Robot Manipulation with In-the-Wild Human Demonstrations [52.29884993824894]
自然環境で日々のタスクを行う人間から、マルチフィンガーロボットポリシーを学ぶことは、ロボットコミュニティにとって長年の大きな目標だった。
AINAは、Aria Gen 2メガネを使用して、どこでも、どこでも、あらゆる環境で収集されたデータから、マルチフィンガーポリシーを学ぶことができる。
論文 参考訳(メタデータ) (2025-11-20T18:59:02Z) - Interpretable Robot Control via Structured Behavior Trees and Large Language Models [0.14990005092937678]
本稿では,自然言語理解とロボット実行を橋渡しする新しい枠組みを提案する。
提案手法は実世界のシナリオでは実用的であり、平均的な認識と実行の精度は約94%である。
論文 参考訳(メタデータ) (2025-08-13T08:53:13Z) - GR00T N1: An Open Foundation Model for Generalist Humanoid Robots [133.23509142762356]
汎用ロボットには多目的体と知的な心が必要だ。
近年のヒューマノイドロボットの進歩は、汎用的な自律性を構築するためのハードウェアプラットフォームとして大きな可能性を秘めている。
我々はヒューマノイドロボットのオープン基盤モデルであるGR00T N1を紹介する。
論文 参考訳(メタデータ) (2025-03-18T21:06:21Z) - $π_0$: A Vision-Language-Action Flow Model for General Robot Control [77.32743739202543]
本稿では,インターネット規模のセマンティック知識を継承するために,事前学習された視覚言語モデル(VLM)上に構築された新しいフローマッチングアーキテクチャを提案する。
我々は,事前訓練後のタスクをゼロショットで実行し,人からの言語指導に追従し,微調整で新たなスキルを習得する能力の観点から,我々のモデルを評価した。
論文 参考訳(メタデータ) (2024-10-31T17:22:30Z) - State-of-the-art in Robot Learning for Multi-Robot Collaboration: A Comprehensive Survey [2.686336957004475]
この基盤上に構築されたマルチロボットシステム(MRS)は劇的な進化を遂げている。
人工知能技術とロボットハードウェアの融合は、MSSに幅広い応用可能性をもたらしている。
本稿では,マルチロボット協調におけるロボット学習の現状について概説する。
論文 参考訳(メタデータ) (2024-08-03T21:22:08Z) - Dialogue with Robots: Proposals for Broadening Participation and Research in the SLIVAR Community [57.56212633174706]
自然言語を使って機械と対話する能力は一般的なものになりつつあるが、期待されている。
本稿では,ロボットとの音声対話のこの成長分野の最近の歴史を詳述する。
私たちはコミュニティに3つの提案を提供しています。ひとつは教育、もうひとつはベンチマーク、もうひとつはロボットとの会話に関する言語モデリングです。
論文 参考訳(メタデータ) (2024-04-01T15:03:27Z) - RoboScript: Code Generation for Free-Form Manipulation Tasks across Real
and Simulation [77.41969287400977]
本稿では,コード生成を利用したデプロイ可能なロボット操作パイプラインのためのプラットフォームである textbfRobotScript を提案する。
自由形自然言語におけるロボット操作タスクのためのコード生成ベンチマークも提案する。
我々は,Franka と UR5 のロボットアームを含む,複数のロボットエボディメントにまたがるコード生成フレームワークの適応性を実証した。
論文 参考訳(メタデータ) (2024-02-22T15:12:00Z) - Exploring Large Language Models to Facilitate Variable Autonomy for Human-Robot Teaming [4.779196219827508]
本稿では,VR(Unity Virtual Reality)設定に基づく,GPTを利用したマルチロボットテストベッド環境のための新しいフレームワークを提案する。
このシステムにより、ユーザーは自然言語でロボットエージェントと対話でき、それぞれが個々のGPTコアで動く。
12人の参加者によるユーザスタディでは、GPT-4の有効性と、さらに重要なのは、マルチロボット環境で自然言語で会話する機会を与えられる際のユーザ戦略について検討している。
論文 参考訳(メタデータ) (2023-12-12T12:26:48Z) - ROS-PyBullet Interface: A Framework for Reliable Contact Simulation and
Human-Robot Interaction [17.093672006793984]
信頼性の高いコンタクト/インパクトシミュレータPyBulletとロボットオペレーティングシステム(ROS)のブリッジを提供するフレームワークであるROS-PyBullet Interfaceを提案する。
さらに,シミュレーション環境でのヒューマン・ロボット・インタラクション(HRI)を促進するために,新たなユーティリティを提供する。
論文 参考訳(メタデータ) (2022-10-13T10:31:36Z) - Self-supervised reinforcement learning for speaker localisation with the
iCub humanoid robot [58.2026611111328]
人の顔を見ることは、ノイズの多い環境での音声のフィルタリングに人間が依存するメカニズムの1つである。
スピーカーに目を向けるロボットを持つことは、挑戦的な環境でのASRのパフォーマンスに恩恵をもたらす可能性がある。
本稿では,人間の初期発達に触発された自己指導型強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2020-11-12T18:02:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。