論文の概要: An Intelligent-Cloud Edge Multimodal Interaction System for Robots
- arxiv url: http://arxiv.org/abs/2607.14675v3
- Date: Thu, 23 Jul 2026 03:08:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 14:12:06.724575
- Title: An Intelligent-Cloud Edge Multimodal Interaction System for Robots
- Title(参考訳): ロボットのためのインテリジェントクラウドエッジマルチモーダルインタラクションシステム
- Authors: Zihan Guo, Xiaoqi Li,
- Abstract要約: 本稿では,拡張YOLOに基づくジェスチャー検出と,協調型大言語モデル(LLM)と視覚言語モデル(VLM)エージェントを統合したクラウドエッジマルチモーダルインタラクションフレームワークを提案する。
クラウド層はジェスチャー検出、シーン理解、マルチモーダル融合、アクション計画を実行する一方、TonyPiロボットはデータ取得、通信、アクション実行、フィードバックをローカルに処理する。
- 参考スコア(独自算出の注目度): 4.1212219465063304
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Robust human-robot interaction in complex environments requires accurate gesture perception, semantic scene understanding, and reliable task planning under limited onboard computing resources. This paper presents a cloud-edge multimodal interaction framework that integrates an enhanced YOLO-based gesture detector with coordinated large language model (LLM) and vision-language model (VLM) agents. The proposed detector, incorporates the Convolutional Block Attention Module (CBAM) into the neck and replaces the baseline bounding-box regression objective with Distance-IoU (DIoU) loss. These modifications improve feature discrimination and localization for small or partially occluded gestures in complex backgrounds. The cloud layer performs gesture detection, scene understanding, multimodal fusion, and action planning, whereas the TonyPi robot locally handles data acquisition, communication, action execution, and feedback. Experiments on a public gesture dataset and a custom dataset show that YOLO-DC achieves precision values of 98.9% and 95.0%, with mAP@0.5 values of 90.7% and 92.7%, respectively. System-level evaluation yields success rates of 95%, 88%, and 82% for single-action, composite-action, and vision-dependent tasks. A 30 participant evaluation yields an overall mean satisfaction score of 3.69 out of 5. These results demonstrate the feasibility of combining refined gesture detection with multimodal agents for resource-constrained robotic interaction.
- Abstract(参考訳): 複雑な環境でのロバストな人間とロボットの相互作用には、正確なジェスチャー認識、セマンティックなシーン理解、限られた計算資源の下での信頼性の高いタスク計画が必要である。
本稿では,拡張YOLOに基づくジェスチャー検出と,協調型大言語モデル(LLM)と視覚言語モデル(VLM)エージェントを統合したクラウドエッジマルチモーダルインタラクションフレームワークを提案する。
提案した検出器は、CBAM(Convolutional Block Attention Module)を首に組み込み、ベースライン境界ボックス回帰目標をDIoU(Distance-IoU)損失に置き換える。
これらの修正により、複雑な背景の小さな、あるいは部分的に隠されたジェスチャーの特徴識別と局所化が向上する。
クラウド層はジェスチャー検出、シーン理解、マルチモーダル融合、アクション計画を実行する一方、TonyPiロボットはデータ取得、通信、アクション実行、フィードバックをローカルに処理する。
公開ジェスチャデータセットとカスタムデータセットの実験では、YOLO-DCの精度は98.9%と95.0%で、mAP@0.5の値は90.7%と92.7%である。
システムレベルの評価は、単一アクション、複合アクション、視覚依存タスクにおいて95%、88%、および82%の成功率をもたらす。
参加者評価30は、総合平均満足度スコアが5.69点中3.69点である。
これらの結果から,改良されたジェスチャー検出とマルチモーダルエージェントを組み合わせた資源制約型ロボットインタラクションの実現可能性が確認された。
関連論文リスト
- SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks [73.92333717662558]
SpaceWorldは、複雑な現実世界のタスクにおけるマルチモーダルエージェントのインタラクティブな空間的理解を評価するためのベンチマークである。
多様なドメイン(例えば、家庭のルーチン、旅行、社会協力など)にまたがる760の人称タスクが特徴である。
信頼性評価のために、各タスクは、人間検証された初期状態、参照軌跡、端末状態検証器を含む。
論文 参考訳(メタデータ) (2026-06-08T15:51:51Z) - Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments [96.23886784364997]
身体的な知性は、操作やナビゲーションといった個々のタスクのための特別なモデルを通してしばしば研究される。
本稿では,Qwenの視覚言語モデリングスタックを連続的な動作と軌道生成に拡張した統一的な基礎モデルであるQwen-VLAを提案する。
論文 参考訳(メタデータ) (2026-05-28T17:36:31Z) - A Gesture-Based Visual Learning Model for Acoustophoretic Interactions using a Swarm of AcoustoBots [8.171680721155761]
AcoustoBotsは、触覚、指向性オーディオ、音響浮揚を届けるモバイル・アココノトペティック・ロボットだ。
既存の実装はスクリプト化されたコマンドに依存しており、リアルタイムなヒューマンコントロールのための直感的なインターフェースがない。
本研究では,マルチモーダルなAcoustoBotプラットフォームと非接触型ヒューマン・スワームインタラクションのためのジェスチャーに基づく視覚学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-21T16:32:38Z) - Active Stereo-Camera Outperforms Multi-Sensor Setup in ACT Imitation Learning for Humanoid Manipulation [4.864819846886142]
本論文は,Unitree G1ヒューマノイドロボットの3本指ハンドを2つの操作タスクに装着した14種類のセンサの組み合わせをベンチマークする。
触覚とプロモセプティブの融合と能動視覚の併用について検討した。
論文 参考訳(メタデータ) (2026-03-30T13:30:34Z) - Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition [71.5328300638085]
Zero-shot Human-Object Interaction (HOI) は、画像中の人間と物体を特定し、その相互作用を認識することを目的としている。
2段階法を含む既存の手法は、特定の検出器との相互作用認識を密に結合する。
本稿では、オブジェクト検出をIRから分離し、マルチモーダル大言語モデル(MLLM)をゼロショットIRに活用する分離フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-16T19:01:31Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - YOLO-APD: Enhancing YOLOv8 for Robust Pedestrian Detection on Complex Road Geometries [0.0]
本稿では,この課題に特化してYOLOv8フレームワークを改良した新しいディープラーニングアーキテクチャであるYOLO-APDを紹介する。
YOLO-APDは最先端の精度を達成し、77.7% mAP@0.5:0.95、例外的な歩行者リコールは96%を超えた。
リアルタイム処理能力を100 FPSで維持し、精度と効率のバランスが優れていることを示す。
論文 参考訳(メタデータ) (2025-07-07T18:03:40Z) - λ: A Benchmark for Data-Efficiency in Long-Horizon Indoor Mobile Manipulation Robotics [11.901933884058021]
本稿では,LAMBDA ベンチマーク-Long-Horizon Actions for Mobile-Manipulation Benchmarking of Directed Activityを紹介する。
私たちのベンチマークには、シミュレーションと実世界の設定において、現実性と多様性を提供する、571人の人間によるデモが含まれています。
予備訓練を受けた場合でも,学習方法は成功率を低く抑えるが,ニューロシンボリックな手法では性能が著しく向上し,データ量も少なくなる。
論文 参考訳(メタデータ) (2024-11-28T19:31:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。