論文の概要: MistyPilot: Enabling Social-Robot Control through Multi-Agent LLM Skill Orchestration
- arxiv url: http://arxiv.org/abs/2608.15549v1
- Date: Sun, 16 Aug 2026 05:45:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.337061
- Title: MistyPilot: Enabling Social-Robot Control through Multi-Agent LLM Skill Orchestration
- Title(参考訳): MistyPilot:マルチエージェントLLMスキルオーケストレーションによるソーシャルロボット制御の実現
- Abstract要約: MistyPilotは、Mistyソーシャルロボットで対応するスキルをオーケストレーションするマルチエージェントフレームワークである。
タスクルータは2つの特殊エージェントのうちの1つに各命令をディスパッチする。
MistyPilotは、ルーティング、センサースキルバインディング、タスク状態解析、結果再利用、100スキルまでのスキル拡張において、高い精度を実現する。
- 参考スコア(独自算出の注目度): 18.20564232594413
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Programming small social robots from natural-language instructions requires more than invoking isolated APIs. Interactive tasks combine reactive physical behaviors with stateful social behaviors, while existing interfaces often require developers to manually compose APIs into skills, configure their parameters, bind sensor events to skills, and manage task states at runtime. We present MistyPilot, a multi-agent LLM framework that interprets high-level natural-language instructions and orchestrates the corresponding skills on the Misty social robot. A Task Router dispatches each instruction to one of two specialized agents: a Physically Interactive Agent for sensor-triggered robot control and direct skill invocation, and a Social Interaction Agent for dialogue-oriented task-state management and context-dependent multimodal response generation. To improve efficiency, the Social Interaction Agent reuses previously generated results when applicable and invokes full generation otherwise. We evaluate MistyPilot on five component-level suites, with sensor bindings and skill invocations executed on the physical Misty robot, and a preliminary user study with 12 participants. MistyPilot attains high accuracy on routing, sensor-skill binding, task-state parsing, result reuse, and skill extension up to 100 skills, and lower variance than an otherwise identical single-agent baseline, while participants report positive perceptions of usability and interaction quality. The code will be made publicly available via the project page.
- Abstract(参考訳): 自然言語の命令から小さなソーシャルロボットをプログラミングするには、孤立したAPIを呼び出す以上のことが必要だ。
インタラクティブなタスクは、リアクティブな物理的な振る舞いとステートフルな社会的振る舞いを組み合わせたものだが、既存のインターフェースでは、開発者が手作業でAPIをスキルに組み立て、パラメータを設定し、センサーイベントをスキルにバインドし、実行時にタスク状態を管理する必要があることが多い。
MistyPilotはハイレベルな自然言語命令を解釈し、それに対応するスキルをMistyソーシャルロボット上でオーケストレーションするマルチエージェントLLMフレームワークである。
タスクルータは、センサートリガーロボット制御と直接スキル実行のための物理対話エージェントと、対話指向タスク状態管理とコンテキスト依存マルチモーダル応答生成のためのソーシャルインタラクションエージェントの2つの特殊エージェントのうちの1つに、それぞれの命令をディスパッチする。
効率を改善するために、Social Interaction Agentは、適用時に以前に生成された結果を再利用し、フル世代を呼び出します。
MistyPilotを5つのコンポーネントレベルスイートで評価し、センサバインディングと物理的なMistyロボット上でのスキル実行と、12人の参加者による予備的なユーザスタディを行った。
MistyPilotは、ルーティング、センサースキルのバインディング、タスク状態のパーシング、結果の再利用、スキル拡張の精度が高く、同じ単一エージェントベースラインよりも分散度が低く、参加者はユーザビリティとインタラクション品質の肯定的な認識を報告している。
コードはプロジェクトのページから公開されている。
関連論文リスト
- Ludi${}_{\scriptscriptstyle 0.1}$: An Agentic System for Socially Intelligent Robots [22.26258894927344]
Ludi$_scriptscriptstyle 0.1$は、社会的に知的なロボットのためのエージェントシステムである。
対話型音声、マルチモーダル推論、メモリ、ナビゲーション、学習された操作を統合する。
Ludi$_scriptstyle 0.1$は流体ロボットコラボレーションへの実践的な道を示す。
論文 参考訳(メタデータ) (2026-08-22T16:38:59Z) - Playful Agentic Robot Learning [108.08954330298549]
本研究では,実演型プログラミングエージェントが,下流のタスクが到着する前に,連続的なスキル学習段階として自己指導型プレイを使用する,遊び型エージェントロボット学習について検討する。
RATは、新しい学習可能な探索タスク、ロボットコードポリシーの計画と実行、中間的な進捗の検証、失敗の診断、密集したステップレベルのフィードバックによる検索、そして成功した実行を永続的なコードスキルライブラリに蒸留することを提案する。
論文 参考訳(メタデータ) (2026-06-17T17:55:23Z) - ComPASS: Towards Personalized Agentic Social Support via Tool-Augmented Companionship [55.402028219661986]
エージェントに外部ツールを付与し、多様なアクションを実行するためのツールを開発する。
われわれはまず、さまざまなマルチメディアアプリケーションをシミュレートするユーザ中心のツールを多数設計し、様々な種類のソーシャルサポート行動をカバーする。
ComPASS-Benchに基づいて,Qwen3-8Bモデルを微調整するためのツール使用記録をさらに合成し,タスク固有のComPASS-Qwenを生成する。
論文 参考訳(メタデータ) (2026-04-20T14:49:16Z) - WebXSkill: Skill Learning for Autonomous Web Agents [104.76374637691212]
WebXSkillは、コードベースのスキルと自然言語ガイダンスのギャップを埋めるフレームワークである。
WebArenaとWebVoyagerでは、WebXSkillはタスク成功率をベースラインで最大9.8と12.9ポイント改善する。
論文 参考訳(メタデータ) (2026-04-14T21:48:15Z) - MistyPilot: An Agentic Fast-Slow Thinking LLM Framework for Misty Social Robots [19.141461555104843]
MistyPilotは、自律的なツール選択、オーケストレーション、パラメータ設定のためのエージェントLLM駆動フレームワークである。
MistyPilotは、Physically Interactive Agent(PIA)とSocially Intelligent Agent(SIA)の2つのコアコンポーネントから構成される。
論文 参考訳(メタデータ) (2026-03-04T02:00:43Z) - RoboOmni: Proactive Robot Manipulation in Omni-modal Context [165.09049429566238]
我々は,音声対話や環境音,視覚的手がかりから意図を導出する,クロスモーダルな文脈指示を導入する。
目的認識,インタラクション確認,アクション実行を統一する,エンドツーエンドのOmni-Modal LLMに基づくフレームワークであるRoboOmniを提案する。
シミュレーションと実世界の設定の実験では、Robo OmniはテキストベースとASRベースのベースラインを越え、成功率、推論速度、意図認識、積極的に支援している。
論文 参考訳(メタデータ) (2025-10-27T18:49:03Z) - Interpretable Robot Control via Structured Behavior Trees and Large Language Models [0.14990005092937678]
本稿では,自然言語理解とロボット実行を橋渡しする新しい枠組みを提案する。
提案手法は実世界のシナリオでは実用的であり、平均的な認識と実行の精度は約94%である。
論文 参考訳(メタデータ) (2025-08-13T08:53:13Z) - Breaking Single-Tester Limits: Multi-Agent LLMs for Multi-User Feature Testing [15.383375235673954]
アプリケーション機能テストのためのマルチユーザ対話タスクを自動化するために,LLM(Large Language Models)を利用した新しいマルチエージェントアプローチであるMAdroidを提案する。
具体的には、MAdroidは、ユーザエージェント(オペレータ)とスーパーバイザーエージェント(コーディネータとオブザーバ)の2つの機能タイプを採用している。
マルチユーザ対話型タスク41件を含む評価は,96.8%の動作類似性を有するタスクの82.9%を達成し,提案手法の有効性を示した。
論文 参考訳(メタデータ) (2025-06-21T01:38:53Z) - ROS-LLM: A ROS framework for embodied AI with task feedback and structured reasoning [74.58666091522198]
非専門家による直感的なロボットプログラミングのためのフレームワークを提案する。
ロボットオペレーティングシステム(ROS)からの自然言語のプロンプトと文脈情報を活用する
我々のシステムは,大規模言語モデル (LLM) を統合し,非専門家がチャットインタフェースを通じてシステムにタスク要求を記述できるようにする。
論文 参考訳(メタデータ) (2024-06-28T08:28:38Z) - RoboScript: Code Generation for Free-Form Manipulation Tasks across Real
and Simulation [77.41969287400977]
本稿では,コード生成を利用したデプロイ可能なロボット操作パイプラインのためのプラットフォームである textbfRobotScript を提案する。
自由形自然言語におけるロボット操作タスクのためのコード生成ベンチマークも提案する。
我々は,Franka と UR5 のロボットアームを含む,複数のロボットエボディメントにまたがるコード生成フレームワークの適応性を実証した。
論文 参考訳(メタデータ) (2024-02-22T15:12:00Z) - Chat with the Environment: Interactive Multimodal Perception Using Large
Language Models [19.623070762485494]
大型言語モデル(LLM)は、数発のロボット計画において顕著な推論能力を示している。
本研究は,LLMがマルチモーダル環境下での対話型ロボットの動作を制御し,高レベルな計画と推論能力を提供することを示す。
論文 参考訳(メタデータ) (2023-03-14T23:01:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。