論文の概要: Multi-modal Interactive Control of Robotic Arm based on Offline Large Language Models
- arxiv url: http://arxiv.org/abs/2608.08183v1
- Date: Sat, 08 Aug 2026 15:21:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.714694
- Title: Multi-modal Interactive Control of Robotic Arm based on Offline Large Language Models
- Title(参考訳): オフライン大規模言語モデルに基づくロボットアームのマルチモーダル対話制御
- Abstract要約: The Socratic Models-ChatGLM is well-performed algorithm for multi-modal interactive control of robotic arm based on offline large language model via the facile PyBullet platform。
- 参考スコア(独自算出の注目度): 5.495344504006371
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) have significantly revolutionized the modern society with numerous advanced interactions between humans and AI agents, whereas the usage of most large language models including ChatGPT are not friendly open-sourced and must require the users paying a lot for such AI services continuously. Therefore, deploying open-sourced large language models on local servers can be considered as an efficient approach to design and implement creative embodied AI algorithms with lower cost and more stable free usage. Inspired by this ordinary motivation, we originally propose and implement the "Socratic Models-ChatGLM", which is a well-performed algorithm for multi-modal interactive control of robotic arm based on offline large language models via the facile PyBullet platform, even presents extraordinary potential to address complicated text-image integrated multi-step long-horizon robotic manipulation tasks.
- Abstract(参考訳): 大規模言語モデル(LLM)は、人間とAIエージェント間の高度な対話によって現代社会に大きく革命をもたらしたが、ChatGPTを含むほとんどの大規模言語モデルの使用は、フレンドリーなオープンソースではないため、ユーザーはそのようなAIサービスに多くの費用を払わなければならない。
したがって、オープンソースで大規模な言語モデルをローカルサーバにデプロイすることは、低コストでより安定した無償使用で創造的な具体的AIアルゴリズムを設計、実装するための効率的なアプローチとみなすことができる。
この通常のモチベーションに触発されて、我々は、ファクシミリPyBulletプラットフォームを介して、オフラインの大規模言語モデルに基づくロボットアームのマルチモーダルな対話制御のための、多段階的なアルゴリズムであるSocratic Models-ChatGLMを提案し、実装した。
関連論文リスト
- EduSim-LLM: An Educational Platform Integrating Large Language Models and Robotic Simulation for Beginners [0.22917707112773592]
本稿では,大規模言語モデルとロボットシミュレーションを統合した教育プラットフォームであるEduSim-LLMを紹介する。
我々は、直接制御と自律制御という2つの人間ロボット相互作用モデルの設計、複数の言語モデルに基づく体系的なシミュレーション、マルチロボット協調、運動計画、操作能力の評価を行う。
論文 参考訳(メタデータ) (2026-01-03T14:40:39Z) - LEO-RobotAgent: A General-purpose Robotic Agent for Language-driven Embodied Operator [1.5566524830295307]
ロボットのための汎用言語駆動型インテリジェントエージェントフレームワークLEO-RobotAgentを提案する。
このフレームワークは強力な一般化、堅牢性、効率性を備えている。
実験では、このフレームワークが主流のロボットプラットフォームに容易に適応できることが確認されている。
論文 参考訳(メタデータ) (2025-12-11T12:58:36Z) - Interpretable Robot Control via Structured Behavior Trees and Large Language Models [0.14990005092937678]
本稿では,自然言語理解とロボット実行を橋渡しする新しい枠組みを提案する。
提案手法は実世界のシナリオでは実用的であり、平均的な認識と実行の精度は約94%である。
論文 参考訳(メタデータ) (2025-08-13T08:53:13Z) - Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review [4.540236408836132]
本稿では,モバイルサービスロボティクスにおける基礎モデルの統合に関する最初の体系的なレビューを紹介する。
本稿では, リアルタイムセンサ融合, 言語条件制御, 適応タスク実行におけるそのようなモデルの役割について検討する。
また、国内援助、医療、サービス自動化分野における現実世界の応用についても論じる。
論文 参考訳(メタデータ) (2025-05-26T20:08:09Z) - $π_0$: A Vision-Language-Action Flow Model for General Robot Control [77.32743739202543]
本稿では,インターネット規模のセマンティック知識を継承するために,事前学習された視覚言語モデル(VLM)上に構築された新しいフローマッチングアーキテクチャを提案する。
我々は,事前訓練後のタスクをゼロショットで実行し,人からの言語指導に追従し,微調整で新たなスキルを習得する能力の観点から,我々のモデルを評価した。
論文 参考訳(メタデータ) (2024-10-31T17:22:30Z) - LVLM-Interpret: An Interpretability Tool for Large Vision-Language Models [50.259006481656094]
本稿では,大規模視覚言語モデルの内部メカニズムの理解を目的とした対話型アプリケーションを提案する。
このインタフェースは, 画像パッチの解釈可能性を高めるために設計されており, 応答の生成に有効である。
本稿では,一般的な大規模マルチモーダルモデルであるLLaVAにおける障害機構の理解に,アプリケーションがどのように役立つかのケーススタディを示す。
論文 参考訳(メタデータ) (2024-04-03T23:57:34Z) - TextBind: Multi-turn Interleaved Multimodal Instruction-following in the Wild [102.93338424976959]
マルチターンインターリーブ型インストラクションフォロー機能を備えた,より大規模な言語モデルを実現するための,ほとんどアノテーションのないフレームワークであるTextBindを紹介する。
提案手法では,画像キャプチャペアのみが必要であり,言語モデルからマルチターンマルチモーダル・インストラクション・レスポンス・会話を生成する。
そこで我々は,画像エンコーダとデコーダモデルをシームレスに統合する言語モデル中心アーキテクチャであるMIMを考案した。
論文 参考訳(メタデータ) (2023-09-14T15:34:01Z) - Large Language Models Empowered Autonomous Edge AI for Connected
Intelligence [51.269276328087855]
エッジ人工知能(Edge AI)は、コネクテッドインテリジェンスを実現するための有望なソリューションである。
この記事では、ユーザのさまざまな要件を満たすために自動的に組織化し、適応し、最適化する、自律的なエッジAIシステムのビジョンを示す。
論文 参考訳(メタデータ) (2023-07-06T05:16:55Z) - HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging
Face [85.25054021362232]
大規模言語モデル(LLM)は、言語理解、生成、相互作用、推論において例外的な能力を示した。
LLMは、複雑なAIタスクを解決するために既存のAIモデルを管理するコントローラとして機能する可能性がある。
本稿では,機械学習コミュニティのさまざまなAIモデルを接続するLLMエージェントであるHuggingGPTを紹介する。
論文 参考訳(メタデータ) (2023-03-30T17:48:28Z) - PaLM-E: An Embodied Multimodal Language Model [101.29116156731762]
本研究では,実世界の連続型センサを言語モデルに組み込むための具体的言語モデルを提案する。
我々は、複数の具体的タスクのために、事前訓練された大規模言語モデルとともに、これらのエンコーディングをエンドツーエンドにトレーニングする。
562Bパラメータを持つ大モデル PaLM-E-562B は、OK-VQA 上での最先端性能を持つ視覚言語ジェネラリストである。
論文 参考訳(メタデータ) (2023-03-06T18:58:06Z) - Reshaping Robot Trajectories Using Natural Language Commands: A Study of
Multi-Modal Data Alignment Using Transformers [33.7939079214046]
我々は、人間とロボットのコラボレーションのための柔軟な言語ベースのインタフェースを提供する。
我々は、ユーザコマンドをエンコードする大規模言語モデルの分野における最近の進歩を生かしている。
言語コマンドによって修正されたロボット軌跡を含むデータセット上で、模倣学習を用いてモデルを訓練する。
論文 参考訳(メタデータ) (2022-03-25T01:36:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。