論文の概要: Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots
- arxiv url: http://arxiv.org/abs/2607.02501v1
- Date: Thu, 02 Jul 2026 17:58:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.961733
- Title: Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots
- Title(参考訳): Embodied.cpp: 異種ロボット上での身体的AIモデルのポータブル推論ランタイム
- Authors: Ling Xu, Chuyu Han, Borui Li, Hao Wu, Shiqi Jiang, Ting Cao, Chuanyou Li, Sheng Zhong, Shuai Wang,
- Abstract要約: 身体的AIモデルは視覚言語行動モデル(VLA)と世界行動モデル(WAM)にまたがる
既存の推論ランタイムは、具体的デプロイメントの契約を満たさない。
具体的推論のためのポータブルなC++ランタイムであるEmbodiedを紹介します。
- 参考スコア(独自算出の注目度): 19.848719701819153
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Embodied AI models now span vision-language-action (VLA) models and world-action models (WAMs), but practical deployment remains fragmented across model-specific Python stacks, backend assumptions, and robot-side glue code, especially on heterogeneous edge devices. Existing inference runtimes are designed mainly for request-response serving and therefore do not satisfy the runtime contract of embodied deployment: multi-rate execution inside closed-loop control, latency-first batch-1 inference on heterogeneous hardware, and extensible embodied interfaces beyond fixed token I/O. We present Embodied.cpp, a portable C++ inference runtime for embodied models. Based on an architectural analysis of representative VLA models and WAMs, Embodied.cpp captures a shared execution path and organizes it into five layers: input adapters, sequence builders, backbone execution, head plugins, and deployment adapters. The runtime provides modular multi-rate execution, latency-first fused inference, and extensible operator and I/O support, enabling deployment across heterogeneous devices, robots, and simulators through one backend abstraction. We evaluate Embodied.cpp on two VLA models, HY-VLA and pi0.5, and on a preliminary WAM benchmark using a LingBot-VA Transformer block. The VLA deployments achieve successful closed-loop execution with 100.0% and 91.0% task success rates, respectively. The WAM benchmark reduces block memory from 312.2 MiB to 88.1 MiB. These results show that Embodied.cpp improves deployment efficiency while preserving high accuracy across diverse embodied model architectures.
- Abstract(参考訳): Embodied AIモデルは現在、ビジョン言語アクション(VLA)モデルとワールドアクションモデル(WAM)にまたがっているが、実際のデプロイメントはモデル固有のPythonスタック、バックエンドの仮定、ロボットサイドのグルーコード、特に異種エッジデバイスに分散している。
既存の推論ランタイムは、主に要求応答機能のために設計されており、従ってエンボディドデプロイメントのランタイムコントラクトを満足していない:クローズドループ制御内のマルチレート実行、異種ハードウェア上の遅延ファーストバッチ-1推論、固定トークンI/Oを超えた拡張可能なエンボディドインターフェース。
Embodied.cppは、エンボディモデルのためのポータブルなC++推論ランタイムである。
代表的なVLAモデルとWAMのアーキテクチャ分析に基づいて、Embodied.cppは共有実行パスをキャプチャして、入力アダプタ、シーケンスビルダー、バックボーン実行、ヘッドプラグイン、デプロイメントアダプタの5つのレイヤに編成する。
ランタイムはモジュール化されたマルチレート実行、レイテンシファーストの融合推論、拡張可能な演算子とI/Oサポートを提供する。
我々は,2つのVLAモデルであるHY-VLAとpi0.5に対してEmbodied.cppを評価し,LingBot-VA Transformerブロックを用いて予備的なWAMベンチマークを行った。
VLAデプロイメントは、それぞれ100.0%と91.0%のタスク成功率でクローズドループ実行を成功させる。
WAMベンチマークはブロックメモリを312.2 MiBから88.1 MiBに削減している。
これらの結果から,Embodied.cppは多種多様なモデルアーキテクチャで高い精度を保ちながら,デプロイメント効率を向上させることが示された。
関連論文リスト
- vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models [1.8512656289778031]
llama上に構築されたポータブルなC++推論ランタイムであるvlaを紹介します。
これは、フローマッチングと拡散VLA推論パターンを提供する最初のggmlクラスエンジンである。
LIBERO-Objectでは、エンジンは200回中1回で最先端のチェックポイントと一致し、1.3GBBのメモリで100%成功してBitVLAを実行する。
論文 参考訳(メタデータ) (2026-06-06T10:45:40Z) - OxyGen: Unified KV Cache Management for Vision-Language-Action Models under Multi-Task Parallelism [15.325398725305774]
我々は,KVキャッシュをタスクや時間とともに共有する第1級のリソースとして扱う推論パラダイムであるKVキャッシュ管理を統一的に提案する。
OxyGenは、孤立実行よりも最大3.7$timesのスピードアップを実現し、200トークン/秒の言語スループットと70Hzのアクション周波数をアクション品質の劣化なしに同時に提供する。
論文 参考訳(メタデータ) (2026-03-15T13:23:56Z) - AtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World Models [9.608633915316252]
VLA(Vision-Language-Action)モデルでは、一般化可能なロボット操作の可能性を示している。
現在のパラダイムは、教師付き微調整中の粗大でハイレベルなタスク命令に依存している。
スケーラブルなオフライン後トレーニングパイプラインと統合された,最初のサブタスク対応VLAフレームワークである方法を提案する。
論文 参考訳(メタデータ) (2026-03-09T15:52:48Z) - LiteVLA-Edge: Quantized On-Device Multimodal Control for Embedded Robotics [0.6119773373677944]
本稿では,Jetson Orinクラスハードウェア上でのデバイス上での完全な推論のための,デプロイメント指向のVLAパイプラインであるLiteVLA-Edgeを紹介する。
提案手法は、FP32における教師付きイメージ・ツー・アクションの微調整と、4ビットGGUF量子化とGPU加速推論を組み合わせたものである。
我々の構成では、LiteVLA-Edgeは、完全にオフラインで動作しながら、150.5,ms(約6.6,Hz)の平均エンドツーエンドランタイムを達成する。
論文 参考訳(メタデータ) (2026-03-03T03:20:52Z) - Characterizing VLA Models: Identifying the Action Generation Bottleneck for Edge AI Architectures [4.6111834169518735]
VLA(Vision-Language-Action)モデルは、ロボット工学や最先端のAIに不可欠なワークロードの新たなクラスである。
本稿では,Nvidia Jetson OrinとThorの2世代のエッジハードウェア上でのVLA性能を特徴付ける。
論文 参考訳(メタデータ) (2026-03-01T01:09:55Z) - HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies [83.41714103649751]
具体的インテリジェンスモデルの開発は、高品質なロボットのデモデータへのアクセスに依存する。
異種多種多様なロボットデータを扱うための視覚言語アクションフレームワークであるHiMoE-VLAを提案する。
HiMoE-VLAは既存のVLAベースラインよりも一貫したパフォーマンス向上を示し、高い精度と堅牢な一般化を実現している。
論文 参考訳(メタデータ) (2025-12-05T13:21:05Z) - SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration [70.72227437717467]
VLA(Vision-Language-Action)モデルは、その強力な制御能力に注目が集まっている。
計算コストが高く、実行頻度も低いため、ロボット操作や自律ナビゲーションといったリアルタイムタスクには適さない。
本稿では,共同スケジューリングモデルとプルーニングトークンにより,VLAモデルを高速化する統一フレームワークSP-VLAを提案する。
論文 参考訳(メタデータ) (2025-06-15T05:04:17Z) - Energy-efficient Task Adaptation for NLP Edge Inference Leveraging
Heterogeneous Memory Architectures [68.91874045918112]
Adapter-ALBERTは、様々なタスクにわたる最大データ再利用のための効率的なモデル最適化である。
検証されたNLPエッジアクセラレータ上でシミュレーションを行うことにより、モデルを不均一なオンチップメモリアーキテクチャにマッピングする利点を実証する。
論文 参考訳(メタデータ) (2023-03-25T14:40:59Z) - SensiX++: Bringing MLOPs and Multi-tenant Model Serving to Sensory Edge
Devices [69.1412199244903]
エッジデバイス上でMLOpsを統合した,適応モデル実行のためのマルチテナントランタイムを提案する。
S SensiX++は、高度にモジュール化されたコンポーネント化と、明確な抽象化によるデータ操作の外部化と、システム全体のオーケストレーションのためのドキュメント中心の宣言という、2つの基本原則で運用されている。
SensiX++のさまざまな自動化コンポーネントの全体的なスループットと定量化メリットについて報告し、運用の複雑さを著しく低減し、エッジデバイスへの組み込みモデルのデプロイ、アップグレード、再構成、提供の労力を削減する効果を実証する。
論文 参考訳(メタデータ) (2021-09-08T22:06:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。