論文の概要: PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud
- arxiv url: http://arxiv.org/abs/2608.03682v2
- Date: Wed, 05 Aug 2026 05:24:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.275587
- Title: PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud
- Title(参考訳): PhyAI: エッジでのリアルタイム物理AIとクラウドでのスケーラブルなロールアウト
- Authors: Chenghua Wang, Daliang Xu, Dongqi Cai, Duojin Sun, Hao Zhang, Haoze Qian, Huaiyuan Zhang, Jinshuo Cui, Junbo Cui, Kezhao Zhao, Longxi Gao, Mengwei Xu, Rongjie Yi, Tam Sikyuen, Tianyue Zhang, Weikai Xie, Xuanzhe Liu, Yingying Qin, Yiwen Lu, Yuan Yao, Yuezhi Zu, Yunhan Guo, Yuxin Zheng, Ziqi Guo,
- Abstract要約: PhyAIは、単一のランタイムを持つ物理AI推論エンジンである。
単一のまたは複数のGPU上でビジョン言語アクション(VLA)モデルとワールドアクションモデル(WAM)を実行する。
pi0、pi0.5、GR00T N1.7、MiniCPM-Robotの公式実装よりも1.40x-4.65xのスピードアップを実現している。
- 参考スコア(独自算出の注目度): 19.027069678233655
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Physical AI policies require inference throughout their lifecycle, including model evaluation, cloud reinforcement learning rollout, edge GPU serving, and onboard deployment. Although these settings share the same checkpoint and action semantics, they often rely on separate inference programs. To unify them, we build PhyAI, a Physical AI inference engine with a single runtime that keeps architecture-specific conditioning, solver, cache, and output logic in model adapters while sharing graph execution, kernels, memory management, and parallel services. The same codebase runs vision-language-action (VLA) models and world-action models (WAMs) on single or multiple GPUs across onboard, edge, and cloud deployments. We used the adapter interface to add MiniCPM-Robot on the day of its release. PhyAI achieves 1.40x-4.65x speedups over the official implementations of pi0, pi0.5, GR00T N1.7, and MiniCPM-Robot. On Cosmos3-Nano-Policy-DROID it reduces latency from 2.46 to 1.18 s on eight H20 GPUs (CFG=2, TP=4), a 2.08x speedup. Specialized runtimes remain faster in several configurations, so our goal is one runtime with competitive latency rather than the fastest result in every case. Detailed profiles reveal why different models need different execution policies: on a Hopper-series GPU at batch size one, the pi0.5 action expert accounts for 8.8% of FLOPs but 57.2% of latency; at batch size 32 its share drops to 13.5% and throughput reaches about 100 samples/s. Cosmos3 remains generation-dominated and gains only 14.3% throughput as batch size increases from 1 to 16. We further introduce the control-time Roofline, which distinguishes inference-bound from environment-bound control; the measured pi0.5 points on four LIBERO suites are environment-bound while Cosmos3 stays inference-bound. Code and benchmarks: https://github.com/mingti-org/phyai.
- Abstract(参考訳): 物理AIポリシは、モデル評価、クラウド強化学習ロールアウト、エッジGPUサービス、オンボードデプロイメントなど、ライフサイクルを通じて推論を必要とする。
これらの設定は同じチェックポイントとアクションセマンティクスを共有しているが、しばしば別々の推論プログラムに依存している。
グラフの実行、カーネル、メモリ管理、並列サービスを共有しながら、モデルアダプタのアーキテクチャ固有の条件付け、解決器、キャッシュ、出力ロジックを保持する、単一のランタイムを備えた物理AI推論エンジンであるPhyAIを構築します。
同じコードベースでは、VLA(Vision-Language-action)モデルとWAM(World-action Model)が、オンボード、エッジ、クラウドデプロイメントにまたがるシングルまたは複数のGPU上で実行される。
アダプタインターフェースを使用して、MiniCPM-Robotをリリース当日に追加しました。
PhyAIはpi0、pi0.5、GR00T N1.7、MiniCPM-Robotの公式実装よりも1.40x-4.65xの高速化を実現している。
Cosmos3-Nano-Policy-DROIDでは、レイテンシを8つのH20 GPU(CFG=2, TP=4),2.08倍のスピードアップで2.46から1.18秒に短縮する。
特殊化されたランタイムは、いくつかの設定で高速なままなので、私たちのゴールは、すべてのケースで最速の結果ではなく、競合するレイテンシを持つ1つのランタイムです。
バッチサイズ1のホッパーシリーズGPUでは、pi0.5アクションエキスパートがFLOPの8.8%、レイテンシ57.2%を占め、バッチサイズ32ではシェアが13.5%に減少し、スループットは約100サンプル/秒に達した。
コスモス3は世代が支配的であり、バッチサイズが1から16に増加するにつれて14.3%のスループットしか得られない。
さらに,4つのLIBERO スイート上の pi0.5 は環境負荷であり,Cosmos3 は環境負荷である。
コードとベンチマーク:https://github.com/mingti-org/phyai.com
関連論文リスト
- Meganeura: Portable GPU Training and Inference through Vulkan and Metal [0.0]
Meganeura氏は、ひとつのコンパクトなネイティブコンパイラが、コンシューマGPU上の両方のフェーズにまたがることができるかどうかを尋ねている。
NVIDIAとAMDの離散GPUで、マッチした5つのワークロードとPyTorchを比較した。
その結果,一般消費者のグラフィクスAPIは,コンパクトな共有トレイン・ツー・デプロイスタックを,時としてベンダ・コンペティティブなパフォーマンスでサポートできることが示唆された。
論文 参考訳(メタデータ) (2026-08-03T00:42:55Z) - RaMP: Runtime-Aware Megakernel Polymorphism for Mixture-of-Experts [0.22625548856057365]
本稿ではルーティング対応のディスパッチフレームワークであるRaMPを紹介する。
RaMPは、静的ディスパッチで1.22倍のカーネルスピードアップと、Tritonで1.41倍、DeepGEMMで1.13倍、FlashInfer CUTLASSで1.30倍のエンドツーエンドスピードアップを提供する。
論文 参考訳(メタデータ) (2026-04-28T18:20:12Z) - Architecture-Aware LLM Inference Optimization on AMD Instinct GPUs: A Comprehensive Benchmark and Deployment Study [0.0]
AMD Instinct MI325X GPUにおけるLCM推定のクロスアーキテクチャ評価
3つのアーキテクチャファミリにまたがる235Bから1兆のパラメータにまたがる4つのモデルのベンチマーク。
論文 参考訳(メタデータ) (2026-02-27T13:21:48Z) - Revati: Transparent GPU-Free Time-Warp Emulation for LLM Serving [1.4573878379102423]
Revatiはリアルタイムシステムコードをシミュレーションライクな速度で直接実行することで、パフォーマンスモデリングを可能にするタイムワープエミュレータである。
Revatiは、実際のGPU実行よりも5~17倍高速で実行しながら、複数のモデルと構成で5%未満の予測エラーを達成する。
論文 参考訳(メタデータ) (2026-01-01T17:19:58Z) - StrikeWatch: Wrist-worn Gait Recognition with Compact Time-series Models on Low-power FPGAs [10.946464973530214]
歩行パターンが良くなると、特に専門家のフィードバックなしに怪我につながることがある。
Wrist-wornウェアラブルは、実用的で非侵襲的な代替手段を提供する。
本稿では,デバイス上でリアルタイム歩行認識を行う小型手首輪システムであるStrikeWatchを紹介する。
論文 参考訳(メタデータ) (2025-10-14T20:28:31Z) - 70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float [52.079202872069835]
大規模言語モデル(LLM)や拡散モデル(DM)といった大規模AIモデルは急速に成長している。
圧縮フレームワークであるDynamic-Length Float (DFloat11) を導入し, LLM と DM サイズを30%削減した。
論文 参考訳(メタデータ) (2025-04-15T22:38:38Z) - MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models [58.3342517278868]
本稿では,Mixed-precision AutoRegressive LINearカーネルの設計について述べる。
バッチサイズは16-32までサポートでき、量子化のスピードアップが最大 (4times$) になる。
MarLINは非同期メモリアクセス、複雑なタスクスケジューリング、パイプライン化といったテクニックを組み合わせてこれを実現している。
論文 参考訳(メタデータ) (2024-08-21T16:10:41Z) - Latency-aware Unified Dynamic Networks for Efficient Image Recognition [72.8951331472913]
LAUDNetは動的ネットワークの理論的および実用的な効率ギャップを橋渡しするフレームワークである。
3つの主要な動的パラダイム - 適応型計算、動的層スキップ、動的チャネルスキップ - を統合している。
これにより、V100,3090やTX2 GPUのようなプラットフォーム上で、ResNetのようなモデルの遅延を50%以上削減できる。
論文 参考訳(メタデータ) (2023-08-30T10:57:41Z) - Accelerating Training and Inference of Graph Neural Networks with Fast
Sampling and Pipelining [58.10436813430554]
グラフニューラルネットワーク(GNN)のミニバッチトレーニングには、多くの計算とデータ移動が必要である。
我々は,分散マルチGPU環境において,近傍サンプリングを用いたミニバッチトレーニングを行うことを支持する。
本稿では,これらのボトルネックを緩和する一連の改良点について述べる。
また,サンプリングによる推論を支援する実験分析を行い,試験精度が実質的に損なわれていないことを示す。
論文 参考訳(メタデータ) (2021-10-16T02:41:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。