論文の概要: Lightweight and Resource-Efficient Perception for Robotic Guide Dogs
- arxiv url: http://arxiv.org/abs/2610.03187v1
- Date: Fri, 02 Oct 2026 12:01:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.355798
- Title: Lightweight and Resource-Efficient Perception for Robotic Guide Dogs
- Title(参考訳): ロボットガイド犬に対する軽量・資源効率の認知
- Abstract要約: マルチカメラストリーミングの認識は、異質なエッジプラットフォームに、共同居住者のワークロードで共有されるようになってきている。
分離された評価は、デプロイメント時間の配置を間違える可能性があることを示す。
1つのGPU-NPUプラットフォーム上で2つのエンドツーエンドパイプラインを使用することで、分離された評価がデプロイメント時の配置を誤解する可能性があることを示す。
- 参考スコア(独自算出の注目度): 14.851753967489849
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multi-camera streaming perception is increasingly deployed on heterogeneous edge platforms shared with co-resident workloads, yet accelerator placement is often evaluated using isolated single-stream experiments and mean streaming average precision (sAP). Using two end-to-end pipelines on a single GPU--NPU platform, we show that isolated evaluation can mis-rank deployment-time placement. Although the GPU pipeline is preferred in isolation, GPU-localized contention introduces deadline misses that make detections stale and can reverse the preferred placement before full GPU saturation. The NPU pipeline is less accurate than the GPU pipeline on small and medium objects in isolation, but nearly matches it on large objects. The largest absolute sAP losses in our latency and contention experiments occur for large objects. In our four-stream experiments, the preferred placement depends on which path becomes stale, and increasing GPU-side contention shifts the best placement from All-GPU to All-NPU. Under a GPU-saturating vision--language co-tenant, All-NPU achieves $5.2\times$ the worst-stream sAP of All-GPU. Because mean sAP can hide severe single-stream degradation, evaluation should report contention sweeps, deadline-miss rates on both paths, and worst-stream sAP alongside mean sAP.
- Abstract(参考訳): マルチカメラストリーミングの認識は、コレジデントワークロードと共有される異種エッジプラットフォームにますます展開されているが、アクセラレーションの配置は独立した単一ストリーム実験と平均ストリーミング平均精度(sAP)を用いて評価されることが多い。
1つのGPU-NPUプラットフォーム上で2つのエンドツーエンドパイプラインを使用することで、分離された評価がデプロイメント時の配置を誤解する可能性があることを示す。
GPUパイプラインは分離して好まれるが、GPUローカライズされた競合は、検出が不安定になり、完全なGPU飽和前に好みの配置を反転できる期限ミスを導入する。
NPUパイプラインは、分離された中小オブジェクト上のGPUパイプラインよりも正確ではないが、大きなオブジェクトとほぼ一致している。
遅延と競合実験における最大の絶対的なsAP損失は、大きなオブジェクトに対して発生します。
4ストリームの実験では、どのパスが古いかに依存し、GPU側の競合が増加することで、All-GPUからAll-NPUに最適な配置がシフトする。
GPU飽和ビジョン-言語共テナントの下で、All-NPUは、All-GPUの最悪のストリーム sAPに対して5.2\times$を達成している。
なぜなら、sAP は深刻な単一ストリームの劣化を隠蔽できるため、評価は、平均 sAP とともに競合スイープ、両パスのデッドラインミス率、最悪のストリーム sAP を報告すべきである。
関連論文リスト
- Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment [8.758783768535805]
VLA(Vision-Language-Action)モデルは、一般的なロボット制御に期待できるが、ロボット上での展開は、コストとエネルギー予算の厳しいリアルタイム推論によってボトルネックとなる。
本稿では,モデル・ハードウエアのコキャラクタリゼーションによる低コストVLAデプロイメントの系統的解析を行う。
論文 参考訳(メタデータ) (2026-04-27T13:12:16Z) - End-to-end RL Improves Dexterous Grasping Policies [64.8476328230578]
本研究は,画像に基づくエンドツーエンド学習のスケールアップ手法について,腕+手システムによる器用な把握について検討する。
我々は、深度と状態に基づく政策の両方をステレオRGBネットワークに訓練・蒸留し、深度蒸留がシミュレーションと現実の両方においてより良い結果をもたらすことを示す。
論文 参考訳(メタデータ) (2025-09-19T21:21:29Z) - Minute-Long Videos with Dual Parallelisms [57.22737565366549]
Diffusion Transformer (DiT)ベースのビデオ拡散モデルは、大規模に高品質なビデオを生成するが、長いビデオの処理遅延とメモリコストは禁じられている。
我々はDualParalと呼ばれる新しい分散推論戦略を提案する。
1つのGPUでビデオ全体を生成する代わりに、時間フレームとモデルレイヤの両方をGPU間で並列化します。
論文 参考訳(メタデータ) (2025-05-27T11:55:22Z) - Characterization of GPU TEE Overheads in Distributed Data Parallel ML Training [7.236249885667945]
信頼できるコンピューティング(CC)または信頼できる実行エンクレーブ(TEE)は、クラウドでセキュアなコンピューティングを実現するための最も一般的なアプローチである。
NVIDIAによるGPU TEEの導入により、モデルウェイトやデータをクラウドプロバイダにリークすることなく、マシンラーニング(ML)モデルをトレーニングすることが可能になった。
本稿では,GPU TEEを用いた分散データ並列(DDP)MLトレーニングの実行に伴う性能オーバーヘッドについて,詳細な解析を行った。
論文 参考訳(メタデータ) (2025-01-20T22:23:50Z) - Adaptive Elastic Training for Sparse Deep Learning on Heterogeneous
Multi-GPU Servers [65.60007071024629]
本稿では,Adaptive SGDが4つの最先端ソリューションよりも精度が高いことを示す。
本稿では,Adaptive SGDが時間と精度で4つの最先端ソリューションより優れていることを示す。
論文 参考訳(メタデータ) (2021-10-13T20:58:15Z) - Data-Efficient Instance Segmentation with a Single GPU [88.31338435907304]
我々は2021年のVIPriors Instance Challengeで使用したデータ効率のセグメンテーション手法を紹介した。
私たちのソリューションは、強力なツールボックスであるmmdetectionをベースにした、Swin Transformerの修正版です。
本手法は,全競技者の2位である0.592のAP@0.50:0.95(medium)を達成した。
論文 参考訳(メタデータ) (2021-10-01T07:36:20Z) - Faster than FAST: GPU-Accelerated Frontend for High-Speed VIO [46.20949184826173]
この研究は、既存のコンピュータビジョンアルゴリズムを改善するために、効率的な低レベルGPUハードウェア固有の命令の適用性に焦点を当てている。
特に、非マックス抑圧とその後の特徴選択は、全体的な画像処理遅延への顕著な寄与である。
論文 参考訳(メタデータ) (2020-03-30T14:16:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。