論文の概要: Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson
- arxiv url: http://arxiv.org/abs/2608.03938v1
- Date: Tue, 04 Aug 2026 17:09:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 07:04:20.735804
- Title: Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson
- Title(参考訳): 8GBの予算内でのバイマニピュレーション:ゼロコピーセンシングとエントリレベルジェットの量子化ACT
- Authors: Ekansh Singh, Eva Samuel, Alessandra Reneau, Ryan Schmeelk, Yashvi Gandhi,
- Abstract要約: NVIDIA Jetson Orin Nano Super (8GB) で完全に動作する2次元SO-101システムを提案する。
我々は、NVMMバッファによってバックアップされたGStreamerキャプチャパイプラインを構築し、3つのカメラセンシングから冗長なホストデバイスコピーを取り除く。
我々は、ACTと拡散政策を同一のデモンストレーションで訓練し、それぞれが独自の基準予算で実施する。
- 参考スコア(独自算出の注目度): 35.18016233072556
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Bimanual manipulation policies trained with imitation learning are typically evaluated on workstation or datacenter-class GPUs, leaving the cost of deploying them on embedded hardware largely uncharacterized. We present a bimanual SO-101 system running entirely on an NVIDIA Jetson Orin Nano Super (8 GB), the entry-level tier of NVIDIA's embedded line, using a desktop GPU (RTX 3070) only for offline training, evaluated on pick-and-place of a deformable beanbag. First, we build a GStreamer capture pipeline backed by NVMM buffers that removes redundant host-device copies from three-camera sensing. Contrary to expectation, the conventional path fit the memory budget and dropped no frames; what zero-copy sensing recovers is CPU headroom (peak single-core utilization 98.0% to 77.0%) and worst-case latency (117.31 ms to 101.52 ms). Second, we train ACT and Diffusion Policy on identical demonstrations, each at its own reference budget (100k gradient steps for ACT, 200k for Diffusion Policy). ACT converges to a task-competent policy (19/20 trials) while Diffusion Policy does not converge to a usable one (0/10) even at twice the step count, which we attribute to differing convergence costs rather than an accuracy ceiling. Third, we convert ACT to TensorRT. FP16 reduces mean inference latency from 114.02 ms to 17.93 ms (6.4x) and INT8 to 12.65 ms (9.0x), with task success preserved at all three precisions (19/20, 18/20, 19/20). We report two findings not previously documented for ACT: TensorRT's general-purpose INT8 calibration quantizes the ResNet18 backbone but accepts zero of 145 transformer layers, explaining INT8's negligible size reduction over FP16 (0.9%) despite a further 28% latency gain; and the need for quantization is conditional on ACT's action-chunking configuration, feasible in full precision at n_action_steps = 100 but not at the per-step re-prediction temporal ensembling requires.
- Abstract(参考訳): 模倣学習でトレーニングされた双方向操作ポリシは、通常、ワークステーションやデータセンタクラスのGPUで評価される。
本稿では、NVIDIAの組み込みラインのエントリーレベル層であるNVIDIA Jetson Orin Nano Super (8GB) で完全に動作する双方向SO-101システムについて、変形可能なビーンバッグのピック・アンド・プレースで評価した、オフライントレーニングのみにデスクトップGPU(RTX 3070)を使用する。
まず、NVMMバッファでバックアップされたGStreamerキャプチャパイプラインを構築し、3つのカメラセンシングから冗長なホストデバイスコピーを取り除く。
期待に反して、従来のパスはメモリ予算に適合し、フレームを落とさず、ゼロコピーによるリカバリはCPUヘッドルーム(シングルコア使用率98.0%から77.0%)と最悪の待ち時間(117.31msから101.52ms)である。
第2に、ACTと拡散政策を同一の実証で訓練し、それぞれ独自の基準予算(ACTが100k、拡散政策が200k)で実施する。
ACTはタスク・コンピテント・ポリシー(19/20の試行)に収束するが、拡散政策は2倍のステップ数でも使用可能なポリシー(0/10)に収束しない。
第3に、ACTをTensorRTに変換する。
FP16は平均推論遅延を114.02msから17.93ms (6.4x)、INT8を12.65ms (9.0x)に減らし、タスク成功は3つの精度(19/20、18/20、19/20)で維持される。
TensorRTの汎用INT8キャリブレーションはResNet18のバックボーンを量子化するが、さらに28%のレイテンシ向上にもかかわらず、INT8の無視可能なサイズ削減をFP16(0.9%)に説明し、145のトランスフォーマー層をゼロにする。
関連論文リスト
- Lightweight Transformer Models for On-Device Fault Detection: A Benchmark Study on Resource-Constrained Deployment [0.0]
オンデバイス障害検出により、クラウド依存のないリアルタイム診断が可能になるが、リソース制約のあるハードウェアに機械学習モデルをデプロイするには、正確性、レイテンシ、モデルサイズ間の慎重にトレードオフが必要である。
本稿では,従来のML手法と,バイナリ故障検出のための軽量トランスフォーマーアーキテクチャを比較したベンチマークを提案する。
その結果, センサデータから, 軽量トランスフォーマーは従来のMLと87.8%のF1で一致したが, モデルサイズは100倍, レイテンシは9000倍であった。
論文 参考訳(メタデータ) (2026-06-23T05:54:33Z) - Holding the FP8 Quality Ceiling at 8-Bit Weights and Activations: INT8 and GGUF Post-Training Quantization of Ideogram 4.0 for Consumer GPUs [0.08599681538174887]
9.3Bフローベース拡散変圧器(DiT)Ideogram 4.0の学習後量子化について検討する。
我々は、Ideogramの公開キャプション仕様に組み込んだ拡張器によって生成されたスキーマ値プロンプトに基づいて、すべての変種を評価する。
We release the INT8 W8A8 and GG Q4_K Quantized weights on Hugging under a gated, non-commercial license。
論文 参考訳(メタデータ) (2026-06-10T16:19:49Z) - ProbeLogits: Kernel-Level LLM Inference Primitives for AI-Native Operating Systems [0.0]
LLM推論を内部で実行するOSカーネルは、任意のテキストが生成される前にロジット分布を読み取ることができる。
本稿では,シングルフォワードパスを実行するカーネルレベルの操作であるProbeLogitsについて述べる。
論文 参考訳(メタデータ) (2026-04-13T18:32:02Z) - GPU-Accelerated Optimization of Transformer-Based Neural Networks for Real-Time Inference [0.0]
本稿では,混合精度最適化を用いたNVIDIARTを用いた変圧器モデルのためのGPU加速型推論パイプラインの設計と評価を行う。
このシステムはCPUベースラインの64.4倍のスピードアップ、シングルサンプル推論の10ms以下のレイテンシ、メモリ使用量の63%削減を実現している。
論文 参考訳(メタデータ) (2026-03-30T17:27:33Z) - Collapse or Preserve: Data-Dependent Temporal Aggregation for Spiking Neural Network Acceleration [1.1597621848542221]
スパイク空間は、GPUハードウェア上で効率的なスパイクニューラルネットワーク(SNN)推論を可能にすると広く信じられている。
SIMDアーキテクチャは2進スパイクの微細で非構造的な空間を利用できない。
本稿では、畳み込み線形性を利用して1回の畳み込みコールの前に$K$スパイクフレームをプリアグリゲートする時間的集約畳み込み(TAC)を提案する。
論文 参考訳(メタデータ) (2026-03-14T07:30:22Z) - Speeding Up MACE: Low-Precision Tricks for Equivarient Force Fields [51.95157731126864]
機械学習力場は高い計算コストで正確な分子動力学(MD)を提供することができる。
この論文は、計算ボトルネックを特定し、低精度の実行ポリシーを評価することで、MACEを安価かつ高速にすることを目的としている。
論文 参考訳(メタデータ) (2025-10-23T14:02:34Z) - Tracking Meets LoRA: Faster Training, Larger Model, Stronger Performance [87.19164603145056]
実験室レベルの資源をトラッキングするための大規模ViTモデルのパワーを明らかにする手法であるLoRATを提案する。
私たちの作業の本質は、推論レイテンシを追加することなく、モデルパラメータの小さなサブセットを微調整するテクニックであるLoRAを適用することです。
我々はPETRの適応のみに基づくアンカーフリーヘッドを設計し、計算オーバーヘッドを少なくして性能を向上する。
論文 参考訳(メタデータ) (2024-03-08T11:41:48Z) - Data-Free Dynamic Compression of CNNs for Tractable Efficiency [46.498278084317704]
構造化プルーニング手法は, 精度が大幅に低下することなく浮動小数点演算を低下させる可能性を示唆している。
HASTE(Hashing for Tractable Efficiency)は,データフリーでプラグイン・アンド・プレイのコンボリューションモジュールで,トレーニングや微調整なしにネットワークのテスト時間推論コストを瞬時に低減する。
CIFAR-10とImageNetでは46.72%のFLOPを1.25%の精度で削減した。
論文 参考訳(メタデータ) (2023-09-29T13:09:40Z) - I-BERT: Integer-only BERT Quantization [78.43819756382103]
トランスフォーマーモデルのための新しい量子化手法であるI-BERTを提案する。
I-BERTは浮動小数点演算なしでエンドツーエンドの整数のみのBERT推論を実行する。
いずれの場合も,I-BERTは全精度ベースラインと同等(かつ若干高い)精度が得られた。
論文 参考訳(メタデータ) (2021-01-05T02:42:58Z) - Efficient Integer-Arithmetic-Only Convolutional Neural Networks [87.01739569518513]
我々は従来のReLUを境界ReLUに置き換え、その減少は活性化量子化によるものであることを示す。
我々の整数ネットワークは、対応するFPNネットワークと同等の性能を発揮するが、メモリコストは1/4に過ぎず、最新のGPUでは2倍高速である。
論文 参考訳(メタデータ) (2020-06-21T08:23:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。