論文の概要: When Faster VLA Deployment Changes Closed-Loop Behavior: Task Success-Latency Analysis of SmolVLA Across PyTorch and ONNX Variants
- arxiv url: http://arxiv.org/abs/2609.14146v2
- Date: Wed, 16 Sep 2026 19:41:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.399482
- Title: When Faster VLA Deployment Changes Closed-Loop Behavior: Task Success-Latency Analysis of SmolVLA Across PyTorch and ONNX Variants
- Title(参考訳): 高速VLA配置変更時の閉ループ動作:PyTorchとONNX変数間のSmolVLAのタスク成功遅延解析
- Abstract要約: VLA(Vision-inspect-action)デプロイメントは、クローズドループタスクの振る舞いを変更しながら、推論レイテンシを低減することができる。
We evaluate HuggingFaceVLA/smolvla_libero on a 2060 (6 GB)
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) deployment can reduce inference latency while changing closed-loop task behavior. We evaluate HuggingFaceVLA/smolvla_libero on an RTX 2060 (6 GB) in LIBERO Spatial and Object (MuJoCo 3.3.2, LeRobot 0.6.1, seed 42), comparing PyTorch+AMP with ONNX Runtime CUDA Execution Provider (CUDA EP). The main evaluation uses 100 episodes/suite; a paired rollout uses 300 episodes/suite. PyTorch+AMP reaches 70.0%/88.0% Spatial/Object success at 1181 ms p99. Requested-FP16 and requested-INT8 ONNX reduce tether-inspect p99 to 601 ms and 532 ms, while Spatial success falls to 41.0% and 40.0% and Object remains at 89.0%. A graph audit shows those artifacts are byte-identical FP32 graphs, so the requested-INT8 row is not operator-level INT8 quantization. A static language-width ablation (16/24/32 tokens) yields Spatial success of 41.0%, 75.0%, and 71.0%; widths 24 and 32 recover much of the Spatial drop while Object success and uniform-bench latency stay approximately stable. Width-24 ONNX Spatial success is comparable to the PyTorch+AMP baseline at roughly half the latency (Wilson intervals overlap; two-proportion chi-squared p=0.53). Context width is an important contributor in this stack; it does not account for every PyTorch-vs-ONNX difference. Deployment evaluation should jointly report latency, artifact inspection, interface constraints, and closed-loop success. Code: https://github.com/rafiqul713/smolvla-libero-onnx.
- Abstract(参考訳): 視覚言語アクション(VLA)デプロイメントは、クローズドループタスクの振る舞いを変更しながら、推論レイテンシを低減することができる。
We evaluate HuggingFaceVLA/smolvla_libero on a RTX 2060 (6 GB) in LIBERO Spatial and Object (MuJoCo 3.3.2, LeRobot 0.6.1, seed 42), compared PyTorch+AMP with ONNX Runtime CUDA Execution Provider (CUDA EP)。
主な評価は100話/スーツ、対のロールアウトは300話/スーツである。
PyTorch+AMPは、1181 ms p99で70.0%/88.0%の空間的/物体的成功に達した。
リクエスト-FP16と要求-INT8 ONNXは、テザインスペクションのp99を601msと532msに減らし、空間的成功は41.0%と40.0%となり、オブジェクトは89.0%である。
グラフ監査は、これらのアーティファクトがバイト単位のFP32グラフであることを示しているので、要求されたINT8行は演算子レベルINT8量子化ではない。
静的言語幅のアブレーション(16/24/32トークン)は、41.0%, 75.0%, 71.0%の空間的成功をもたらす。
Width-24 ONNX 空間的成功は PyTorch+AMP ベースラインとほぼ半分のレイテンシで同等である(ウィルソン区間は重なり合う; 2-proportion chi-squared p=0.53)。
コンテキスト幅は、このスタックの重要なコントリビュータであり、PyTorch-vs-ONNXの差をすべて考慮していない。
デプロイ評価は、レイテンシ、アーティファクトインスペクション、インターフェースの制約、クローズドループの成功を共同で報告する必要がある。
コード:https://github.com/rafiqul713/smolvla-libero-onnx。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - RedKnot-MLA: Multi-Head Offline-Online Reuse for DeepSeek-V4 Long-Context Serving [30.406836978404403]
マルチヘッド潜時注意(MLA)は、複数の論理的クエリヘッドを1つの満載の潜時KVストリームを通じて公開する。
我々はRedKnotのヘッドアウェア再利用原理をDeepSeek-V4で実現したシステムを提案する。
論文 参考訳(メタデータ) (2026-09-07T03:59:33Z) - UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations [68.29650478987561]
UI-Mateは、環境に根ざしたトレーニングスタックとコンテキスト内の実演学習を統合する基盤GUIエージェントである。
OSWorldでは77.0%、WindowsAgentArenaでは66.2%と評価された。
論文 参考訳(メタデータ) (2026-08-16T20:59:59Z) - The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context [45.88028371034407]
コード修復における制御ケーススタディを報告し,新しい現象ではない。
私たちは、同じスタック上の1つのフラグ(1チャンク毎の重複)を切り替えます。
BM25(3.2pp、重要なパラダイム間相互作用)を逆転させる。
厳格な固定予算では、ファイルごとのハードダイドプリケートや、タスクに対するA/Bパッケージングポリシは、メトリックフラグを調整しないことが示されます。
論文 参考訳(メタデータ) (2026-08-14T19:22:50Z) - Dual-Node NVIDIA DGX Spark over Tailscale: A Remote-Access Testbed for Distributed LLM Training and Cyber-Threat-Intelligence Fine-Tuning [0.0]
本報告では,2つのNVIDIA DGX Sparkシステムを対象とした分散NanoChatプリトレーニングのコンセプト実証について述べる。
このクラスタは400レベルのAIコース(CS 426)とCBS 255のSecurity+ POGILアクティビティ用のクエリエンジンをサポートする。
論文 参考訳(メタデータ) (2026-08-07T13:41:57Z) - Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson [35.18016233072556]
NVIDIA Jetson Orin Nano Super (8GB) で完全に動作する2次元SO-101システムを提案する。
我々は、NVMMバッファによってバックアップされたGStreamerキャプチャパイプラインを構築し、3つのカメラセンシングから冗長なホストデバイスコピーを取り除く。
我々は、ACTと拡散政策を同一のデモンストレーションで訓練し、それぞれが独自の基準予算で実施する。
論文 参考訳(メタデータ) (2026-08-04T17:09:41Z) - AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents [83.37969790806069]
LLMエージェントのエラーは、エラーが表面化するステップが原因ではないことが多いため、デバッグが難しい。
Agent DebuggerXはオープンソースのフレームワークで、デバッグをDe Detect, Attribute, Recover, Rerunのクローズドループとして整理する。
コアとなるDeep Debuggerは、グローバルな軌跡理解を通じてマルチターン根本原因診断を行う。
論文 参考訳(メタデータ) (2026-07-21T06:21:13Z) - LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation [53.88286427894783]
視覚言語モデル(VLM)は、ロボット分野において、言語コンテキストによる環境認識を可能にする強力なツールとして登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
本稿では,大規模フロンティアモデルからの複雑な空間意味推論を,組み込みGPUデバイス上でエッジ実行を行うための軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T09:11:59Z) - Structural Grid Descriptors Predict Within-Task Solver Success on ARC-AGI [0.0]
中間格子状態の構造的性質が、条件付き相互情報I(X;Ytask) > 0 の試験として、シンボルARC-AGIソルバが成功するかどうかを予測できるかどうかを問う。
44,800回にわたって、アーキテクチャ的に異なる2つのサーチとDFSソルバにまたがって実行されており、ほとんどのコンテンツは単一のグリッド-複雑軸に沿って配置されている。
信号はソルバ容量(ビームサーチとSDFS、p 95の残差AUC=0.927と0.896)で説明されず、軌道を測るために弱結合されているだけである(R2は約0)。
論文 参考訳(メタデータ) (2026-06-08T04:51:24Z) - CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models [7.489020109808801]
われわれは,クロスパラダイム・ビジョン・ランゲージ・アクション(VLA)のポストトレーニングに関する実証的研究であるCrossVLAを報告する。
i) 確率フローODE統合なしでDPOを連続動作バックボーンで操作できる代理フローマッチングログ確率推定器、(ii) VLA DPOのパラメータ係数層としてのLoRAとDoRAの頭と頭の比較、(iii) ノイズループを示す推論時間解剖学は、サンプル_actions遅延の78.6%、プレフィックス-K/Vキャッシングのラを支配している。
論文 参考訳(メタデータ) (2026-05-21T01:02:41Z) - Measuring Maximum Activations in Open Large Language Models [60.3514350516308]
集中度, MoE, 視覚言語, 中間訓練, 命令調整型変異にまたがる8つのオープンファミリーから27個のチェックポイントで, グローバルおよび階層的に最大値を測定した。
最大アクティベーションサイズは、単純なサイズの副産物ではなく、ファミリー、アーキテクチャ、トレーニングステージに結びついているモデル特性である、と結論付けます。
論文 参考訳(メタデータ) (2026-05-15T03:31:51Z) - WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation [88.10947115397971]
この研究でWildClawBenchは、6つのテーマのカテゴリにまたがる60の人間によるバイリンガルなマルチモーダルタスクのネイティブランタイムベンチマークである。
各タスクは、約8分間のウォールクロック時間と20以上のツールコールで実行されます。
グラディングはハイブリッドであり、決定論的ルールベースのチェック、副作用の環境状態監査、意味的検証のためのLLM/VLM判定を組み合わせている。
論文 参考訳(メタデータ) (2026-05-11T17:49:43Z) - Visual Implicit Autoregressive Modeling [42.343328817507505]
我々は、浅いプレ/ポストブロック間に暗黙の平衡層を埋め込んだ次世代の自己回帰生成器であるVisual Implicit Autoregressive Modeling (VIAR)を紹介する。
VIARはImageNet 256x256ベンチマークでFID 2.16とsFID 8.07を達成した。
スケール毎のノブを制御することで、VIARはピークメモリを19.24GBから8.53GBに削減し、スループットを2倍にする。
論文 参考訳(メタデータ) (2026-05-02T03:23:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。