論文の概要: WAMJET: A Harness for World Action Model Acceleration
- arxiv url: http://arxiv.org/abs/2610.03797v1
- Date: Thu, 01 Oct 2026 04:26:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.277592
- Title: WAMJET: A Harness for World Action Model Acceleration
- Title(参考訳): WAMJET:世界行動モデル加速のためのハーネス
- Abstract要約: World Action Models (WAM) は、ロボット操作に事前訓練されたビデオ基盤モデルを活用するが、その大きなバックボーンとビデオアクションの共予測は高価である。
本稿では,WAM推論を高速化するエージェントハーネスであるWAMJETを提案する。
- 参考スコア(独自算出の注目度): 46.1179527452706
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World Action Models (WAMs) leverage pretrained video foundation models for robot manipulation, but their large backbones and video-action co-prediction are expensive. Although existing acceleration techniques offer many ways to reduce this cost, selecting and composing them requires substantial engineering for each model and hardware platform. To tackle this bottleneck, we present WAMJET, an agentic harness that accelerates WAM inference by equipping coding agents with reusable optimization guidance and measurement and validation tools. WAMJET follows a bottleneck-driven workflow where the agent profiles inference, modifies targeted code, validates effects, and iteratively refines the acceleration stack as bottlenecks shift, while preserving action quality. Experiments span six WAMs, three coding agents, and two GPU architectures. WAMJET achieves up to 9.95x lossless speedup over upstream implementations. Approximation and hardware-aware optimization yield additional latency reductions, with comparable success rates. The results show that WAMJET can produce effective acceleration stacks for WAM deployment.
- Abstract(参考訳): World Action Models (WAM) は、ロボット操作に事前訓練されたビデオ基盤モデルを活用するが、その大きなバックボーンとビデオアクションの共予測は高価である。
既存のアクセラレーション技術はこのコストを削減する多くの方法を提供しているが、モデルとハードウェアプラットフォームごとに大きなエンジニアリングを必要とする。
このボトルネックに対処するために、再利用可能な最適化ガイダンスと測定および検証ツールを備えた符号化エージェントを組み込むことにより、WAM推論を高速化するエージェントハーネスであるWAMJETを提案する。
WAMJETはボトルネック駆動のワークフローに従い、エージェントが推論をプロファイルし、ターゲットコードを変更し、効果を検証し、ボトルネックシフトとしてアクセラレーションスタックを反復的に洗練し、アクション品質を保存する。
実験は6つのWAM、3つのコーディングエージェント、2つのGPUアーキテクチャにまたがる。
WAMJETはアップストリーム実装で最大9.95倍のロスレススピードアップを実現している。
近似とハードウェア対応の最適化は、同等の成功率で、さらなるレイテンシ削減をもたらす。
その結果, WAMJET は WAM デプロイメントに有効な加速スタックを生成できることが示唆された。
関連論文リスト
- A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference [16.66163943624991]
VLA(Vision-Language-Action)モデルは、AIを具現化するための強力な可能性を示しているが、GPU上の高い推論レイテンシは、リアルタイムデプロイメントを制限する。
本稿では,VQVLAを提案する。VQVLAは,重みの類似性や実行のダイナミクスを利用して,VLA推論を高速化するアルゴリズムハードウェアの共同設計フレームワークである。
VQVLAはA100 GPU, Dadu-Corki, LUT-DLA, CodeGEMM, ShiftAddLLMでそれぞれ6.5x, 2.8x, 1.9x, 3.3x, 4.3xのスピードアップを実現している。
論文 参考訳(メタデータ) (2026-07-27T08:29:05Z) - Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation [50.504140880964336]
本稿では,ビデオ拡散モデルのためのエージェント型,ネイティブな,トレーニング不要なアクセラレーションフレームワークであるSol Video Inferenceを紹介する。
キャッシュ、スパースアテンション、トークンプルーニング、量子化、カーネル融合の5つの広く適用可能なテクニックをエージェントアクセラレーションスタックにまとめる。
ほぼロスレスなVBench品質を維持しながら、エンドツーエンドのアクセラレーションを2倍以上に向上させる。
論文 参考訳(メタデータ) (2026-06-21T17:23:20Z) - Accelerating Vision-Language-Action Model Integrated with Action Chunking via Parallel Decoding [24.1236728596359]
VLA(Vision-Language-Action)モデルでは、一般化可能なロボット操作の可能性を示している。
本稿では,アクションチャンキングと統合されたVLAモデルのための最初の並列デコーディングフレームワークであるPD-VLAを提案する。
本フレームワークは,並列な固定点反復によって解く非線形システムとして自己回帰復号を再構成する。
論文 参考訳(メタデータ) (2025-03-04T06:12:08Z) - Data-Model-Circuit Tri-Design for Ultra-Light Video Intelligence on Edge
Devices [90.30316433184414]
本稿では,HDビデオストリーム上での高スループット,低コスト,高精度MOTのためのデータモデル・ハードウエア・トリデザイン・フレームワークを提案する。
現状のMOTベースラインと比較して、我々の三設計アプローチは12.5倍の遅延低減、20.9倍のフレームレート改善、5.83倍の低消費電力、9.78倍のエネルギー効率を実現でき、精度は低下しない。
論文 参考訳(メタデータ) (2022-10-16T16:21:40Z) - An Algorithm-Hardware Co-Optimized Framework for Accelerating N:M Sparse
Transformers [11.811907838840712]
一般のN:M空間パターンを利用して, フレキシブルかつ効率的にトランスフォーマーを高速化するアルゴリズム・ハードウェア協調最適化フレームワークを提案する。
我々は、N:Mスパーストランスをデプロイする際の大幅な高速化を実現するために、フレキシブルで効率的なハードウェアアーキテクチャ、すなわちSTAを提案する。
実験の結果, 他の方法と比較して, IDPを用いて生成したN:Mスパース変圧器は, トレーニング効率の高い精度で平均6.7%向上することがわかった。
論文 参考訳(メタデータ) (2022-08-12T04:51:49Z) - StreamYOLO: Real-time Object Detection for Streaming Perception [84.2559631820007]
将来を予測する能力を備えたモデルを提供し、ストリーミング知覚の結果を大幅に改善する。
本稿では,複数の速度を駆動するシーンについて考察し,VasAP(Velocity-Awared streaming AP)を提案する。
本手法は,Argoverse-HDデータセットの最先端性能を実現し,SAPとVsAPをそれぞれ4.7%,VsAPを8.2%改善する。
論文 参考訳(メタデータ) (2022-07-21T12:03:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。