論文の概要: StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design
- arxiv url: http://arxiv.org/abs/2607.22708v1
- Date: Mon, 20 Jul 2026 14:14:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.834701
- Title: StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design
- Title(参考訳): StepX-Edge: アーキテクチャとデプロイメントの共設計によるデバイス上でのUIビジョンランゲージモデル
- Authors: Yin Wang, Haotian Hu, Jineng Han, Wentao Qiu, Zhenhua Ge, Liujian Tang, Fanyi Wang,
- Abstract要約: StepX-Edgeは、デバイス上のUIビジョン言語モデルで、コグニティブな3つのアーキテクチャ、トレーニング、デプロイメントを通じて緊張を解消します。
トレーニングには,UIサブタスク間の相互動作効果の観察を中心に,5段階のStepX-Curriculumフレームワークを設計する。
デプロイでは、モジュール単位で異なる2段階のPTQ-to-QAT量子化方式により、後量子化精度の損失を1%に抑える。
- 参考スコア(独自算出の注目度): 8.502778898017556
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying a vision-language model with full UI understanding on end devices has long been trapped between accuracy and efficiency: on one side is the accuracy bar for OCR, screen understanding, visual question answering, and element grounding; on the other is the strict compute, memory, and power budget of mobile chips. Existing work either trades one for the other, or stops at simulation without real-device validation. We present StepX-Edge, a 0.9B-parameter on-device UI vision-language model that resolves this tension through three-layer co-design of architecture, training, and deployment. Architecturally, UI-aware Layered Visual Encoding (ULVE) and a Progressive Dimensionality Projection (PDP) connector target the extreme aspect ratios and fine-grained perception of screens, while standard full attention throughout ensures native compatibility with mainstream mobile NPU operators. For training, the five-stage StepX-Curriculum framework is designed around our observation of mutual-promotion effects among UI subtasks, so that all four capabilities grow synergistically under a tight parameter budget rather than interfering. For deployment, a module-wise differentiated two-stage PTQ-to-QAT quantization scheme keeps the post-quantization accuracy loss within 1%. StepX-Edge achieves the strongest overall UI understanding among <=1B models, surpassing all 2B-2.3B baselines on ScreenQA (88.76 F1) and Chinese OCRBench v2 (57.25), and matching 1.3B-2.3B general VLMs on RefCOCO (92.0%) and OCRBench v1 (831) with far fewer parameters. After W4A16+KV8 quantization, the model runs stably on Snapdragon 8 Gen5 devices with ~0.84 s TTFT, 98 tok/s decode, and 1.4 GB peak memory. We will open-source the training data, the full training recipe, and the quantization deployment pipeline.
- Abstract(参考訳): エンドデバイスにUIを完全に理解したビジョン言語モデルをデプロイすることは、OCRの正確性バー、画面理解、視覚的質問応答、要素接地など、正確性と効率の両面で長い間抑制されてきた。
既存の作業は、一方を他方と交換するか、あるいは実際のデバイス検証なしでシミュレーションを停止する。
アーキテクチャ、トレーニング、デプロイメントの3層共同設計を通じて、この緊張を解消する、0.9BパラメータオンデバイスUIビジョン言語モデルであるStepX-Edgeを紹介します。
アーキテクチャ上、UI対応のレイヤド・ビジュアル・エンコーディング(ULVE)とプログレッシブ・ディメンダリティ・プロジェクション(PDP)コネクタは、画面の極端なアスペクト比ときめ細かい認識をターゲットとしている。
トレーニングのために,5段階のStepX-Curriculumフレームワークは,UIサブタスク間の相互プロモーション効果の観測を中心に設計されている。
デプロイでは、モジュール単位で異なる2段階のPTQ-to-QAT量子化方式により、後量子化精度の損失を1%に抑える。
StepX-Edgeは、ScreenQA (88.76 F1) と中国のOCRBench v2 (57.25) の2B-2.3Bベースラインを全て上回り、RefCOCO (92.0%) とOCRBench v1 (831) の1.3B-2.3B一般的なVLMと一致する。
W4A16+KV8量子化後、モデルは ~0.84 s TTFT、98 tok/s デコード、1.4 GB のピークメモリを備えた Snapdragon 8 Gen5 デバイスで安定して動作する。
トレーニングデータ、完全なトレーニングレシピ、量子化デプロイメントパイプラインをオープンソースにします。
関連論文リスト
- Joint Architecture-Token-Bitwidth Multi-Axis Optimization of Vision Transformers for Semiconductor IC Packaging [32.78037242946664]
視覚変換器(ViT)は、視覚認識において高い性能を達成しているが、資源に制約のある産業環境への展開は依然として限られている。
アーキテクチャ,トークン,ビット幅の3つの相補的軸を共同で最適化する,最初の包括的フレームワークの1つを提示する。
具体的には、Neural Architecture Search(AutoFormer)を介してコンパクトなバックボーンを特定し、トークンマージ(ToMe)による情報処理を削減し、fp16混合精度推論による操作間実行を高速化する。
論文 参考訳(メタデータ) (2026-05-03T06:45:24Z) - Scalable Training of Mixture-of-Experts Models with Megatron Core [26.9162079065285]
MOE(Scaling Mixture-of-Experts)トレーニングでは、密集したモデルに欠けているシステムの課題が導入されている。
各トークンは専門家のサブセットのみを活性化するため、このスパーシリティにより、トータルパラメータはトーケン計算よりもはるかに高速に成長できる。
メモリ(微細な再計算,オフロード,通信,計算)の統合最適化により,MoEトレーニングにおけるこれらの課題に対処する。
論文 参考訳(メタデータ) (2026-03-08T15:42:43Z) - Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device LLMs [49.99513618431772]
本稿では,モデル精度と推論性能を捉えるハードウェア共同設計法を提案する。
我々はNVIDIA Jetson Orin上で1,942の候補アーキテクチャを実証的に評価した。
我々のアーキテクチャはWikiText-2で19.42%低いパープレキシティを実現している。
論文 参考訳(メタデータ) (2026-02-10T23:51:00Z) - STEP3-VL-10B Technical Report [115.89015065130127]
STEP3-VL-10Bは、コンパクト効率とフロンティアレベルのマルチモーダルインテリジェンスとのトレードオフを再定義する軽量基盤モデルである。
そこで我々はPallel Coordinated Reasoning(PaCoRe)を実装して,テスト時間計算をスケールし,リソースをスケーラブルな知覚推論に割り当てる。
MMBenchでは92.2%、MMMUでは80.11%、AIME2025では94.43%、MathVisionでは75.95%である。
論文 参考訳(メタデータ) (2026-01-14T17:58:24Z) - Lightweight Transformer Architectures for Edge Devices in Real-Time Applications [0.0]
本調査では,エッジデプロイメント用に設計された軽量トランスフォーマーアーキテクチャについて検討する。
我々は、MobileBERT、TinyBERT、DistilBERT、EfficientFormer、EdgeFormer、MobileViTなど、注目すべき軽量版を体系的にレビューした。
実験により, モデルサイズを4~10倍, 推論遅延を3~9倍削減し, モデル精度を75~96%向上できることを確認した。
論文 参考訳(メタデータ) (2026-01-05T01:04:25Z) - EVCC: Enhanced Vision Transformer-ConvNeXt-CoAtNet Fusion for Classification [0.5394291557377919]
トランスフォーマーとCNNを組み合わせたハイブリッド視覚アーキテクチャは画像分類が大幅に進歩しているが、通常は計算コストがかなり高い。
本稿では、Vision Transformer、軽量ConvNeXt、CoAtNetを統合した新しいマルチブランチアーキテクチャであるEVCCを紹介する。
CIFAR-100、Tobacco3482、CelebA、Brain Cancerデータセットにわたる実験は、EVCCが強力なモデルよりも優れていることを示している。
論文 参考訳(メタデータ) (2025-11-24T02:11:19Z) - Edge-MoE: Memory-Efficient Multi-Task Vision Transformer Architecture
with Task-level Sparsity via Mixture-of-Experts [60.1586169973792]
M$3$ViTは、Mix-of-experts (MoE)を導入した最新のマルチタスクViTモデルである。
MoEは精度の向上と80%以上の削減計算を実現しているが、FPGAに効率的なデプロイを行う上での課題は残されている。
Edge-MoEと呼ばれる私たちの研究は、アーキテクチャの革新の集合を伴って、マルチタスクのViTのための最初のエンドツーエンドFPGAアクセラレータを導入するという課題を解決します。
論文 参考訳(メタデータ) (2023-05-30T02:24:03Z) - EdgeNeXt: Efficiently Amalgamated CNN-Transformer Architecture for
Mobile Vision Applications [68.35683849098105]
入力テンソルを複数のチャネルグループに分割するSDTAエンコーダを導入する。
1.3Mパラメータを持つEdgeNeXtモデルでは、ImageNet-1Kで71.2%のTop-1精度を実現している。
パラメータ5.6MのEdgeNeXtモデルでは、ImageNet-1Kで79.4%のTop-1精度を実現しています。
論文 参考訳(メタデータ) (2022-06-21T17:59:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。