論文の概要: Large Models for Small Devices: Recent Advances and Empirical Analysis of Edge AI Deployment
- arxiv url: http://arxiv.org/abs/2608.15693v1
- Date: Sun, 16 Aug 2026 11:52:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.394063
- Title: Large Models for Small Devices: Recent Advances and Empirical Analysis of Edge AI Deployment
- Title(参考訳): 小型デバイスのための大規模モデル:エッジAI展開の最近の進歩と実証分析
- Abstract要約: リソース制約のあるエッジデバイス上で大規模なAIモデルを実行するには、モデルサイズと計算量を削減するためにモデル圧縮が必要である。
質問応答とイメージセグメンテーションにまたがって、GPU、CPU、Raspberry Piプラットフォームにコンパクトな言語とイメージモデルをデプロイします。
ニューラルネットワークグラフ解析とプリフィル・デコードレベルの遅延分解により,これらの効果を説明する。
- 参考スコア(独自算出の注目度): 4.582004238093247
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Running large AI models on resource-constrained edge devices requires model compression to reduce model size and computation. What compresses well, however, need not deploy well. We survey dozens of recent works that report compression results on real hardware and extract practical deployment guidelines from them. Following these guidelines, we deploy compact language and image models on GPU, CPU, and Raspberry Pi platforms across question answering and image segmentation. No single technique wins across tasks. For question answering, Qwen3.5 0.8B reaches 93.85 SQuAD F1 and 92 EM under Q5_K_M GGUF quantization, while structured pruning at the same precision costs 16 F1 at a 1% ratio. For segmentation, the ranking reverses: default quantization leaves parameters and MACs unchanged, whereas pruning cuts model size by nearly 80% at near-constant mIoU. Pruning can even inflate the deployed artifact by 21-49% by breaking k-quant super-block alignment; combined with longer, less format-compliant outputs, this raises Raspberry Pi latency up to 3.4x. Compression can also manufacture the appearance of competence rather than destroy it visibly: one LoRA-recovered variant stays fully parseable and holds 71% strict BoolQ accuracy while sending 97 of 100 predictions to a single class, at 52.6% balanced accuracy. We explain these effects through neural-flow graph analysis and prefill-decode-level latency decomposition, and condense them into task-specific deployment research directions. The right technique depends on the task, the model, and the hardware. Our experiment code and artifacts are open-sourced at https://github.com/Arnavvvkumar/deployment
- Abstract(参考訳): リソース制約のあるエッジデバイス上で大規模なAIモデルを実行するには、モデルサイズと計算量を削減するためにモデル圧縮が必要である。
しかし、よく圧縮されるものは、うまくデプロイする必要はない。
実際のハードウェア上での圧縮結果を報告し,実際のデプロイメントガイドラインを抽出する,最近の数十の作業について調査する。
これらのガイドラインに従って、質問応答とイメージセグメンテーションを越えて、GPU、CPU、Raspberry Piプラットフォームにコンパクト言語とイメージモデルをデプロイします。
タスクに1つのテクニックが勝つことはありません。
Qwen3.5 0.8BはQ5_K_M GGUF量子化の下で93.85 SQuAD F1および92 EMに達するが、同じ精度での構造化プルーニングは1%のコストで16 F1となる。
デフォルトの量子化ではパラメータとMACは変わらないが、プルーニングはmIoUに近い場所でモデルサイズを80%近く削減する。
プルーニングは、k-quantのスーパーブロックアライメントを壊すことで、デプロイされたアーティファクトを21-49%削減することも可能であり、より長く、フォーマットに準拠しない出力と組み合わせることで、Raspberry Piのレイテンシを3.4倍に向上させる。
1つのLoRAが回収した派生型は、完全に解析可能であり、71%の厳密なBoolQ精度を持ち、100の予測を52.6%の精度で1つのクラスに送信する。
ニューラルフローグラフ解析とプリフィル・デコードレベルの遅延分解を用いてこれらの効果を説明し、それらをタスク固有のデプロイメント研究の方向性に導出する。
正しいテクニックは、タスク、モデル、ハードウェアに依存します。
実験コードとアーティファクトはhttps://github.com/Arnavvkumar/deploymentでオープンソース化されています。
関連論文リスト
- SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference [6.978795233982147]
SPORKは推測されたツールコールを早期にディスパッチし、残りのチェーン・オブ・ソート・デコードでその実行を重複させる。
SPORKは、推測されたツールコールを早期にディスパッチする、トレーニング不要のコントローラである。
論文 参考訳(メタデータ) (2026-07-03T13:51:32Z) - 70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float [52.079202872069835]
大規模言語モデル(LLM)や拡散モデル(DM)といった大規模AIモデルは急速に成長している。
圧縮フレームワークであるDynamic-Length Float (DFloat11) を導入し, LLM と DM サイズを30%削減した。
論文 参考訳(メタデータ) (2025-04-15T22:38:38Z) - Activations and Gradients Compression for Model-Parallel Training [85.99744701008802]
モデル並列分散トレーニングセットアップにおけるアクティベーションと勾配の同時圧縮が収束に与える影響について検討する。
グラデーションはアクティベーションよりも軽度な圧縮速度を必要とする。
実験では、TopKでトレーニングされたモデルが、推論中に圧縮も適用された場合にのみ正常に動作することが示されている。
論文 参考訳(メタデータ) (2024-01-15T15:54:54Z) - FFSplit: Split Feed-Forward Network For Optimizing Accuracy-Efficiency
Trade-off in Language Model Inference [57.119047493787185]
本稿では、異なるハードウェア上で、モデルサイズを43.1%削減し、1.25sim1.56times$wall clock time speedupを無視できる精度低下で実現する方法を示す。
実際、本手法では、異なるハードウェア上で、モデルサイズを43.1%削減し、1.25sim1.56Times$wall clock time speedupを無視できる精度で実現している。
論文 参考訳(メタデータ) (2024-01-08T17:29:16Z) - QMoE: Practical Sub-1-Bit Compression of Trillion-Parameter Models [64.34635279436054]
Mixture-of-Experts (MoE)アーキテクチャは、スパースルーティングによる大規模言語モデル(LLM)の高推論コストに対する一般的な解決策を提供する。
本稿では,QMoEと呼ばれる新しい圧縮実行フレームワークの形で,このメモリ問題に対する解決策を提案する。
論文 参考訳(メタデータ) (2023-10-25T17:24:53Z) - Rotation Invariant Quantization for Model Compression [7.269081881533542]
トレーニング後のニューラルネットワーク(NN)モデル圧縮は、メモリリソースが限られているデバイスに大規模なメモリ消費モデルを展開するための魅力的なアプローチである。
NNモデル全体の量子化に単一パラメータを用いる回転不変量子化(RIQ)手法を提案する。
論文 参考訳(メタデータ) (2023-03-03T10:53:30Z) - CrAM: A Compression-Aware Minimizer [103.29159003723815]
本稿では、CrAMと呼ばれる新しい圧縮対応最小化器を提案し、最適化ステップを原則的に修正する。
CrAMは、標準のSGD/アダムベースベースラインよりも精度が高い密度のモデルを生成するが、重量計算では安定である。
CrAMは、転送学習のためにうまく機能するスパースモデルを生成することができ、GPUハードウェアでサポートされている半構造化の2:4プルーニングパターンでも機能する。
論文 参考訳(メタデータ) (2022-07-28T16:13:28Z) - LUT-GEMM: Quantized Matrix Multiplication based on LUTs for Efficient Inference in Large-Scale Generative Language Models [9.727062803700264]
量子化行列乗算のための効率的なカーネルであるLUT-GEMMを紹介する。
LUT-GEMMは資源集約化プロセスを取り除き、計算コストを削減する。
我々は,3ビット量子化を用いたOPT-175Bモデルに適用した場合,LUT-GEMMはトークン生成遅延を大幅に高速化することを示した。
論文 参考訳(メタデータ) (2022-06-20T03:48:17Z) - End-to-End Supermask Pruning: Learning to Prune Image Captioning Models [17.00974730372399]
80%から95%のスパースネットワークが、その密度の高いネットワークにマッチするか、より優れているかを示す。
Up-Down と Object Relation Transformer のコードと事前訓練されたモデルは、MS-COCO データセット上で CIDEr スコア >120 を達成することができる。
論文 参考訳(メタデータ) (2021-10-07T09:34:00Z) - An Information Theory-inspired Strategy for Automatic Network Pruning [97.03772272417599]
深層畳み込みニューラルネットワークは、リソース制約のあるデバイスで圧縮されることがよく知られている。
既存のネットワークプルーニング手法の多くは、人的努力と禁忌な計算資源を必要とする。
本稿では,自動モデル圧縮のための情報理論に基づく戦略を提案する。
論文 参考訳(メタデータ) (2021-08-19T07:03:22Z) - Training with Quantization Noise for Extreme Model Compression [57.51832088938618]
与えられたモデルサイズに対する精度を最大化しながら、コンパクトなモデルを作成するという問題に取り組む。
標準的な解決策は、トレーニング中に重みが定量化され、勾配がストレート・スルー推定器に近似される量子化意識訓練(Quantization Aware Training)でネットワークをトレーニングすることである。
本稿では, この手法を, 極端な圧縮法を用いて, int8 の固定点量子化を超えて機能するように拡張する。
論文 参考訳(メタデータ) (2020-04-15T20:10:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。