論文の概要: AIR-LLM: Broadcasting AI Weights over Radio for Memory-Free Edge LLM Inference via RF Computing
- arxiv url: http://arxiv.org/abs/2610.00465v1
- Date: Wed, 30 Sep 2026 18:00:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.67366
- Title: AIR-LLM: Broadcasting AI Weights over Radio for Memory-Free Edge LLM Inference via RF Computing
- Title(参考訳): AIR-LLM: RFコンピューティングによるメモリフリーエッジLLM推論のためのラジオ放送AIウェイト
- Abstract要約: 次世代の大規模言語モデル(LLM)は、クラウドからユビキタスエッジデバイスへと拡張されている。
しかし、エッジデバイスには、ますます大きなLLM重みを格納するメモリが欠けていることや、十分なメモリを持っていても、重みをロードするのに不十分なエネルギーを費やすことが典型的だ。
本稿では,無線放送にインスパイアされたエッジデバイスのためのLLM推論アーキテクチャであるAIR-LLMを提案する。
- 参考スコア(独自算出の注目度): 5.383374895767837
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Next-generation large language models (LLMs) are expanding from the cloud to ubiquitous edge devices. However, edge devices typically either lack the memory to store increasingly large LLM weights or, even with enough memory, spend unaffordable energy on loading the weights. This raises our question: can an edge device run an LLM without storing or loading its weights, but receive them over the air and consume them on the fly? Inspired by wireless broadcasting, we present AIR-LLM, an LLM inference architecture for edge devices, which is composed of: (i) a central radio (e.g., 5G base stations) that broadcasts the LLM weights into the air, and (ii) the edge user that receives the weights and completes the general matrix-vector multiplication (GEMV) of LLM inference directly in the radio frequency (RF) domain using RF mixers. To further shorten the airtime, AIR-LLM exploits MIMO spatial multiplexing and proposes an energy-efficient precoder-postcoder pair on the edge to calibrate its own wireless channel. Since the central radio stays user-unaware, AIR-LLM is user-scalable so that one broadcast serves unlimited users within its coverage. We implement AIR-LLM on the NVIDIA Sionna ray-traced channels of two real-world urban scenes and the profiling of a real RF mixer. With a WikiText-2 perplexity degradation of 4.0% on LLaMA-3.1-8B, AIR-LLM saves the energy by 157.7x/40.4x against the FP16 and weight-only quantization baselines; with 20 users, its airtime is 104.1x/26.0x shorter, respectively.
- Abstract(参考訳): 次世代の大規模言語モデル(LLM)は、クラウドからユビキタスエッジデバイスへと拡張されている。
しかしながら、エッジデバイスは、ますます大きなLLM重みを格納するメモリが不足しているか、あるいは十分なメモリを持っていても、重みをロードするのに不十分なエネルギーを消費する。
エッジデバイスは、重量を保存したりロードしたりせずにLCMを走らせることができるが、それを空中から受信して、それをリアルタイムで消費できるのか、という疑問が浮かび上がっている。
無線放送にインスパイアされたエッジデバイスのためのLLM推論アーキテクチャであるAIR-LLMについて述べる。
(i)LLM重量を空中に放送する中央ラジオ(eg,5G基地局)
二 RFミキサーを用いた無線周波数(RF)領域において、LLM推論の一般行列ベクトル乗算(GEMV)を受信し、完了するエッジユーザ。
時空をさらに短縮するために、AIR-LLMはMIMO空間多重化を利用して、エッジ上にエネルギー効率の良いプリコーダとポストコーダのペアを提案し、独自の無線チャネルを校正する。
中央無線局はユーザーを意識しないため、AIR-LLMはユーザースケーリング可能であり、1つの放送局がその範囲内で無制限のユーザーを提供する。
実世界の2つの都市シーンのNVIDIA Sionna線処理チャネルと実RFミキサーのプロファイリングにAIR-LLMを実装した。
LLaMA-3.1-8BではWikiText-2のパープレキシティ劣化が4.0%であり、AIR-LLMはFP16と重量のみの量子化ベースラインに対して157.7x/40.4xのエネルギーを節約している。
関連論文リスト
- Unlocking Lossless Speedups in LLMs via Discrete Diffusion [67.4336730000437]
大規模言語モデル(LLM)は、その成功の大部分は、次世代の予測(NTP)に負っている。
本稿では,ARモデル分布を定義する新しいモデルのクラスである拡散拡張LDMを紹介する。
我々はこれらのモデルのパラメータを2つのセットに分割する: AR重み、標準NTP目標を用いたトレーニング、軽量拡散重み、同時に複数のトークンを生成する訓練。
論文 参考訳(メタデータ) (2026-09-03T15:48:43Z) - Low-Altitude Fluid Antenna Network with Multi-Agent Reinforcement Learning [49.09908852315575]
マルチエージェント強化学習(MARL)を用いた低高度FAネットワークの高速かつ高性能な再構成について検討する。
今回のケーススタディでは、固定位置ベースラインと比較して、関節FA位置とビームフォーミング最適化がシステム総和率を118.5%向上できることを示した。
論文 参考訳(メタデータ) (2026-08-28T04:27:44Z) - FairyFuse: Multiplication-Free LLM Inference on CPUs via Fused Ternary Kernels [2.339485034137561]
提案するFairyFuseは,コモディティCPU上での乗算不要な実行を可能にする推論システムである。
ルーフライン解析により、16倍の重み圧縮により、メモリバウンドGEMVは帯域幅制限CPUの計算系にシフトすることが示された。
エンドツーエンドでは、FairyFuseは1つのIntel Xeon 8558Pで毎秒32.4トークンを獲得し、ラマを上回っている。
論文 参考訳(メタデータ) (2026-04-22T02:42:10Z) - EdgeMoE: Empowering Sparse Large Language Models on Mobile Devices [3.3947808667959536]
EdgeMoEは、Mix-of-expert (MoE) LLM用のオンデバイス推論エンジンである。
非専門家の重みはデバイスメモリに保持されるが、専門家の重みは外部ストレージに保持され、アクティベート時にのみメモリにフェッチされる。
論文 参考訳(メタデータ) (2023-08-28T06:56:08Z) - AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration [54.692405042065815]
LLM低ビット量のみの量子化のためのハードウェアフレンドリーなアプローチであるActivation-Aware Weight Quantization (AWQ)を提案する。
AWQ は 1% の正重みしか保護せず,命令調整型 LM とマルチモーダル LM の量子化性能に優れる。
また,4ビットオンデバイスLLM/VLMに適した,効率的なフレキシブルな推論フレームワークであるTinyChatを実装した。
論文 参考訳(メタデータ) (2023-06-01T17:59:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。