論文の概要: LightRot: A Light-Weighted Rotation Scheme and Architecture for Accurate Low-Bit Large Language Model Inference
- arxiv url: http://arxiv.org/abs/2607.27704v1
- Date: Thu, 30 Jul 2026 05:39:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.406301
- Title: LightRot: A Light-Weighted Rotation Scheme and Architecture for Accurate Low-Bit Large Language Model Inference
- Title(参考訳): LightRot: 高精度な低ビット大言語モデル推論のための軽量回転方式とアーキテクチャ
- Authors: Sangjin Kim, Yuseon Choi, Jungjun Oh, Byeongcheol Kim, Hoi-Jun Yoo,
- Abstract要約: この研究は、軽量な回転スキームと低ビットLSM推論のための専用ハードウェアアクセラレータであるLightRotを提示する。
提案アーキテクチャは,GLR(Grouped Local Rotation)とODA(Outlier Direction Aligning)アルゴリズムを階層的なFHT(Fast Hadamard Transform)ベースのローテーションユニットに統合する。
提案した加速器は28nmのCMOSプロセスで実装され、4ビット推論で27.4TOPS/Wのピークエネルギー効率を実現する。
- 参考スコア(独自算出の注目度): 0.7122535777902205
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As large language models (LLMs) continue to demonstrate exceptional capabilities across various domains, the challenge of achieving energy-efficient and accurate inference becomes increasingly critical. This work presents LightRot, a lightweight rotation scheme and dedicated hardware accelerator designed for low-bit LLM inference. The proposed architecture integrates Grouped Local Rotation (GLR) and Outlier Direction Aligning (ODA) algorithms with a hierarchical Fast Hadamard Transform (FHT)-based rotation unit to address key challenges in low-bit quantization, including the energy overhead of rotation operations. The proposed accelerator, implemented in a 28nm CMOS process, achieves a peak energy efficiency of 27.4 TOPS/W for 4-bit inference, surpassing prior state-of-the-art designs. Unlike conventional approaches that rely on higher-precision inference or evaluate on basic language modeling tasks like GPT-2, LightRot is optimized for advanced models such as LLaMA2-13B and LLaMA3-8B. Its performance is further validated on MT-Bench, demonstrating robust applicability to real-world conversational scenarios and redefining benchmarks for chat-based AI systems. By synergizing algorithmic innovations and hardware efficiency, this work sets a new paradigm for scalable, low-bit LLM inference, paving the way for sustainable AI advancements.
- Abstract(参考訳): 大規模言語モデル(LLM)が様々な領域にまたがる例外的な能力を示し続けるにつれ、エネルギー効率と正確な推論を達成するという課題がますます重要になる。
この研究は、軽量な回転スキームと低ビットLSM推論用に設計された専用ハードウェアアクセラレータであるLightRotを提示する。
提案アーキテクチャは,GLR(Grouped Local Rotation)とODA(Outlier Direction Aligning)アルゴリズムを階層的なFHT(Fast Hadamard Transform)ベースのローテーションユニットに統合し,ロービット量子化における重要な課題に対処する。
提案した加速器は28nmのCMOSプロセスで実装され、4ビット推論で27.4TOPS/Wのピークエネルギー効率を達成し、従来の最先端の設計を上回った。
GPT-2のような高精度な推論や基本的な言語モデリングタスクによる評価を行う従来の手法とは異なり、LightRotはLLaMA2-13BやLLaMA3-8Bのような高度なモデルに最適化されている。
そのパフォーマンスはMT-Benchでさらに検証されており、現実の会話シナリオへの堅牢な適用性と、チャットベースのAIシステムに対するベンチマークの再定義を実証している。
アルゴリズムのイノベーションとハードウェア効率の相乗効果によって、この研究はスケーラブルで低ビットのLSM推論のための新しいパラダイムを確立し、持続可能なAIの進歩への道を開いた。
関連論文リスト
- GyRot: Leveraging Hidden Synergy between Rotation and Fine-grained Group Quantization for Low-bit LLM Inference [0.7122535777902205]
GyRotは低ビット量子化フレームワークであり、ハードウェアアクセラレータである。
LLaMAファミリーモデル全体で最先端の4ビット精度を実現している。
最大3.4倍のスピードアップと3.6倍のエネルギー効率を提供する。
論文 参考訳(メタデータ) (2026-07-30T05:26:20Z) - AUTOGATE: Automated Clock Gating via Toggling-Aware LLM-based RTL Rewriting [17.55906131128768]
本稿では,産業レベルのRTL電力最適化のための最初のエージェントフレームワークであるAUTOGATEを紹介する。
本稿では、波形レベルの解析とRTL書き換えを橋渡しする機械学習(ML)-LLM共同設計を提案する。
AUTOGATEはベースラインに対する動的パワーを一貫して減少させることを示す。
論文 参考訳(メタデータ) (2026-06-16T03:22:54Z) - Merging Beyond: Streaming LLM Updates via Activation-Guided Rotations [55.047454145941366]
Streaming Mergingは、反復最適化プロセスとしてマージを概念化する革新的なモデル更新パラダイムである。
ARMは勾配勾配勾配のダイナミクスを近似するために設計された戦略である。
ARMは初期のSFTチェックポイントしか必要とせず、反復的なマージによって完全に収束したSFTモデルを上回る。
論文 参考訳(メタデータ) (2026-02-03T08:15:57Z) - IMSE: Efficient U-Net-based Speech Enhancement using Inception Depthwise Convolution and Amplitude-Aware Linear Attention [2.3959703715401903]
本稿では,系統的に最適化された超軽量ネットワークIMSEを提案する。
1) MET モジュールを Amplitude-Aware Linear Attention (MALA) に、2) Deformable Embedding (DE) モジュールを Inception Depthwise Convolution (IDConv) に置き換える。
実験では、IMSEはパラメータ数を16.8%(0.513Mから0.427M)削減し、PESQ測定値(3.373)の最先端技術に匹敵する競争性能を達成する。
論文 参考訳(メタデータ) (2025-11-18T14:11:54Z) - Pangu Embedded: An Efficient Dual-system LLM Reasoner with Metacognition [95.54406667705999]
Pangu Embeddedは、Ascend Neural Processing Units (NPU) 上で開発された効率的なLarge Language Model (LLM) 推論器である。
既存の推論最適化 LLM でよく見られる計算コストと推論遅延の問題に対処する。
単一の統一モデルアーキテクチャ内で、迅速な応答と最先端の推論品質を提供する。
論文 参考訳(メタデータ) (2025-05-28T14:03:02Z) - R-Sparse: Rank-Aware Activation Sparsity for Efficient LLM Inference [77.47238561728459]
R-スパース(R-Sparse)は、高度なLCMにおいて高い疎度を達成できる訓練不要なアクティベーション・スパシティ・アプローチである。
10種類のタスクにわたるLlama-2/3およびMistralモデルの実験は、R-Sparseが50%のモデルレベルの間隔で同等のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2025-04-28T03:30:32Z) - Optuna vs Code Llama: Are LLMs a New Paradigm for Hyperparameter Tuning? [45.58422897857411]
この研究は、LoRAを用いてパラメータ効率の良いCode Llamaを微調整することで、ハイパーパラメータ最適化のための大規模言語モデル(LLM)の使用について検討する。
提案手法は,計算オーバーヘッドを大幅に削減しつつ,競合的あるいは優れたRoot Mean Square Error(RMSE)を実現する。
その結果,LLMに基づく最適化によって,木構造型パーゼンエミュレータ (TPE) のようなベイズ的手法が確立されただけでなく,知覚品質と低レイテンシ処理を必要とする実世界のアプリケーションへのチューニングが高速化された。
論文 参考訳(メタデータ) (2025-04-08T13:15:47Z) - Explore Activation Sparsity in Recurrent LLMs for Energy-Efficient Neuromorphic Computing [3.379854610429579]
Recurrent Large Language Models (R-LLM) は自己注意の複雑さを軽減するのに有効であることが証明されている。
ニューロモルフィックハードウェア上でのエネルギー効率を高めるために,R-LLMの活性化をスパースする,低コストでトレーニング不要なアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-01-09T19:13:03Z) - Search for Efficient Large Language Models [52.98684997131108]
大規模言語モデル(LLMs)は、人工知能研究の領域で長い間停滞してきた。
軽量プルーニング、量子化、蒸留がLLMの圧縮に取り入れられ、メモリの削減と推論の加速を狙った。
ほとんどのモデル圧縮技術は、最適アーキテクチャの探索を見越して重量最適化に重点を置いている。
論文 参考訳(メタデータ) (2024-09-25T21:32:12Z) - Optimization-driven Machine Learning for Intelligent Reflecting Surfaces
Assisted Wireless Networks [82.33619654835348]
インテリジェントサーフェス(IRS)は、個々の散乱素子の位相シフトを制御して無線チャネルを再形成するために用いられる。
散乱素子の規模が大きいため、受動ビームフォーミングは一般に高い計算複雑性によって挑戦される。
本稿では、IRS支援無線ネットワークの性能向上のための機械学習(ML)アプローチに焦点を当てる。
論文 参考訳(メタデータ) (2020-08-29T08:39:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。