論文の概要: SymbolicLight V2: Hybrid Neuromorphic Architecture and Sparse Execution for Low-Energy Language Inference
- arxiv url: http://arxiv.org/abs/2609.09772v1
- Date: Wed, 09 Sep 2026 06:18:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.915632
- Title: SymbolicLight V2: Hybrid Neuromorphic Architecture and Sparse Execution for Low-Energy Language Inference
- Title(参考訳): SymbolicLight V2:低エネルギー言語推論のためのハイブリッドニューロモルフィックアーキテクチャとスパース実行
- Abstract要約: SymbolicLight V2はスパースイベント計算と連続状態処理を組み合わせる。
デジタル固定点演算を用いたAlveo U50C FPGA上でSybolicLight V2を実装した。
ROCK 5Tの4つのCortex-A76コアでは、完全なリクエストは9.80Wで65.4トークン/秒、アダプタのAC入力で生成されたトークン毎に0.151Jに達する。
- 参考スコア(独自算出の注目度): 8.419155861590548
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: SymbolicLight V2 combines sparse event computation with continuous-state processing in a hybrid neuromorphic language architecture. Extending V1's spike-gated dual paths, it adds graded signed events at further projections and softmax-free local attention. We implement the 194M-parameter model on an Alveo U50C FPGA using digital fixed-point arithmetic and on an ARM CPU using sparse integer execution. Across three same-checkpoint FPGA implementations at 175 MHz, active-row weight gathering and valid-state KV loading raise decode throughput from 474.6 to 643.2 tokens/s for a 32-token prefix and 128 outputs. Estimated gross card energy falls from 0.06087 to 0.04407 J per generated token, a 27.6% reduction. Complete-request energy, including prefill, falls by 24.4-27.7% across three prefix lengths. An independent idle split attributes 82.8% of gross card energy to loaded idle, explaining the benefit of shorter token latency. Against the recorded RTX 5090 compiled-FP32 baseline, integer FPGA execution uses 89.1% less estimated card energy during short-context decode; arithmetic precisions differ, and the GPU baseline is not the lowest-energy tested configuration. On four Cortex-A76 cores of a ROCK 5T, complete requests reach 65.4 tokens/s at 9.80 W and 0.151 J per generated token at the adapter's AC input. These results connect event sparsity to omitted computation and data movement. The mechanisms also support other dedicated V2 implementations: increasing throughput by a greater factor than active power lowers energy per generated token. Evaluation holds the deployed checkpoint fixed; its quality trails a same-budget dense control, so the results do not establish equal-quality efficiency.
- Abstract(参考訳): SymbolicLight V2は、スパースイベント計算と、ハイブリッドニューロモルフィック言語アーキテクチャにおける連続状態処理を組み合わせたものである。
V1のスパイクゲートデュアルパスを拡張して、さらなるプロジェクションでのグレード付き署名イベントとソフトマックスフリーローカルアテンションを追加する。
デジタル固定点演算を用いたアルベオU50CFPGAと、スパース整数実行を用いたARM CPU上で194Mパラメータモデルを実装した。
175MHzでの3つの同一チェックポイントFPGA実装、アクティブローの重み付け、有効状態のKVロードにより、32tokenプレフィックスと128の出力に対して474.6から643.2トークン/sのデコードスループットが向上した。
推定総カードエネルギーは、生成トークン当たり0.06087から0.04407Jに減少し、27.6%が減少する。
プレフィルを含む完全要求エネルギーは、3つのプレフィックスの長さで24.4-27.7%減少する。
独立したアイドル分割は、ローディングアイドルに対する総カードエネルギーの82.8%を占め、トークンレイテンシの短さの利点を説明する。
記録されたRTX 5090のコンパイル-FP32ベースラインに対して、整数FPGAの実行は短文復号時に89.1%少ない推定カードエネルギを使用し、演算精度は異なり、GPUベースラインは最低エネルギーテスト構成ではない。
ROCK 5Tの4つのCortex-A76コアでは、完全なリクエストは9.80Wで65.4トークン/秒、アダプタのAC入力で生成されたトークン毎に0.151Jに達する。
これらの結果は、イベントの間隔を省略された計算とデータ移動に結びつける。
このメカニズムは、他の専用のV2実装もサポートしている: アクティブパワーよりもスループットが大きくなると、生成されたトークンあたりのエネルギーが低下する。
評価は、配置されたチェックポイントを固定しており、その品質は、同じ予算密度の制御を辿っているため、結果が等質な効率を確立することはない。
関連論文リスト
- VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention [47.30761996669105]
トレーニング不要な低ビットアテンションフレームワークであるVC-Attentionを提案する。
V-Smoothは、オンラインの軽量クラスタリングによってバリュートークンを再注文するので、融合ハードウェアブロック内のトークンは、共に量子化される。
ログドメインのスコアを直接E4M3確率符号に1つの融合乗算加算でマッピングし、FP32指数関数とフォーマット変換を排除した。
論文 参考訳(メタデータ) (2026-09-14T16:17:35Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation [53.88286427894783]
視覚言語モデル(VLM)は、ロボット分野において、言語コンテキストによる環境認識を可能にする強力なツールとして登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
本稿では,大規模フロンティアモデルからの複雑な空間意味推論を,組み込みGPUデバイス上でエッジ実行を行うための軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T09:11:59Z) - From Compression to Deployment: Real-Time and Energy-Efficient FastGRNN on Ultra-Constrained Microcontrollers [0.0]
本稿では、2つのベアメタルターゲット上に配置されたコンパクトゲートセルであるFastGRNNのエンドツーエンドのオープンソース再生について述べる。
このモデルは重量566バイトを占め、HAPTテストセット上でマクロF1 = 0.918(シード0; 5シードQ15は0.853+-0.107)を達成する。
どちらのプラットフォームも、リアルタイム50Hzのストリーミング推論(Arduinoでは9.21ms、MSP430では13ms)を維持しており、256エントリのシグモイド/タンのルックアップテーブルは30.5倍のスピードアップを提供する。
論文 参考訳(メタデータ) (2026-06-15T19:49:38Z) - EULER-ADAS: Energy-Efficient & SIMD-Unified Logarithmic-Posit Engine for Precision-Reconfigurable Approximate ADAS Acceleration [0.12314765641075437]
EULER-ADASは、エネルギー効率と信頼性を意識したADASアクセラレーションのためのSIMD対応の対数有界型ニューラルネットワークエンジンである。
提案したデータパスは,有界正規化ポジット表現,段階適応対数マンティサ乗算とビットトランケーション,SIMD共有クイア蓄積経路を組み合わせたものである。
FPGAの実装により、提案された構成により、LUT数を41.4%、遅延を76.1%、パワーを71.9%削減できる。
論文 参考訳(メタデータ) (2026-05-07T19:20:10Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - TRINE: A Token-Aware, Runtime-Adaptive FPGA Inference Engine for Multimodal AI [16.724696664451653]
TRINEは再構成なしでエンドツーエンドのマルチモーダル推論を実行する。
トークンプルーニングだけで、ViT重パイプライン上では最大7.8倍になる。
int8量子化では、一般的なタスク間で精度が2.5%低下する。
論文 参考訳(メタデータ) (2026-03-24T07:12:15Z) - Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels [83.99688944263843]
DoRA(Weight-De Low-Rank Adaptation)は、LoRAを方向から分離することで拡張する。
d_in = 8192 とランク r = 384 では、単一のモジュールのノルムは bf16 で512MB の過渡的なワーキングメモリを必要とする。
因子ノルムは、二乗ノルムを O(d_out r + r2) 中間体を通して計算可能な基底、交差、およびグラマー項に分解し、密積を除去する。
論文 参考訳(メタデータ) (2026-03-23T17:57:24Z) - A Persistent-State Dataflow Accelerator for Memory-Bound Linear Attention Decode on FPGA [10.452946241750562]
Gated DeltaNet(GDN)は、成長するKVキャッシュを固定サイズのリカレントステートに置き換える線形アテンションメカニズムである。
このボトルネックはアルゴリズムではなくアーキテクチャであることが示され、全てのサブクワッド列モデルはデコード時に 1 FLOP/B 未満の演算強度を示す。
オンチップBRAMにおいて,フル2MBのリカレント状態を持続的に保持することにより,このボトルネックを解消するFPGAアクセラレータを提案する。
論文 参考訳(メタデータ) (2026-03-06T06:03:38Z) - SHIELD8-UAV: Sequential 8-bit Hardware Implementation of a Precision-Aware 1D-F-CNN for Low-Energy UAV Acoustic Detection and Temporal Tracking [4.962717354668883]
ShiELD8-UAV (ShielD8-UAV) は、高精度1D機能駆動CNNアクセラレータのシーケンシャルな8ビットハードウェア実装である。
この設計は共有マルチ精度データパス上で層単位で実行し、複製された処理要素を不要にする。
その結果、逐次実行と高精度量子化とシリアライズ対応プルーニングを組み合わせることで、実用的な低エネルギーエッジ推論が可能となった。
論文 参考訳(メタデータ) (2026-03-01T12:09:15Z) - A 71.2-$μ$W Speech Recognition Accelerator with Recurrent Spiking Neural Network [0.0502254944841629]
本稿では,2つの繰り返し層と1つの完全連結層,低時間ステップを有する小型の繰り返しスパイクニューラルネットワークを提案する。
2.79MBモデルでは、プルーニングと4ビットの固定点量子化が行われ、96.42%から0.1MBに縮小した。
このデザインは100kHzでリアルタイムに動作し、71.2 mu$Wを消費し、最先端の設計を上回っている。
論文 参考訳(メタデータ) (2025-03-27T10:14:00Z) - InfiniteHBD: Building Datacenter-Scale High-Bandwidth Domain for LLM with Optical Circuit Switching Transceivers [37.89954553921228]
HBD(High-Bandwidth Domains)は、並列処理のような通信集約型並列処理において重要である。
スイッチ中心のHBDはスケールコストを禁ずるが、GPU中心のHBDは深刻な障害伝播に悩まされる。
本稿では,トランシーバレベルにおける接続性と動的スイッチングを統合した,トランシーバ中心のHBDアーキテクチャであるInfiniteHBDを提案する。
論文 参考訳(メタデータ) (2025-02-06T09:01:24Z) - BottleFit: Learning Compressed Representations in Deep Neural Networks
for Effective and Efficient Split Computing [48.11023234245863]
圧縮速度が強い場合でも高い精度を達成するための新しいトレーニング戦略を含む,BottleFitと呼ばれる新しいフレームワークを提案する。
BottleFitは77.1%のデータ圧縮を実現し、ImageNetデータセットでは最大で0.6%の精度でロスする。
本稿では,BottleFitが消費電力とレイテンシを最大で49%,(w.r.t.)ローカルコンピューティングでは89%,エッジオフロードでは37%,W.r.t.エッジオフロードでは55%削減することを示した。
論文 参考訳(メタデータ) (2022-01-07T22:08:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。