論文の概要: Hardware-Software Co-Design for Float16 On-Device Training on RISC-V Single-Core
- arxiv url: http://arxiv.org/abs/2607.21130v1
- Date: Thu, 23 Jul 2026 10:06:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.370735
- Title: Hardware-Software Co-Design for Float16 On-Device Training on RISC-V Single-Core
- Title(参考訳): RISC-Vシングルコア上でのFloat16オンデバイストレーニングのためのハードウェア・ソフトウェア共同設計
- Abstract要約: 本研究は,リソース制約のあるRISC-Vシングルコア上で,デバイス上での完全なトレーニングを可能にするオープンソースフレームワークを提案する。
本手法では,float32と比較してメモリフットプリントを約50%削減し,モデル性能の低下を最小限に抑える。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: By leveraging standard RISC-V extensions, namely Zfh (scalar float16) and Zvfh (vector float16), this work proposes an open-source framework to enable complete on-device training on resource-constrained RISC-V single-core. Our approach allows memory footprint reduction by about 50% as compared to using float32 and with minimal model performance degradation. We also facilitate transfer learning and fine-tuning scenarios by incorporating layer-freezing capabilities. Our work builds onto AIfES, an open-source, modular and generic DNN training and inference framework for embedded systems that can be extended with custom hardware-specific functions. The benefits of float16 is further emphasized by outlining the low area overhead of Zfh on a RV64GC super-scalar out-of-order FPGA softcore (+1.15% LUT6 and +0.05% FF at 175MHz). Finally, we discuss the architecture of a Zvfh implementation within the same RISC-V core.
- Abstract(参考訳): RISC-Vの標準拡張であるZfh(scalar float16)とZvfh(vector float16)を活用することにより、リソースに制約のあるRISC-Vシングルコア上でのデバイス上での完全なトレーニングを可能にするオープンソースフレームワークを提案する。
本手法では,float32と比較してメモリフットプリントを約50%削減し,モデル性能の低下を最小限に抑える。
また, 層凍結機能の導入により, 伝達学習や微調整のシナリオも容易に行うことができる。
当社の作業は、カスタムハードウェア固有の機能で拡張可能な組み込みシステムのための、オープンソースでモジュール化された汎用的なDNNトレーニングおよび推論フレームワークであるAIfES上に構築されています。
float16の利点は、RV64GC超スカラーのFPGAソフトコア(+1.15% LUT6と+0.05% FF at 175MHz)でZfhの低領域オーバーヘッドを概説することで強調されている。
最後に、同じRISC-Vコア内のZvfh実装のアーキテクチャについて述べる。
関連論文リスト
- SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD [89.88607039727783]
本稿では,Ascend NPU SuperPODにおけるエンドツーエンド最適化手法を提案する。
モデルレベルの並列性、計算通信オーケストレーション、低レベルのカーネル実行にまたがる階層的最適化フレームワークを開発した。
その結果、34.22%のモデルFLOP(Model FLOP)利用が達成され、オープンソースのベースラインレシピよりも2.93倍改善された。
論文 参考訳(メタデータ) (2026-07-22T13:49:17Z) - HORCRUX: A Complete PQC RISC-V eXtension Architecture [37.36871652478481]
この研究は、HORCRUXと呼ばれるポスト量子暗号(PQC)のためのコンパクトRISC-V拡張を提供する。
HorCRUXは、制約のある環境での暗号処理能力、高パフォーマンス、低リソース消費の間の難しいトレードオフに対処する。
この拡張のモジュール構造は、標準のRISC-Vコアとの後方互換性を維持しており、制約された組み込みシステムにPQCをデプロイするためのスケーラブルなソリューションを提供する。
論文 参考訳(メタデータ) (2026-07-15T15:21:26Z) - VFA: Relieving Vector Operations in Flash Attention with Global Maximum Pre-computation [5.279829639786756]
FlashAttentionスタイルのオンラインソフトマックスは、線形メモリによる正確な注意計算を可能にする。
オンラインソフトマックスの非マルチコンポーネントはベクトルまたはSIMD制限となり、遅延が支配的になる。
本稿では,Vector Relieved Flash Attention (VFA)を提案する。
論文 参考訳(メタデータ) (2026-04-14T14:28:50Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels [83.99688944263843]
DoRA(Weight-De Low-Rank Adaptation)は、LoRAを方向から分離することで拡張する。
d_in = 8192 とランク r = 384 では、単一のモジュールのノルムは bf16 で512MB の過渡的なワーキングメモリを必要とする。
因子ノルムは、二乗ノルムを O(d_out r + r2) 中間体を通して計算可能な基底、交差、およびグラマー項に分解し、密積を除去する。
論文 参考訳(メタデータ) (2026-03-23T17:57:24Z) - Speeding Up MACE: Low-Precision Tricks for Equivarient Force Fields [51.95157731126864]
機械学習力場は高い計算コストで正確な分子動力学(MD)を提供することができる。
この論文は、計算ボトルネックを特定し、低精度の実行ポリシーを評価することで、MACEを安価かつ高速にすることを目的としている。
論文 参考訳(メタデータ) (2025-10-23T14:02:34Z) - Decentor-V: Lightweight ML Training on Low-Power RISC-V Edge Devices [2.2332974094443174]
勾配降下の軽量な変種であるL-SGDは、Arm Cortex-M Microcontroller Units(MCUs)のニューラルネットワークトレーニングを可能にした
この作業はL-SGDをRISC-VベースのMCUに拡張する。
RISC-V用L-SGDの8ビット量子化バージョンを導入し,メモリ使用量の約4倍の削減を実現し,トレーニング時間の2.2倍の高速化を実現した。
論文 参考訳(メタデータ) (2025-09-10T09:33:54Z) - PRISM: Distributed Inference for Foundation Models at Edge [73.54372283220444]
PRISMは、エッジデバイス上での分散トランスフォーマー推論のための通信効率と計算アウェア戦略である。
ViT,BERT,GPT-2のPRISMを多種多様なデータセットで評価した。
論文 参考訳(メタデータ) (2025-07-16T11:25:03Z) - Tensor Program Optimization for the RISC-V Vector Extension Using Probabilistic Programs [0.6242215470795112]
RISC-VベクトルユニットにAIワークロードを効率的にマッピングするためのTVMコンパイラに基づくワークフローを提案する。
本提案では,GCCのオートベクタ化機能と比較して,実行レイテンシが平均46%向上したことを示す。
コミュニティが他のRISC-V拡張をターゲットに拡張する提案をオープンソースとして公開しました。
論文 参考訳(メタデータ) (2025-07-02T08:15:33Z) - V-Seek: Accelerating LLM Reasoning on Open-hardware Server-class RISC-V Platforms [13.87105456715319]
本稿では,ベクトル処理機能を備えた初の商用マルチコアRISC-V CPUであるSophon SG2042上でのLLM(Large Language Models)推論の最適化に着目する。
DeepSeek R1 Distill Llama 8B と DeepSeek R1 Distill QWEN 14B の2つの最新の技術 LLM について、トークン生成のための 4.32/2.29 トークン/s とプロンプト処理のための 6.54/3.68 トークン/s を、ベースラインと比較して2.9x/3.0x の速度で達成した。
論文 参考訳(メタデータ) (2025-03-21T09:00:19Z) - Reconfigurable Distributed FPGA Cluster Design for Deep Learning
Accelerators [59.11160990637615]
エッジコンピューティングアプリケーション用に設計された低消費電力組み込みFPGAに基づく分散システムを提案する。
提案システムは,様々なニューラルネットワーク(NN)モデルを同時に実行し,パイプライン構造にグラフを配置し,NNグラフの最も計算集約的な層により大きなリソースを手動で割り当てる。
論文 参考訳(メタデータ) (2023-05-24T16:08:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。