論文の概要: Opt.Gear Technical Report
- arxiv url: http://arxiv.org/abs/2608.01034v2
- Date: Tue, 04 Aug 2026 01:57:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 13:15:27.420901
- Title: Opt.Gear Technical Report
- Title(参考訳): Opt.Gearテクニカルレポート
- Authors: Juneyoung Park, Youngwook Kwon,
- Abstract要約: OptGearは、デバイス上での効率的なデプロイメント、リアルタイム推論、強力なタスク能力のために設計された基盤モデルである。
密度モデル(1M、270M、1B)で、コンテキスト長は64Kである。
OptGear-1MはARM Cortex-M7 CPU上でW4A32量子化で20TPSを達成した最初の生成言語モデルである。
- 参考スコア(独自算出の注目度): 3.573729952898132
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We introduce OptGear, a foundation model designed for efficient on-device deployment, real-tim inference, and strong task capability. It includes a dense model (1M, 270M, and 1B) with a context length of 64K. We designed a new hybrid architecture that combines a convolutional key-value gated mixer with local-global attention to reduce the KV-cache memory that tends to increase exponentially with long context. This architecture delivers up to X4.9 faster prefill and decoding speeds on the NPUs compared to models of a similar scale models. From a 2T tokens candidate corpus, OptGear is trained on a curated 0.5T tokens subset without knowledge distillation. This is the most data-efficient of the existing foundation models. All models are released with open weights and deployment binaries for ONNX, Qualcomm NPU, and Apple ANE making OptGear a practical base for edge applications that need fast, memory-efficient inference and strong task capabilities. Furthermore, to expand the ecosystem of on-device generative language models, we are introducing the OptGear-1M that can be deployed on Micro-Controller Units (MCUs), a Tiny Language Model (TLM). OptGear-1M is the first generative language model to achieve 20 TPS with W4A32 quantization on the ARM Cortex-M7 CPU of the STM32H747I-DISCO.
- Abstract(参考訳): 我々は、デバイス上での効率的なデプロイメント、リアルタイム推論、強力なタスク能力のために設計された基盤モデルであるOpsGearを紹介します。
密度モデル(1M、270M、1B)で、コンテキスト長は64Kである。
我々は、畳み込みキー-値ゲートミキサーとローカル-グローバルアテンションを組み合わせた新しいハイブリッドアーキテクチャを設計し、長いコンテキストで指数関数的に増大するKV-キャッシュメモリを削減した。
このアーキテクチャでは、同様のスケールモデルのモデルと比較して、NPUのプリフィルとデコード速度が最大でX4.9速くなる。
2Tトークン候補コーパスから、OptGearは知識蒸留なしで0.5Tトークンサブセットで訓練される。
これは既存の基盤モデルの中で最もデータ効率が良い。
ONNX、Qualcomm NPU、Apple ANE向けのオープンウェイトとデプロイメントバイナリを備えたすべてのモデルがリリースされ、高速でメモリ効率のよい推論と強力なタスク機能を必要とするエッジアプリケーションのための実践的な基盤としてOpsGearを提供している。
さらに、デバイス上の生成言語モデルのエコシステムを拡大するために、マイクロコントローラユニット(MCU)にデプロイ可能なOptGear-1Mを導入しています。
OptGear-1Mは、STM32H747I-DISCOのARM Cortex-M7 CPU上でW4A32量子化で20TPSを達成した最初の生成言語モデルである。
関連論文リスト
- dInfer: An Efficient Inference Framework for Diffusion Language Models [54.80918957287927]
拡散に基づく大規模言語モデル (dLLM) は自己回帰(AR) LLM に代わる有望な代替品として登場した。
本稿では、dLLM推論のための効率的かつ効率的なフレームワークであるdInferについて述べる。
論文 参考訳(メタデータ) (2025-10-09T16:19:42Z) - MiniCPM4: Ultra-Efficient LLMs on End Devices [126.22958722174583]
MiniCPM4は、エンドサイドデバイス向けに明示的に設計された高効率な大規模言語モデル(LLM)である。
この効率性は、モデルアーキテクチャ、トレーニングデータ、トレーニングアルゴリズム、推論システムという4つの重要な側面において、体系的な革新を通じて達成します。
論文 参考訳(メタデータ) (2025-06-09T16:16:50Z) - Pangu Ultra MoE: How to Train Your Big MoE on Ascend NPUs [111.69640966866059]
ミキチャー・オブ・エキスパート(MoE)と1兆近いパラメータを持つ疎大言語モデル(LLM)が、最も有能な言語モデルの領域を支配している。
本稿では,Ascend NPU上でそのようなスケールを利用するレシピを明らかにすることを目的としている。
主な目的は、動的スパースモデル構造下でのコンピューティングリソースのより良い使用と、実際のハードウェアで期待されるパフォーマンス向上の実現である。
論文 参考訳(メタデータ) (2025-05-07T15:46:36Z) - Puzzle: Distillation-Based NAS for Inference-Optimized LLMs [17.72841008597783]
大きな言語モデル(LLM)は優れた能力を提供するが、高い推論コストは広く採用を制限する。
本稿では,LLMの推論を高速化するハードウェア対応フレームワークであるPuzzleについて述べる。
我々は、Llama-3.1-Nemotron-51B-Instruct (Nemotron-51B)とLlama-3.3-Nemotron-49Bという2つの公開モデルを通して、我々のフレームワークの影響を実証する。
論文 参考訳(メタデータ) (2024-11-28T13:45:42Z) - MobileNMT: Enabling Translation in 15MB and 30ms [53.75988363281843]
デバイス上で15MBと30msで翻訳できるMobileNMTを提案する。
モデルとエンジンの共設計により、既存のシステムと比較して47.0xのスピードを上げ、メモリの99.5%を節約し、BLEUの損失は11.6%に留まった。
論文 参考訳(メタデータ) (2023-06-07T08:25:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。