論文の概要: Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference
- arxiv url: http://arxiv.org/abs/2608.20210v1
- Date: Thu, 20 Aug 2026 16:09:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.632214
- Title: Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference
- Title(参考訳): Daedalus-150M:CPU推論用に設計された畳み込み型ハイブリッド
- Authors: Christos Koutsiaris,
- Abstract要約: 小さな言語モデルは通常、大きなもののように構築され、その後CPUに圧縮される。
ターゲットを最初に修正し、ユーザを1人、トークンを1度に1人、重みを4ビット、通常のCPUで、それに合うようにアーキテクチャを選択しました。
このモデルはトレーニング開始前に修正された42.20のバーに対して5タスクのベンチマークで47.31得点した。
GPT-2 124M、Pythia-160M、OPT-125M、GPT-neo-125Mの3倍から6倍のデータで訓練され、MobileLLM-125Mを超える。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Small language models are usually built like large ones and then squeezed onto a CPU afterwards. We did the opposite: we fixed the target first, one user, one token at a time, 4-bit weights, ordinary CPU, and chose the architecture to suit it. The result keeps full attention in only 6 of its 18 blocks. The other 12 use short convolutions whose memory is two timesteps wide no matter how long the conversation gets, so two thirds of the network never re-reads a growing cache. Trained from scratch on 59.9B tokens, the model scores 47.31 on a five-task benchmark against a bar of 42.20 that was fixed before training began. It beats GPT-2 124M, Pythia-160M, OPT-125M and GPT-neo-125M, all trained on three to six times more data, and exceeds MobileLLM-125M's published score despite that model seeing a trillion tokens. Validation bits-per-byte is 0.8685. To check the architecture rather than the training recipe, we trained a conventional all-attention model of the same size on the same data, and wrote down the winning condition before scoring either. The hybrid won the chosen quality metric by 0.81%, matched it on downstream tasks, produced a 6.3% smaller 4-bit file, and decoded 1.76x faster at 2048 tokens of context, 2.08x against an external model of similar size. In every measurement the speed advantage is near zero at an empty context and grows with length, which is what the mechanism predicts and what a merely leaner model would not show. A simple bandwidth calculation predicts only 1.17x, so memory volume alone does not explain the gap. We also report what did not work: an unmitigated 4-bit quality cost, roughly half the convolution channels ending up inert and impossible to remove, and a vocabulary larger than this model size warrants.
- Abstract(参考訳): 小さな言語モデルは通常、大きなもののように構築され、その後CPUに圧縮される。
ターゲットを最初に修正し、ユーザを1人、トークンを1度に1人、重みを4ビット、通常のCPUで、それに合うようにアーキテクチャを選択しました。
その結果は18ブロック中6ブロックで完全に注目されている。
残りの12つは、会話がいつ終わるかに関わらず、メモリが2つのタイムステップ幅を持つ短い畳み込みを使用するため、ネットワークの3分の2はキャッシュの増大を読み取りません。
59.9Bトークンのスクラッチからトレーニングされ、トレーニング開始前に修正された42.20のバーに対して5タスクのベンチマークで47.31得点した。
GPT-2 124M、Pythia-160M、OPT-125M、GPT-neo-125Mの3倍から6倍のデータで訓練され、このモデルでは1兆個のトークンを見ることができるにもかかわらずMobileLLM-125Mのスコアを超える。
検証ビット/バイトは0.8685である。
トレーニングレシピではなくアーキテクチャをチェックするために,同じデータに対して同じ大きさの従来のオールアテンションモデルをトレーニングし,いずれかのスコアを付ける前に当選条件を書き留めた。
このハイブリッドは、選択された品質指標を0.81%向上させ、下流のタスクと一致させ、6.3%の4ビットファイルを生成し、2048のトークンで1.76倍高速にデコードし、同様のサイズの外部モデルに対して2.08倍になった。
あらゆる測定において、速度の優位性は空の文脈でゼロに近くなり、長さで成長する。
単純な帯域幅の計算では1.17倍しか予測できないため、メモリボリュームだけではそのギャップを説明できない。
また、未解決の4ビット品質コスト、畳み込みチャネルの約半分が不完全で取り外しが不可能なこと、このモデルサイズ以上の語彙を報告しました。
関連論文リスト
- Opt.Gear Technical Report [3.573729952898132]
OptGearは、デバイス上での効率的なデプロイメント、リアルタイム推論、強力なタスク能力のために設計された基盤モデルである。
密度モデル(1M、270M、1B)で、コンテキスト長は64Kである。
OptGear-1MはARM Cortex-M7 CPU上でW4A32量子化で20TPSを達成した最初の生成言語モデルである。
論文 参考訳(メタデータ) (2026-08-02T06:43:25Z) - A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi [0.0]
このレポートはハードウェアを維持し、適合するモデルに何ができるかを尋ねる。
SigLIP2エンコーダとウィンドウアテンションマージを組み合わせた,現代的なマルチモーダルアシスタントであるMini-V-4.6をデプロイする。
システムは、画像質問のエンドツーエンドを1.7秒で答える。
論文 参考訳(メタデータ) (2026-07-16T04:48:44Z) - Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel [0.0]
凍結した小さな言語モデルを、重みを変えることなく、同時により有能かつ劇的に安価にします。
浮動小数点回転符号化モデルにおいて,自己配置グラフトは数値的に正確な操作点であることを示す。
システムは動作レベルで記述され、エンジンはプロプライエタリであり、報告された全ての数値はコミットされた入力と出力によってバックアップされるので、スコアはそれなしで再チェックできる。
論文 参考訳(メタデータ) (2026-07-15T23:55:48Z) - Variable Bit-width Quantization: Learning Per-Group Precision for "Bigger-but-Smaller" Language Models [0.0]
可変ビット幅量子化(VBQ)を導入する。
64重みの連続した群が1,2,4,8ビットから独自の分解能を学習する訓練時間法である。
バイト単位の品質では、VBQはFP16よりも3.9-8.4倍効率が高い。
論文 参考訳(メタデータ) (2026-07-03T02:42:04Z) - Chronicals: A High-Performance Framework for LLM Fine-Tuning with 3.51x Speedup over Unsloth [0.0]
Unsloth上で3.5倍のスピードアップを実現したオープンソースのトレーニングフレームワークであるCentralsを紹介します。
オンラインのソフトマックスの正しさ、FlashAttention IO complexity O(N2 d2 M-1)、LoRA+学習速度勾配近似など、完全な数学的基礎を提供する。
論文 参考訳(メタデータ) (2026-01-06T00:00:55Z) - Test-Time Training Done Right [61.8429380523577]
テスト時間トレーニング(TTT)モデルは、推論中にモデルの重みの一部を適応させることによってコンテキストをモデル化する。
既存のTT手法は、長文データを扱う上で有効性を示すのに苦労した。
我々は,大規模チャンクテストタイムトレーニング(LaCT)を開発し,ハードウェア利用率を桁違いに向上させる。
論文 参考訳(メタデータ) (2025-05-29T17:50:34Z) - QMoE: Practical Sub-1-Bit Compression of Trillion-Parameter Models [64.34635279436054]
Mixture-of-Experts (MoE)アーキテクチャは、スパースルーティングによる大規模言語モデル(LLM)の高推論コストに対する一般的な解決策を提供する。
本稿では,QMoEと呼ばれる新しい圧縮実行フレームワークの形で,このメモリ問題に対する解決策を提案する。
論文 参考訳(メタデータ) (2023-10-25T17:24:53Z) - QLoRA: Efficient Finetuning of Quantized LLMs [66.58009990713134]
我々は,48GBのGPU上で65Bパラメータモデルを微調整するのに十分なメモリ使用量を削減する,効率的な微調整手法QLoRAを提案する。
QLoRAは凍結した4ビット量子化事前学習言語モデルを通して低ランクアダプタ(LoRA)に逆伝搬する
最高のモデルファミリであるGuanacoは、Vicunaベンチマークでリリースされたすべてのモデルより優れています。
論文 参考訳(メタデータ) (2023-05-23T17:50:33Z) - The case for 4-bit precision: k-bit Inference Scaling Laws [75.4335600212427]
量子化法は、モデル内の各パラメータを表すために必要なビット数を減少させる。
最終的なモデルサイズは、元のモデルのパラメータの数と圧縮率の両方に依存する。
我々は16ビットの入力とkビットのパラメータを持つ35,000以上のゼロショット実験を行い、どの量子化手法が3ビットから8ビットの精度でスケーリングを改善するかを検証した。
論文 参考訳(メタデータ) (2022-12-19T18:48:33Z) - Combined Scaling for Zero-shot Transfer Learning [146.0851484769142]
我々は,ImageNet ILSVRC-2012バリデーションセットにおいて,85.7%のトップ1の精度を達成できるBASICと組み合わせたスケーリング手法を提案する。
この精度はCLIPとALIGNの9.3%を超える。
我々のモデルは、ロバストネスベンチマークの大幅な改善も示しています。
論文 参考訳(メタデータ) (2021-11-19T05:25:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。