論文の概要: A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi
- arxiv url: http://arxiv.org/abs/2607.14568v1
- Date: Thu, 16 Jul 2026 04:48:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:32.99116
- Title: A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi
- Title(参考訳): 6GB 2011 GPU上の最新のマルチモーダルアシスタント:FermiのステージValidated, All-GPU CUDA推論
- Authors: A. C. Opus, J. Q. Lu,
- Abstract要約: このレポートはハードウェアを維持し、適合するモデルに何ができるかを尋ねる。
SigLIP2エンコーダとウィンドウアテンションマージを組み合わせた,現代的なマルチモーダルアシスタントであるMini-V-4.6をデプロイする。
システムは、画像質問のエンドツーエンドを1.7秒で答える。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A companion study ran a 35B mixture-of-experts model on a 2011 NVIDIA Tesla C2075 (Fermi, sm_20, 6GB) as a GPU-prefill/CPU-decode hybrid, because the 4-bit model did not fit in device memory (arXiv:2606.24031). This report keeps the hardware and asks what a model that fits can do: we deploy MiniCPM-V-4.6, a modern multimodal assistant pairing a SigLIP2 vision encoder and window-attention merger (16x visual token compression) with a compact hybrid gated-delta-net backbone, entirely on the GPU. Three results. (i) An all-GPU engine built on measured foundations: projections that dequantize 8-bit weights once and call the vendor SGEMM still in the last Fermi toolchain (64% of FP32 peak; our best hand-written GEMM hit 37%, wrongly called the ceiling); a chunked delta-rule rewrite of the recurrent layers, 2.8x faster than the sequential scan once attribution exposed one bad kernel; and a measured negative: 4-bit weights make decode slower than 8-bit here, since Fermi issues nibble-unpacking shifts at half rate. (ii) The vision side is a port with a proof obligation: we translate tower, merger, and projector to sm_20 CUDA, validating every stage against a locally generated reference forward (full tower 1.4e-5). One failure, position-embedding bucketization differing on exact rational ties, generalizes to a rule: float tie-breaking in index arithmetic is implementation-defined; call the reference operator, do not reimplement it. (iii) Long context exposes an O(N^2) wall short benchmarks hide: prefill falls from 114 tok/s at 2k tokens to 21 at 10k in a naive attention kernel; per-head vendor-GEMM calls writing into the existing score buffer (zero extra memory) restore a flat profile (408 at 2k, 361 at 10k; 17x), verified by exact needle retrieval from 60% depth. The same rewrite cuts image encoding 6x, to 0.93s. The system answers an image question end-to-end in 1.7s.
- Abstract(参考訳): 2011年のNVIDIA Tesla C2075(Fermi, sm_20, 6GB)では、4ビットモデルはデバイスメモリ(arXiv:2606.24031)に収まらないため、GPU-prefill/CPU-decodeハイブリッドとして35Bの試験モデルを実行した。
我々は、SigLIP2ビジョンエンコーダとウィンドウアテンションマージ(16倍のビジュアルトークン圧縮)を、GPU上に完全にハイブリッドゲート-デルタ-ネットバックボーンと組み合わせた、最新のマルチモーダルアシスタントであるMiniCPM-V-4.6をデプロイする。
3つの結果。
i) 8ビットの重みを1度減らし、ベンダーをSGEMMと呼ぶプロジェクション(FP32ピークの64%、最も手書きのGEMMは37%、天井と呼ばれている)、繰り返しレイヤのチャンクされたデルタルルリライト、1回のアトリビュートが1つの悪いカーネルを露出するとシーケンシャルスキャンよりも2.8倍高速、そして測定された負の値: 4ビットの重みはここで8ビットよりも遅くデコードする。
(二 目視側は、証明義務のある港で、塔、合併及びプロジェクターをsm_20 CUDAに変換し、各ステージを局所的に生成された基準フォワード(フルタワー1.4e-5)に対して検証する。)
1つの失敗、位置埋め込みバケット化は、正確な合理的な結びつきによって異なるが、ルールを一般化する: インデックス演算におけるフロートタイブレークは実装定義されている; 参照演算子を呼び出す、再実装しない。
三 長期の文脈は、O(N^2)の壁ショートベンチマークを隠蔽する。 プリフィルは、2kトークンで114 tok/sから、単純注意カーネルで21 at 10kに落ち、ベンダー間GEMMは、既存のスコアバッファ(ゼロ余分メモリ)に書き込むと、フラットプロファイル(408 at 2k, 361 at 10k; 17x)を復元し、60%の深さから正確な針検索によって検証する。
同じ書き直しにより、画像のエンコーディングは6x、0.93sに削減される。
システムは、画像質問のエンドツーエンドを1.7秒で答える。
関連論文リスト
- TileMaxSim: IO-Aware GPU MaxSim Scoring with Dimension Tiling and Fused Product Quantization [3.3723515662362265]
ColBERTのようなマルチベクトル検索モデルは、きめ細かいトークンレベルのMaxSimスコアリングによって最先端の精度を達成する。
既存のGPU実装は、ほとんどのハードウェア性能を未使用のままにしている。
私たちは、このギャップを埋めるIO対応のTritonカーネルのファミリーであるTileMaxSimを紹介します。
論文 参考訳(メタデータ) (2026-06-24T23:03:56Z) - Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels [83.99688944263843]
DoRA(Weight-De Low-Rank Adaptation)は、LoRAを方向から分離することで拡張する。
d_in = 8192 とランク r = 384 では、単一のモジュールのノルムは bf16 で512MB の過渡的なワーキングメモリを必要とする。
因子ノルムは、二乗ノルムを O(d_out r + r2) 中間体を通して計算可能な基底、交差、およびグラマー項に分解し、密積を除去する。
論文 参考訳(メタデータ) (2026-03-23T17:57:24Z) - Architecture-Aware LLM Inference Optimization on AMD Instinct GPUs: A Comprehensive Benchmark and Deployment Study [0.0]
AMD Instinct MI325X GPUにおけるLCM推定のクロスアーキテクチャ評価
3つのアーキテクチャファミリにまたがる235Bから1兆のパラメータにまたがる4つのモデルのベンチマーク。
論文 参考訳(メタデータ) (2026-02-27T13:21:48Z) - Chronicals: A High-Performance Framework for LLM Fine-Tuning with 3.51x Speedup over Unsloth [0.0]
Unsloth上で3.5倍のスピードアップを実現したオープンソースのトレーニングフレームワークであるCentralsを紹介します。
オンラインのソフトマックスの正しさ、FlashAttention IO complexity O(N2 d2 M-1)、LoRA+学習速度勾配近似など、完全な数学的基礎を提供する。
論文 参考訳(メタデータ) (2026-01-06T00:00:55Z) - GPU-Accelerated Interpretable Generalization for Rapid Cyberattack Detection and Forensics [0.0]
IGメカニズムは最近IEEE Transactions on Information Forensics and Securityで公開され、最先端のエビデンスベースの侵入検知を提供する。
我々は、PyTorchの再設計であるIG-GPUを紹介し、すべてのペアの交叉とサブセット評価をコモディティGPUにオフロードする。
15kレコードのNSL-KDDデータセットでは、IG-GPUはIGのマルチコアCPU実装よりも116倍のスピードアップを示している。
論文 参考訳(メタデータ) (2025-07-16T12:38:19Z) - 70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float [52.079202872069835]
大規模言語モデル(LLM)や拡散モデル(DM)といった大規模AIモデルは急速に成長している。
圧縮フレームワークであるDynamic-Length Float (DFloat11) を導入し, LLM と DM サイズを30%削減した。
論文 参考訳(メタデータ) (2025-04-15T22:38:38Z) - Speedy MASt3R [68.47052557089631]
MASt3Rは、DUSt3Rを活用して高速な相互マッチング方式を導入することで、画像マッチングを3Dタスクとして再定義する。
高速MASt3Rは、精度を犠牲にすることなく、推論時間(画像ペアあたり198msから91ms)を54%削減する。
この進歩により、リアルタイムな3D理解が可能になり、複合現実ナビゲーションや大規模3Dシーン再構築といったアプリケーションに恩恵をもたらす。
論文 参考訳(メタデータ) (2025-03-13T03:56:22Z) - HeadInfer: Memory-Efficient LLM Inference by Head-wise Offloading [79.38548165722229]
HEADINFERはKVキャッシュをCPURAMにオフロードするが、GPU上のトランスフォーマー層のKVキャッシュを完全に保存する必要はない。
HEADINFERはメモリフットプリントを大幅に削減し,計算効率を向上することを示した。
論文 参考訳(メタデータ) (2025-02-18T06:26:05Z) - Fast Inference with Kronecker-Sparse Matrices [4.387337528923525]
KS行列乗算のための既存のGPUカーネルは、高いデータ移動コストに悩まされている。
本稿では、これらのオーバーヘッドを解消する、融合した出力定常GPUカーネルを提案する。
FP32では,VT-S/16では最大22%,GPT-2媒体では16%のレイテンシ低下を示した。
論文 参考訳(メタデータ) (2024-05-23T19:36:10Z) - Efficient and Generic 1D Dilated Convolution Layer for Deep Learning [52.899995651639436]
幅広いパラメータをカバーする汎用的な1D畳み込み層の効率的な実装を紹介します。
特にIntel AVX-512とAVX-512 BFloat16命令を含むアーキテクチャ向けに最適化されている。
本稿では,最適化された1次元畳み込み層の性能を,実際のゲノミクスデータセットを用いたエンドツーエンドニューラルネットワークトレーニングで実証する。
論文 参考訳(メタデータ) (2021-04-16T09:54:30Z) - Hybrid Models for Learning to Branch [81.93868699246214]
我々はCPUマシン上で効率的な分岐を行うための新しいハイブリッドアーキテクチャを提案する。
提案アーキテクチャは,GNNの表現力と分岐処理のための計算コストの低い多層パーセプトロン(MLP)を組み合わせる。
論文 参考訳(メタデータ) (2020-06-26T21:03:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。