論文の概要: Learning Exact NVIDIA SASS Encoders with $\mathbb{F}_2$ Linear Algebra
- arxiv url: http://arxiv.org/abs/2608.20532v1
- Date: Thu, 20 Aug 2026 19:51:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.191808
- Title: Learning Exact NVIDIA SASS Encoders with $\mathbb{F}_2$ Linear Algebra
- Title(参考訳): $\mathbb{F}_2$リニア代数を用いたNVIDIA SASSエンコーダの学習
- Abstract要約: F2Asmは128ビットのSASSエンコーダをペア化された分解と元のCUBIN命令から学習する。
F2Asmは、SASS命令エンコーダをF2上のベクトル値アフィンマップとして学習した最初のシステムである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: NVIDIA provides a SASS disassembler but no public SASS assembler for recent data-center GPUs, limiting controlled machine-code rewriting. We present F2Asm, which learns exact 128-bit SASS encoders from paired disassembly and original CUBIN instruction words. To our knowledge, F2Asm is the first system to learn SASS instruction encoders as vector-valued affine maps over F2 and the first open-source NVIDIA SASS assembler to support Rubin SM107. F2Asm uses Gaussian elimination over F2 to incrementally build a compact basis, detect inconsistencies, and reject inputs outside the learned span. F2Asm separates target-specific control bits, relocation rules, and CUBIN metadata from its learning algorithm. We train encoders for Hopper SM90/SM90a, Blackwell SM100, and Rubin SM107 using 3,225 CUBINs from pinned NVIDIA and third-party production libraries, CUDA 13.3 packages, and CUDA 13.4 Developer Preview archives. In round-trip tests, F2Asm reassembles the disassembled SASS for each CUBIN, and all compared executable text sections match the originals exactly.
- Abstract(参考訳): NVIDIAはSASSアセンブラを提供するが、最近のデータセンターGPUのためのパブリックSASSアセンブラはなく、制御されたマシンコードの書き換えを制限する。
F2Asmは128ビットのSASSエンコーダをペア化された分解と元のCUBIN命令から学習する。
我々の知る限り、F2Asmは、F2上のベクトル値アフィンマップとしてSASS命令エンコーダを学習する最初のシステムであり、Rubin SM107をサポートする最初のオープンソースのNVIDIA SASSアセンブラである。
F2AsmはF2上のガウス除去を用いて、コンパクトな基底を漸進的に構築し、不整合を検出し、学習したスパンの外側の入力を拒否する。
F2Asmは、ターゲット固有の制御ビット、リロケーションルール、CUBINメタデータを学習アルゴリズムから分離する。
我々は、NVIDIAおよびサードパーティ製ライブラリの3,225個のCUBIN、CUDA 13.3パッケージ、CUDA 13.4 Developer Previewアーカイブを使用して、Hopper SM90/SM90a、Blackwell SM100、Rubin SM107のエンコーダを訓練する。
ラウンドトリップテストでは、F2AsmはCUBINごとに分解されたSASSを再組み立てし、比較可能なテキストセクションはすべてオリジナルと正確に一致する。
関連論文リスト
- PySIFT: GPU-Resident Deterministic SIFT for Deep Learning Vision Pipelines [0.22940141855172033]
DSPマルチスケールプールを用いた古典SIFTは,神経記述子や配向置換よりも優れていた。
In this present PySIFT, a first fully GPU-resident SIFT, implemented in CuPy/Numba kernels with DLPack zero-copy handoff to downstream DL framework。
論文 参考訳(メタデータ) (2026-05-18T05:24:55Z) - Resource-Efficient Iterative LLM-Based NAS with Feedback Memory [49.44875022114861]
ニューラルアーキテクチャサーチ(NAS)はネットワーク設計を自動化するが、従来の手法ではかなりの計算資源を必要とする。
本稿では,大規模言語モデル(LLM)を活用して,畳み込みニューラルネットワークアーキテクチャを反復的に生成し,評価し,洗練するクローズドループパイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-12T16:00:22Z) - CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation [51.72529978689561]
Agentは、カーネルの専門知識を3つのコンポーネントで開発する大規模なエージェント強化学習システムである。
AgentはKernelBench上で、トーチコンパイルよりも100%、100%、92%高速なレートを提供する。
論文 参考訳(メタデータ) (2026-02-27T18:58:05Z) - VibeTensor: System Software for Deep Learning, Fully Generated by AI Agents [42.56489784841984]
実装の変更が生成され、エージェントが提案する差分として適用される。
アーキテクチャを説明し、システムの生成と検証に使用するワークフローを要約し、アーティファクトを評価する。
論文 参考訳(メタデータ) (2026-01-21T19:29:00Z) - CASS: Nvidia to AMD Transpilation with Data, Models, and Benchmark [8.97422045170539]
クロスアーキテクチャGPUコードトランスパイレーションのための,最初の大規模データセットとモデルスイートであるCASSを紹介する。
データセットは、ホストとデバイス間で70万の検証済みコードペアで構成されている。
ドメイン固有言語モデルのCASSファミリーを訓練し、95%のソース翻訳精度と37.5%のアセンブリ翻訳精度を達成する。
論文 参考訳(メタデータ) (2025-05-22T17:48:53Z) - Rethinking End-to-End 2D to 3D Scene Segmentation in Gaussian Splatting [86.15347226865826]
We design an new end-to-end object-aware lifting approach, called Unified-Lift。
コントラスト損失を用いて学習したガウスレベルの機能を各ガウス点に拡張し、インスタンス情報をエンコードする。
LERF-Masked、Replica、Messy Roomsの3つのベンチマークで実験を行った。
論文 参考訳(メタデータ) (2025-03-18T08:42:23Z) - A Case Study in CUDA Kernel Fusion: Implementing FlashAttention-2 on
NVIDIA Hopper Architecture using the CUTLASS Library [0.7366405857677227]
我々は、NVIDIA Hopperアーキテクチャをターゲットとしたカスタムフューズカーネルとして、FlashAttention-2の前方パスの最適化実装を提供する。
最新のNVIDIA Ampereアーキテクチャ向けに最適化されたFlashAttention-2のバージョンよりも20~50%高いFLOP/sを観測した。
論文 参考訳(メタデータ) (2023-12-19T07:56:25Z) - CUDA: Convolution-based Unlearnable Datasets [77.70422525613084]
現代のディープラーニングモデルの大規模なトレーニングは、Web上の公開データに大きく依存している。
最近の研究は、小さくて特殊なノイズを加えることによって、ディープラーニングモデルのためのデータを作ることを目的としている。
これらの手法は、敵の訓練(AT)に対して脆弱であり、または/または計算的に重い。
論文 参考訳(メタデータ) (2023-03-07T22:57:23Z) - CARAFE++: Unified Content-Aware ReAssembly of FEatures [132.49582482421246]
この目標を達成するために、ユニバーサルで軽量で高効率なオペレータであるContent-Aware ReAssembly of FEatures(CARAFE++)を提案します。
CARAFE++は、インスタンス固有のコンテンツ認識処理を可能にするアダプティブカーネルをオンザフライで生成する。
計算のオーバーヘッドが無視できるすべてのタスクにおいて、一貫性と実質的な利益を示しています。
論文 参考訳(メタデータ) (2020-12-07T07:34:57Z) - XDA: Accurate, Robust Disassembly with Transfer Learning [23.716121748941138]
XDAは、トランスファーラーニングベースの分解フレームワークである。
マシンコードに存在するさまざまなコンテキスト依存を学習する。
IDA Proのような手書きの分解器より最大38倍速い。
論文 参考訳(メタデータ) (2020-10-02T04:14:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。