論文の概要: Unprivileged Topology Certificates for Cloud GPU Attestation
- arxiv url: http://arxiv.org/abs/2606.24934v1
- Date: Mon, 22 Jun 2026 11:33:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 17:05:30.049445
- Title: Unprivileged Topology Certificates for Cloud GPU Attestation
- Title(参考訳): プライベートなトポロジ証明書によるクラウドGPUの検証
- Abstract要約: クラウドテナントはモデル名とリージョンを受け取るが、ジョブを実行する物理アクセラレータを直接検査することはできない。
この設定のために、ソフトウェアのみのプリミティブを提示します。
プローブは、物理SMラベルと依存するグローバル負荷を用いて、メモリ毎の待ち行列を測定する。
- 参考スコア(独自算出の注目度): 0.2864713389096699
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cloud GPU tenants receive a model name and a region, but cannot directly inspect the physical accelerator that runs their job. We present a software-only attestation primitive for this setting. A CUDA probe measures an SM-by-memory-region latency matrix using physical SM labels and dependent global loads. A streaming reducer commits sufficient statistics, configuration, code hashes, network evidence, and a compressed raw data archive into a certificate that a verifier can check without a GPU. The certificate supports three claims. First, the per-SM latency map is a stable physical fingerprint. Over a six-hour full-load RTX 5090 run, its median temporal jitter is 0.09 cycles, while shape-only leave-one-out classification separates distinct Blackwell dies with 100.0% accuracy. Second, cache-bypassing HBM sweeps recover hardware-class topology across generations, including a unified Volta V100 memory domain, a two-way Hopper H200 L2 split, and a Blackwell B200 two-die NV-HBI package whose 74/74 SM partition carries a 30-cycle, 15.5 ns cross-die penalty. Third, public network landmarks bind the same certificate to a coarse location. In the B200 run, 169 RIPE Atlas probes place the server within 44 km of its claimed datacentre and reject all 11 decoy sites. Together, these measurements check cloud-GPU identity, class, and coarse location without privileged access or a vendor key.
- Abstract(参考訳): クラウドGPUテナントはモデル名とリージョンを受け取るが、ジョブを実行する物理アクセラレータを直接検査することはできない。
この設定のために,ソフトウェアのみの検証プリミティブを提案する。
CUDAプローブは、物理SMラベルと依存グローバル負荷を用いて、メモリ毎の待ち行列を測定する。
ストリーミングリデューサは、十分な統計、構成、コードハッシュ、ネットワークエビデンス、圧縮された生データアーカイブをGPUなしで検証できる証明書にコミットする。
この証明書は3つの主張を支持している。
まず、SMごとのレイテンシマップは安定した物理指紋である。
6時間にわたるフルロードのRTX 5090ランでは、中央の時間ジッターは0.09サイクルであり、形状のみの1回限りの分類ではブラックウェルの死亡は100.0%の精度で区別される。
第二に、キャッシュバイパスHBMは、Volta V100メモリドメイン、双方向ホッパーH200 L2分割、ブラックウェルB200の2次元NV-HBIパッケージ、74/74 SMパーティションが30サイクル、15.5 nsのクロスディーペナルティを含む、世代にわたってハードウェアクラスのトポロジを回復する。
第3に、公開ネットワークのランドマークは、同じ証明書を粗い場所にバインドする。
B200のランニングでは、169のRIPE Atlasプローブがサーバを主張するデータセンタの44km以内に配置し、11のデコイサイトをすべて拒否する。
これらの測定は、特権的なアクセスやベンダーキーなしでクラウドGPUのアイデンティティ、クラス、粗いロケーションをチェックする。
関連論文リスト
- Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control [0.0]
固定シェアF, 正確なオフラインシェアP*, ローカルアッパーバウンドU, オンライン達成シェアAを用いて, 既定コホート境界を定式化する。
別のメカニズムの研究では、4バイトをホストに返さずに、GPUで計算されたバイナリ決定をデバイスに保持している。
論文 参考訳(メタデータ) (2026-08-12T14:42:15Z) - Device-First Feedback: Toward Mobile-Native LLM-Driven Neural Architecture Search [44.70501115891534]
アーキテクチャ生成LLMのQLoRA微調整からループを閉じる自動モバイルデプロイメントパイプラインを提案する。
我々はSamsung SM-P613タブレット上で,CIFAR-10とCIFAR-100の2つのベンチマークで同じ凍結プロトコルを評価した。
論文 参考訳(メタデータ) (2026-07-29T14:36:45Z) - SENTRY: SAM2-Enhanced Neighbor-Aware and Temporally Reasoned Memory for Visual Tracking [39.49925011934288]
SAM2ベースのビジュアルオブジェクトトラッキングにおけるメモリ更新機構を再検討する。
本稿では,SENTRYについて紹介する。
コミットする前に、各メモリ更新を短時間の時間的一貫性で検証する。
論文 参考訳(メタデータ) (2026-06-23T11:35:15Z) - The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing [6.69555823710995]
GPU-CCはNVIDIA B300上でGPUローカルなパフォーマンスを保ち、BF16 matmulは信頼できないパフォーマンスの0.998倍で動作する。
しかし、Intel TDXとGPU-CCは依然として13~27%のスループットを失い、KV-cache復元のレイテンシは2倍以上になる。
ブリッジモデルは+131%のKVストアのペナルティと34倍のモデルスローダウンを説明する。
論文 参考訳(メタデータ) (2026-06-22T21:48:53Z) - Non-Uniform L2 Cache Latency Across the Streaming Multiprocessors of an NVIDIA L40 [0.2864713389096699]
NVIDIA L40は96MiB L2キャッシュを公開する。
L2-hitレイテンシは、物理ストリーミングマルチプロセッサ(SM)がどの負荷に対処するかに強く、再現的に依存します。
ターンシリアライズされた %smid-resolved プローブは、1回の打ち上げで142個のSMの全てのヒット遅延をマッピングする。
論文 参考訳(メタデータ) (2026-06-21T16:50:45Z) - AutoMegaKernel: A Statically-Checked Agent Harness for Self-Retargeting Megakernel Synthesis [0.0]
AutoMegaresearchKernel (AMK)はHuggingFace Llamaファミリーモデルを単一の永続的なカーネルにコンパイルし、1回の起動で全前方パスを実行する。
AMKは、高帯域のトレーニングクラスであるA100/H100でcuBLASをパスし、ハーネスがクロスSM同期ボトルネックをローカライズする。
これはデコード位置0における精度非対称(W8A16とbf16)の比較であり、最大の実チェックポイントはTinyLlama-1.1Bである。
論文 参考訳(メタデータ) (2026-06-08T16:02:03Z) - Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment [60.442064966340524]
本稿では、WiFi経由で接続されたNVIDIA Jetson Orin Nanoデバイスに関するプロトタイプ研究を行う。
主な発見は、主なボトルネックは、ネットワーク帯域幅だけでなく、通信中のCPU-GPUステージングである。
実験によると、この戦略はフルテンソル交換と比較して遅延を65%-77%減らし、エネルギー消費を34%-52%減らしている。
論文 参考訳(メタデータ) (2026-05-25T10:39:28Z) - Resource-Efficient Iterative LLM-Based NAS with Feedback Memory [49.44875022114861]
ニューラルアーキテクチャサーチ(NAS)はネットワーク設計を自動化するが、従来の手法ではかなりの計算資源を必要とする。
本稿では,大規模言語モデル(LLM)を活用して,畳み込みニューラルネットワークアーキテクチャを反復的に生成し,評価し,洗練するクローズドループパイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-12T16:00:22Z) - VibeTensor: System Software for Deep Learning, Fully Generated by AI Agents [42.56489784841984]
実装の変更が生成され、エージェントが提案する差分として適用される。
アーキテクチャを説明し、システムの生成と検証に使用するワークフローを要約し、アーティファクトを評価する。
論文 参考訳(メタデータ) (2026-01-21T19:29:00Z) - CompTrack: Information Bottleneck-Guided Low-Rank Dynamic Token Compression for Point Cloud Tracking [43.89894227481455]
LiDARポイントクラウドにおける3Dオブジェクトトラッキングは、コンピュータビジョンと自律運転において重要なタスクである。
成功をおさめたにもかかわらず、ポイントクラウドの本質的な分散性は、二重冗長性の問題をもたらす。
我々は、ポイントクラウドにおける両方の冗長性を体系的に排除する、新しいエンドツーエンドフレームワークであるCompTrackを提案する。
論文 参考訳(メタデータ) (2025-11-19T16:12:24Z) - BOLT: Bandwidth-Optimized Lightning-Fast Oblivious Map powered by Secure HBM Accelerators [13.90111222973057]
クラウド実行環境は、パターンリークへのアクセスに対して脆弱である。
Oblivious Mapsは、アクセスパターンを隠すことによってこれを緩和するが、高いオーバーヘッドに悩まされる。
本稿では,光速OMAP加速器BOLTについて述べる。
論文 参考訳(メタデータ) (2025-09-01T19:49:21Z) - GPU-Accelerated Interpretable Generalization for Rapid Cyberattack Detection and Forensics [0.0]
IGメカニズムは最近IEEE Transactions on Information Forensics and Securityで公開され、最先端のエビデンスベースの侵入検知を提供する。
我々は、PyTorchの再設計であるIG-GPUを紹介し、すべてのペアの交叉とサブセット評価をコモディティGPUにオフロードする。
15kレコードのNSL-KDDデータセットでは、IG-GPUはIGのマルチコアCPU実装よりも116倍のスピードアップを示している。
論文 参考訳(メタデータ) (2025-07-16T12:38:19Z) - Endor: Hardware-Friendly Sparse Format for Offloaded LLM Inference [47.043257902725294]
本研究では, 圧縮率が高く, 減圧オーバーヘッドの少ない非ゼロ値に対して, 刈り取られたLLM重みの非構造スパースパターンを圧縮する新しいスパース形式を提案する。
一般的なHugingface Accelerateを使ったオフロード推論と比較して、EndorはOPT-66Bを1.70倍、Llama2-70Bを1.78倍加速する。
論文 参考訳(メタデータ) (2024-06-17T15:55:08Z) - EAutoDet: Efficient Architecture Search for Object Detection [110.99532343155073]
EAutoDetフレームワークは、1.4GPU日でオブジェクト検出のための実用的なバックボーンとFPNアーキテクチャを検出できる。
本稿では,一方のエッジ上での候補演算の重みを共有し,それらを一つの畳み込みに集約することでカーネル再利用手法を提案する。
特に、発見されたアーキテクチャは最先端のオブジェクト検出NAS法を超越し、120 FPSで40.1 mAP、49.2 mAP、41.3 FPSをCOCOテストデブセットで達成している。
論文 参考訳(メタデータ) (2022-03-21T05:56:12Z) - Video-based Person Re-identification without Bells and Whistles [49.51670583977911]
ビデオベースの人物再識別(Re-ID)は、異なるカメラの下で歩行者を特定するために、ビデオトラッカーとトリミングされたビデオフレームをマッチングすることを目的としている。
従来の方法による不完全な検出と追跡の結果から, 収穫したトラックレットの空間的, 時間的不整合が生じている。
本稿では,深層学習に基づくトラックレットの検出と追跡を適用することで,これらの予期せぬノイズを効果的に低減できる簡易な再検出リンク(DL)モジュールを提案する。
論文 参考訳(メタデータ) (2021-05-22T10:17:38Z) - Hashing-based Non-Maximum Suppression for Crowded Object Detection [63.761451382081844]
オブジェクト検出のための非最大ボックスを効率的に抑制するアルゴリズム,HNMS(Hash-based non-maximumpression)を提案する。
2段階検出器では、領域提案ネットワークにおけるNMSをHNMSに置き換え、相当の精度でかなりのスピードアップを観測する。
CARPK、SKU-110K、CrowdHumanデータセットを用いて実験を行い、HNMSの有効性と有効性を示す。
論文 参考訳(メタデータ) (2020-05-22T23:45:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。