論文の概要: TherMapNet Attention-Guided Runtime Full-Chip Thermal Map Prediction from Performance Metrics
- arxiv url: http://arxiv.org/abs/2608.21887v1
- Date: Sat, 22 Aug 2026 10:00:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.510434
- Title: TherMapNet Attention-Guided Runtime Full-Chip Thermal Map Prediction from Performance Metrics
- Title(参考訳): TherMapNet Attention-Guided Runtime Full-Chip Thermal Map Prediction from Performance Metrics
- Abstract要約: TherMapNetは、パフォーマンス指標から直接フルチップの熱マップを予測する、注意誘導型熱シミュレータである。
Transformerエンコーダは、各メトリックの時系列をトークンとして扱うことで、時間的進化をキャプチャする。
その後、CNNはきめ細かい空間特徴を抽出する。
- 参考スコア(独自算出の注目度): 14.23014892482236
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Runtime thermal management of high-performance chips depends on fast and accurate full-chip thermal maps. Conventional simulators typically estimate power traces from performance metrics first, which adds overhead. This work proposes TherMapNet, an attention-guided thermal simulator that predicts full-chip thermal maps directly from performance metrics. A Transformer encoder captures temporal evolution by treating the time series of each metric as a token, improving modeling of dynamic workloads. A CNN then extracts fine-grained spatial features. For the CNN, a dual-branch channel-spatial attention convolution module (DACM) and a triplet loss are used to improve spatial learning and reconstruction accuracy. TherMapNet is applied to a multi-core CPU (AMD Ryzen 7 4800U) and a many-core GPU (NVIDIA GeForce RTX 4060). Experiments show that it outperforms prior thermal simulators, with RMSE below 0.26 C and inference under 2.4 ms on an NVIDIA GeForce RTX 3090 GPU. These results indicate that TherMapNet can support high-quality runtime thermal management of modern multi-core chips.
- Abstract(参考訳): 高性能チップの実行時熱管理は高速で正確な全チップ熱マップに依存する。
従来のシミュレータは、まずパフォーマンス指標から電力トレースを推定する。
本研究は,パフォーマンス指標から直接全チップ熱マップを予測するアテンション誘導熱シミュレータであるTherMapNetを提案する。
Transformerエンコーダは、各メトリックの時系列をトークンとして扱い、動的ワークロードのモデリングを改善することで、時間的進化をキャプチャする。
その後、CNNはきめ細かい空間特徴を抽出する。
CNNでは、空間学習と再構成精度を向上させるために、二重分岐チャネル空間注意畳み込みモジュール(DACM)と三重項損失を用いる。
TherMapNetはマルチコアCPU(AMD Ryzen 7 4800U)とマルチコアGPU(NVIDIA GeForce RTX 4060)に適用される。
実験によると、RMSEは0.26C未満、推論はNVIDIA GeForce RTX 3090 GPUで2.4ms以下である。
これらの結果は,最新のマルチコアチップの高品質な実行時熱管理をサポートできることを示唆している。
関連論文リスト
- LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation [84.86814271505109]
LongLive-2.0は、長いビデオ生成の完全なトレーニングと推論ワークフロー全体を通じて、NVFP4ベースの並列インフラストラクチャである。
トレーニングには,quence-parallel autoregressive (AR) トレーニングを導入する。
実験ではトレーニングで2.15倍、推論で1.84倍のスピードアップを示す。
論文 参考訳(メタデータ) (2026-05-18T17:57:03Z) - Optimizing Attention on GPUs by Exploiting GPU Architectural NUMA Effects [3.124720734513875]
我々は、従来のGPUカーネルスケジューリング戦略を損なうことなく、計算領域間でメモリレイテンシと帯域幅がいかに大きく変化するかを示す。
Swizzled Head-first Mappingは、注意をGPU NUMAドメインに合わせる空間認識型スケジューリング戦略である。
AMDのMI300Xアーキテクチャでは,最先端の注目アルゴリズムよりも50%高い性能を実現している。
論文 参考訳(メタデータ) (2025-11-03T23:48:39Z) - AIRMap -- AI-Generated Radio Maps for Wireless Digital Twins [7.32219702732606]
超高速無線マップ推定のためのディープラーニングフレームワークを提案する。
AirMapはNVIDIA L40Sで、推論毎に5dB RMSE以下でパスゲインを予測する。
フィールド測定の20%しか使用していない軽量な移動学習校正は、中央値の誤差を約10%に削減する。
論文 参考訳(メタデータ) (2025-10-28T15:15:48Z) - Multi-GPU RI-HF Energies and Analytic Gradients $-$ Towards High Throughput Ab Initio Molecular Dynamics [0.0]
本稿では,複数グラフィクス処理ユニット(GPU)を用いた高次ハートリー・フォックエネルギーと解析勾配の解法を最適化したアルゴリズムと実装を提案する。
このアルゴリズムは特に、中小分子(10-100原子)の高スループット初期分子動力学シミュレーションのために設計されている。
論文 参考訳(メタデータ) (2024-07-29T00:14:10Z) - Benchmarking Edge Computing Devices for Grape Bunches and Trunks
Detection using Accelerated Object Detection Single Shot MultiBox Deep
Learning Models [2.1922186455344796]
この研究は、オブジェクト検出のための異なるプラットフォームのパフォーマンスをリアルタイムでベンチマークする。
著者らは、自然なVineデータセットを使用して、RetinaNet ResNet-50を微調整した。
論文 参考訳(メタデータ) (2022-11-21T17:02:33Z) - EAutoDet: Efficient Architecture Search for Object Detection [110.99532343155073]
EAutoDetフレームワークは、1.4GPU日でオブジェクト検出のための実用的なバックボーンとFPNアーキテクチャを検出できる。
本稿では,一方のエッジ上での候補演算の重みを共有し,それらを一つの畳み込みに集約することでカーネル再利用手法を提案する。
特に、発見されたアーキテクチャは最先端のオブジェクト検出NAS法を超越し、120 FPSで40.1 mAP、49.2 mAP、41.3 FPSをCOCOテストデブセットで達成している。
論文 参考訳(メタデータ) (2022-03-21T05:56:12Z) - Accelerating Training and Inference of Graph Neural Networks with Fast
Sampling and Pipelining [58.10436813430554]
グラフニューラルネットワーク(GNN)のミニバッチトレーニングには、多くの計算とデータ移動が必要である。
我々は,分散マルチGPU環境において,近傍サンプリングを用いたミニバッチトレーニングを行うことを支持する。
本稿では,これらのボトルネックを緩和する一連の改良点について述べる。
また,サンプリングによる推論を支援する実験分析を行い,試験精度が実質的に損なわれていないことを示す。
論文 参考訳(メタデータ) (2021-10-16T02:41:35Z) - Adaptive Elastic Training for Sparse Deep Learning on Heterogeneous
Multi-GPU Servers [65.60007071024629]
本稿では,Adaptive SGDが4つの最先端ソリューションよりも精度が高いことを示す。
本稿では,Adaptive SGDが時間と精度で4つの最先端ソリューションより優れていることを示す。
論文 参考訳(メタデータ) (2021-10-13T20:58:15Z) - MFGNet: Dynamic Modality-Aware Filter Generation for RGB-T Tracking [72.65494220685525]
可視データと熱データ間のメッセージ通信を促進するために,新しい動的モダリティ対応フィルタ生成モジュール(MFGNet)を提案する。
我々は、2つの独立ネットワークを持つ動的モダリティ対応フィルタを生成し、その可視フィルタとサーマルフィルタをそれぞれ、対応する入力特徴写像上で動的畳み込み演算を行う。
重閉塞,高速移動,外見による問題に対処するため,新たな方向認識型目標誘導型アテンション機構を活用することで,共同で局所的・グローバル検索を行うことを提案する。
論文 参考訳(メタデータ) (2021-07-22T03:10:51Z) - A Simple Model for Portable and Fast Prediction of Execution Time and
Power Consumption of GPU Kernels [2.9853894456071077]
このモデルは、Parboil、Rodinia、Polybench-GPU、SHOCなどのベンチマークから189個の計算カーネルを使用してランダムなフォレストに基づいて構築されている。
クロスバリデーションを用いたモデル性能の評価では、中央値平均パーセンテージエラー(MAPE)は8.86-52.00%と1.84-2.94%で、それぞれ5つのGPUで電力予測を行う。
論文 参考訳(メタデータ) (2020-01-20T13:40:54Z) - Efficient Video Semantic Segmentation with Labels Propagation and
Refinement [138.55845680523908]
本稿では,ハイブリッドGPU/CPUを用いた高精細ビデオのリアルタイムセマンティックセマンティックセマンティック化の問題に取り組む。
i) CPU上では、非常に高速な光フロー法であり、ビデオの時間的側面を利用して、あるフレームから次のフレームへ意味情報を伝達するために使用される。
高解像度フレーム(2048 x 1024)を持つ一般的なCityscapesデータセットでは、単一のGPUとCPU上で80から1000Hzの動作ポイントが提案されている。
論文 参考訳(メタデータ) (2019-12-26T11:45:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。