論文の概要: TokenPowerSandbox: Evidence-Gated CPU-First Screening for Energy-Aware LLM Serving
- arxiv url: http://arxiv.org/abs/2608.18149v1
- Date: Tue, 11 Aug 2026 03:27:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.156032
- Title: TokenPowerSandbox: Evidence-Gated CPU-First Screening for Energy-Aware LLM Serving
- Title(参考訳): TokenPowerSandbox:Evidence-Gated CPU-First Screening for Energy-Aware LLM Serving
- Authors: Chenxu Niu,
- Abstract要約: TokenPowerSandboxは、解釈可能なCPUレジデントプロジェクタ、ショートターゲットGPUプローブ、フルワークロード検証、タンパーエビデント凍結前測定の証明を組み合わせたエビデンスゲートワークフローである。
- 参考スコア(独自算出の注目度): 1.624454100511275
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Energy-aware LLM serving requires comparing configurations under realistic request shapes, yet exhaustive target-GPU profiling is costly and a cheap predictor can be dangerously confident outside its measured scope. We present TokenPowerSandbox, an evidence-gated workflow that combines an interpretable CPU-resident projector, short target-GPU probes, full-workload verification, and tamper-evident freeze-before-measurement provenance. On one NVIDIA H100 80GB serving Qwen2.5-7B-Instruct with vLLM, three anchor repeats and six development workloads calibrate workload transfer. The same frozen model is evaluated on a blind holdout and a separately predeclared no-refit confirmation totaling 51 post-freeze runs. Energy MAPE is 6.23% and 7.35%, with Spearman rank correlations of 0.976 and 0.933. However, a predeclared TTFT gate passes at concurrency four (9.27% MAPE) and triggers abstention below four (64.80%), showing why energy accuracy cannot certify latency.
- Abstract(参考訳): エネルギーを意識したLCMサービスでは、現実的な要求形状で構成を比較する必要があるが、徹底的なターゲットGPUプロファイリングはコストがかかり、安価な予測器は測定範囲外において危険な信頼性を持つことができる。
TokenPowerSandboxは、解釈可能なCPUレジデントプロジェクタ、ショートターゲットGPUプローブ、フルワークロード検証、タンパーエビデントフリーズ前測定の証明を組み合わせたエビデンスゲートワークフローである。
Qwen2.5-7B-InstructをvLLMで提供するNVIDIA H100 80GBでは、3つのアンカーリピートと6つの開発ワークロードがワークロード転送をキャリブレーションする。
同じ凍結モデルが、ブラインドホールドアウトと、別々に宣言された、51回のポストフリーズランで評価される。
エネルギーMAPEは6.23%と7.35%であり、スピアマンのランク相関は0.976と0.933である。
しかし、事前宣言されたTTFTゲートはコンカレンシー4 (9.27% MAPE) を通過し、4 (64.80%) 未満の停止を引き起こすため、なぜエネルギー精度が遅延を証明できないのかを示す。
関連論文リスト
- Jetson-ORB-SLAM3: Accuracy-Preserving GPU Implementation for Edge Computing Devices [0.09558392439655011]
NVIDIA Jetson Orin Nano用のORB-SLAM3の精度保存GPU実装を提案する。
単分子慣性モードでは、システムは11個のEuRoC配列で32FPSの平均を維持できる。
論文 参考訳(メタデータ) (2026-08-18T15:07:37Z) - Operating Multi-Node Full Fine-Tuning on NVIDIA B300: A Field Report on Telemetry-Based Triage, Negative Results, and Operational Hardening [6.384763560610076]
我々は16 x NVIDIA B300(FSDP/Zero-3)上の32.76Bパラメータ密度モデル(Qwen3-32B)をフルチューニングした運用経験を報告する。
我々の貢献は、新しいハードウェア上でのフィールド体験と調整された一連の測定である。
我々は、PyTorchの文書化されたJoin / equalize-to-minimumプラクティスに対するインスタンスを配置する。
論文 参考訳(メタデータ) (2026-08-06T12:11:25Z) - A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi [0.0]
このレポートはハードウェアを維持し、適合するモデルに何ができるかを尋ねる。
SigLIP2エンコーダとウィンドウアテンションマージを組み合わせた,現代的なマルチモーダルアシスタントであるMini-V-4.6をデプロイする。
システムは、画像質問のエンドツーエンドを1.7秒で答える。
論文 参考訳(メタデータ) (2026-07-16T04:48:44Z) - Embedded Arena: Iterative Optimization via Hardware Feedback [44.54626665766497]
エージェント共最適化は、精度が3.3%、オーディオが400倍、特徴誤差が6%の視覚モデルに対して250倍の圧縮を達成する。
Elk検出カメラトラップ(96.7%精度)と音声書き起こしウェアラブル(8.44%FER)の2つの実世界のシステムにおける実用的影響を実証する。
論文 参考訳(メタデータ) (2026-06-15T04:04:23Z) - NITP: Next Implicit Token Prediction for LLM Pre-training [62.744626632562664]
本研究では,表現空間に直接集中的監督を施した離散予測を増大させるために,Next Implicit Token Prediction (NITP)を提案する。
NITPは、安定な自己教師対象と同じモデルから浅層表現を用いて、次のトークンの暗黙的なセマンティック内容を予測するようにモデルを訓練する。
実験的には、0.5Bから9Bのパラメータを含む高密度モデルとMoEモデルにまたがって、NITPは無視できる計算オーバーヘッドでダウンストリーム性能を一貫して改善する。
論文 参考訳(メタデータ) (2026-05-24T09:13:12Z) - Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX [2.6853734738584047]
本稿では,1個のNVIDIA H100 80GB GPU上での標準非機密実行と秘密計算モードとの比較を行った。
その結果、秘密のGPU推論は、負荷下で使用可能なスループットを維持することができるが、キャパシティプランニングは、安定したスループットペナルティと、より大きなモデルで観測された初期の飽和挙動の両方を考慮しなければならない。
論文 参考訳(メタデータ) (2026-05-20T22:52:12Z) - Brain-inspired spike-timing plasticity for reliable label-efficient event-camera vision [0.3823356975862005]
ローカルスパイクタイピング依存可塑性(STDP)モジュールは、GPUをサポートせずに単一のCPUスレッドで動作する。
密度勾配訓練検出器は, 勾配訓練, 密度行列乗算, 局所可塑性自由運転を建設によって組み合わせることができない。
論文 参考訳(メタデータ) (2026-05-17T22:56:16Z) - LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs [45.51664355320938]
本稿では,コモディティGPU上での3Bから32Bパラメータなど,中規模の言語モデルトレーニングのためのエンドツーエンド/C++実装を提案する。
これは、標準的な8ビットトレーニングパイプラインを実行し、追加のアルゴリズム近似なしで実行し、FLOP使用率を約50%維持する。
論文 参考訳(メタデータ) (2025-12-17T10:51:45Z) - Shallow Cross-Encoders for Low-Latency Retrieval [69.06104373460597]
BERTやT5のような大きなトランスフォーマーモデルに基づくクロスエンコーダは計算コストが高く、非常に小さな遅延ウィンドウ内で少数の文書しかスコアできない。
より弱い浅層変圧器モデル(すなわち、層数が限られている変圧器)は、これらの実用的な低レイテンシ設定に制約された場合、実際にフルスケールモデルよりも優れた性能を示すことを示す。
論文 参考訳(メタデータ) (2024-03-29T15:07:21Z) - It Takes Two: Masked Appearance-Motion Modeling for Self-supervised
Video Transformer Pre-training [76.69480467101143]
自己監督型ビデオトランスフォーマーの事前トレーニングは、最近マスク・アンド・予測パイプラインの恩恵を受けている。
本稿では,映像中の動きの手がかりを余分な予測対象として明示的に調査し,マスケッド・出現運動モデリングフレームワークを提案する。
一般的なビデオ表現を学習し、Kinects-400で82.3%、Something V2で71.3%、UCF101で91.5%、HMDB51で62.5%を達成する。
論文 参考訳(メタデータ) (2022-10-11T08:05:18Z) - FastFlowNet: A Lightweight Network for Fast Optical Flow Estimation [81.76975488010213]
ディセンス光学フロー推定は、多くのロボットビジョンタスクで重要な役割を果たしています。
現在のネットワークはしばしば多くのパラメータを占有し、計算コストがかかる。
提案したFastFlowNetは、周知の粗大なやり方で、以下のイノベーションで機能する。
論文 参考訳(メタデータ) (2021-03-08T03:09:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。