論文の概要: Task-Aware QUBO Allocation for Mixed-Precision Quantization
- arxiv url: http://arxiv.org/abs/2609.22238v2
- Date: Wed, 23 Sep 2026 00:08:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.799481
- Title: Task-Aware QUBO Allocation for Mixed-Precision Quantization
- Title(参考訳): 混合精度量子化のためのタスク対応QUBOアロケーション
- Abstract要約: 混合精度量子化は、重み付けとアクティベーションビット幅を個別に割り当て、次いで選択したネットワークの回復を必要とする。
タスク対応の2次非拘束二元最適化(QUBO)を、異なる重みとアクティベーションプロファイルを持つサロゲートとして開発する。
品質、達成されたコスト、ルーティングの安定性、最適化のコストを一緒に評価する。
- 参考スコア(独自算出の注目度): 0.09320657506524148
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixed-precision quantization requires discrete allocation of weight and activation bit-widths, followed by recovery of the selected network. We develop a task-aware quadratic unconstrained binary optimization (QUBO) surrogate with separate weight and activation profiles, a bit-operation (BOP) cost, and selected structural priors. QUBO provides a network-wide allocation that can be refined through direct validation-based PROTES search. On a compact NAFBlock-based denoiser, the refined route achieves 37.192 dB after LSQ+ at 4.035\% routed-layer BOPs, versus 37.092 dB at 4.101\% for a HAWQ-style baseline. The repeated-search primary experiment shows that LSQ+ largely closes the quality gap between QUBO allocation and expensive direct refinement. An additional restoration architecture retains a larger recovered gain, indicating that refinement's value depends on architecture and recovery. We evaluate quality, achieved cost, routing stability and optimization expense together. Deployment measurements characterize a fake-quantized floating-point implementation; BOP reductions describe analytical allocation savings.
- Abstract(参考訳): 混合精度量子化は、重み付けとアクティベーションビット幅を個別に割り当て、次いで選択したネットワークの回復を必要とする。
タスク対応の2次非拘束二元最適化(QUBO)を、異なる重みとアクティベーションプロファイル、ビット演算(BOP)コスト、選択された構造的事前条件で構築する。
QUBO はネットワーク全体のアロケーションを提供し、直接検証ベースの PROTES 検索によって改善できる。
コンパクトなNAFBlockベースのデノイザでは、洗練されたルートはLSQ+の4.035\%のルーティング層BOPで37.192 dBを達成するが、HAWQスタイルのベースラインでは37.092 dBが4.101\%となる。
繰り返し調査された一次実験は、LSQ+がQUBOアロケーションと高価な直接精製の間の品質ギャップをほとんど埋めていることを示している。
さらなる復元アーキテクチャは、リカバリの利益を大きく保ち、リカバリの価値はアーキテクチャとリカバリに依存していることを示している。
品質、達成されたコスト、ルーティングの安定性、最適化のコストを一緒に評価する。
配置測定は、偽量子化浮動小数点の実装を特徴付け、BOP削減は分析的アロケーションの削減を記述している。
関連論文リスト
- Adaptive Error Budget Allocation for Fault-Tolerant Quantum Resource Estimation: A Metaheuristic Approach [0.14323566945483496]
システムレベルのリソース推定は、フォールトトレラントな量子コンピューティングツールチェーンの重要なコンポーネントである。
そこで我々は,Azure Quantum Resource Estor上で,微分自由探索を直接行うトレーニングフリー最適化フレームワークを提案する。
MQTベンチの31ファミリーから2から91キュービットに及ぶ433個の回路上で,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-08-16T07:14:29Z) - Agent-UCT: Upper Confidence Bounds Applied to Trees for Agentic Workflow Optimization with Cost-Awareness [11.231092673447735]
本稿では,木に応用したエージェントベースのコスト・アウェア・アッパー・バウンドを提案する。これは,2部目のプレフィックス・リユース・グラフから得られた再利用・アウェア・レギュラー化項を用いて,UCTを拡張した木探索アルゴリズムである。
Agent-UCTは、以前実体化された設定プレフィックスを利用したブランチに対する選択をバイアスし、効果的な探索を維持しながら冗長な実行を減らす。
WTB(Workflow Test Bench)は、決定論的リプレイ、コンテンツ適応可能なキャッシング、トランザクション一貫性を提供し、中間状態が一度実体化され、検索計算全体で再利用されることを保証する。
論文 参考訳(メタデータ) (2026-07-27T08:41:18Z) - Multi-Agent Scheduling with LLM-Assisted Contract Net Negotiation for Stream Processing in Mobile Edge Computing [0.0]
ストリームクラスタシステムは、異質なモバイルエッジクラウドインフラストラクチャで運用されるようになっている。
本稿では,emphLLM-MR-CNPを主役とするemphMAS-DecStreamを提案する。
MAS-DecStreamは遅延違反を3%に減らし、リソース過剰を排除し、20エージェントの競合解決率0.91に達し、マルチラウンドルールベースのベースラインよりも最大22%改善する。
論文 参考訳(メタデータ) (2026-07-19T13:06:58Z) - CAGE: Curvature-Aware Gradient Estimation For Accurate Quantization-Aware Training [73.46600457802693]
本稿では,量子化による損失に対応する新しい手法を提案する。
CAGEは、同様の計算コストで、精度の観点から最先端の手法を大幅に改善する。
LlamaモデルのQAT事前トレーニングでは、CAGEは4ビット(W4A4)で達成された精度と事前のベストメソッドとを一致させる。
論文 参考訳(メタデータ) (2025-10-21T16:33:57Z) - Beyond Outliers: A Study of Optimizers Under Quantization [82.75879062804955]
量子化下でのモデルロバスト性に対する選択の影響について検討する。
モデルの性能が、異なるベースラインでトレーニングした場合にどのように低下するかを評価する。
異なるパラメータによる量子化対応トレーニングのスケーリング法則を導出する。
論文 参考訳(メタデータ) (2025-09-27T21:15:22Z) - Compute-Optimal Quantization-Aware Training [50.98555000360485]
量子化対応トレーニング(QAT)は、量子化されたニューラルネットワークの精度を向上させるための主要な技術である。
従来の研究では、トレーニングを完全精度(FP)フェーズに分解し、QATフェーズが続くと、より優れた精度が得られることが示されている。
最終性能に及ぼすQAT時間の影響について検討する。
論文 参考訳(メタデータ) (2025-09-26T21:09:54Z) - End-to-End On-Device Quantization-Aware Training for LLMs at Inference Cost [53.25965863436039]
量子化対応トレーニング(QAT)は、より原則化されたソリューションを提供するが、バックプロパゲーションに依存しているため、メモリコストは禁じられている。
重み付けとアクティベーション量子化の両方をサポートするゼロオーダー最適化ベースのQATフレームワークであるZeroQATを提案する。
実験の結果、ZeroQATはPTQとQATのベースラインを一貫して上回り、メモリは大幅に削減された。
論文 参考訳(メタデータ) (2025-08-21T01:18:27Z) - Cost-Sensitive Multi-Fidelity Bayesian Optimization with Transfer of Learning Curve Extrapolation [55.75188191403343]
各ユーザが事前に定義した機能であるユーティリティを導入し,BOのコストと性能のトレードオフについて述べる。
このアルゴリズムをLCデータセット上で検証した結果,従来のマルチファイルBOや転送BOベースラインよりも優れていた。
論文 参考訳(メタデータ) (2024-05-28T07:38:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。