論文の概要: InferOpt: Constrained Multi-Objective Search for LLM Inference Configurations
- arxiv url: http://arxiv.org/abs/2610.04473v1
- Date: Sat, 03 Oct 2026 12:19:09 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:05:53.562311
- Title: InferOpt: Constrained Multi-Objective Search for LLM Inference Configurations
- Title(参考訳): InferOpt: LLM推論設定のための制約付き多目的探索
- Abstract要約: InferOptは、変数境界、決定論的リソースコスト、評価フックのみを必要とする再利用可能な検索フレームワークである。
1つのパイプラインは28次元連続KV空間と26次元離散MoE空間をカバーしている。
InferOptは全KV基準点の7.3%と14.0%で一致した統一予算を破る。
- 参考スコア(独自算出の注目度): 10.870302114905913
- License:
- Abstract: Serving an LLM means setting dozens of inference-time knobs, from per-layer KV retention to per-layer expert counts. Practice sets them with mechanism-specific heuristics that return a single operating point and do not scale to layer-wise search spaces. We recast inference configuration as constrained multi-objective black-box optimization and build InferOpt, a reusable search framework that requires only variable bounds, a deterministic resource cost, and an evaluation hook. InferOpt searches on a frozen sampled proxy set, rejects over-budget candidates before any model call, tightens the budget adaptively, and re-validates Pareto representatives on full-scale dataset. One pipeline covers a 28-dimensional continuous KV space (Qwen2.5-7B) and a 26-dimensional discrete MoE space (DeepSeek-V2-Lite). On KV, post-prefill pruning cuts the 16K cache by 64.4% and TPOT by 22.9--48.5%, and the searched layer-wise budget by InferOpt beats a matched uniform budget by 7.3% and 14.0% of the Full KV reference points. On MoE, a searched top-k schedule by InferOpt removes 43.0% of routed token--expert pairs while staying within 0.59 points of the default, closer than the matched-budget baselines. Against Random Search, NSGA-II, and MOTPE, InferOpt leads on both spaces, taking the best proxy hypervolume and the lowest retention on KV and staying closest to the uncompressed reference at the lowest experts on MoE.
- Abstract(参考訳): LLMは、層ごとのKV保持から層ごとのエキスパート数まで、数十の推論時ノブを設定することを意味する。
プラクティスでは、単一の操作ポイントを返すメカニズム固有のヒューリスティックをセットし、レイヤワイズ検索スペースにスケールしない。
InferOptは、変数境界のみを必要とする再利用可能な検索フレームワークであり、決定論的リソースコスト、評価フックである。
InferOptは、凍結されたサンプルプロキシセットを検索し、モデル呼び出しの前に過剰予算候補を拒否し、予算を適応的に強化し、Paretoの代表者をフルスケールデータセットで再検証する。
1つのパイプラインは28次元連続KV空間(Qwen2.5-7B)と26次元離散MoE空間(DeepSeek-V2-Lite)をカバーしている。
KVでは16Kキャッシュを64.4%削減し、TPOTを22.9-48.5%削減し、InferOptによる検索された層幅予算は全KV基準点の7.3%と14.0%を上回っている。
MoEでは、InferOptが検索したトップkスケジュールが、43.0%のルート付きトークン-専門家ペアを削除し、デフォルトの0.59ポイント以内に留まり、マッチした予算ベースラインよりも近い。
Random Search, NSGA-II, MOTPEに対して、InferOptは両方の空間をリードし、最高のプロキシハイパーボリュームとKVの保持率が最も低く、MoEの最も低い専門家では圧縮されていない参照に最も近いままである。
関連論文リスト
- Does the VGGT Family Need All Its Layers? [55.81487806596663]
VGGT,3ドル,VGGT-$:3,018プルーニング構成における層冗長性について検討した。
取り外し可能な層が2つの冗長領域に集結しているのに対して、層間をまたがる削除は、常に破壊的である。
CKAは、間隔分解のためのより安価な表現ベースのプロキシを提供し、プルーニング品質とキャリブレーションコストのトレードオフを提供する。
論文 参考訳(メタデータ) (2026-09-29T06:52:07Z) - Beyond Mean Attention: Diversity-Aware, Layer-Wise Scoring for KV Cache Eviction [3.060720241524644]
KVキャッシュ消去法は、小さな観測窓に平均的な注意だけでトークンをランク付けする。
統一スコアである$_i+__mathrmcorr(i,S)$について検討し,ウィンドウクエリ間の注意分散と,選択したトークンに対する冗長性について検討した。
論文 参考訳(メタデータ) (2026-09-25T03:08:00Z) - SemKV: Semantic Mixed-Precision KV Cache Quantization Guided by the Quality Cliff for Long-Context LLM Inference [3.2938220347051175]
分数ビットグリッド上の均一なKV量子化は、優雅に分解されないことを示す。
本稿では,アフィンベースを歪み最適化量子化器 (TurboQuant-MSE) に置き換えることによって,テスト対象のプロトコルの崖を突破することを示す。
論文 参考訳(メタデータ) (2026-08-28T22:19:47Z) - Constraint-Aware Quantum Optimization of Defect Configurations in Doped ZrO2: XY-Mixer QAOA and Grover Adaptive Search [0.0]
我々は, ZrO2ドープ熱バリアコーティング(TBC)材料システムにおいて, 合成欠陥探索のためのエンドツーエンドの制約を考慮した量子最適化ワークフローを開発した。
論文 参考訳(メタデータ) (2026-06-20T11:03:12Z) - Attribution-Guided and Coverage-Maximized Pruning for Structural MoE Compression [74.00650541246374]
そこで本研究では,MoEモデルに適した構造解析フレームワークを提案する。
我々のアプローチはメモリフットプリントを5.27$times削減し、最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-16T06:53:27Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - Echo: KV-Cache-Free Associative Recall with Spectral Koopman Operators [45.88028371034407]
スペクトルクープマン注意(SKA)を中心に構築されたKV-cacheフリー連想リコールアーキテクチャ
我々は、SKA(Spectral Koopman Attention)を中心に構築されたKV-cacheフリーな連想型リコールアーキテクチャであるEchoを紹介する。
論文 参考訳(メタデータ) (2026-05-07T22:26:27Z) - KV Pareto: Systems-Level Optimization of KV Cache and Model Compression for Long Context Inference [2.8485297992257017]
長文Long-context Large Language Models (LLMs) は、キー値(KV)キャッシュとシーケンス長の線形成長により、推論中に重要なメモリボトルネックに直面している。
KVキャッシュの量子化、チャンクプリフィル、モデルウェイト量子化といった個別の最適化手法は、将来性を示しているが、それらの共同効果とエッジ展開のための最適構成は、まだ未定である。
論文 参考訳(メタデータ) (2025-12-01T18:03:47Z) - KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference [40.97781175723418]
KVキャッシュの量子化は、長いコンテキストにおける大規模言語モデル推論のスループットとレイテンシを改善することができる。
現在の方法では、KVキャッシュの量子化に対する階層的感度を見極めること、オンラインのきめ細かい決定のオーバーヘッドが高いこと、異なるLLMや制約に対する柔軟性の低いこと、の3つの未解決問題がある。
粗粒度のKVキャッシュに対して最適なハードウェアフレンドリなKV量子化ペアを適応的に探索する,シンプルで効果的なフレームワークKVTunerを提案する。
論文 参考訳(メタデータ) (2025-02-06T15:26:26Z) - KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization [67.74400574357472]
LLMは、大きなコンテキストウィンドウを必要とするアプリケーションでの利用が増えており、この大きなコンテキストウィンドウでは、KVキャッシュのアクティベーションが推論時のメモリ消費の主要な要因として表面化している。
量子化はKVキャッシュのアクティベーションを圧縮する上で有望な手法であるが、既存のソリューションは4ビット以下の精度でアクティベーションを正確に表現できない。
我々の研究であるKVQuantは、いくつかの新しい手法を取り入れることで、低精度のKVキャッシュ量子化を容易にする。
論文 参考訳(メタデータ) (2024-01-31T18:58:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。