論文の概要: The Undetected Damage of Quantization on Retrieval and How to Fix It
- arxiv url: http://arxiv.org/abs/2609.24322v2
- Date: Sun, 27 Sep 2026 10:43:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-29 21:31:51.595783
- Title: The Undetected Damage of Quantization on Retrieval and How to Fix It
- Title(参考訳): 検索における量子化の未検出損傷とその修正方法
- Abstract要約: 分類精度を保った量子モデルでは,トップ1検索結果の14ドルから46%の値がまだ変化していることを示す。
この失敗を2つの上位モデルスコア間のギャップに結び付け、そのギャップを使用して、定量化された回答をいつ信頼するかを決めます。
この差が最大の丸め誤差の2倍を超える場合にのみ、トップ1結果が量子化を継続することが保証されていることを示す。
- 参考スコア(独自算出の注目度): 51.02977749156532
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We show that a quantized model that keeps its classification accuracy still changes $14$ to $46\%$ of its top-1 retrieval results, and that aggregate ranking metrics reveal only part of this damage. We tie this failure to the gap between the two highest model scores and use that gap to decide when to trust a quantized answer and where additional precision should be spent. We show that the top-1 result is guaranteed to survive quantization only when this gap exceeds twice the largest rounding error. In classification, the scores are logits, and training compares the correct class against every other class, which encourages this gap. In retrieval, the scores are query-document similarities, and training compares each positive only against sampled negatives, so nothing separates the top-1 item from the second. This gap can be measured without labels. Before deployment, it predicts which models will break under quantization, and at deployment time it tells, per input, whether the quantized answer still matches the full-precision answer. Most classification inputs have a gap wide enough to trust the quantized answer, but few retrieval queries do. That gap motivates a different fix in each task. In retrieval, spending extra bit-width on the layers whose quantization moves the gap most recovers up to three-quarters of an extra bit's benefit for half its cost. In classification, routing the few low-gap inputs to full precision recovers most of the lost accuracy at a fraction of the cost.
- Abstract(参考訳): 分類精度を保った定量化モデルは,トップ1検索結果の14ドルから46セントにまだ変化しており,総合ランキングの指標は,この被害の一部に過ぎなかった。
この失敗を2つの最も高いモデルスコア間のギャップに結び付け、そのギャップを使用して、定量化された回答をいつ信頼するか、そして追加の精度をいつ使うべきかを判断します。
この差が最大の丸め誤差の2倍を超える場合にのみ、トップ1結果が量子化を継続することが保証されていることを示す。
分類において、スコアはロジットであり、トレーニングは正しいクラスを他のすべてのクラスと比較し、このギャップを促進する。
検索では、スコアはクエリドキュメントの類似性であり、トレーニングは各正の値とサンプリングされた負の値のみを比較するため、トップ1の項目を第2の項目から分離することはない。
このギャップはラベルなしで測定できる。
デプロイ前には、どのモデルが量子化の下で壊れるかを予測し、デプロイメント時には、入力毎に、量子化された回答が完全な精度の答えとまだ一致するかどうかを知らせる。
ほとんどの分類入力は、定量化された答えを信頼できるほど広いギャップを持っているが、検索クエリはほとんどない。
このギャップは、各タスクで異なる修正を動機付けます。
検索において、量子化がギャップを動かす層に余分なビット幅を費やすと、その半分のコストで余剰ビットの利点の4分の3まで回復する。
分類において、少数の低ギャップ入力を完全精度にルーティングすると、損失した精度のほとんどをコストのごく一部で回復する。
関連論文リスト
- Why Does Post-Training Quantization Work? [24.890051501757146]
訓練後の量子化は、重みを少ない精度で保存することで大きな言語モデルを圧縮し、各量子化重みは隠れた状態に誤りをもたらす。
なぜポストトレーニングの量子化が機能するのか?
事前学習された量子化ロバスト性を特徴付ける2つのメカニズムを同定する。
論文 参考訳(メタデータ) (2026-09-10T15:32:32Z) - Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents [19.600181756177303]
密度とMoEの2つのモデルファミリの2ドルベンチでは、量子化は標準メートル法では自由に見える。
量子化は、モデルが既に示す失敗を最大2.5$times$の完全精度で増幅する。
目標とするエラー修正プロンプトは、正確度毎に5つの通信モデルで実行される。
論文 参考訳(メタデータ) (2026-07-29T12:40:04Z) - RANSAC Scoring Done Right [0.6678130184505635]
最も広く使われているRANSAC変種は、インレーヤを数えたり、残差閾値を超えて飽和するポイント当たりのスコアを和らげることで、候補モデルを評価する。
通常の推論順序を逆転することで、この依存を排除します。
単一の閉形式表現は、非形式的ジェフリーズ極限と情報的経験的ベイズ先行にまたがる。
提案されたRANSACスコアは、不整合スケールが式から真に欠落している最初のスコアである。
論文 参考訳(メタデータ) (2026-06-12T15:03:30Z) - RankAlign: A Ranking View of the Generator-Validator Gap in Large Language Models [43.89751891729739]
我々は,モデルが生成した解答と,その解答の検証,ジェネレータとバリケータのギャップとの相違について考察する。
この測定結果から,質問応答,語彙意味論タスク,次の単語予測など,さまざまな設定に大きなギャップがあることが分かる。
次にランキングベースのトレーニング手法である RankAlign を提案する。
論文 参考訳(メタデータ) (2025-04-15T16:53:31Z) - Rethinking Early Stopping: Refine, Then Calibrate [49.966899634962374]
キャリブレーション・リファインメント分解の新規な変分定式化について述べる。
我々は,校正誤差と精錬誤差が訓練中に同時に最小化されないという理論的,実証的な証拠を提供する。
論文 参考訳(メタデータ) (2025-01-31T15:03:54Z) - Deep Imbalanced Regression via Hierarchical Classification Adjustment [50.19438850112964]
コンピュータビジョンにおける回帰タスクは、しばしば、対象空間をクラスに定量化することで分類される。
トレーニングサンプルの大多数は目標値の先頭にあるが、少数のサンプルは通常より広い尾幅に分布する。
不均衡回帰タスクを解くために階層型分類器を構築することを提案する。
不均衡回帰のための新しい階層型分類調整(HCA)は,3つのタスクにおいて優れた結果を示す。
論文 参考訳(メタデータ) (2023-10-26T04:54:39Z) - Shrinking Class Space for Enhanced Certainty in Semi-Supervised Learning [59.44422468242455]
そこで我々はShrinkMatchと呼ばれる新しい手法を提案し、不確実なサンプルを学習する。
それぞれの不確実なサンプルに対して、元の Top-1 クラスを単に含むスランク類空間を適応的に求める。
次に、スランク空間における強と弱に強化された2つのサンプル間の整合正則化を課し、識別的表現を試みます。
論文 参考訳(メタデータ) (2023-08-13T14:05:24Z) - Beyond mAP: Towards better evaluation of instance segmentation [23.562251593257674]
平均精度は、ハイリコール範囲における重複予測をペナルティ化しない。
本研究では,空間的およびカテゴリー的両方の重複予測の量を明示的に測定する2つの新しい手法を提案する。
当社のセマンティックソーティングとNMSは,ヘッジド予測を緩和し,APを保存するためのプラグイン・アンド・プレイモジュールとして追加することができる。
論文 参考訳(メタデータ) (2022-07-04T17:56:14Z) - Uniformity in Heterogeneity:Diving Deep into Count Interval Partition
for Crowd Counting [56.44300325295678]
一様誤差分割(UEP)と呼ばれる新しいカウント間隔分割基準を提案する。
MCP基準は、推論中にそのカウント値を表すために、各インターバルのベストカウントプロキシを選択する。
統一誤り分割ネットワーク(UEPNet)と呼ばれる単純で効果的なモデルを提案する。
論文 参考訳(メタデータ) (2021-07-27T06:24:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。