論文の概要: Perplexity Can Miss SAE Feature Damage Under Quantization
- arxiv url: http://arxiv.org/abs/2606.03002v2
- Date: Thu, 04 Jun 2026 19:39:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-08 14:33:29.294551
- Title: Perplexity Can Miss SAE Feature Damage Under Quantization
- Title(参考訳): パープレキシティは、量子化下でのSAEの特徴的損傷を見逃す可能性がある
- Abstract要約: 量子化モデルは、パープレキシティや下流の精度が完全精度のオリジナルに近い場合、許容できると判断される。
凍結スパースオートエンコーダ(SAE)を固定的な測定基準として用いることでこれを検証する。
- 参考スコア(独自算出の注目度): 0.16921396880325779
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Quantization is a standard path to deploying large language models, and quantized models are typically judged acceptable when perplexity or downstream accuracy remains close to the full-precision original. But behavioral parity need not imply feature fidelity: the sparse-autoencoder (SAE) features used to interpret a full-precision model may change after weight rounding. We test this directly by using a frozen SAE as a fixed measurement basis, encoding full-precision and round-to-nearest (RTN) quantized activations on identical tokens, and measuring per-feature survival by Pearson correlation across bit-widths from INT8 to INT4 on Pythia-70M and Gemma-2-2B. Our central finding is that perplexity can miss feature damage: on Gemma-2-2B, INT7 improves perplexity while degrading 18.7% of active SAE features, and under sliding-window evaluation INT6 also improves perplexity while only 51.3% of active features survive. Feature survival is graded rather than cliff-like, with 62.4% of active Pythia features and 51.3% of active Gemma features surviving at INT6; most non-surviving features are blurred rather than fully damaged. Survival is also predictable from full-precision feature statistics alone, with cross-validated AUC 0.92--0.97 and peak activation as the strongest marginal predictor. Finally, RTN quantization and matched-perplexity magnitude pruning damage strongly overlapping feature sets, with Jaccard overlap 0.79--0.86 and damage-score Spearman correlation 0.98. These results show that behavioral metrics alone are insufficient evidence that full-precision interpretability findings transfer to quantized models, motivating feature-level audits of compression.
- Abstract(参考訳): 量子化は、大きな言語モデルをデプロイするための標準的な経路であり、量子化モデルは典型的には、パープレキシティや下流の精度が完全精度のオリジナルに近いままであるときに許容される。
スパースオートエンコーダ (SAE) は、重量の丸め後に、完全な精度のモデルを解釈するために用いられる。
我々は、凍結SAEを固定された測定基準として使用し、同一トークン上でのフル精度およびラウンド・トゥ・アネレスト(RTN)の量子化活性化を符号化し、Pythia-70MおよびGemma-2-2B上のINT8からINT4までのビット幅のピアソン相関により、フェース・サバイバルを測定することで直接テストする。
Gemma-2-2Bでは、INT7は18.7%のアクティブSAE機能を劣化させ、また、スライディングウインドウ評価の下では、51.3%のアクティブ機能しか残っていないが、パープレキシティも改善する。
特徴の生存は崖のようなものではなく、62.4%の活発なピキアの特徴と51.3%のアクティブなジェマの特徴がINT6で生き残る。
生存は、完全精度の特徴統計だけで予測可能であり、AUC 0.92--0.97 のクロスバリデーションとピークアクティベーションが最強の辺縁予測器である。
最後に、RTN量子化と一致するパープレキシティのプルーニング損傷は、Jaccardの重なり0.79--0.86と損傷スコアのSpearman相関0.98で強く重なり合う。
これらの結果は、行動指標だけでは、完全精度の解釈可能性発見が量子化モデルに伝達され、特徴レベルの圧縮監査を動機付ける証拠が不十分であることを示している。
関連論文リスト
- Where Decoder Cosine Similarity Fails for SAE Feature Flow Discovery [0.20415910628419062]
状態機能と更新機能がどのように相互作用し、下流の残留機能を生成するかを検討する。
その結果,特徴フローのアトラスが表現更新機構の診断に有効であることが示唆された。
論文 参考訳(メタデータ) (2026-09-11T08:44:13Z) - Steering Under Compression: Dose-Response, Capability Cost, and Failure Asymmetry in Quantized LLMs [0.0]
推論時ステアリングは、パラメータ修正なしで大きな言語モデルの振る舞い制御を可能にする。
トレーニング後の量子化により、デプロイメントのメモリと計算コストが削減される。
重量のみの量子化下での活性化ステアリングを系統的に研究する。
論文 参考訳(メタデータ) (2026-09-06T08:41:42Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Verbal Confidence Saturation in 3-9B Open-Weight Instruction-Tuned LLMs: A Pre-Registered Psychometric Validity Screen [0.0]
実験では,7つの指導訓練付きオープンウェイトモデルを用いて,最小の妥当性基準を満たす言語的信頼度が得られるかどうかを検証した。
カテゴリー的誘因は有効性には至らなかった。
声道レベルの対数確率は,観察された分散状態下での言語的信頼度を有意に予測しなかった。
論文 参考訳(メタデータ) (2026-04-24T04:45:21Z) - Are LLM Uncertainty and Correctness Encoded by the Same Features? A Functional Dissociation via Sparse Autoencoders [10.172598963520961]
大規模言語モデルは、その出力レベルの不確かさと実際の正しさが、同じ内部メカニズムによって駆動されるか、または異なる特徴集団によって駆動されるかという疑問を提起する。
モデル予測を正当性と信頼軸に沿って分割する2x2フレームワークを導入し,スパースオートエンコーダを用いて各次元に関連する特徴を独立に同定する。
論文 参考訳(メタデータ) (2026-04-21T20:34:14Z) - Sparse Autoencoder Decomposition of Clinical Sequence Model Representations: Feature Complexity, Task Specialisation, and Mortality Prediction [1.7865154997539017]
スパースオートエンコーダ(SAE)は、大きな言語モデルやタンパク質言語モデルに適用されているが、電子健康記録(EHR)基礎モデルには体系的に適用されていない。
InSPECT(外来)とMIMIC-IV(ICU)の残留ストリーム抽出点10点すべてにおいて、14.5万パラメータ自己回帰性臨床シーケンスモデルであるFlatASCEND上でTopK SAEを訓練する。
SAE分解は、トランスフォーマーの深さをまたいだプログレッシブな抽象化を明らかにする:層0の特徴は、ほぼ完全なトークン検出器(45.7%シングルトン)であり、層6の特徴は、複数の臨床カテゴリ(0.5%シングルトン)にまたがる約30のトークンタイプにまたがっている。
論文 参考訳(メタデータ) (2026-04-13T12:08:32Z) - Understanding NPM Malicious Package Detection: A Benchmark-Driven Empirical Analysis [10.599261033874884]
NPMエコシステムは、ソフトウェアサプライチェーン攻撃の主要なターゲットとなっている。
ベンチマークによるNPMマルウェア検出の実証分析を行う。
我々は、11の行動カテゴリと8の回避テクニックを付加した、6,420の悪意のある7,288の良性パッケージのデータセットを構築した。
論文 参考訳(メタデータ) (2026-03-29T07:04:31Z) - Uncertainty-Aware Mapping from 3D Keypoints to Anatomical Landmarks for Markerless Biomechanics [39.155383773210836]
マーカーレスバイオメカニクスは、ますますビデオから抽出された3D骨格キーポイントに依存している。
本研究では,3Dポーズキーポイントを3D解剖学的ランドマークにマッピングするための信頼度尺度として,予測の不確実性について検討する。
論文 参考訳(メタデータ) (2026-03-27T09:42:23Z) - How Pruning Reshapes Features: Sparse Autoencoder Analysis of Weight-Pruned Language Models [0.0]
本稿では,非構造化プルーニングが言語モデルの特徴幾何にどう影響するかについて,最初の体系的研究を行う。
種子の安定性,特徴生存性,SAE伝達性,特徴脆弱性,因果関係に関する5つの研究課題について検討した。
我々の最も顕著な発見は、希少なSAE機能 ― 発射率の低い ― が、頻繁なプルーニングよりもはるかに優れていることです。
論文 参考訳(メタデータ) (2026-03-26T11:12:42Z) - Multi-Axis Trust Modeling for Interpretable Account Hijacking Detection [1.0152838128195467]
本稿では,ハディスにインスパイアされたマルチ軸信頼モデリングフレームワークを提案する。
我々は,5つの信頼軸 – 長期的整合性(アダラ),行動精度(ダブト),文脈連続性(アイソナド),累積的評価,異常証拠 – を,ユーザアカウントに対して意味論的に意味のある行動特徴からなる26のコンパクトなセットに翻訳する。
CLUE-LDSクラウドアクティビティデータセットのフレームワークを,インジェクトされたアカウントハイジャックシナリオを用いて評価した。
論文 参考訳(メタデータ) (2026-02-20T19:36:30Z) - A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training [86.64715217940274]
外接線は正規化と共に機能する。
アウトリーチは、コントリビュータではなく、再スケール要因として役立ちます。
外乱は学習可能なパラメータに吸収されるか、明示的なゲート再スケーリングによって緩和される。
論文 参考訳(メタデータ) (2026-01-30T13:29:45Z) - Explainable Admission-Level Predictive Modeling for Prolonged Hospital Stay in Elderly Populations: Challenges in Low- and Middle-Income Countries [65.4286079244589]
長期滞在期間 (pLoS) は, 院内感染のリスクに関連する重要な要因である。
入院レベルの患者と病院の診療データを用いて, pLosの予測モデルを開発し, 解説する。
論文 参考訳(メタデータ) (2026-01-07T23:35:24Z) - Transparent Early ICU Mortality Prediction with Clinical Transformer and Per-Case Modality Attribution [42.85462513661566]
ICU滞在後48時間から, 生理的時系列測定と非構造的臨床記録とを融合した, 軽量で透明なマルチモーダルアンサンブルを提案する。
ロジスティック回帰モデルは、バイタル用双方向LSTMとノート用微調整された臨床ModernBERT変換器の2つのモード固有モデルからの予測を組み合わせる。
MIMIC-IIIベンチマークでは、遅延融合アンサンブルは、よく校正された予測を維持しながら、最高の単一モデルに対する差別を改善する。
論文 参考訳(メタデータ) (2025-11-19T20:11:49Z) - Segmentation variability and radiomics stability for predicting Triple-Negative Breast Cancer subtype using Magnetic Resonance Imaging [36.402807672379296]
本研究では, 放射能を用いた3重複性乳癌サブタイプのMRIによる予測において, セグメンテーションの変動が特徴安定性および予測性能に及ぼす影響について検討した。
経時的情報の導入は特徴の安定性を低下させる可能性があるが、特徴予測能力は低下しない。
論文 参考訳(メタデータ) (2025-04-02T12:48:01Z) - RULSurv: A probabilistic survival-based method for early censoring-aware prediction of remaining useful life in ball bearings [39.58317527488534]
Kullback-Leibler分散とRUL推定を用いた早期故障検出のための新しいフレキシブルな手法を提案する。
我々は,XJTU-SYデータセットにおいて,3つの異なる操作条件にまたがる5倍のクロスバリデーション戦略を用いてアプローチを実証する。
提案手法は,最大荷重下での5軸受の平均累積相対精度(CRA)を0.7586で達成し,複数の最先端ベースラインを改良する。
論文 参考訳(メタデータ) (2024-05-02T16:17:29Z) - Uncertainty-boosted Robust Video Activity Anticipation [72.14155465769201]
ビデオアクティビティの予測は、ロボットビジョンから自動運転まで幅広い応用可能性を受け入れることで、将来何が起こるかを予測することを目的としている。
近年の進展にもかかわらず、コンテンツ進化過程やイベントラベルの動的相関として反映されたデータ不確実性問題は、何らかの形で無視されている。
本研究では,予測結果の信頼性を示す不確実な値を生成する,不確実性を考慮した頑健なビデオアクティビティ予測フレームワークを提案する。
論文 参考訳(メタデータ) (2024-04-29T12:31:38Z) - Adaptive Feature Selection for No-Reference Image Quality Assessment by Mitigating Semantic Noise Sensitivity [55.399230250413986]
上流タスクから有害なセマンティックノイズを除去するためのQFM-IQM(Quality-Aware Feature Matching IQA Metric)を提案する。
提案手法は,8つの標準IQAデータセット上での最先端NR-IQA法よりも優れた性能を実現する。
論文 参考訳(メタデータ) (2023-12-11T06:50:27Z) - Removing Spurious Features can Hurt Accuracy and Affect Groups
Disproportionately [83.68135652247496]
自然な修正は、モデルからスプリアスな特徴を取り除くことである。
誘導バイアスによる突発的特徴の除去は精度を低下させる可能性が示唆された。
また,ロバストな自己学習によって,全体的な正確性に影響を与えずにスプリアスな特徴を除去できることを示した。
論文 参考訳(メタデータ) (2020-12-07T23:08:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。