論文の概要: Saying, Not Knowing: Aggressively GGUF-Quantized Small Language Models Still Write Rare Words They Can No Longer Define
- arxiv url: http://arxiv.org/abs/2610.04403v1
- Date: Sat, 03 Oct 2026 09:50:16 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:39:18.257763
- Title: Saying, Not Knowing: Aggressively GGUF-Quantized Small Language Models Still Write Rare Words They Can No Longer Define
- Title(参考訳): GGUF-Quantized Small Language Models(GGUF-Quantized Small Language Models)
- Abstract要約: GGUFフォーマットの混合精度K量子への後学習量子化は、一般に、オープンウェイト言語モデルが消費者向けハードウェアに到達する方法である。
我々は、13のファミリーと4つのアーキテクチャバックボーン、0.35B-14Bパラメータにわたる27の定量化されたアーティファクトを監査し、公開しているQ2_Kへのはしごを評価した。
- 参考スコア(独自算出の注目度): 0.0
- License:
- Abstract: Post-training quantization to the GGUF format's mixed-precision K-quants is commonly how open-weight language models reach consumer hardware, yet its effect on fine-grained lexical competence is uncharacterized. We audit 27 quantized artifacts across 13 families and four architecture backbones, 0.35B-14B parameters, evaluated down their published ladder to Q2_K (about 2.6 bits per weight), on 429 frequency-validated rare English words under two probes: surface inclusion of a prompt-supplied word and its one-sentence definition, scored by a tiered multi-synonym matcher, its error measured by a blind LLM-judge census of every definition, with human verification. Three regimes emerge at Q2: total collapse into unusable builds, severe semantic dissociation in sub-2B models, and mostly robust preservation above about 3B. In every sub-2B artifact, definitions fall 20-67% below the artifact's baseline, typically several times the inclusion loss. Two controls separate rarity from task difficulty: within the rare set, loss rises with rarity in six of seven sub-2B artifacts, and on a 100-word common-word set rare words lose more than common words in all eight, significantly in six. Tokenizer vocabulary size does not predict the damage (Spearman rho=0.12); parameter count dominates (rho=0.72), confirmed within five of six same-tokenizer families. Q4_K_M remains lexically clean at >=1B. The damage is frequency-graded, provider-dependent, and not calibrated by WikiText-2 perplexity: across nine artifact-matched ladders, near-identical Q2 penalties (44.7%/47.6%) separate an artifact keeping its definitions (3.6%) from one losing them (43.6%). Aggressively quantized small models can keep generating fluent text while no longer knowing what it means, risking hardware-constrained deployments in domains where semantics carries consequences. Validation must be per artifact.
- Abstract(参考訳): GGUFフォーマットの混合精度K-quantsに対する学習後の量子化は、オープンウェイト言語モデルがコンシューマーハードウェアに到達する方法として一般的であるが、その微細な語彙能力への影響は未定である。
我々は、13の家系と4つのアーキテクチャのバックボーン、0.35B-14Bパラメータからなる27個の定量化されたアーティファクトを、2つのプローブの下で429個の周波数検証されたレア・イングリッシュ語(Q2_K:約2.6ビット)に対して評価した。
第2四半期には3つの体制が出現し、全体の崩壊は使用不能なビルド、サブ2Bモデルにおける深刻な意味的解離、そしてほぼ3B以上の堅牢な保存である。
すべてのサブ2Bアーティファクトでは、定義はアーティファクトのベースラインより20~67%低い。
希少なセットでは、7つのサブ2Bアーティファクトのうち6つのうち6つが希少さによって損失が増加し、100ワードの共通単語セットでは、希少な単語が8つすべてで一般的な単語よりも多くなり、6つが顕著に減少する。
Tokenizer vocabulary size not predict the damage (Spearman rho=0.12), parameter count dominates (rho=0.72), confirmed within five of six same-tokenizer family。
Q4_K_M は >=1B でレキシカルに清潔である。
9つのアーティファクトマッチングされたはしご、ほぼ同一のQ2ペナルティ(44.7%/47.6%)で、その定義を維持しているアーティファクト(43.6%)はそれらを失うもの(43.6%)から切り離されている。
攻撃的に定量化された小さなモデルは、意味を知らないまま、流動的なテキストを生成し続けることができ、セマンティクスが結果をもたらすドメインにおけるハードウェア制約によるデプロイメントのリスクを負う。
検証はアーティファクトごとに行わなければならない。
関連論文リスト
- SpatialChain: A Benchmark for Auditing Spatial Reasoning Faithfulness in VLMs [32.72182829728677]
思考可能な視覚言語モデル(VLM)は、空間的ベンチマークにおいてずっと高い精度を報告している。
しかし、最終回答スコアは、正しい予測が忠実な空間的推論や言語的ショートカットを反映しているかを明らかにすることはできない。
28350のトレーニングデータセットであるSpatialChainと、空間指向のGQA質問と、シーングラフに基づく推論チェーンをペアにした899のテスト例を紹介する。
論文 参考訳(メタデータ) (2026-10-05T14:29:54Z) - Quantization Thresholds Replicate, Failure Modes Do Not: A Three-Model Study of Agentic Tool Use in Polish from 8-bit to 2-bit [0.0]
PolAgentBenchはポーランドのプロンプトと英語のツールスキーマを用いた決定論的ベンチマークである。
ビエリク-11B-v3.0とその熟成された蒸留子ビエリク-ミニトロン-7B-v3.0はモデル圧縮を分離する。
論文 参考訳(メタデータ) (2026-09-25T22:13:11Z) - Can Scene Text Recognition Read Rare Compositions? [1.7844382164707184]
6つの標準ベンチマークにおいて、シーンテキスト認識は89-97%正確であると報告され、その問題が飽和として広く扱われている。
私たちは代替の読書を提示する。
同じテスト画像が、基準コーパスに対して、接地的単語の規則性と文字n-gramの新規性によって共同で成層されると、結果の5x5グリッドのレアワードxレアトリグラムコーナーでの精度は、q3/q3センタより10〜18pt下方に低下する。
論文 参考訳(メタデータ) (2026-09-01T07:16:42Z) - Compress and Forget: bitsandbytes Quantization Amplifies Proactive Interference in LLMs [0.23438564092609357]
プロアクティブ干渉(英: Proactive interference, PI)は、大規模言語モデルにおける文書化された障害モードであり、繰り返し上書きされた値の検索は、事前上書きが蓄積されるにつれて劣化する。
PTQは現在、オープンウェイトモデルのデフォルトのデプロイメントパスとなっているが、この障害モードへの影響はテストされていない。
アーキテクチャ的に異なる3つの命令調整モデルの3つの精度レベル(FP16, INT8, INT4/NF4, ビット/バイト)を評価する。
論文 参考訳(メタデータ) (2026-08-19T06:17:13Z) - Context-Aware Distillation and Ablation for Text2DSL [78.29352305480285]
我々は、コンテクスト対応蒸留により、プロンプトのみの合成生成を置き換える。
教師の大きな言語モデルは、明示的に定義された構造化コンテキストの下で機能する。
これは、検証されたポルキットベンチコーパスを4,204対から10,073対にスケールする。
論文 参考訳(メタデータ) (2026-06-21T16:27:24Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - In-Context Fixation: When Demonstrated Labels Override Semantics in Few-Shot Classification [4.738949927143789]
その結果, 同種ラベルは意味論的に有効なものであっても, 6つのモデルで12%の精度で崩壊することがわかった。
モデルはラベル位置を占めるトークンを、徹底的な回答語彙として扱う。
論文 参考訳(メタデータ) (2026-05-08T10:20:39Z) - BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation [34.429649156970015]
以前の評価では、検索なしでベースモデルをテストしたが、これは現在の慣行を反映していない。
3つの検索可能なフロンティアモデルでは、9つのフィールドと6方向のエラー分類に基づいてBibエントリを生成する。
全体的な精度は83.6%だが、完全な正確さは50.9%に過ぎない。
論文 参考訳(メタデータ) (2026-04-03T16:30:58Z) - Fact or Facsimile? Evaluating the Factual Robustness of Modern Retrievers [34.31192184496381]
デンスレトリバーとリランカーは、検索強化世代(RAG)パイプラインの中心である。
我々は,これらのコンポーネントがベースとする大規模言語モデル(LLM)をどの程度の事実的能力で継承するか,あるいは失うかを評価する。
全ての埋め込みモデルにおいて、クエリと正しい完了の間のコサイン類似度スコアは、間違ったものよりも著しく高い。
論文 参考訳(メタデータ) (2025-08-28T04:13:51Z) - Does quantization affect models' performance on long-context tasks? [31.289794345238544]
大きな言語モデル(LLM)は、128Kトークンを超えるコンテキストウィンドウをサポートするようになった。
我々は,長い入力(>64Kトークン)と長い出力を持つタスクに対して,量子化LDMを初めて体系的に評価する。
その結果,平均8ビット量子化では精度が0.8%低下し,4ビット法では大きな損失が生じることがわかった。
論文 参考訳(メタデータ) (2025-05-26T17:54:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。