論文の概要: Bits and Memories: Measuring Verbatim Extraction Across LLM Quantization
- arxiv url: http://arxiv.org/abs/2607.25451v1
- Date: Tue, 28 Jul 2026 08:41:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.777741
- Title: Bits and Memories: Measuring Verbatim Extraction Across LLM Quantization
- Title(参考訳): ビットと記憶:LSM量子化における頂点抽出の測定
- Abstract要約: 5つの精度レベル、全精度から4ビットまで、そして3つのモデルサイズまで、動詞の抽出をトラックする。
記憶されたトレーニングデータを除去する手段として圧縮を扱うべきではないと結論付けている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Language models are almost always quantized before they are deployed, and a growing line of work asks whether quantization also lowers their privacy risk. That work measures privacy almost entirely with membership inference. We think this is the wrong thing to measure for the risk that most people actually worry about, namely a model reproducing its training data word for word, and we measure that directly. Using the Pythia models and the public set of sequences each of them is known to have memorized, we track verbatim extraction across five precision levels, from full precision down to four bits, and across three model sizes, while measuring general capability (perplexity) at every point. We find two things. Quantization is a selective forgetter: verbatim memorization falls off faster than capability at every precision and every model size we tried, and this holds under two unrelated quantization algorithms and two evaluation corpora. But the selectivity is not enough to make quantization a privacy defense, which cuts against the optimistic reading of earlier membership-inference results. At the largest model we study, four-bit quantization still reproduces most of the memorized sequences while giving up only a few percent of capability, and the fraction of memorized data that survives quantization grows with model size. We conclude that compression should not be treated as a way to remove memorized training data, and that extraction, not membership inference, is the number practitioners should be watching. All code, sampled evaluation data, and per-configuration results are released.
- Abstract(参考訳): 言語モデルは、ほとんどの場合、デプロイされる前に量子化されます。
その仕事は、ほぼ完全にメンバーシップの推測でプライバシーを計測する。
これは、ほとんどの人が実際に心配しているリスク、すなわちトレーニングデータワードを言葉で再現するモデルを測る上で、間違った方法だと思います。
Pythiaモデルとそれらの各列が記憶されていることが知られている公開配列を用いて、全精度から4ビットまで、そして3つのモデルサイズまで、5つの精度レベルにわたる動詞の抽出を追跡し、各点で一般的な能力(複雑度)を計測する。
私たちは2つのものを見つけます。
動詞の暗記は、すべての精度と試したモデルサイズで能力よりも早く落ち、これは2つの無関係な量子化アルゴリズムと2つの評価コーパスの下に保持されます。
しかし、その選択性は、量子化をプライバシーを守るのに十分ではない。
最大のモデルでは、4ビット量子化は依然として記憶されたシーケンスのほとんどを再現するが、能力はわずか数パーセントに過ぎず、量子化を生き残る記憶データのごく一部はモデルサイズによって増大する。
我々は,圧縮を記憶したトレーニングデータを除去する手段として扱うべきではないと結論付け,抽出は会員推定ではなく,実践者が見るべき数であると結論付けた。
すべてのコード、サンプル評価データ、設定毎の結果がリリースされます。
関連論文リスト
- QUAIL: Quantization Aware Unlearning for Mitigating Misinformation in LLMs [0.16114012813668935]
低ビット量子化が機械学習を損なう理由を分析する。
量子化を意識したアンラーニング手法を提案する。
提案手法は, 4ビット量子化下での忘れを保存し, 既存の手法は忘れた知識をほぼ完全に復元する。
論文 参考訳(メタデータ) (2026-01-21T23:48:38Z) - Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models [13.249913291727042]
大規模なコーパスでトレーニングされた大規模な言語モデルは、トレーニングデータの冗長な記憶がちで、プライバシーと著作権の重大なリスクが生じる。
マルチメモリ化という新しいフレームワークを紹介します。
我々は、外部の敵探索がそれを引き起こす異なる接頭辞のターゲット数を特定することができれば、シーケンスを記憶として定義することでこれを定量化する。
論文 参考訳(メタデータ) (2025-11-25T19:40:24Z) - How much do language models memorize? [104.22411031699127]
我々は暗記を意図しない暗記と一般化の2つの構成要素に分けた。
サイズが大きくなるデータセット上で言語モデルをトレーニングし、そのキャパシティが満たされるまでモデルを記憶していることを観察する。
モデルキャパシティとデータサイズとメンバシップ推論に関する一連のスケーリング法則を作成した。
論文 参考訳(メタデータ) (2025-05-30T17:34:03Z) - Demystifying Verbatim Memorization in Large Language Models [67.49068128909349]
大きな言語モデル(LLM)は、しばしば長いシーケンスを冗長に記憶し、しばしば深刻な法的およびプライバシー上の意味を持つ。
我々は, Pythia チェックポイントからのプレトレーニングをインジェクトシーケンスで継続することにより, 制御された環境下での動詞の暗記を学習する枠組みを開発する。
その結果,(1) 動詞の暗記には非自明な繰り返しが必要であり,(2) 後続の(おそらくはより良い)チェックポイントは,アウト・オブ・ディストリビューション・シーケンスであっても,動詞の列を暗記する傾向にあることがわかった。
論文 参考訳(メタデータ) (2024-07-25T07:10:31Z) - MUSE: Machine Unlearning Six-Way Evaluation for Language Models [109.76505405962783]
言語モデル(LM)は、プライベートおよび著作権のあるコンテンツを含む大量のテキストデータに基づいて訓練される。
総合的な機械学習評価ベンチマークであるMUSEを提案する。
人気のある8つのアンラーニングアルゴリズムがハリー・ポッターの本やニュース記事をいかに効果的に解き放つかをベンチマークする。
論文 参考訳(メタデータ) (2024-07-08T23:47:29Z) - Rethinking LLM Memorization through the Lens of Adversarial Compression [93.13830893086681]
Webスケールデータセットでトレーニングされた大規模言語モデル(LLM)は、許容可能なデータ使用に関する重大な懸念を提起する。
ひとつ大きな疑問は、これらのモデルがすべてのトレーニングデータを"記憶する"のか、それとも、人間がどのように情報を学び、合成するかに何らかの方法で多くのデータソースを統合するのかである。
本稿では,LLMの記憶度を評価する指標として,ACR(Adversarial Compression Ratio)を提案する。
論文 参考訳(メタデータ) (2024-04-23T15:49:37Z) - ROME: Memorization Insights from Text, Logits and Representation [17.458840481902644]
本稿では、トレーニングデータの直接処理をバイパスするROMEという革新的な手法を提案する。
具体的には、コンテキスト非依存、従来型、事実の3つの異なるタイプに分類されるデータセットを選択します。
そこで本研究では,生成したテキストのロジットと表現を調べることで,記憶されたサンプルと記憶されていないサンプルの相違に着目した。
論文 参考訳(メタデータ) (2024-03-01T13:15:30Z) - Exploring Memorization in Fine-tuned Language Models [53.52403444655213]
我々は,タスク間の微調整中に,言語モデルの暗記を探索する最初の包括的分析を行う。
オープンソースと、さまざまなタスクにまたがる独自の微調整LMによる研究は、暗記が様々な微調整タスクの間に強い相違を示すことを示している。
本稿では,この課題の相違をスパース符号化理論を用いて直感的に説明し,暗記と注目スコア分布との強い相関関係を明らかにする。
論文 参考訳(メタデータ) (2023-10-10T15:41:26Z) - Preventing Verbatim Memorization in Language Models Gives a False Sense
of Privacy [91.98116450958331]
我々は、動詞の暗記の定義があまりに制限的であり、より微妙な暗記の形式を捉えることができないと論じる。
具体的には、全ての動詞の暗記を完全に防止する効率的な防御を設計し、実装する。
我々は、潜在的な代替定義について議論し、なぜ記憶の定義がニューラルネットワークモデルにとって難しいが決定的なオープンな問題であるのかを論じる。
論文 参考訳(メタデータ) (2022-10-31T17:57:55Z) - Quantifying Memorization Across Neural Language Models [61.58529162310382]
大規模言語モデル(LM)は、トレーニングデータの一部を記憶するために示され、適切に誘導されると、記憶されたデータを冗長に出力する。
これは、暗記がプライバシーを侵害し(ユーザーデータをエクスポーティングする)、実用性を低下させ(繰り返し覚えやすいテキストは、しばしば品質が低い)、公平性を損なうため、望ましくない。
本稿では、LMが記憶されたトレーニングデータを出力する度合いを定量化する3つの対数線形関係について述べる。
論文 参考訳(メタデータ) (2022-02-15T18:48:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。