論文の概要: Playing Whack-a-Mole with misconceptions about memorization, extraction, and copyright
- arxiv url: http://arxiv.org/abs/2609.09320v1
- Date: Tue, 08 Sep 2026 18:05:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.779369
- Title: Playing Whack-a-Mole with misconceptions about memorization, extraction, and copyright
- Title(参考訳): 記憶、抽出、著作権に関する誤解を伴うWhack-a-Moleの演奏
- Abstract要約: Alignment Whack-a-Mole のヘッドライン微調整による暗記結果が不正な測定方法であると確信している。
暗記を誘発するために使われるプロンプト手順は、プロンプト内で「抽出」されたテキストをリークするリスクを負う。
先月、疑わしい原告がこの論文について問い合わせてきたので、このメモを書いています。
- 参考スコア(独自算出の注目度): 5.360583649509007
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: After careful review, I'm confident the headline fine-tuning memorization results in Alignment Whack-a-Mole use an invalid measurement procedure. The book memorization coverage metric these headline results depend on counts sequence matches far shorter than what field standards consider valid evidence of memorization, and the prompting procedure used to elicit memorization runs the risk of leaking the text being "extracted" in the prompt. The paper doesn't include the negative-control experiments needed to see how much the results are inflated by false positives: claiming extraction success (and therefore memorization of training data) when matches between generations and training data may be due to other factors. Given these validity issues, the paper's claims that fine-tuning lets users extract substantial portions of copyrighted books, in a form that could substitute for the originals, aren't supported by the reported results. The failure to report the experiments' cost (an important component of the threat model) further compromises the copyright claims. I'm writing this note because, in the last month, (prospective) plaintiffs have reached out to me to ask about this paper. They're looking to cite this work as valid evidence in support of claims in ongoing and potential future copyright litigation.
- Abstract(参考訳): 注意深いレビューの後、Alignment Whack-a-Mole のヘッドライン微調整による暗記結果が不正な測定方法であると確信しています。
書籍の暗記カバレッジメトリックは、これらの見出し結果は、暗記の有効な証拠と考えるフィールド標準よりもはるかに短い数列一致に依存し、暗記に使用するプロンプト手順は、プロンプトで「抽出」されたテキストをリークするリスクを負う。
この論文は、結果が偽陽性によってどの程度膨らませられるかを確認するのに必要な負の制御実験を含まない: 世代とトレーニングデータとの一致が他の要因による可能性がある場合、抽出成功(したがってトレーニングデータの記憶)を主張する。
これらの妥当性の問題から、ユーザーが著作権のある書籍のかなりの部分を原本に代える形で取り出すことができるという微調整は、報告された結果には支持されないという論文の主張がある。
実験のコスト(脅威モデルの重要な構成要素)を報告できないことは、著作権請求をさらに侵害する。
先月、原告が私にこの論文について問い合わせてきたので、このメモを書いています。
彼らはこの研究を、現在および将来の著作権訴訟における主張を支持する有効な証拠として挙げようとしている。
関連論文リスト
- Extractable Memorization From First Principles [66.10415626674103]
一致した比較が厳密で校正された暗記の主張を可能にすることを示す。
我々は「抽出可能な記憶」を洗練し、有効な記憶のクレームとほぼ確実な生成を必要とする。
論文 参考訳(メタデータ) (2026-07-14T11:31:36Z) - Coding-agents can replicate scientific machine learning papers [0.0]
論文複製により、選択された各論文は、記録された証拠を持つターゲットを主張し、コーディングエージェントスキルとして実装する。
このワークフローにより、エージェントはこれらのターゲットを記録し、論文の手法を再構築し、計算実験を行い、生成された出力を証明とリンクさせ、論文の主張と比較する。
本論文は,4つの理科の機械学習論文における12の独立した実行について,ペーパーレプリケーションを評価した。
論文 参考訳(メタデータ) (2026-07-02T13:11:30Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models [15.308143290363246]
プロットサマリーを全文に拡張するための微調整トレーニングモデルは、保持されている著作権付き書籍の85%を再生する。
村上春樹の小説の特色は、30点以上の無関係作家の著作を口頭で思い出させるものである。
我々の発見は、モデルウェイトが著作権作品のコピーを保存し、個々の著者の作品を微調整した後に現れるセキュリティの失敗が、最近の公正使用判決の重要な前提を損なうという、説得力のある証拠を提供する。
論文 参考訳(メタデータ) (2026-03-21T21:46:16Z) - Extracting memorized pieces of (copyrighted) books from open-weight language models [63.06081428612624]
我々は、生成的AIに対する著作権訴訟における原告と被告が、大規模な言語モデル(LLM)が原告の保護された表現を記憶している範囲について、その主張に反対することが多いことを示している。
これらの偏極的な立場は、記憶と著作権の関係を劇的に単純化することを示します。
我々は、我々の結果が著作権訴訟に重大な影響を及ぼす理由について議論する。
論文 参考訳(メタデータ) (2025-05-18T21:06:32Z) - Illusions of Relevance: Using Content Injection Attacks to Deceive Retrievers, Rerankers, and LLM Judges [52.96987928118327]
検索,リランカー,大型言語モデル(LLM)の埋め込みモデルは,コンテンツインジェクション攻撃に対して脆弱であることがわかった。
主な脅威は,(1) 意味不明な内容や有害な内容の挿入,(2) 関連性を高めるために,問合せ全体あるいはキークエリ用語の挿入,の2つである。
本研究は, 注射内容の配置や関連物質と非関連物質とのバランスなど, 攻撃の成功に影響を与える要因を系統的に検討した。
論文 参考訳(メタデータ) (2025-01-30T18:02:15Z) - Investigating the Feasibility of Mitigating Potential Copyright Infringement via Large Language Model Unlearning [0.0]
LLM(Pre-trained Large Language Models)は、優れた能力を示すと同時に、著作権のある資料の学習と生成によるリスクも生んでいる。
本研究では,LLMから複数の時間ステップで著作権付きコンテンツを解放する新しいフレームワークであるSSU(Stable Sequential Unlearning)を提案する。
SSUは時に、未学習の有効性と汎用言語能力の効果的なトレードオフを達成し、既存のベースラインを上回ります。
論文 参考訳(メタデータ) (2024-12-16T20:01:06Z) - Can Watermarking Large Language Models Prevent Copyrighted Text Generation and Hide Training Data? [62.72729485995075]
著作権文書の生成に対する抑止剤としての透かしの有効性について検討する。
我々は、透かしがメンバーシップ推論攻撃(MIA)の成功率に悪影響を及ぼすことを発見した。
透かしにおける最近のMIAの成功率を改善するための適応的手法を提案する。
論文 参考訳(メタデータ) (2024-07-24T16:53:09Z) - Preventing Verbatim Memorization in Language Models Gives a False Sense
of Privacy [91.98116450958331]
我々は、動詞の暗記の定義があまりに制限的であり、より微妙な暗記の形式を捉えることができないと論じる。
具体的には、全ての動詞の暗記を完全に防止する効率的な防御を設計し、実装する。
我々は、潜在的な代替定義について議論し、なぜ記憶の定義がニューラルネットワークモデルにとって難しいが決定的なオープンな問題であるのかを論じる。
論文 参考訳(メタデータ) (2022-10-31T17:57:55Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z) - Assessing Effectiveness of Using Internal Signals for Check-Worthy Claim
Identification in Unlabeled Data for Automated Fact-Checking [6.193231258199234]
本稿では,偽ニュース記事からチェック価値のあるクレーム文を特定する手法について検討する。
我々は2つの内部監督信号(見出しと抽象的な要約)を利用して文をランク付けする。
見出しは、ファクトチェックのWebサイトがクレームを記述する方法とよく似ているが、要約ベースのパイプラインは、エンドツーエンドのファクトチェックシステムにとって最も有望である。
論文 参考訳(メタデータ) (2021-11-02T16:17:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。