論文の概要: CopyShield: A Cross-Level Benchmark of Copyright Defenses in LLMs
- arxiv url: http://arxiv.org/abs/2609.01161v1
- Date: Tue, 01 Sep 2026 12:43:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.647507
- Title: CopyShield: A Cross-Level Benchmark of Copyright Defenses in LLMs
- Title(参考訳): CopyShield: LLMにおける著作権防衛のクロスレベルベンチマーク
- Authors: Maryam Alshehyari, Dushyant Singh Chauhan, Samuele Poppi, Martin Takac, Salem Lahlou, Nils Lukas,
- Abstract要約: 異なる介入レベルで3つの代表的防御を比較したベンチマークであるCopyShieldを紹介した。
5冊のパブリックドメインの本を対照記憶として,LLaMA-3.1-8BとMistral-7B-v0.3の2つのモデルファミリー上でのCopyShieldの評価を行った。
- 参考スコア(独自算出の注目度): 10.232931203118614
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models can reproduce memorized text verbatim, yet copyright defenses are usually evaluated under incompatible protocols. We introduce CopyShield, a controlled benchmark comparing three representative defenses at distinct intervention levels: contrastive decoding (output), Direct Preference Optimization (behavioral), and activation intervention (representation). We evaluate CopyShield on two model families, LLaMA-3.1-8B and Mistral-7B-v0.3, using controlled memorization over five public-domain books and a shared protocol measuring literal leakage, calibrated non-literal leakage, utility, and degeneracy. Across these methods, intervention level is associated with distinct compliance-utility trade-offs. On LLaMA-3.1-8B, contrastive decoding remains near-degeneracy-free (0-2%) but reaches a literal-suppression floor at NV-Recall 0.192-0.203. DPO nearly eliminates literal leakage (0.263 to 0.002) but induces paraphrase-loop degeneracy in 58% of QA outputs, with no utility gain over the SFT baseline. Activation intervention attains the lowest non-literal flagging rate (1/200) by blocking 84% of non-literal queries before generation. Human evaluation confirms that DPO has low coherence, whereas activation lowers perceived copyright risk through broad refusal. On Mistral-7B-v0.3, the output- and representation-level patterns persist, while DPO degeneracy falls to 10-14%, showing that its severity is model-dependent. Together, CopyShield provides cross-level reference baselines and identifies targeted non-literal suppression as an open challenge. The code is available at https://github.com/spotai-mbzuai/CopyShield.git.
- Abstract(参考訳): 大規模な言語モデルは記憶されたテキストの動詞を再現することができるが、著作権の保護は通常、互換性のないプロトコルで評価される。
対照的復号(出力)、直接選好最適化(振る舞い)、アクティベーション介入(表現)の3つの異なる介入レベルを比較した制御されたベンチマークであるCopyShieldを紹介する。
5冊のパブリックドメインの本と、リテラルリーク、校正された非リテラルリーク、ユーティリティ、デジェネリシーを測定する共有プロトコルを用いて、LLaMA-3.1-8BとMistral-7B-v0.3の2つのモデルファミリー上でCopyShieldを評価した。
これらの方法全体で、介入レベルは、異なるコンプライアンスユーティリティトレードオフと関連付けられています。
LLaMA-3.1-8Bでは、コントラッシブデコーディングは、ほぼ縮退しない(0-2%)が、NV-Recall 0.192-0.203でリテラル圧縮フロアに達する。
DPOはリテラルリーク(0.263から0.002)をほぼ排除するが、QA出力の58%でパラフレーズループの縮退を誘導する。
アクティベーション介入は、生成前に84%の非リテラルクエリをブロックすることで、最低の非リテラルフラグングレート(1/200)を達成する。
人間の評価では、DPOはコヒーレンスが低いのに対して、アクティベーションは広い拒絶を通じて著作権のリスクを低くする。
Mistral-7B-v0.3では、出力レベルおよび表現レベルパターンが持続し、DPO縮退率は10-14%に低下し、その重症度がモデル依存であることが示されている。
CopyShieldは、クロスレベルな参照ベースラインを提供し、ターゲットとする非リテラル抑圧をオープンチャレンジとして識別する。
コードはhttps://github.com/spotai-mbzuai/CopyShield.gitで公開されている。
関連論文リスト
- Now You (Still) See Me: Detecting Evasive Steganographic Payloads in LLMs [52.149036302760386]
大規模な言語モデルは、プロンプトによって引き起こされるシークレットを、流動的で良心的な出力にエンコードするように微調整することができる。
近年の研究では、内部の活性化から秘密を回収する線形プローブによる検出を提案する。
この防御は体系的に回避できるが,対象とするデータレベルの介入によって検出性が回復可能であることを示す。
論文 参考訳(メタデータ) (2026-06-08T12:27:11Z) - Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration [3.9458538778648964]
本稿では,このバリアを除去するためのツールとして,リフレクションストリームを再現する低ランクなウェイト編集である,消音の予備的研究を行う。
脆弱性判定は3つのツール検出アンサンブル(QLCode、Sem、Bandit)と手動で行う。
論文 参考訳(メタデータ) (2026-06-03T20:06:52Z) - SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adversarial Data Poisoning [1.0998907972211756]
SilentRetrievalは2段階のデータ中毒攻撃で、RAGシステムを敵対的な文書でハイジャックする。
SilentRetrievalは84.6%/81.3% HR@10、57.5%/54.8% ASR-LLM on Natural QuestionsとMS MARCOを達成している。
論文 参考訳(メタデータ) (2026-05-27T07:30:30Z) - LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests [0.0]
コーディングエージェントとLLMベースのアプリケーションは、通常、潜在的に敏感なコンテンツをクラウドのLLM APIに送信し、ログ化、保持、トレーニングに使用されるか、召喚される可能性がある。
プライバシ保護型LCM要求に対する8つの手法の系統的実証評価を行った。
MCPやOpenAI互換のAPIと互換性のあるオープンソースシムで、全8つ(あるいはデプロイメントがまだ実現不可能な、牽引可能な研究段階のサブセット)を実装しています。
論文 参考訳(メタデータ) (2026-04-13T21:05:42Z) - CLASP: Defending Hybrid Large Language Models Against Hidden State Poisoning Attacks [48.54598003197356]
Mambaのような状態空間モデル(SSM)はトランスフォーマーの効率的な代替品として大きな注目を集めている。
HiSPAsは、最近発見された脆弱性で、敵対する文字列を通じてSSMメモリを破損させる。
この脅威に対して防御するためのCLASPモデルを紹介します。
論文 参考訳(メタデータ) (2026-03-12T17:29:55Z) - Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model [99.16364381244445]
現代の言語モデル(LM)は、トレーニングデータの一部を記憶し、動詞のスパンを出力する傾向がある。
提案するAnchored Decodingは,動詞の模倣を抑えるためのプラグアンドプレイ推論時間法である。
本手法は,著作権リスクとユーティリティの長期評価において,6組のモデルペアで評価する。
論文 参考訳(メタデータ) (2026-02-06T19:00:14Z) - SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking [58.475471437150674]
ソフトプロンプト(SWAP)のための逐次透かしを提案する。
SWAPは、特定のディフェンダー指定のアウト・オブ・ディストリビューション・クラスを通じて、透かしを符号化する。
11のデータセットの実験では、SWAPの有効性、無害性、および潜在的適応攻撃に対する堅牢性を示す。
論文 参考訳(メタデータ) (2025-11-05T13:48:48Z) - Obliviate: Efficient Unmemorization for Protecting Intellectual Property in Large Language Models [2.7174461714624805]
本稿では,特定の配列の正確な複製を外科的に抑制する軽量な方法であるObliviateを紹介する。
Obliviateはまず記憶されたパスを特定し、次に各ターゲットトークンに対して、モデルの出力分布を最小限に調整する。
Obliviate を4つの一般的な 6-8B- パラメータモデル (LLaMA-3.1, LLaMA-3.1-インストラクト, Qwen-2.5, Yi-1.5) 上で, 合成ベンチマークと有機著作権抽出を用いて評価した。
論文 参考訳(メタデータ) (2025-02-20T20:02:56Z) - CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model Generation [132.00910067533982]
LM世代におけるリテラルコピーと非リテラルコピーの両方を測定するために設計されたベンチマークであるCopyBenchを紹介する。
リテラル複写は比較的稀であるが、イベント複写と文字複写という2種類の非リテラル複写は、7Bパラメータのモデルでも発生する。
論文 参考訳(メタデータ) (2024-07-09T17:58:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。