論文の概要: TextCloak: Thwarting Unauthorized LLM Exploitation via RL-Driven Unlearnable Text
- arxiv url: http://arxiv.org/abs/2607.28862v1
- Date: Thu, 30 Jul 2026 22:01:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.493255
- Title: TextCloak: Thwarting Unauthorized LLM Exploitation via RL-Driven Unlearnable Text
- Title(参考訳): TextCloak: RL-Driven Unlearnable Textによる無許可LDM爆発の防止
- Authors: Chengshuai Zhao, Pingchuan Ma, Dawei Li, Bohan Jiang, Zhiyuan Yu, Zhen Tan, Huan Liu,
- Abstract要約: TextCloakは、不正なLarge Language Modelsのエクスプロイトからテキストデータを保護するためのRL駆動のフレームワークである。
このポリシーを最適化するためにGRPO-UEを導入する。これは、微調整されたサロゲートLLMにおいて引き起こされるダウンストリーム劣化に基づいて、生成した未学習テキストに報酬を与える。
6つの公開データセットと9つの最先端のLCMに関する総合的な実験は、TextCloakが合法的な使用のためにテキストユーティリティを維持しながら、無許可の微調整を一貫して障害していることを示している。
- 参考スコア(独自算出の注目度): 25.2694535530709
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid development of Large Language Models (LLMs) has led to significant advances across a wide range of language tasks, while simultaneously raising growing concerns about unauthorized data exploitation and privacy leakage. Unlearnable examples (UEs) offer a promising defense by introducing carefully designed perturbations into data such that models trained on them exhibit degraded utility. However, existing methods for text protection are primarily designed for classification tasks (e.g., sentiment analysis) in discriminative language models and often rely on injecting class-specific linguistic cues, which limits their effectiveness in the open-ended generation settings of LLMs. In this work, we propose TextCloak, an RL-driven framework for protecting textual data against unauthorized LLM exploitation. TextCloak employs a generative policy that transforms batches of clean text into unlearnable examples while preserving semantic fidelity and linguistic naturalness. To optimize the policy, we introduce GRPO-UE, which rewards generated unlearnable text based on the downstream degradation they induce in fine-tuned surrogate LLMs and updates the generator parameters via group-relative policy optimization. This bi-level optimization enables the generator to discover generalizable protective patterns beyond class-specific cues. Comprehensive experiments on six publicly available datasets and nine state-of-the-art LLMs demonstrate that TextCloak consistently impairs unauthorized fine-tuning while maintaining text utility for legitimate use. Further analyses establish its transferability and robustness across model architectures, training configurations, and adaptive attacks, highlighting its broad applicability as a practical defense against unauthorized LLM exploitation.
- Abstract(参考訳): LLM(Large Language Models)の急速な開発により、幅広い言語タスクが大幅に進歩し、同時に、不正なデータエクスプロイトやプライバシリークに対する懸念が高まっている。
未学習の例(UE)は、データに慎重に設計された摂動を導入し、それらに基づいてトレーニングされたモデルが劣化したユーティリティを示すことによって、有望な防御を提供する。
しかし、既存のテキスト保護法は、主に識別言語モデルにおける分類タスク(例えば感情分析)のために設計されており、しばしばクラス固有の言語的手がかりを注入することに依存しており、LLMのオープン・エンド・ジェネレーション・セッティングにおけるそれらの有効性を制限する。
本研究では,テキストデータを不正なLLM攻撃から保護するためのフレームワークであるTextCloakを提案する。
TextCloakは、意味的忠実さと言語的自然性を維持しながら、クリーンテキストのバッチを学習不可能な例に変換するジェネレーティブポリシーを採用している。
このポリシーを最適化するために、GRPO-UEを導入する。これは、微調整されたサロゲートLLMで引き起こされるダウンストリーム劣化に基づいて生成した未学習テキストを報奨し、グループ相対的なポリシー最適化によってジェネレータパラメータを更新する。
この二段階最適化により、ジェネレータはクラス固有のキューを超えて一般化可能な保護パターンを発見することができる。
6つの公開データセットと9つの最先端のLCMに関する総合的な実験は、TextCloakが合法的な使用のためにテキストユーティリティを維持しながら、無許可の微調整を一貫して障害していることを示している。
さらに、モデルアーキテクチャ、トレーニング構成、アダプティブアタックに対するトランスファービリティとロバスト性を確立し、無許可のLLM攻撃に対する実用的防御として、その幅広い適用性を強調した。
関連論文リスト
- Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation [4.893110077312707]
本研究では,大規模モデルの解釈可能性を活用するブラックボックス攻撃手法を提案する。
Sparse Feature Perturbation Framework (SFPF) を導入する。
実験結果から,SFPFが生成した対向テキストは,最先端の防御機構をバイパスできることが示された。
論文 参考訳(メタデータ) (2025-08-14T07:12:44Z) - Guiding LLMs to Generate High-Fidelity and High-Quality Counterfactual Explanations for Text Classification [2.899704155417792]
大規模言語モデルによる対実生成を支援するための単純な分類器誘導方式を2つ導入する。
その単純さにもかかわらず、我々の手法は最先端の対物生成方法より優れている。
論文 参考訳(メタデータ) (2025-03-06T14:15:07Z) - Robust Detection of LLM-Generated Text: A Comparative Analysis [0.276240219662896]
大規模言語モデルは生命の多くの側面に広く統合することができ、その出力は全てのネットワークリソースを迅速に満たすことができる。
生成したテキストの強力な検出器を開発することがますます重要になっている。
この検出器は、これらの技術の潜在的な誤用を防ぎ、ソーシャルメディアなどのエリアを負の効果から保護するために不可欠である。
論文 参考訳(メタデータ) (2024-11-09T18:27:15Z) - Unveiling Large Language Models Generated Texts: A Multi-Level Fine-Grained Detection Framework [9.976099891796784]
大型言語モデル (LLM) は文法の修正、内容の拡張、文体の改良によって人間の書き方を変えてきた。
既存の検出方法は、主に単一機能分析とバイナリ分類に依存しているが、学術的文脈においてLLM生成テキストを効果的に識別することができないことが多い。
低レベル構造, 高レベル意味, 深層言語的特徴を統合することで, LLM生成テキストを検出する多レベルきめ細粒度検出フレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-18T07:25:00Z) - Silent Guardian: Protecting Text from Malicious Exploitation by Large Language Models [63.91178922306669]
大規模言語モデル(LLM)に対するテキスト保護機構であるSilent Guardianを紹介する。
保護されるテキストを慎重に修正することで、TPEはLDMを誘導して最初にエンドトークンをサンプリングし、直接相互作用を終了させることができる。
本研究では,SGがターゲットテキストを種々の構成で効果的に保護し,保護成功率の約100%を達成できることを示す。
論文 参考訳(メタデータ) (2023-12-15T10:30:36Z) - Red Teaming Language Model Detectors with Language Models [114.36392560711022]
大規模言語モデル(LLM)は、悪意のあるユーザによって悪用された場合、重大な安全性と倫理的リスクをもたらす。
近年,LLM生成テキストを検出し,LLMを保護するアルゴリズムが提案されている。
1) LLMの出力中の特定の単語を, 文脈が与えられたシノニムに置き換えること, 2) 生成者の書き方を変更するための指示プロンプトを自動で検索すること,である。
論文 参考訳(メタデータ) (2023-05-31T10:08:37Z) - Contextualized Perturbation for Textual Adversarial Attack [56.370304308573274]
逆例は自然言語処理(NLP)モデルの脆弱性を明らかにする。
本稿では,フロートおよび文法的出力を生成するContextualized AdversaRial Example生成モデルであるCLAREを提案する。
論文 参考訳(メタデータ) (2020-09-16T06:53:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。