論文の概要: Auditing Data Provenance in LLM Fine-tuning via Intrinsic Distributional Fingerprints
- arxiv url: http://arxiv.org/abs/2608.02154v1
- Date: Mon, 03 Aug 2026 12:35:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.565623
- Title: Auditing Data Provenance in LLM Fine-tuning via Intrinsic Distributional Fingerprints
- Title(参考訳): LLMファインチューニングにおける固有分布フィンガープリントによるデータ提示
- Authors: Zirui Huang, Yunlong Mao, Wei Tong, Tingting Wu, Xin Ge, Sheng Zhong,
- Abstract要約: 大規模言語モデル(LLM)におけるデータIP侵害を監査するためのポストホックフレームワークであるtextitDistribution Provenance Audit (DPA) を提案する。
DPAは、証明を避けるための微調整の戦術によらず、実用性を維持するための実践的な必要性は、意味的物質と語彙的形態の基本的な共通点を維持するためのモデルである。
- 参考スコア(独自算出の注目度): 12.090394120714402
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The proliferation of customized Large Language Models (LLMs) poses critical risks of Data Intellectual Property (Data IP) infringement via unauthorized fine-tuning on proprietary data. Existing audit techniques are limited, as they require intervention during data preparation or training and remain fragile under malicious obfuscations such as data paraphrasing and knowledge distillation. We propose \textit{Distribution Provenance Audit (DPA)}, a post-hoc framework for auditing data IP infringement in LLM fine-tuning under black-box and malicious settings. DPA is grounded in a critical insight: regardless of fine-tuning tactics to evade provenance, the practical necessity of maintaining utility constrains the model to preserve the fundamental intersection of semantic substance and lexical form. Accordingly, DPA captures this persistent lexical-semantic intersection as intrinsic distributional fingerprints. The framework formulates the audit as a statistical hypothesis test, effectively quantifying these fingerprints via unbiased output sampling to reliably reject the null hypothesis of non-usage. Extensive experiments on medical and legal fine-tuning tasks show that DPA consistently outperforms existing baselines, remaining robust against adversarial trainers employing paraphrasing and knowledge distillation. We further highlight a fundamental dual-use tension: the same high-fidelity distributional fingerprints enabling reliable auditing may also facilitate privacy attacks.
- Abstract(参考訳): カスタマイズされたLarge Language Models(LLMs)の普及は、プロプライエタリなデータに対する不正な微調整を通じて、データ知的財産権(Data Intellectual Property, データIP)侵害の重大なリスクを引き起こす。
既存の監査技術は、データ準備や訓練の介入が必要であり、データ言い換えや知識蒸留のような悪意ある難読化の下でも脆弱なままであるため、制限されている。
ブラックボックスと悪意のある設定下でのLLM微調整におけるデータIP侵害を監査するためのポストホックフレームワークである。
DPAは、証明を避けるための微調整の戦術によらず、実用性を維持するための実践的な必要性は、意味的物質と語彙形式の基本的交差を維持するためにモデルを制約する。
したがって、DPAはこの永続的な語彙と意味の交差を本質的な分布指紋として捉えている。
このフレームワークは、監査を統計的仮説テストとして定式化し、非使用者の無効仮説を確実に否定するために、非バイアス出力サンプリングを通じてこれらの指紋を効果的に定量化する。
医学および法的な微調整タスクに関する大規模な実験は、DPAが既存のベースラインを一貫して上回り、パラフレージングと知識蒸留を駆使した敵の訓練者に対して頑健であることを示している。
信頼性の高い監査を可能にするのと同じ高忠実度分布指紋は、プライバシー攻撃を助長する可能性がある。
関連論文リスト
- Phantoms and Disclosures: a Causal Framework for Auditing Synthetic Data [56.86147283213652]
データ開示の検出と説明を目的とした,カスタマイズ可能な実証監査フレームワークを提案する。
本フレームワークでは,ユーザの情報を直接再現する「真の開示」と,ユーザのデータを偶発的に生成する「幻の開示」とを区別する機構を導入する。
論文 参考訳(メタデータ) (2026-06-15T16:54:02Z) - Alignment Imprint: Zero-Shot AI-Generated Text Detection via Provable Preference Discrepancy [51.887915969023965]
現代のLarge Language Models (LLMs) がアライメントされ、測定可能な分布インプリントが残されていることを示す。
高エントロピー領域における不安定性を軽減するため、ログライクなアライメント・アライメント・プレフレパシー(LAPD)を導入する。
LAPDはアライメントインプリントに基づく標準化された情報重み統計である。
論文 参考訳(メタデータ) (2026-04-18T09:12:24Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking [58.475471437150674]
ソフトプロンプト(SWAP)のための逐次透かしを提案する。
SWAPは、特定のディフェンダー指定のアウト・オブ・ディストリビューション・クラスを通じて、透かしを符号化する。
11のデータセットの実験では、SWAPの有効性、無害性、および潜在的適応攻撃に対する堅牢性を示す。
論文 参考訳(メタデータ) (2025-11-05T13:48:48Z) - Copyright Infringement Detection in Text-to-Image Diffusion Models via Differential Privacy [23.262369771803364]
我々は、著作権侵害の概念を定式化し、差分プライバシー(DP)の観点からその検出を行う。
テキストから画像への拡散モデルにおける著作権侵害を識別する新しいポストホック検出フレームワークであるD-Plus-Minus(DPM)を提案する。
以上の結果から,DPMは元のトレーニングデータセットやテキストプロンプトへのアクセスを必要とせず,確実に侵害内容を検出することが示唆された。
論文 参考訳(メタデータ) (2025-09-27T00:38:12Z) - CertDW: Towards Certified Dataset Ownership Verification via Conformal Prediction [48.82467166657901]
本稿では,最初の認証データセット透かし(CertDW)とCertDWベースの認証データセットオーナシップ検証手法を提案する。
共形予測に触発されて,主確率 (PP) と透かし頑健性 (WR) の2つの統計指標を導入する。
我々は、不審モデルのWR値が、透かしのないデータセットでトレーニングされた良性モデルのPP値を大幅に上回る場合に、PPとWRの間に証明可能な低い境界が存在することを証明した。
論文 参考訳(メタデータ) (2025-06-16T07:17:23Z) - Hide in Plain Sight: Clean-Label Backdoor for Auditing Membership Inference [16.893873979953593]
本研究では,ステルスデータ監査のための新しいクリーンラベルバックドア方式を提案する。
我々のアプローチでは、ターゲットモデルの振る舞いを模倣するシャドウモデルによって生成される最適なトリガを用いる。
提案手法は,ブラックボックスアクセスによるロバストなデータ監査を可能にし,多様なデータセット間で高い攻撃成功率を達成する。
論文 参考訳(メタデータ) (2024-11-24T20:56:18Z) - Certifiably Byzantine-Robust Federated Conformal Prediction [49.23374238798428]
本稿では,悪意のあるクライアントに対する堅牢な共形予測を行う新しいフレームワークRob-FCPを提案する。
我々は、さまざまなビザンチン攻撃の下で、悪意のあるクライアントの多様な割合に対するRob-FCPの堅牢性を実証的に実証した。
論文 参考訳(メタデータ) (2024-06-04T04:43:30Z) - On the Robustness of Dataset Inference [21.321310557323383]
機械学習(ML)モデルは、大量のデータ、計算リソース、技術的専門知識を必要とするため、トレーニングにコストがかかる。
オーナーシップ検証技術により、モデル盗難事件の被害者は、容疑者モデルが実際に彼らから盗まれたことを実証することができる。
フィンガープリント技術であるデータセット推論(DI)は,従来の手法よりも堅牢性や効率性が向上することが示されている。
論文 参考訳(メタデータ) (2022-10-24T22:17:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。