論文の概要: JUMP: Single-Pass Membership Inference on Fine-Tuned Diffusion Language Models
- arxiv url: http://arxiv.org/abs/2607.16207v1
- Date: Sat, 09 May 2026 05:40:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.03186
- Title: JUMP: Single-Pass Membership Inference on Fine-Tuned Diffusion Language Models
- Title(参考訳): JUMP:微調整拡散言語モデルにおける単一パスメンバーシップ推論
- Abstract要約: 我々は、細調整された離散拡散言語モデル(dLLMs)に対する会員推論攻撃(MIA)について研究する。
JUMP(Joint Uncertainty-Guided Mask Probing)は,DLLMの特性を両立させるシングルパススコアリング攻撃である。
6つのMIMIRドメインにわたる微調整されたLLaDA-8Bベースでは、JUMPは平均ROC-AUCをSAMAで0.82から0.90に改善し、低FPR検出を大幅に改善する。
- 参考スコア(独自算出の注目度): 5.43345665278304
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Membership inference attacks (MIAs) test whether a candidate example appeared in a model's training data. We study MIAs for fine-tuned discrete diffusion language models (dLLMs), where membership means inclusion in the target model's fine-tuning set. Unlike autoregressive language models, dLLMs allow an attacker to choose arbitrary mask sets and obtain token distributions for all masked positions in parallel. The prior dLLM attack, SAMA, follows a natural loss-mimicking strategy by averaging reconstruction signals over many randomly sampled masks, but it uses the any-order interface only as randomization and requires many target/reference queries. We propose JUMP (Joint Uncertainty-Guided Mask Probing), a single-pass scoring attack that exploits both distinctive properties of dLLMs: any-order decodability is used to select low-reference-confidence positions, and parallel decodability is used to score all selected positions through one joint masked query per model. JUMP masks the selected positions jointly and computes a clipped target/reference reconstruction-gap statistic. On fine-tuned LLaDA-8B-Base across six MIMIR domains, JUMP improves mean ROC-AUC from 0.82 to 0.90 over SAMA and substantially improves low-FPR detection, while requiring only one selector pass and one scoring pass through each of the target and reference models.
- Abstract(参考訳): メンバーシップ推論攻撃(MIA)は、モデルのトレーニングデータに候補サンプルが現れるかどうかをテストする。
対象モデルの微調整集合に含まれるような細調整離散拡散言語モデル(dLLM)についてMIAについて検討する。
自動回帰言語モデルとは異なり、dLLMは攻撃者が任意のマスクセットを選択し、すべてのマスクされた位置のトークン分布を並列に取得することを可能にする。
以前のdLLM攻撃であるSAMAは、ランダムにサンプリングされたマスクを平均化することで、自然な損失緩和戦略に従っているが、任意の順序のインタフェースはランダム化としてのみ使用し、多くのターゲット/参照クエリを必要とする。
JUMP (Joint Uncertainty-Guided Mask Probing) は,DLLMの2つの特性を利用する単一パススコアリング攻撃である。
JUMPは、選択された位置を共同でマスクし、クリップされた目標/参照再構成ギャップ統計を計算する。
6つのMIMIRドメインにわたる微調整されたLLaDA-8Bベースでは、JUMPは平均ROC-AUCを0.82から0.90に改善し、ターゲットモデルと参照モデルそれぞれに1つのセレクタパスと1つのスコアパスを必要としながら、低FPR検出を大幅に改善する。
関連論文リスト
- Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models [51.21958617138889]
自己認識スケジューリングは、軽量な順序ポリシーを学び、任意の順序と半自己回帰デコーディングの両方にシームレスに適用する。
1B MDMのスドクでは、SASはパズルの精度を82.0%(ベストスケジュール)から91.8%に改善し、第2ステージの微調整で97.5%に達する。
LLaDA-8Bの数学的推論では、ASSはGSM8Kのpass@1を64%から76%に改善し、MBPPは39.5%から41%に改善した。
論文 参考訳(メタデータ) (2026-06-22T16:32:25Z) - Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models [59.51249894128724]
マスク付き拡散言語モデルは、反復を識別するごとに複数のトークンを明らかにすることで推論ステップを削減することができる。
パラレルマスク拡散復号法のためのトレーニング不要な復号法であるADASを提案する。
論文 参考訳(メタデータ) (2026-06-09T13:17:27Z) - An Embarrassingly Simple Detector for Model Extraction Attacks in Large Language Model API Traffic [16.151531550259993]
大規模言語モデル(LLM)はホストAPIを通じてますますデプロイされ、モデルの抽出がモデルのオーナシップとサービスのセキュリティに対する現実的な脅威となる。
我々は、良性キャリブレーションされた交通窓分布試験としてモデル抽出監視を定式化する。
入力クエリをセマンティック空間に埋め込み、それらの集合分布が過去の良性トラフィックから逸脱するかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-04T05:33:49Z) - MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models [53.05463623673949]
MaskForgeは完全にブラックボックス対応の攻撃で、構造パターンのライブラリを最適化した検索としてdLLMのレッドチームを実行する。
攻撃成功率は79.3%であり、最強のdLLMベースラインよりも17.6%向上している。
論文 参考訳(メタデータ) (2026-06-01T18:10:21Z) - Self-Rewarding Sequential Monte Carlo for Masked Diffusion Language Models [58.946955321428845]
本研究は自己回帰型モンテカルロ(SMC)を提示する。
提案アルゴリズムは,既存のMDLMのほとんどが信頼性に基づくサンプリング戦略に依存している点に起因している。
粒子重み付けのための自己回帰信号として軌道レベルの信頼性を導入する。
論文 参考訳(メタデータ) (2026-02-02T09:21:45Z) - Bridge the Points: Graph-based Few-shot Segment Anything Semantically [79.1519244940518]
プレトレーニング技術の最近の進歩により、視覚基礎モデルの能力が向上した。
最近の研究はSAMをFew-shot Semantic segmentation (FSS)に拡張している。
本稿では,グラフ解析に基づく簡易かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2024-10-09T15:02:28Z) - Model Inversion Attacks Through Target-Specific Conditional Diffusion Models [54.69008212790426]
モデル反転攻撃(MIA)は、ターゲット分類器のトレーニングセットからプライベートイメージを再構築することを目的としており、それによってAIアプリケーションにおけるプライバシー上の懸念が高まる。
従来のGANベースのMIAは、GANの固有の欠陥と潜伏空間における最適化の偏りにより、劣った遺伝子的忠実度に悩まされる傾向にある。
これらの問題を緩和するために拡散モデル反転(Diff-MI)攻撃を提案する。
論文 参考訳(メタデータ) (2024-07-16T06:38:49Z) - Practical Membership Inference Attacks against Fine-tuned Large Language Models via Self-prompt Calibration [32.15773300068426]
メンバーシップ推論攻撃は、対象のデータレコードがモデルトレーニングに使用されたかどうかを推測することを目的としている。
自己校正確率変動(SPV-MIA)に基づくメンバーシップ推論攻撃を提案する。
論文 参考訳(メタデータ) (2023-11-10T13:55:05Z) - MaskDiff: Modeling Mask Distribution with Diffusion Probabilistic Model
for Few-Shot Instance Segmentation [31.648523213206595]
少数ショットのインスタンスセグメンテーションは、数ショットの学習パラダイムをインスタンスセグメンテーションタスクに拡張する。
従来のアプローチでは、ポイント推定と呼ばれるプロトタイプ学習を通じてその課題に対処しようと試みてきた。
本稿では,二項マスクの条件分布をモデル化したMaskDiffという新しい手法を提案する。
論文 参考訳(メタデータ) (2023-03-09T08:24:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。