論文の概要: DiffSafeMerge: Mitigating Backdoor Inheritance in Diffusion Model Merging
- arxiv url: http://arxiv.org/abs/2608.09445v1
- Date: Mon, 10 Aug 2026 11:20:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.218208
- Title: DiffSafeMerge: Mitigating Backdoor Inheritance in Diffusion Model Merging
- Title(参考訳): DiffSafeMerge:拡散モデル統合におけるバックドア継承の軽減
- Abstract要約: 緩和は、妥協されたソース、トリガー、ターゲットを知ることなく困難である。
我々はDiffSafeMerge(DSM)を紹介し、これは小さなラベルのないクリーンなセットと固定された攻撃非依存のストレスプローブを使ってソースブロックをスコアリングする。
- 参考スコア(独自算出の注目度): 12.412925762132284
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Unconditional diffusion checkpoint merging assumes benign sources, yet a compromised public checkpoint can transfer a dormant backdoor while clean generation appears normal. Mitigation is difficult without knowing the compromised source, trigger, or target, and broad sanitization may degrade image quality. We introduce DiffSafeMerge (DSM), which uses a small unlabeled clean set and fixed, attack-agnostic stress probes to score source blocks, shrink suspicious contributions toward a trusted reference, and select attenuation under a clean denoising-loss budget. We evaluate four attacks, two datasets, and 21 target conditions. Intended merging already has zero worst-target ASR in 10 of 14 source cases; DSM preserves these outcomes and records no target match in the remaining four over three seeds, including three with baseline ASR of 48--100\%. Among methods with zero worst-target ASR on both datasets, DSM obtains the lowest case-averaged FID in the matched seed-0 comparison.
- Abstract(参考訳): 非条件拡散チェックポイントのマージは、良質なソースを仮定するが、汚染された公開チェックポイントは、クリーンな生成が正常に現れる間、休息中のバックドアを転送することができる。
緩和は、妥協されたソース、トリガー、ターゲットを知ることなく困難であり、広範囲の衛生が画質を低下させる可能性がある。
そこで,DiffSafeMerge (DSM) を紹介した。これは小さな未ラベルのクリーンセットと固定されたアタック非依存のストレスプローブを用いて,ソースブロックをスコアし,信頼された参照に対する疑わしいコントリビューションを縮小し,クリーンなデノライジングロス予算の下で減衰を選択する。
4つの攻撃、2つのデータセット、21の目標条件を評価した。
DSMはこれらの結果を保存し、残りの4種に48-100\%のベースラインを持つ3種を含む3種を含む3種を含む3種にターゲットマッチを記録しない。
両方のデータセットで最悪のターゲットASRをゼロにする手法の中で、DSMは一致したシード-0の比較において、最小のケース平均FIDを得る。
関連論文リスト
- Subgroup Membership Inference Audits of Differentially Private Synthetic Text [28.947903737268916]
このようなリリースの最悪のプライバシー漏洩が、差分プライバシー(DP)によって拘束されているとしても、実際には残留するリスクが残っている。
本稿では,対象プールが明示的なパラメータであるサブグループ対象メンバシップ推論ゲームを定義し,32プロキシの監査でインスタンス化する。
監査は、合成リリースがサブグループのメンバシップをリークし、事前攻撃がこのリークを体系的に過小評価していることを示している。
論文 参考訳(メタデータ) (2026-09-09T07:56:24Z) - MaliciousSkillBench: A Comprehensive Benchmark for Malicious Agent Skill Detection [24.37473229751569]
MaliciousSkillBenchは、悪意のあるエージェントスキル検出のための包括的なベンチマークである。
我々は13の公開ソースを統合し、そのうち11つはCoreの悪意のあるアーティファクトに貢献し、8,414の生の悪意のあるレコードを7,539の正規化されたユニクティックIDに減らした。
そして、3つの学習されたテキスト検出器と3つの既製のスキルスキャナを評価した。
論文 参考訳(メタデータ) (2026-08-20T11:13:00Z) - Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning [6.382763634670965]
本稿では,各トークンを任意のソースが割り当てる最も低い確率で格納するトークンワイド最小値と,ソースが反対方向に移動する任意のトークンのベース確率に逆戻りするベース相対変量という2つのコンセンサスデコーダを紹介する。
制御された中毒タスク、サブリミナルラーニング、創発的なミスアライメント、コンセンサス復号は、共通の望ましい行動を保ちながら、ソース固有の誤った行動を抑制する。
論文 参考訳(メタデータ) (2026-07-25T23:41:47Z) - A Failure-Mode Benchmark for Polymorphic Sybil Poisoning in RAG [4.879573049082894]
そこで我々は, 接地型QAの評価フレームワークと評価フレームワークを, コーディネート検索中毒下でリリースした。
読み手出力を4つの排他的カテゴリ(emphgold, emphhijack, emphabstention, emphdrift)に分割するフレームワーク
本報告では,攻撃目標と攻撃目標を協調的に支援する攻撃クラスであるEmphpolymorphic sybil poisoningを導入する。
論文 参考訳(メタデータ) (2026-07-04T06:56:06Z) - Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement [66.67463557274358]
バイアス付きデータセットに基づいてトレーニングされた基礎モデルは、しばしばターゲットラベルと非因果属性の間の急激な相関に依存する。
信頼誘導概念マイニング(CBCM:Confidence-guided Concept Mining)を導入し,属性アノテーションを使わずに信頼性の高いスプリアス属性を同定する。
本稿では,目標と突発的な表現を2つのブランチに分離するプロンプトチューニングフレームワークであるDual-branch Cross-projection Debiasing (DCD)を提案する。
論文 参考訳(メタデータ) (2026-06-23T05:28:47Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - Towards Persistent Case-Based Memory for Autonomous Data Science: A CBR-Augmented R&D-Agent with a Locally Deployable Small Language Model [0.0]
我々は, Gemma 4 31B Dense のカスタムバックエンドに CBR レイヤを Microsoft の R&D-Agent フレームワークに統合した CBR 拡張 R&D-Agent を提案する。
ケースは構造化レコードとして格納され、実行可能なコードスナップショットと品質メタデータが格納される。
108回の検索イベントにおけるヒューリスティックな再利用検出は,意味的関連性が高いことを示す。
論文 参考訳(メタデータ) (2026-06-03T12:56:11Z) - SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adversarial Data Poisoning [1.0998907972211756]
SilentRetrievalは2段階のデータ中毒攻撃で、RAGシステムを敵対的な文書でハイジャックする。
SilentRetrievalは84.6%/81.3% HR@10、57.5%/54.8% ASR-LLM on Natural QuestionsとMS MARCOを達成している。
論文 参考訳(メタデータ) (2026-05-27T07:30:30Z) - Toward Efficient Membership Inference Attacks against Federated Large Language Models: A Projection Residual Approach [44.738736515079346]
Federated Large Language Models (FedLLMs) は、複数のパーティが生データを共有することなく、協調的にLLMを微調整することができる。
FedLLMsの特異な性質、すなわち、巨大なパラメータスケール、急速な収束、スパースな非直交勾配は、既存のMIAsを非効率にする。
提案するProjResは,FedLLMsに適したプロジェクション残差型受動MIAである。
論文 参考訳(メタデータ) (2026-04-23T01:44:04Z) - VeriX-Anon: A Multi-Layered Framework for Mathematically Verifiable Outsourced Target-Driven Data Anonymization [0.0]
VeriX-Anonは、オープンソースのターゲット駆動k匿名化のための多層検証フレームワークである。
認証決定木のメルクル式ハッシュによる決定論的検証、ランダムフォレスト決定境界付近の境界センチネルによる確率的検証、および暗号識別子による正確な重複性ツインズの組み合わせである。
12のシナリオのうち11の偏差を正しく検出した。
論文 参考訳(メタデータ) (2026-04-14T08:22:18Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - ME: Trigger Element Combination Backdoor Attack on Copyright Infringement [76.0062084678398]
SilentBadDiffusion(SBD)は、テキスト・ツー・イメージタスクにおけるSD攻撃において優れた性能を示す手法である。
本稿では,SBDのような攻撃の研究に利用できる新しいデータセットを作成し,SBDに基づくマルチ要素攻撃法を提案する。
著作権侵害率 (CIR) / First Attack Epoch (FAE) の2つの新しいデータセットは16.78% / 39.50と51.20% / 23.60で、それぞれPokemonとMijourneyのベンチマークに近いか、あるいは劣っている。
論文 参考訳(メタデータ) (2025-06-12T14:51:27Z) - Discriminator-Free Generative Adversarial Attack [87.71852388383242]
生成的ベースの敵攻撃は、この制限を取り除くことができる。
ASymmetric Saliency-based Auto-Encoder (SSAE) は摂動を生成する。
SSAEが生成した敵の例は、広く使われているモデルを崩壊させるだけでなく、優れた視覚的品質を実現する。
論文 参考訳(メタデータ) (2021-07-20T01:55:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。