論文の概要: Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle
- arxiv url: http://arxiv.org/abs/2608.04314v1
- Date: Wed, 05 Aug 2026 00:46:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.668323
- Title: Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle
- Title(参考訳): 善に対する敵対的攻撃 : 視覚コンテンツライフサイクルにおける積極的保護に関する調査
- Authors: Jiaming Zhang, Boyang Chen, Zherui Li, Fuyao Zhang, Xinyu Yan, Hong Xi Tae, Wenwen He, Xuan Wang, Siqi Guo, Junhao Dong, Kun Wang, Hanxun Huang, Yige Li, Xingjun Ma, Yang Cao, Lingjuan Lyu, Wei Yang Bryan Lim,
- Abstract要約: この介入点付近で成長した保護パラダイムについて検討する。
ほとんどの保護は、主に静的あるいは弱い適応的な敵に対して検証されている。
我々は、堅牢で構成可能で、デプロイ可能な所有者側の保護のために、クロスステージ対策とオープンな問題を統合することで、閉鎖する。
- 参考スコア(独自算出の注目度): 65.6642776933861
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Once visual content enters an AI pipeline, its owner often retains little technical control over how it is used. Legal and regulatory remedies can address misuse, but many technical interventions must be applied earlier, when content is released or accessed. This survey examines the protective paradigm that has grown around this intervention point, which we call \emph{adversarial attacks for good}. Perturbations and structured signals long studied as attacks on learned models are instead applied by data owners, creators, platforms, or auditors to disrupt unauthorized automation or support later accountability. Five research communities have arrived at this inversion largely independently, each addressing a different stage of a visual asset's lifecycle: privacy filters against unwanted recognition at sharing time, unlearnable examples against unauthorized training, generative safeguards against malicious editing or imitation, adversarial CAPTCHAs for access control against automated agents, and provenance mechanisms for post-circulation attribution. Although developed in separate venues with incompatible success criteria, many of these methods exploit persistent gaps between human perception, semantic interpretation, and machine inference, suggesting that the paradigm remains relevant as visual pipelines evolve toward multimodal models and autonomous agents. To make their claims comparable, we evaluate all five families along shared axes of transferability, adaptability, and deployment readiness. Across the lifecycle, we find that most protections are still validated mainly against static or weakly adaptive adversaries, while evidence beyond controlled benchmarks remains scarce. We close by consolidating cross-stage countermeasures and open problems for robust, composable, and deployable owner-side protection.
- Abstract(参考訳): ビジュアルコンテンツがAIパイプラインに入ると、その所有者は、その使用方法に関する技術的なコントロールをほとんど保持しないことが多い。
法的および規制的な治療法は誤用に対処できるが、コンテンツが解放されたりアクセスされたりする際には、多くの技術的介入が早期に適用されなければならない。
本調査では,この介入点付近で発達した保護パラダイムについて検討し,これを「善の敵攻撃」と呼ぶ。
学習モデルに対する攻撃は、無許可の自動化を妨害したり、後の説明責任をサポートするために、データオーナ、クリエータ、プラットフォーム、監査官によって適用される。
5つの研究コミュニティが独立してこの反転に到達し、それぞれが視覚的アセットのライフサイクルの異なる段階に対処している: 共有時の望ましくない認識に対するプライバシーフィルター、無許可のトレーニングに対する無許可の例、悪意のある編集や模倣に対する生成的保護、自動エージェントに対するアクセス制御のための敵CAPTCHA、循環後帰属の証明メカニズム。
相容れない成功基準を持つ異なる場所で開発されたが、これらの手法の多くは人間の知覚、意味解釈、機械推論の間の永続的なギャップを利用しており、視覚パイプラインがマルチモーダルモデルや自律エージェントへと進化していくにつれて、そのパラダイムは依然として関連していることを示唆している。
彼らの主張を同等にするために、私たちは5つのファミリー全てを、転送可能性、適応性、デプロイメントの準備の共有軸に沿って評価します。
ライフサイクル全体を通じて、ほとんどのプロテクションは、主に静的または弱い適応の敵に対して検証されているのに対して、制御されたベンチマーク以外の証拠は乏しい。
我々は、堅牢で構成可能で、デプロイ可能な所有者側の保護のために、クロスステージ対策とオープンな問題を統合することで、閉鎖する。
関連論文リスト
- Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response [0.0]
サイバー対応AIエージェントは、言語モデルとツール、メモリ、実行環境を組み合わせて、攻撃的なセキュリティタスクを実行する。
このレビューでは、その境界における5つの脆弱性クラスを合成する。マルチステップ攻撃チェーン、サンドボックス境界と競合する目的、サプライチェーンとクレデンシャル露出、永続的なコマンド・アンド・コントロール、自動アクションのスピード。
論文 参考訳(メタデータ) (2026-07-28T07:34:37Z) - Boundary-targeted Membership Inference Attacks on Safety Classifiers [70.20833439671131]
安全分類器は、セルフハームとメンタルヘルスの議論を含むセンシティブなデータセットに基づいて訓練される。
低信頼例を識別する新たな境界目標選択戦略を導入する。
実験により、相手は会話の19%を安全分類器が5%の偽陽性率でユーザーの苦痛を示すようにフラグ付けして回復できることが示された。
これは最先端のMIAメソッドだけで攻撃するより3.5ドル高い。
論文 参考訳(メタデータ) (2026-05-21T12:05:22Z) - Provable Robustness against Backdoor Attacks via the Primal-Dual Perspective on Differential Privacy [51.758416625168]
ランダムな平滑化は、敵の摂動に対する堅牢性を証明するための強力なツールである。
本稿では,複雑な構成機構の認証のためのフレームワークを提案する。
複雑な脅威モデル下での堅牢性を証明するために複合メカニズムを使用するための原則的で一般的なフレームワークを提供する。
論文 参考訳(メタデータ) (2026-05-20T22:17:29Z) - LatentGuard: Controllable Latent Steering for Robust Refusal of Attacks and Reliable Response Generation [4.29885665563186]
LATENTGUARDは、行動アライメントと教師付き潜在空間制御を組み合わせて、解釈可能で正確な安全操縦を行うフレームワークである。
本研究は, 実用性を損なうことなく, 安全性制御性と応答解釈性の両方を向上することを示す。
論文 参考訳(メタデータ) (2025-09-24T07:31:54Z) - Avoid Adversarial Adaption in Federated Learning by Multi-Metric
Investigations [55.2480439325792]
Federated Learning(FL)は、分散機械学習モデルのトレーニング、データのプライバシの保護、通信コストの低減、多様化したデータソースによるモデルパフォーマンスの向上を支援する。
FLは、中毒攻撃、標的外のパフォーマンス劣化とターゲットのバックドア攻撃の両方でモデルの整合性を損なうような脆弱性に直面している。
我々は、複数の目的に同時に適応できる、強い適応的敵の概念を新たに定義する。
MESASは、実際のデータシナリオで有効であり、平均オーバーヘッドは24.37秒である。
論文 参考訳(メタデータ) (2023-06-06T11:44:42Z) - A Self-supervised Approach for Adversarial Robustness [105.88250594033053]
敵対的な例は、ディープニューラルネットワーク(DNN)ベースの視覚システムにおいて破滅的な誤りを引き起こす可能性がある。
本稿では,入力空間における自己教師型対向学習機構を提案する。
これは、反逆攻撃に対する強力な堅牢性を提供する。
論文 参考訳(メタデータ) (2020-06-08T20:42:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。