論文の概要: Detector-Evasive LLM Paraphrasing via Constrained Policy Optimization
- arxiv url: http://arxiv.org/abs/2606.00392v1
- Date: Fri, 29 May 2026 22:19:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.380129
- Title: Detector-Evasive LLM Paraphrasing via Constrained Policy Optimization
- Title(参考訳): 制約付きポリシー最適化による検出・拡張型LLMパラフレージング
- Authors: Mingyi Wang, Zhuoer Shen, Yuheng Bu, Shaofeng Zou,
- Abstract要約: AIテキスト検出器は、パラフレーズやディテクター誘導パラフレーズ攻撃に対して脆弱である。
既存の検出器回避法は、しばしば意味保存の正確な制御を欠いている。
本稿では,新しいGRPOスタイルのグループベースのポリシー更新を施した2次元強化学習アルゴリズムであるDe Detector Evasion Policy Optimization (DEPO)を提案する。
- 参考スコア(独自算出の注目度): 27.078441680572254
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI-text detectors are vulnerable to paraphrasing and detector-guided paraphrasing attacks, but existing detector-evasion methods often lack precise control over semantic preservation. In particular, optimizing directly for detector evasion can degrade fine-grained semantics, whereas scalarized reward designs provide only indirect, weight-sensitive control over the evasion-semantics trade-off. We address this limitation by formulating detector-evasive LLM paraphrasing as a Constrained Markov Decision Process, where detector evasion is the primary objective and semantic preservation is enforced as an explicit constraint. We propose Detector Evasion Policy Optimization (DEPO), a Lagrangian primal-dual reinforcement learning algorithm with a novel GRPO-style group-based policy update. DEPO adaptively balances semantic preservation and detector evasion during training, enabling the policy to improve attack success within a prescribed semantic-preservation region. Experiments on MAGE, M4, RAID, and peer-review datasets, evaluated against MAGE, RoBERTa, RADAR, Binoculars, and Fast-DetectGPT detectors, show that DEPO achieves strong detector evasion while precisely satisfying the semantic preservation constraint. DEPO also exhibits cross-domain, cross-detector, and prompt-level robustness.
- Abstract(参考訳): AIテキスト検出器は、パラフレーズやディテクター誘導のパラフレーズ攻撃に弱いが、既存のディテクター回避法は意味保存の正確な制御を欠いていることが多い。
特に、検出器の回避を直接最適化することは、きめ細かいセマンティクスを劣化させるが、スカラー化された報酬設計は、回避・セマンティクスのトレードオフを間接的に、重量に敏感に制御するだけである。
本稿では, 検出回避LPMパラフレーズを制約付きマルコフ決定プロセスとして定式化し, 検出回避を主目的とし, 意味的保存を明示的制約として行うことにより, この制限に対処する。
本稿では,新しいGRPO型グループベースのポリシー更新機能を備えたラグランジアン原始二重強化学習アルゴリズムであるDe Detector Evasion Policy Optimization (DEPO)を提案する。
DEPOは、トレーニング中のセマンティック保存と検出回避を適応的にバランスさせ、所定のセマンティック保存領域内での攻撃成功を改善することができる。
MAGE, M4, RAID, およびピアレビューデータセットに関する実験は, MAGE, RoBERTa, RADAR, Binoculars, Fast-DetectGPT検出器に対して評価され, 意味保存制約を正確に満たしながら, DEPOが強力な検出回避を実現することを示す。
DEPOはまた、クロスドメイン、クロス検出器、即時レベルの堅牢性を示す。
関連論文リスト
- Backdoor Mitigation in Object Detection via Adversarial Fine-Tuning [10.393154496941527]
バックドア攻撃は、安全クリティカルな視覚システムに深刻な脅威をもたらす。
適応微調整は、分類において一般的なバックドア緩和手法である。
物体検出バックドアの軽減のための検出対応逆調整フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-07T09:33:06Z) - Agentic Spatio-Temporal Grounding via Collaborative Reasoning [80.83158605034465]
時間的ビデオグラウンド(Temporal Video Grounding)は、テキストクエリが与えられたビデオ内の対象物または人の時間的チューブを検索することを目的としている。
本稿では,STVGの課題に対して,オープンワールドおよびトレーニングフリーシナリオに向けたエージェント時空間グラウンド(ASTG)フレームワークを提案する。
具体的には、現代多言語モデル(MLLM)を活用した2つの特殊エージェントSRA(Spatial Reasoning Agent)とTRA(Temporal Reasoning Agent)である。
人気のあるベンチマークの実験は、既存の弱教師付きおよびゼロショットアプローチをマージンで上回る提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2026-02-10T10:16:27Z) - Semantics-Preserving Evasion of LLM Vulnerability Detectors [14.476903104601154]
LLMベースの脆弱性検知器は、セキュリティクリティカルなコードレビューにますますデプロイされている。
セマンティクス保存脅威モデルに基づく検出時間整合性の評価を行った。
異なる攻撃方法/キャリア間での関節の堅牢性の測定基準を導入する。
論文 参考訳(メタデータ) (2026-01-30T20:54:27Z) - Proactive Hardening of LLM Defenses with HASTE [0.614338876867286]
プロンプトベースの攻撃技術は、LLMベースのAIシステムをセキュアにデプロイし、保護する上で、大きな課題の1つだ。
本稿では,HASTE(Hard- negative Attack Sample Training Engine)について紹介する。
このフレームワークは、ハードネガティブまたはハード陽性のイテレーション戦略に対してファジングの有無にかかわらず、インジェクション検出の有効性を評価するために一般化することができる。
論文 参考訳(メタデータ) (2026-01-27T00:19:34Z) - Contamination Detection for VLMs using Multi-Modal Semantic Perturbation [73.76465227729818]
オープンソースのVision-Language Models (VLM)は、ベンチマークタスクで最先端のパフォーマンスを達成した。
プレトレーニングコーパスは,テストセットリークによるパフォーマンスの低下という,実践者とユーザ双方にとって重要な懸念を提起する。
既存の検出手法が不整合性を示すか,不整合性を示すかを示す。
マルチモーダルなセマンティック摂動に基づく,新しい簡易かつ効果的な検出法を提案する。
論文 参考訳(メタデータ) (2025-11-05T18:59:52Z) - Advancing Machine-Generated Text Detection from an Easy to Hard Supervision Perspective [108.30620357325559]
既存の機械生成テキスト(MGT)検出手法は、ラベルを「黄金標準」として暗黙的に仮定する
このような不正確な条件下での信頼性の高い監視を実現するための,容易かつハードな強化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-02T15:59:31Z) - On the Adversarial Robustness of Learning-based Conformal Novelty Detection [10.58528988397402]
AdaDetect を用いた共形ノベルティ検出の対角的ロバスト性について検討した。
以上の結果から,高い検出力を維持しながらFDRを著しく増大させる可能性が示唆された。
論文 参考訳(メタデータ) (2025-10-01T03:29:11Z) - Towards Copyright Protection for Knowledge Bases of Retrieval-augmented Language Models via Reasoning [58.57194301645823]
大規模言語モデル(LLM)は、現実のパーソナライズされたアプリケーションにますます統合されている。
RAGで使用される知識基盤の貴重かつしばしばプロプライエタリな性質は、敵による不正使用のリスクをもたらす。
これらの知識基盤を保護するための透かし技術として一般化できる既存の方法は、一般的に毒やバックドア攻撃を含む。
我々は、無害な」知識基盤の著作権保護の名称を提案する。
論文 参考訳(メタデータ) (2025-02-10T09:15:56Z) - ADoPT: LiDAR Spoofing Attack Detection Based on Point-Level Temporal
Consistency [11.160041268858773]
ディープニューラルネットワーク(DNN)は、自動運転車(AV)のためのLiDARベースの知覚システムにますます統合されている
我々は,攻撃者がLiDARデータに偽のオブジェクトを注入し,その環境を誤解釈して誤った判断を下すという,LiDAR偽造攻撃の課題に対処することを目指している。
ADoPT (Anomaly Detection based on Point-level Temporal consistency) は、連続するフレーム間の時間的一貫性を定量的に測定し、ポイントクラスタのコヒーレンシーに基づいて異常物体を同定する。
nuScenesデータセットを用いた評価では、アルゴリズムは様々なLiDARスプーフィング攻撃に対して効果的に対応し、低(低)を実現している。
論文 参考訳(メタデータ) (2023-10-23T02:31:31Z) - Exploiting Low-confidence Pseudo-labels for Source-free Object Detection [54.98300313452037]
Source-free Object Detection (SFOD) は、ラベル付きソースデータにアクセスすることなく、未ラベルのターゲットドメインにソーストレーニングされた検出器を適応することを目的としている。
現在のSFOD法は適応相におけるしきい値に基づく擬似ラベル手法を用いる。
疑似ラベルを最大限に活用するために,高信頼度と低信頼度しきい値を導入する手法を提案する。
論文 参考訳(メタデータ) (2023-10-19T12:59:55Z) - Small Object Detection via Coarse-to-fine Proposal Generation and
Imitation Learning [52.06176253457522]
本稿では,粗粒度パイプラインと特徴模倣学習に基づく小型物体検出に適した2段階フレームワークを提案する。
CFINetは、大規模な小さなオブジェクト検出ベンチマークであるSODA-DとSODA-Aで最先端の性能を達成する。
論文 参考訳(メタデータ) (2023-08-18T13:13:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。