論文の概要: UTS at ELOQUENT 2026 Voight-Kampff: structural shifts in AI writing bypass state-of-the-art detectors
- arxiv url: http://arxiv.org/abs/2607.13565v1
- Date: Wed, 15 Jul 2026 08:05:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.695623
- Title: UTS at ELOQUENT 2026 Voight-Kampff: structural shifts in AI writing bypass state-of-the-art detectors
- Title(参考訳): ELOQUENT 2026 Voight-KampffのUTS:最先端検出器をバイパスするAI書き込みの構造変化
- Abstract要約: 我々は,どの言語モデル回避攻撃が最先端の対人微調整を生き残るかを検討する。
われわれはELOQUENT 2026 Voight-Kampffのリーダーボードのトップ5を席巻する戦略を開発している。
- 参考スコア(独自算出の注目度): 1.348563827917271
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We investigate which language model evasion attacks survive state-of-the-art adversarial fine-tuning, developing strategies that sweep the top 5 positions on the ELOQUENT 2026 Voight-Kampff leaderboard. While adversarial fine-tuning trivially closes the 2025 winning evasion recipes, we uncover a fundamental asymmetry in detector vulnerability: pushing generated text out of the detector's training distribution reliably defeats adversarial detection, whereas pulling it into the distribution (e.g., mimicking human training data) fails completely. Exploiting this, we introduce two novel out-of-distribution attack families - cross-decade register attacks and modernist stream-of-consciousness form. Both strategies easily bypass adversarial closure, achieving up to approximately 50x higher fool rates than previous methods while preserving naturalness. Furthermore, experiments show that the obvious deployer countermeasure (augmenting training data with period prose) fails to close the vulnerability. Our findings show that the tested detector families, including adversarially fine-tuned ones, exhibit persistent vulnerabilities under structural out-of-distribution shifts, a mechanism that directly powers our leading competition performance.
- Abstract(参考訳): ELOQUENT 2026 Voight-Kampff Leaderboardの上位5位を網羅する手法を開発した。
敵の微調整は、2025年に勝利した回避レシピを自明に閉じるが、検出器の脆弱性の基本的な非対称性を明らかにする: 生成されたテキストを検出器のトレーニング分布から押し出すと、敵の検出を確実に損なう。
そこで我々は,2つの新たなアウト・オブ・ディストリビューション・アタック・ファミリー(クロス・デイド・レジスタ・アタックとモダニスト・ストリーム・オブ・アタック・フォーム)を導入する。
どちらの戦略も敵の閉ざしを容易に回避し、自然性を保ちながら従来の方法より最大50倍高い愚かさを達成できる。
さらに、実験により、明らかなデプロイ対策(周期的な散文によるトレーニングデータの増大)が脆弱性を解決できないことが示されている。
以上の結果から, 反対に微調整された検出ファミリを含む検査された検出ファミリは, 構造的アウト・オブ・ディストリビューションシフトの下で永続的な脆弱性を示すことが明らかとなった。
関連論文リスト
- Crushing the Evidence: A Dual-Penalty Evasion Framework for Fooling White-Box Explainable AI Auditors [4.377640147713394]
ポストホックモデルの説明器は、高感度ドメインのモデルを監査するために広くデプロイされている。
説明可能性パイプラインにおける潜在的な攻撃について、いくつかの研究がなされている。
より強力なホワイトボックス、勾配調整型回避攻撃フレームワークを導入する。
論文 参考訳(メタデータ) (2026-08-01T10:03:14Z) - Provable Robustness against Backdoor Attacks via the Primal-Dual Perspective on Differential Privacy [51.758416625168]
ランダムな平滑化は、敵の摂動に対する堅牢性を証明するための強力なツールである。
本稿では,複雑な構成機構の認証のためのフレームワークを提案する。
複雑な脅威モデル下での堅牢性を証明するために複合メカニズムを使用するための原則的で一般的なフレームワークを提供する。
論文 参考訳(メタデータ) (2026-05-20T22:17:29Z) - Deepfake detectors are DUMB: A benchmark to assess adversarial training robustness under transferability constraints [0.0]
DUMB -- データセットのsoUrces、モデルアーキテクチャと Balance - と DUMBer メソッドを拡張して、ディープフェイク検出を行います。
我々は、転送可能性制約およびデータセット構成の下での敵攻撃に対するロバストネス検出器の評価を行った。
実験により, 対人訓練戦略は, 流通事例の堅牢性を高めるが, 採用戦略によっては, クロスデータセット構成下での分解も可能であることが示された。
論文 参考訳(メタデータ) (2026-01-09T18:06:19Z) - Debiased Dual-Invariant Defense for Adversarially Robust Person Re-Identification [52.63017280231648]
人物再識別(ReID)は、歩行者軌道追跡などの現実の多くの応用において、基本的な課題である。
Person ReIDモデルは、歩行者画像に対する知覚不能な摂動が完全に誤った予測を引き起こすような、敵の攻撃に非常に敏感である。
本稿では,2つの相からなる二重不変防衛フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-13T03:56:40Z) - A unified Bayesian framework for adversarial robustness [0.4078247440919472]
チャネルを通して敵の不確実性をモデル化する形式的ベイズ的枠組みを導入する。
これは2つの強固化戦略、すなわち、訓練中に制定された積極的防御と、作戦中に制定された反応性防衛と、敵の浄化に適合する。
我々は,我々の方法論を実証的に検証し,敵の不確実性を明示的にモデル化する利点を示す。
論文 参考訳(メタデータ) (2025-10-10T11:28:30Z) - GCP: Guarded Collaborative Perception with Spatial-Temporal Aware Malicious Agent Detection [11.336965062177722]
協調的知覚は、悪意のあるエージェントからの敵対的なメッセージ攻撃に対して脆弱である。
本稿では,既存の単発外乱検出手法を損なう新しい盲検領域混乱(BAC)攻撃を明らかにする。
本稿では、空間的時間的認識による悪意のあるエージェント検出に基づくガード付き協調認識フレームワークを提案する。
論文 参考訳(メタデータ) (2025-01-05T06:03:26Z) - FaultGuard: A Generative Approach to Resilient Fault Prediction in Smart Electrical Grids [53.2306792009435]
FaultGuardは、障害タイプとゾーン分類のための最初のフレームワークであり、敵攻撃に耐性がある。
本稿では,ロバスト性を高めるために,低複雑性故障予測モデルとオンライン逆行訓練手法を提案する。
本モデルでは,耐故障予測ベンチマークの最先端を最大0.958の精度で上回っている。
論文 参考訳(メタデータ) (2024-03-26T08:51:23Z) - Kick Bad Guys Out! Conditionally Activated Anomaly Detection in Federated Learning with Zero-Knowledge Proof Verification [31.38942054994932]
フェデレーテッド・ラーニング(FL)システムは敵の攻撃を受けやすい。
RedJasperは、現実世界のFLデプロイメント用に特別に設計された2段階の異常検出手法である。
第1段階で不審な活動を特定し、第2段階を条件付きで活性化し、不審な局所モデルをさらに精査する。
論文 参考訳(メタデータ) (2023-10-06T07:09:05Z) - Interpretability is a Kind of Safety: An Interpreter-based Ensemble for
Adversary Defense [28.398901783858005]
我々は,強固な防御敵に対するX-Ensembleと呼ばれるインタプリタベースのアンサンブルフレームワークを提案する。
X-エンサンブルはランダムフォレスト(RF)モデルを用いて、準検出器をアンサンブル検出器に結合し、敵のハイブリッド攻撃防御を行う。
論文 参考訳(メタデータ) (2023-04-14T04:32:06Z) - Understanding the Vulnerability of Skeleton-based Human Activity Recognition via Black-box Attack [53.032801921915436]
HAR(Human Activity Recognition)は、自動運転車など、幅広い用途に採用されている。
近年,敵対的攻撃に対する脆弱性から,骨格型HAR法の堅牢性に疑問が呈されている。
攻撃者がモデルの入出力しかアクセスできない場合でも、そのような脅威が存在することを示す。
BASARと呼ばれる骨格をベースとしたHARにおいて,最初のブラックボックス攻撃手法を提案する。
論文 参考訳(メタデータ) (2022-11-21T09:51:28Z) - Illusory Attacks: Information-Theoretic Detectability Matters in Adversarial Attacks [76.35478518372692]
エプシロン・イリューソリー(epsilon-illusory)は、シーケンシャルな意思決定者に対する敵対的攻撃の新たな形態である。
既存の攻撃と比較して,エプシロン・イリューソリーの自動検出は極めて困難である。
以上の結果から, より優れた異常検知器, 効果的なハードウェアおよびシステムレベルの防御の必要性が示唆された。
論文 参考訳(メタデータ) (2022-07-20T19:49:09Z) - Provable Defense Against Delusive Poisoning [64.69220849669948]
本研究は, 対人訓練が妄想性中毒に対する防御法であることを示す。
これは、敵の訓練が妄想的中毒に対する原則的な防御方法であることを意味している。
論文 参考訳(メタデータ) (2021-02-09T09:19:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。