Whitewashing Hate, Smearing Harmless Content: Annotator-Style Rebuttal Attacks on LLM-Based Moderation
Abstractの概要
本論文では、LLMに基づくヘイトスピーチモデレーションにおける判定後の攻撃対象領域として、モデルに当初の正しい判断を再検討させるアノテーター風の反論を検証しています。著者らは、ヘイトコンテンツを無害と見せかけるホワイトウォッシングと、通常コンテンツをヘイトであると中傷するスミアリングの2つの操作方向を定式化し、直接的反論、境界摂動、敵対的論拠、およびそれらの組み合わせを含む4つの反論戦略を評価しました。複数のLLMと2つのヘイトスピーチデータセット(SBICおよびIHC)にわたる実験において、これらの攻撃はモデレーション精度を一貫して低下させ、マルチターン対話においてその効果がさらに増大することが示されました。また、予測自体が正しいままであっても反論によって正解ラベルの信頼度が大幅に損なわれるため、ハードラベルの反転率だけでは攻撃の深刻度が過小評価されることも分析により実証されています。
新規性
本研究は、入力側のプロンプトインジェクションのみに依存するのではなく、モデルによる初期判定の後に与えられる敵対的な査読者フィードバックを評価する、人間とAIの協調型モデレーションワークフローに合わせた再判定プロトコルを導入しています。また、攻撃の方向(ホワイトウォッシング対スミアリング)と反論のメカニズム(境界摂動対敵対的論拠)を明確に切り離すことで、モデル固有の持続的な脆弱性の非対称性を明らかにしています。
成果
実験の結果、アノテーター風の反論はモデル全体の分類性能を大幅に低下させることが示され、最も強力な攻撃はGPT-5.1、Qwen3-8B、Gemma4-E4Bでは通常「境界摂動+論拠」であり、Gemini-2.5では「境界摂動」単体でした。ほとんどのモデルは通常サンプルに対するスミアリング攻撃下でより大きな性能低下を被り、連続的な反論は中立的な追加発言では回復できない累積的な精度低下を引き起こします。評価された推論時防御策は、部分的かつクラスに偏りのある回復しか提供できず、重大な脆弱性が未緩和のまま残されています。
論文の注目点
- 捏造された査読者フィードバックは協調型モデレーションにおける効果的な判定後攻撃面として機能し、LLMの当初の正しい判定を覆すことに成功します。
- 敵対的な反論は予測が反転しない場合でも正解ラベルの信頼度を著しく損なうことが多いため、ハードラベルの反転率だけでは攻撃の影響が過小評価されます。
- 事前判定の付加や反論後プロンプティングなどの推論時防御は、包括的な頑健性ではなく部分的でクラス非対称な緩和にとどまります。