論文の概要: HarmTrace: Anchor-Calibrated Decoupled Optimization for Fine-Grained Target Identification in Harmful Memes
- arxiv url: http://arxiv.org/abs/2608.16622v1
- Date: Mon, 17 Aug 2026 14:21:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.743284
- Title: HarmTrace: Anchor-Calibrated Decoupled Optimization for Fine-Grained Target Identification in Harmful Memes
- Title(参考訳): HarmTrace: Anchor-Calibrated Decoupled Optimization for Fine-Grained Target Identification in Harmful Memes
- Abstract要約: 我々は, きめ細かい目標同定による有害ミームの検出を延長する。
モデルは、すべてのミームに対する有害度を予測し、有害ミームに対しては、ターゲットカテゴリ、ターゲットエンティティ、テキスト参照、視覚領域を出力する。
HarmTraceは、評価された背骨のJRAと有害性の両方を改善する。
- 参考スコア(独自算出の注目度): 34.73591718598261
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal harmful meme detection is typically formulated as image--text harmfulness classification. A model may correctly predict harmfulness while misidentifying the attacked target or its supporting evidence. We therefore extend harmful meme detection with fine-grained target identification, asking what type of target is attacked, who is targeted, and where the target appears in the meme. The model predicts harmfulness for every meme and, for harmful memes, outputs the target category, target entity, textual mention, and visual region. To support this task, we introduce Meme3W, which unifies multiple public harmful meme datasets and provides human-verified annotations for harmful instances. We further introduce Joint Record Accuracy (JRA), a strict record-level metric requiring the harmfulness label and all target-identification fields to be jointly correct. Experiments with representative multimodal large language models reveal a substantial gap between harmfulness accuracy and JRA. To narrow this gap, we propose HarmTrace, an anchor-calibrated decoupled optimization framework. HarmTrace strengthens target-entity supervision through entity-aware supervised fine-tuning. It then applies Conditional Target-identification Policy Optimization (CTPO) to decouple harmfulness and target-identification advantages, restricting target-identification optimization to label-correct responses for harmful examples. CTPO uses a Virtual Positive Anchor (VPA) as a fully correct reference for target-identification advantage normalization. HarmTrace improves both JRA and harmfulness accuracy across the evaluated backbones, with JRA on the Qwen3-VL-8B backbone increasing from 17.58\% to 52.51\%. Our code is publicly available at https://github.com/llly1234/HarmTrace-for-Harmful-Memes.
- Abstract(参考訳): マルチモーダル有害ミーム検出は通常、画像-テキスト有害度分類として定式化される。
モデルは、攻撃対象またはその支持証拠を誤認しながら、有害性を正しく予測することができる。
そこで我々は,どの標的が攻撃されたのか,どの標的が攻撃されたのか,どこに標的が現れるのかを問う,きめ細かい標的識別による有害なミーム検出を拡張した。
モデルは、すべてのミームに対する有害度を予測し、有害ミームに対しては、ターゲットカテゴリ、ターゲットエンティティ、テキスト参照、視覚領域を出力する。
このタスクをサポートするために、複数の有害なミームデータセットを統一し、有害なインスタンスに対して人間検証されたアノテーションを提供するMeme3Wを紹介する。
さらに、有害度ラベルと全てのターゲット識別フィールドを共同で補正する必要がある厳密な記録レベル尺度であるジョイントレコード精度(JRA)についても紹介する。
代表的多モーダル大言語モデルを用いた実験により, 有害度精度とJRAとの間に大きなギャップがあることが判明した。
このギャップを狭めるために、アンカーキャリブレーションされた最適化フレームワークであるHarmTraceを提案する。
HarmTraceは、エンティティ・アウェアによる微調整を通じて、ターゲット・エンタリティの監視を強化する。
次に、条件付きターゲット識別ポリシー最適化(CTPO)を適用し、有害な事例に対するラベル正しい応答に対する目標識別最適化を制限した。
CTPOは、ターゲット識別優位正規化のための完全な正しい参照として、仮想陽性アンカー(VPA)を使用している。
HarmTraceは、評価されたバックボーンのJRAと有害性の両方を改善し、Qwen3-VL-8Bバックボーン上のJRAは17.58\%から52.51\%に増加した。
私たちのコードはhttps://github.com/llly1234/HarmTrace-for-Harmful-Memesで公開されています。
関連論文リスト
- INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment [27.025430116180477]
エージェントは、目標の対立やプレッシャーの下で有害な行動をとる。
チェーン・オブ・シンクレット(CoT)モニタリングを用いることで、有害な実行は推論において意図的な信号に先行することが多いことが分かりました。
対象行動へのコミットメントを表現するための専用チャネルとして,意図目標のツールを追加するアプローチであるINTENT-AS-A-TOOLを導入する。
論文 参考訳(メタデータ) (2026-08-27T16:47:19Z) - MIND: A Multi-agent Framework for Zero-shot Harmful Meme Detection [3.7336554275205898]
我々は、アノテーション付きデータに依存しないゼロショット有害なミーム検出のためのマルチエージェントフレームワークであるMINDを提案する。
MINDは3つの重要な戦略を実装している。1) 文脈情報を提供するための注釈のない参照セットから類似のミームを抽出する; 2) 類似のミームを包括的に理解するための双方向の洞察メカニズムを提案する; 3) 論理的仲裁による堅牢な意思決定を保証するためにマルチエージェントの議論メカニズムを採用する。
論文 参考訳(メタデータ) (2025-07-09T14:46:32Z) - Detecting Harmful Memes with Decoupled Understanding and Guided CoT Reasoning [26.546646866501735]
有害ミーム検出のための新しいフレームワークであるU-CoT+を紹介する。
まず,視覚的ミームを詳細なテキスト記述に変換する高忠実度ミーム・トゥ・テキストパイプラインを開発する。
この設計は、ミームの解釈をミーム分類から切り離し、複雑な生の視覚的内容に対する即時推論を避ける。
論文 参考訳(メタデータ) (2025-06-10T06:10:45Z) - Any Target Can be Offense: Adversarial Example Generation via Generalized Latent Infection [83.72430401516674]
GAKerは任意のターゲットクラスに対して逆例を構築することができる。
本手法は,未知のクラスに対する攻撃成功率を約14.13%で達成する。
論文 参考訳(メタデータ) (2024-07-17T03:24:09Z) - Prediction Exposes Your Face: Black-box Model Inversion via Prediction Alignment [24.049615035939237]
モデル反転(MI)攻撃は、その出力から対象モデルのプライベートトレーニングデータを再構成する。
ブラックボックスMI攻撃のための予測画像P2I手法を提案する。
本手法は,攻撃精度を8.5%向上し,データセットCelebAのクエリ数を99%削減する。
論文 参考訳(メタデータ) (2024-07-11T01:58:35Z) - Some Targets Are Harder to Identify than Others: Quantifying the Target-dependent Membership Leakage [11.086440815804227]
メンバーシップ推論(MI)ゲームでは、攻撃者はアルゴリズムの入力にターゲットポイントが含まれているか否かを推測しようとする。
本稿では,固定ターゲットMIゲームにおける最適攻撃のパワーを研究することで,会員攻撃の目標依存性の硬さを説明する。
論文 参考訳(メタデータ) (2024-02-15T16:30:55Z) - HGAttack: Transferable Heterogeneous Graph Adversarial Attack [63.35560741500611]
ヘテロジニアスグラフニューラルネットワーク(HGNN)は、Webやeコマースなどの分野でのパフォーマンスでますます認識されている。
本稿ではヘテロジニアスグラフに対する最初の専用グレーボックス回避手法であるHGAttackを紹介する。
論文 参考訳(メタデータ) (2024-01-18T12:47:13Z) - Pseudo Label-Guided Model Inversion Attack via Conditional Generative
Adversarial Network [102.21368201494909]
モデル反転(MI)攻撃はプライバシーに対する懸念を高めている。
近年のMI攻撃では,探索空間を狭める前にGAN(Generative Adversarial Network)を画像として活用している。
我々は条件付きGAN(cGAN)による擬似ラベル誘導MI(PLG-MI)攻撃を提案する。
論文 参考訳(メタデータ) (2023-02-20T07:29:34Z) - Object-fabrication Targeted Attack for Object Detection [54.10697546734503]
物体検出の敵攻撃は 標的攻撃と未標的攻撃を含む。
新たなオブジェクトファブリケーションターゲット攻撃モードは、特定のターゲットラベルを持つ追加の偽オブジェクトをファブリケートする検出器を誤解させる可能性がある。
論文 参考訳(メタデータ) (2022-12-13T08:42:39Z) - DISARM: Detecting the Victims Targeted by Harmful Memes [49.12165815990115]
DISARMは、有害なミームを検出するために名前付きエンティティ認識と個人識別を使用するフレームワークである。
DISARMは10の単一モーダル・マルチモーダルシステムより著しく優れていることを示す。
複数の強力なマルチモーダルライバルに対して、有害なターゲット識別の相対誤差率を最大9ポイントまで下げることができる。
論文 参考訳(メタデータ) (2022-05-11T19:14:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。