論文の概要: Now You See the Hate: Adaptive View Retrieval for Hidden Hateful Illusions
- arxiv url: http://arxiv.org/abs/2607.19061v2
- Date: Wed, 22 Jul 2026 15:00:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 14:36:03.347831
- Title: Now You See the Hate: Adaptive View Retrieval for Hidden Hateful Illusions
- Title(参考訳): 憎しみに満ちた幻想を再現する「Adaptive View Retrieval」が登場
- Authors: Qianpu Chen, Derya Soydaner,
- Abstract要約: 我々は,隠された憎悪の錯覚検出を知覚的検索問題として定式化する。
Adaptive View Retrievalは、イメージと隠れメッセージテンプレートの補完ビューバンクを組み立てる。
オリジナルビューベースラインと、ヘイトスラング、ヘイトシンボル、可視性レベルにわたる固定された単一変換フィルタを大幅に上回る。
- 参考スコア(独自算出の注目度): 0.6138671548064355
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Hateful optical illusions expose a serious gap in current multimodal safety systems. On original-view hateful illusions, previous work shows that six moderation classifiers achieve at most 20.9 to 24.5% accuracy and nine state-of-the-art VLMs remain at or below 10.2% with illusion-aware prompting, leaving most hidden hate undetected. We formulate hidden hateful illusion detection as a perceptual retrieval problem and propose Adaptive View Retrieval. This retrieve-and-calibrate framework assembles a complementary view bank for the image and hidden-message templates, adaptively selects which views to trust, retrieves hidden-message identities, and calibrates whether the recovered evidence is harmful. On HatefulIllusion with a frozen CLIP encoder, Adaptive View Retrieval reaches 93.2% balanced accuracy on the held-out test split. It substantially outperforms original-view baselines and fixed single-transform filters across hate slangs, hate symbols, and visibility levels. The same design also surpasses official fine-tuned CLIP baselines, matches or exceeds human performance on IllusionMNIST, IllusionFashionMNIST, and IllusionAnimals, and outperforms zoom-out preprocessing on HC-Bench under the SemVink protocol. Together, these results show that robust multimodal moderation requires recovering hidden meaning before deciding whether it is harmful.
- Abstract(参考訳): 不快な光学錯視は、現在のマルチモーダル安全システムにおいて深刻なギャップを露呈する。
オリジナル・ビューのヘイトフル・イリュージョンでは、6つのモデレーション分類器が少なくとも20.9から24.5%の精度で達成され、9つの最先端のVLMが10.2%以下にとどまり、イリュージョン・アウェア・プロンプトによりほとんどの隠れたヘイトが検出されていない。
認識検索問題として隠れヘイトフルイリュージョン検出を定式化し、適応ビュー検索を提案する。
画像と隠蔽メッセージテンプレートの補完ビューバンクを組み立て、どのビューを信頼するかを適応的に選択し、隠蔽メッセージIDを検索し、回収された証拠が有害かどうかを校正する。
凍結したCLIPエンコーダを持つHatefulIllusionでは、Adaptive View Retrievalはホールドアウトテストスプリットで93.2%のバランスの取れた精度に達する。
オリジナルビューベースラインと、ヘイトスラング、ヘイトシンボル、可視性レベルにわたる固定された単一変換フィルタを大幅に上回る。
IllusionMNIST、IllusionFashionMNIST、IllusionAnimalsでは、公式の微調整されたCLIPベースラインを上回り、人間のパフォーマンスを上回り、SemVinkプロトコルの下でHC-Benchでズームアウト前処理を上回ります。
これらの結果から,ロバストなマルチモーダルモデレーションは有害かどうかを判断する前に隠れた意味を回復する必要があることが示唆された。
関連論文リスト
- Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment [45.92240827409312]
Saliency-Driven Perceptual Realignment (SDPR) は、推論全体を通して視覚的認知の低下を緩和するトレーニング不要のフレームワークである。
提案するSDPRは,全発生経路における視覚的認知の全体的アライメントのため,幻覚に対して頑健である。
論文 参考訳(メタデータ) (2026-07-18T14:39:16Z) - Detecting Clinical Hallucinations in LVLMs via Counterfactual Visual Grounding Uncertainty [22.008964207160663]
視覚的エビデンスを基礎として,任意のLVLM応答を監査する視覚追跡可能な幻覚検出フレームワークを提案する。
我々は、視覚的に検証可能なエンティティを抽出し、医療領域適応Qwen-VL接地検証器を用いて、入力画像上に各エンティティをローカライズする。
複数の医用画像モダリティとLVLMバックボーンを用いた実験により,本手法は幻覚検出性能を継続的に向上することが示された。
論文 参考訳(メタデータ) (2026-06-26T18:15:38Z) - Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models [11.342804429826936]
VLM(Vision-Language Models)は、視覚的錯覚に対する体系的な偏見を示し、実際の視覚的差異を知覚するのではなく、記憶された事実を思い出させる。
本稿では,CVPR 2026 における第5回 DataCV Challenge Task 1 のトレーニングフリーフレームワークについて述べる。
私たちのソリューションは,第1位のソリューションのわずか0.47%という,この課題において2位を確保しました。
論文 参考訳(メタデータ) (2026-05-09T09:52:23Z) - Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions [26.051334752537546]
本稿では,スケーラブルなヘイトフルイリュージョン生成のリスクと,現在のコンテンツモデレーションモデルを回避する可能性について検討する。
我々は62のヘイトメッセージに条件付き安定拡散と制御ネットを用いて1,860個の光学錯視を生成する。
そのうち1,571件はヘイトメッセージの埋め込みに成功し、Hateful Illusionデータセットを形成している。
論文 参考訳(メタデータ) (2025-07-30T12:37:29Z) - Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models [24.363156120809546]
劣化文書理解におけるOCR幻覚評価のための最初のベンチマークであるKIE-HVQAを提案する。
このデータセットには、IDカードと請求書にまたがるテストサンプルが含まれており、OCR信頼性のための実世界の劣化をシミュレートしている。
Qwen2.5-VL 実験により,GPT-4o に対して 7B-パラメータモデルでは幻覚のない精度が 22% 向上していることが示された。
論文 参考訳(メタデータ) (2025-06-25T06:44:07Z) - Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling [78.78822033285938]
VLM(Vision-Language Models)は視覚的理解に優れ、視覚幻覚に悩まされることが多い。
本研究では,幻覚を意識したトレーニングとオンザフライの自己検証を統合した統合フレームワークREVERSEを紹介する。
論文 参考訳(メタデータ) (2025-04-17T17:59:22Z) - IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models [56.34742191010987]
現在のビジュアル言語モデル(VLM)は印象的なイメージ理解を示すが、視覚錯覚に苦慮している。
我々はIllusionBenchを紹介した。IllusionBenchは、古典的な認知錯覚と現実のシーン錯覚を含む包括的視覚錯覚データセットである。
我々は従来のパターンに似ているが現実に異なるトラップイリュージョンを設計し、SOTAモデルの問題を強調する。
論文 参考訳(メタデータ) (2025-01-01T14:10:25Z) - Dual Spoof Disentanglement Generation for Face Anti-spoofing with Depth
Uncertainty Learning [54.15303628138665]
フェース・アンチ・スプーフィング(FAS)は、顔認識システムが提示攻撃を防ぐ上で重要な役割を担っている。
既存のフェース・アンチ・スプーフィング・データセットは、アイデンティティと重要なばらつきが不十分なため、多様性を欠いている。
我々は「生成によるアンチ・スプーフィング」によりこの問題に対処するデュアル・スポット・ディアンタングメント・ジェネレーション・フレームワークを提案する。
論文 参考訳(メタデータ) (2021-12-01T15:36:59Z) - Aurora Guard: Reliable Face Anti-Spoofing via Mobile Lighting System [103.5604680001633]
紙写真やデジタルビデオの高解像度レンダリングリプレイに対する反偽造は、未解決の問題だ。
オーロラガード(Aurora Guard, AG)と呼ばれる, シンプルだが効果的な顔保護システムを提案する。
論文 参考訳(メタデータ) (2021-02-01T09:17:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。