論文の概要: LU-500: A Logo Benchmark for Concept Unlearning
- arxiv url: http://arxiv.org/abs/2607.24101v2
- Date: Wed, 29 Jul 2026 12:52:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.252661
- Title: LU-500: A Logo Benchmark for Concept Unlearning
- Title(参考訳): LU-500:コンセプトアンラーニングのためのローゴベンチマーク
- Authors: Keyu Li, Jin Gao, Jialing Zhang, Dequan Wang,
- Abstract要約: コンセプト・アンラーニングは、テキスト・ツー・イメージ・モデルにおいて、保護された、あるいは安全でない視覚的概念の再現を制限するために、ますます使われている。
LU-500は、Fortune Global 500社が開発したロゴアンラーニングベンチマークで、このローカライズされたセッティングとセマンティックに絡み合った設定を研究する。
そこで本研究では,局所的なロゴ除去とグローバルな画像保存を両立させるマルチグラデーションプロトコルを定義した。
- 参考スコア(独自算出の注目度): 27.279391309749624
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Concept unlearning is increasingly used to limit the reproduction of protected or unsafe visual concepts in text-to-image models. Existing evaluations, however, mostly study targets that dominate the whole image, such as styles, broad object categories, or portrait-like identities, leaving company logos comparatively underexamined. Logos create a different failure mode: a small localized mark can carry the entire protected concept, must be visually precise to remain recognizable, and can be triggered implicitly by products, storefronts, packaging, or advertisements even when the word ``logo'' is absent. We introduce LU-500, a logo-unlearning benchmark built from Fortune Global 500 companies to study this localized and semantically entangled setting. LU-500 contains nearly 10,000 curated text-query and logo-image pairs, with an explicit track (LUex-500) and an implicit contextual track (LUim-500). To avoid reducing the task to a binary detector score, we define a multi-grained protocol that evaluates both local logo removal and global image preservation in pixel and latent spaces. Experiments on representative inference-time methods, including NP, SLD, and SEGA, and compatible fine-tuning-based methods such as ESD and Forget-Me-Not, show that the evaluated methods struggle to remove logo evidence without changing non-target content. We further analyze ProLU, a prompt-space multi-agent baseline: it improves local erasure by removing logo-inducing semantics, but also illustrates why prompt filtering is not a substitute for weight-level disentanglement. Correlation analyses over logo area, location, and structural complexity suggest that future logo unlearning may need spatially aware controls, such as SSIM-guided constraints, rather than purely global concept suppression.
- Abstract(参考訳): コンセプト・アンラーニングは、テキスト・ツー・イメージ・モデルにおいて、保護された、あるいは安全でない視覚的概念の再現を制限するために、ますます使われている。
しかし、既存の評価は、スタイル、広い対象カテゴリー、肖像画のようなアイデンティティなど、画像全体を支配的なターゲットとして研究しており、会社のロゴは比較的過小評価されている。
ログは別の障害モードを生成する: 小さなローカライズされたマークは、保護された概念全体を持てることができ、認識可能なまま視覚的に正確であり、‘logo’という単語が存在しない場合でも、製品、店頭、パッケージ、広告によって暗黙的にトリガーされる。
LU-500は、Fortune Global 500社が開発したロゴアンラーニングベンチマークで、このローカライズされたセッティングとセマンティックに絡み合った設定を研究する。
LU-500には1万近いキュレートされたテキストクエリとロゴイメージペアがあり、明示的なトラック(LUex-500)と暗黙的なコンテキストトラック(LUim-500)がある。
バイナリ検出器スコアに対するタスクの削減を回避するため,局所的なロゴ除去と,画素空間と潜時空間のグローバルな画像保存を両立させるマルチグラデーションプロトコルを定義した。
NP, SLD, SEGA, ESDやForget-Me-Notのような微調整法と互換性のある提案手法を用いた実験により, 非ターゲットコンテンツを変更することなく, ロゴエビデンスを除去することが困難であることが示された。
さらに,プロンプト空間のマルチエージェントベースラインであるProLUを解析し,ロゴを誘導するセマンティクスを除去することで局所消去を改善するとともに,プロンプトフィルタが重みレベルの乱れの代用ではない理由も示す。
ロゴ領域、位置、構造的複雑さに関する相関分析は、将来のロゴの学習には、純粋にグローバルな概念抑圧ではなく、SSIM誘導制約のような空間的に意識された制御が必要であることを示唆している。
関連論文リスト
- From Unlearning to UNBRANDING: A Benchmark for Trademark-Safe Text-to-Image Generation [0.7798283447125206]
ブランド認識は多次元であり、明示的なロゴを超えて独特の構造的特徴を包含する。
商標のきめ細かい除去と微妙な構造的ブランド機能のための新しいタスクであるunbrandingを紹介します。
我々のVision Language Modelsのメトリクスによって検証された結果、アンブランディングははっきりした、実際に関係のある問題であることを確認した。
論文 参考訳(メタデータ) (2025-12-15T23:15:36Z) - Introducing Visual Scenes and Reasoning: A More Realistic Benchmark for Spoken Language Understanding [51.010563573083495]
視覚画像と明示的推論の両方を統合する新しいデータセットであるVRSLUを紹介する。
オーバーイデオライズされたCAでは、GPT-4oとFLUX.1-devを使用して、ユーザの環境やステータスを反映した画像を生成し、続いて人間の検証によって品質を保証する。
推論のために、GPT-4oは予測ラベルの説明を生成するために使用され、その説明は人間のアノテータによって洗練され、精度と一貫性が保証される。
論文 参考訳(メタデータ) (2025-11-24T11:32:24Z) - Logo-VGR: Visual Grounded Reasoning for Open-world Logo Recognition [25.658499211854153]
我々は,製品モデレーションにおける中核的な課題である,オープンワールドのロゴ認識ベンチマークを導入する。
数万のブランドを記憶する従来のロゴ認識手法とは異なり,Logo-VGRを提案する。
OOD設定では,Logo-VGRが10ポイント近く,強いベースラインを上回ります。
論文 参考訳(メタデータ) (2025-09-30T05:35:10Z) - LogoSticker: Inserting Logos into Diffusion Models for Customized Generation [73.59571559978278]
テキスト・ツー・イメージ・モデルにロゴを挿入する作業を導入する。
我々の目標は、ロゴのアイデンティティを拡散モデルに挿入し、様々な状況下でシームレスに合成できるようにすることです。
この課題に対処するために,新しい2相パイプラインLogoStickerを提案する。
論文 参考訳(メタデータ) (2024-07-18T17:54:49Z) - SLANT: Spurious Logo ANalysis Toolkit [61.59021920232986]
SLANT: Spurious Logo Analysis Toolkitを開発した。
というロゴをマイニングするためのセミオートマチックなメカニズムが組み込まれている。
我々は、VLモデルが負の人形容詞と相関する様々な無害なロゴを発見した。
攻撃者は有害なコンテンツに急激なロゴを配置することができ、モデルがそれを無害と誤分類する原因となった。
論文 参考訳(メタデータ) (2024-06-03T15:41:31Z) - Image-Text Pre-Training for Logo Recognition [0.27195102129094995]
マッチングモデルの性能向上のための2つの新しいコントリビューションを提案する。
微調整済みのImageNet事前学習モデルの標準パラダイムは、マッチング問題を効果的に解決するために必要なテキスト感度を見つけるのに失敗する。
OpenLogoDet3K47で微調整された場合、イメージテキストデータ上で事前トレーニングされた同じビジョンバックボーンが、980.6%のリコール@1.99ドルを達成した。
論文 参考訳(メタデータ) (2023-09-18T23:18:02Z) - Contrastive Multi-View Textual-Visual Encoding: Towards One Hundred
Thousand-Scale One-Shot Logo Identification [2.243832625209014]
オープン・セットのワンショット・セッティングにおいて,ビジネスブランドのロゴを自然シーンで識別する問題について検討する。
ロゴに現れるテキストをエンコードする新しい多視点テキスト視覚符号化フレームワークを提案する。
提案手法は, 自然シーンの作業において, 作付ロゴ識別, 作付ロゴ識別, エンド・ツー・エンドのロゴ識別を行う。
論文 参考訳(メタデータ) (2022-11-23T12:59:41Z) - Discriminative Semantic Feature Pyramid Network with Guided Anchoring
for Logo Detection [52.36825190893928]
我々は,DSFP-GAを用いた識別的セマンティック特徴ピラミッドネットワークという新しい手法を提案する。
我々のアプローチは主に差別的セマンティック特徴ピラミッド(DSFP)とガイドアンコリング(GA)から構成される。
論文 参考訳(メタデータ) (2021-08-31T11:59:00Z) - An Effective and Robust Detector for Logo Detection [58.448716977297565]
一部の攻撃者は、よく訓練されたロゴ検出モデルを侵害で騙している。
本稿では,2回検討する機構に基づく新しいロゴ検出手法を提案する。
我々は,デテクトRSアルゴリズムを,等化損失関数,マルチスケール変換,および逆データ拡張を備えたカスケードスキーマに拡張する。
論文 参考訳(メタデータ) (2021-08-01T10:17:53Z) - LogoDet-3K: A Large-Scale Image Dataset for Logo Detection [61.296935298332606]
完全アノテーション付き最大のロゴ検出データセットであるLogoDet-3Kを紹介する。
3000のロゴカテゴリー、約20万の注釈付きロゴオブジェクト、158,652の画像がある。
大規模なロゴ検出のための最先端のYOLOv3フレームワークにFocal LosとCIoU Losを組み込んだ強力なベースライン手法であるLogo-Yoloを提案する。
論文 参考訳(メタデータ) (2020-08-12T14:57:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。