論文の概要: Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed
- arxiv url: http://arxiv.org/abs/2607.24898v1
- Date: Mon, 27 Jul 2026 16:42:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.576132
- Title: Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed
- Title(参考訳): Harmは普遍的ではない:コミュニティ特有の毒性検出は早急に必要である
- Authors: Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camilla Longden, Cecily Morrison,
- Abstract要約: テキスト・ツー・イメージ・ジェネレーションのための最先端の毒性検知器は、すべてワンサイズ・フィットのアプローチを採用している。
安全とラベル付けされた画像の約35%は障害コミュニティによって有害であると考えられている。
地域特異的毒性検出(CTD)の提唱
- 参考スコア(独自算出の注目度): 14.067913369851894
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: State-of-the-art toxicity detectors for text-to-image generation adopt a one-size-fits-all approach: a single universal model applying fixed safety guidelines to all users. Our empirical evidence shows that these detectors fail to shield marginalized communities: approximately 35% of generated images labeled safe are considered harmful by disability communities. In this position paper, we argue for community-specific toxicity detection (CTD). To demonstrate its feasibility, we collaborate with disability experts to develop safety guidelines for two communities: dwarfism and blind/low vision. Using a dataset of 2,400 annotated T2I-generated images we demonstrate that both large vision-language models and existing general-purpose toxicity detectors catastrophically fail to recognize harmful content under these guidelines in zero-shot settings with F1 score lower than random guessing (F1 0.32 and 0.37). Promisingly, prompt-based adaptation methods (ICL, VQA) substantially improve harm detection performance (GPT-4o: F1 0.50 and 0.78), while parameter-efficient fine-tuning improves smaller models (0.5b-7b with best F1 0.48 and 0.59) with less than 100 demonstrations, but remains sensitive to evolving guidelines. Despite these gains, CTD performance remains far below F1 $\approx 0.9$ achieved for general-purpose toxicity detection, highlighting the challenge and the need for sustained research effort.
- Abstract(参考訳): テキスト・ツー・イメージ・ジェネレーションのための最先端の毒性検知器は、全ユーザーに対して固定安全ガイドラインを適用した単一の普遍的モデルである、ワンサイズフィットのアプローチを採用している。
安全とラベル付けされた画像の約35%は、障害コミュニティによって有害であると考えられています。
本稿では,地域特異的毒性検出(CTD)について論じる。
その実現可能性を示すため、我々は障害の専門家と協力し、ドワーフ主義とブラインド/ロービジョンという2つのコミュニティの安全ガイドラインを策定した。
2,400個の注釈付きT2I生成画像を用いて、大規模な視覚言語モデルと既存の汎用毒性検知器の両方が、ランダムな推測よりもF1スコアが低いゼロショット設定で、破滅的にこれらのガイドラインの下で有害なコンテンツを認識できないことを示した(F1 0.32, 0.37)。
プロンプトベースの適応法(ICL, VQA)は、害検出性能(GPT-4o: F1 0.50, 0.78)を大幅に改善する一方、パラメータ効率の良い微調整は、より小さなモデル(0.5b-7bと最良のF1 0.48, 0.59)を100回未満で改善するが、進化するガイドラインに敏感である。
これらの上昇にもかかわらず、CTDのパフォーマンスは、汎用毒性検出のために達成されたF1$\approx 0.9$よりもはるかに低いままであり、継続的な研究努力の必要性と課題を浮き彫りにしている。
関連論文リスト
- AI-generated Images Challenge Visual Trust in High-risk Scenarios [79.40239296310791]
SafeIMGは、GPT Image 2.0を用いて生成された12のパブリックおよび個人安全シナリオにまたがる安全指向のベンチマークである。
SafeIMGは、検出器が合成画像を認識するかどうかを評価するだけでなく、それらの決定が人間の識別された異常を反映しているかどうかも評価する。
我々は,特殊合成画像検出器と視覚言語モデル(VLM)を評価し,どちらも信頼性のある検出を提供していないことを発見した。
論文 参考訳(メタデータ) (2026-07-23T06:56:49Z) - Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study [0.0]
Webスケールコーパスでトレーニングされた大規模言語モデル(LLM)は、本質的にトレーニングデータから有害なパターンを吸収する。
復号時間エキスパート(Decoding-time Experts, DExperts)は、モデルの再訓練を必要とせずに生成を行う推論時間緩和手法である。
この研究は、明示的な毒性軽減と暗黙的な毒性軽減のギャップを強調することで、AI安全性に関する研究の活発化に寄与する。
論文 参考訳(メタデータ) (2026-05-13T20:12:30Z) - Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context [82.32380418146656]
Health-ORSC-Benchは、医療におけるtextbfOver-Refusalと textbfSafe Completionの品質を測定するために設計された最初の大規模ベンチマークである。
私たちのフレームワークは、人間の検証を備えた自動パイプラインを使用して、さまざまなレベルの意図の曖昧さでモデルをテストします。
Health-ORSC-Benchは、次世代の医療AIアシスタントを調整するための厳格な標準を提供する。
論文 参考訳(メタデータ) (2026-01-25T01:28:52Z) - I Detect What I Don't Know: Incremental Anomaly Learning with Stochastic Weight Averaging-Gaussian for Oracle-Free Medical Imaging [2.384534878752428]
異常ラベルを使わずに,信頼度の高い正規サンプル群を漸進的に拡張する,教師なしのオラクルフリーフレームワークを導入する。
凍結した事前訓練された視覚バックボーンは、小さな畳み込みアダプタで拡張され、無視できる計算オーバーヘッドを伴う高速なドメイン適応が保証される。
COVID-CXRでは、ROC-AUCは0.9489から0.9982に改善され、肺炎CXRでは0.6834から0.8968に上昇し、脳MRIではND-5では0.6041から0.7269に上昇する。
論文 参考訳(メタデータ) (2025-11-05T23:28:14Z) - Rethinking Toxicity Evaluation in Large Language Models: A Multi-Label Perspective [104.09817371557476]
大規模言語モデル(LLM)は、様々な自然言語処理タスクにおいて印象的な結果を得た。
有害なコンテンツを生み出す可能性には、深刻な安全上の懸念が浮かび上がっている。
毒性検出のための3つの新しいマルチラベルベンチマークを導入する。
論文 参考訳(メタデータ) (2025-10-16T06:50:33Z) - OVERT: A Benchmark for Over-Refusal Evaluation on Text-to-Image Models [91.55634905861827]
Over-refusalは$textitover-refusal$として知られる現象で、T2Iモデルの実用性を減らす。
我々は,OVERT(textbfOVE$r-$textbfR$efusal evaluation on $textbfT$ext-to-image model)を提案する。
論文 参考訳(メタデータ) (2025-05-27T15:42:46Z) - Cascading Neural Network Methodology for Artificial
Intelligence-Assisted Radiographic Detection and Classification of Lead-Less
Implanted Electronic Devices within the Chest [0.7874708385247353]
本研究は、LLIED存在/位置の100%検出と、LLIEDタイピングにおける高分類によるCXR解釈支援人工知能(AI)方法論の開発に焦点を当てた。
カスケーディングニューラルネットワーク(Faster R-CNNによる検出とInception V3による分類)の開発には、"ground-truth" CXRアノテーション(LLIEDあたりROIラベル付け)と推論ディスプレイ(生成バウンディングボックス(GBBs))がある。
論文 参考訳(メタデータ) (2021-08-25T19:29:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。