Fugu-MT 論文翻訳(概要): VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model

論文の概要: VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model

arxiv url: http://arxiv.org/abs/2406.14194v2
Date: Wed, 25 Dec 2024 07:31:14 GMT
ステータス: 翻訳完了
システム内更新日: 2024-12-30 21:44:04.760222
Title: VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
Title（参考訳）: VLBiasBench:大規模視覚言語モデルにおけるバイアス評価のための総合ベンチマーク
Authors: Sibo Wang, Xiangkui Cao, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen, Wen Gao,
Abstract要約: 我々は、LVLM(Large Vision-Language Models)におけるバイアスを評価するベンチマークであるVLBiasBenchを紹介する。 VLBiasBenchは、年齢、障害ステータス、性別、国籍、身体的外観、人種、宗教、職業、社会経済ステータスを含む9つの異なる社会バイアスのカテゴリを含むデータセットと、人種x性別と人種x社会経済ステータスの2つの交叉バイアスのカテゴリを含む。 15のオープンソースモデルと2つの高度なクローズドソースモデルに対して広範な評価を行い、これらのモデルに存在するバイアスに関する新たな洞察を得る。
参考スコア（独自算出の注目度）: 72.13121434085116
License: http://creativecommons.org/licenses/by/4.0/
Abstract: The emergence of Large Vision-Language Models (LVLMs) marks significant strides towards achieving general artificial intelligence. However, these advancements are accompanied by concerns about biased outputs, a challenge that has yet to be thoroughly explored. Existing benchmarks are not sufficiently comprehensive in evaluating biases due to their limited data scale, single questioning format and narrow sources of bias. To address this problem, we introduce VLBiasBench, a comprehensive benchmark designed to evaluate biases in LVLMs. VLBiasBench, features a dataset that covers nine distinct categories of social biases, including age, disability status, gender, nationality, physical appearance, race, religion, profession, social economic status, as well as two intersectional bias categories: race x gender and race x social economic status. To build a large-scale dataset, we use Stable Diffusion XL model to generate 46,848 high-quality images, which are combined with various questions to creat 128,342 samples. These questions are divided into open-ended and close-ended types, ensuring thorough consideration of bias sources and a comprehensive evaluation of LVLM biases from multiple perspectives. We conduct extensive evaluations on 15 open-source models as well as two advanced closed-source models, yielding new insights into the biases present in these models. Our benchmark is available at https://github.com/Xiangkui-Cao/VLBiasBench.
Abstract（参考訳）: LVLM(Large Vision-Language Models)の出現は、汎用人工知能の実現に向けて大きな一歩を踏み出した。しかし、これらの進歩にはバイアスのあるアウトプットに関する懸念が伴い、これはまだ徹底的に調査されていない課題である。既存のベンチマークは、データスケールの制限、単一質問フォーマット、バイアスの幅の狭いため、バイアスを評価するのに十分な包括的ではない。この問題に対処するために、LVLMのバイアスを評価するために設計された総合ベンチマークであるVLBiasBenchを紹介する。 VLBiasBenchは、年齢、障害状態、性別、国籍、身体的外観、人種、宗教、職業、社会経済ステータスを含む9つの異なる社会バイアスのカテゴリと、人種x性、人種x社会経済ステータスの2つの交叉バイアスのカテゴリを含むデータセットを特徴としている。大規模なデータセットを構築するために、安定拡散XLモデルを用いて46,848個の高品質な画像を生成し、128,342個のサンプルを作成する。これらの質問は、オープン・エンド型とクローズ・エンド型に分けられ、バイアス源の徹底的な検討と、複数の視点からLVLMバイアスの包括的評価を行う。 15のオープンソースモデルと2つの高度なクローズドソースモデルに対して広範な評価を行い、これらのモデルに存在するバイアスに関する新たな洞察を得る。私たちのベンチマークはhttps://github.com/Xiangkui-Cao/VLBiasBench.comで公開されています。

関連論文リスト

Surface Fairness, Deep Bias: A Comparative Study of Bias in Language Models [49.41113560646115]
大規模言語モデル(LLM)におけるバイアスの様々なプロキシ尺度について検討する。 MMLU (Multi-subject benchmark) を用いた人格評価モデルでは, スコアの無作為かつ大半がランダムな差が生じることがわかった。 LLMアシスタントメモリとパーソナライゼーションの最近の傾向により、これらの問題は異なる角度から開かれている。
論文参考訳（メタデータ） (2025-06-12T08:47:40Z)
SB-Bench: Stereotype Bias Benchmark for Large Multimodal Models [42.54907891780377]
大規模マルチモーダルモデル(LMM)におけるステレオ型バイアスは有害な社会的偏見を持続させる。 LMMにおけるステレオタイプバイアスを評価する既存のデータセットは、しばしば多様性に欠け、合成画像に依存している。我々は、ステレオタイプバイアスを評価するための最も包括的なフレームワークであるStereotype Bias Benchmark(SB-bench)を紹介する。
論文参考訳（メタデータ） (2025-02-12T20:41:53Z)
Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings [13.686732204665738]
既存のBBQデータセットを,補間質問型と短解質問型を組み込むことで拡張する。我々の発見によると、LSMは年齢や社会経済的地位など、特定の保護された属性に対してより偏りのある反応を生み出す。偏見をゼロショット、少数ショット、チェーン・オブ・シントを組み合わせることで、偏見のレベルを約0。
論文参考訳（メタデータ） (2024-12-09T01:29:47Z)
With a Grain of SALT: Are LLMs Fair Across Social Dimensions? [3.5001789247699535]
本稿では,ジェンダー,宗教,人種にまたがるオープンソースのLarge Language Models(LLM)におけるバイアスの系統的分析について述べる。私たちはSALTデータセットを使用して,General Debate, positioned Debate, Career Advice, Problem Solving, CV Generationという,5つの異なるバイアストリガを組み込んでいます。以上の結果から, モデル間で一貫した分極が明らかとなり, 組織的に好意的あるいは好ましくない治療を受ける集団が存在する。
論文参考訳（メタデータ） (2024-10-16T12:22:47Z)
Bias Similarity Across Large Language Models [32.0365189539138]
我々は2つのデータセット(4Kと100万の質問)を用いて複数の次元にわたる出力分布を通してバイアスを分析する。結果から,微調整が出力分布に与える影響は最小限であり,プロプライエタリなモデルは未知として過度に応答し,バイアスを最小化し,精度と実用性を損なう傾向にあることがわかった。 Llama3-ChatやGemma2-itのようなオープンソースモデルは、GPT-4のようなプロプライエタリなモデルに匹敵する公平さを示し、大規模でクローズドソースなモデルは本質的にバイアスが小さいという仮定に挑戦する。
論文参考訳（メタデータ） (2024-10-15T19:21:14Z)
Investigating Implicit Bias in Large Language Models: A Large-Scale Study of Over 50 LLMs [0.0]
大規模言語モデル(LLM)は幅広いタスクで採用されている。最近の研究では、LLMは明示的な偏見評価をパスしても暗黙の偏見を抑えることができることが示されている。この研究は、新しい言語モデルやより大きな言語モデルが自動的にバイアスを減らさないことを強調している。
論文参考訳（メタデータ） (2024-10-13T03:43:18Z)
Identifying and Mitigating Social Bias Knowledge in Language Models [52.52955281662332]
個々人の社会的偏見をきめ細かなキャリブレーションを可能にする新しいデバイアス・アプローチであるFairness Stamp(FAST)を提案する。 FASTは最先端のベースラインを超え、デバイアス性能が優れている。これは、大きな言語モデルにおける公平性を達成するためのきめ細かいデバイアス戦略の可能性を強調している。
論文参考訳（メタデータ） (2024-08-07T17:14:58Z)
BIGbench: A Unified Benchmark for Social Bias in Text-to-Image Generative Models Based on Multi-modal LLM [8.24274551090375]
画像生成のバイアスの統一ベンチマークであるBIGbenchを紹介する。既存のベンチマークとは異なり、BIGbenchは4次元にわたるバイアスを分類し評価する。また, 蒸留効果や無関係な保護属性など, バイアスに関する新たな研究方向を明らかにした。
論文参考訳（メタデータ） (2024-07-21T18:09:40Z)
GenderBias-\emph{VL}: Benchmarking Gender Bias in Vision Language Models via Counterfactual Probing [72.0343083866144]
本稿では,GenderBias-emphVLベンチマークを用いて,大規模視覚言語モデルにおける職業関連性バイアスの評価を行う。ベンチマークを用いて15のオープンソースLVLMと最先端の商用APIを広範囲に評価した。既存のLVLMでは男女差が広くみられた。
論文参考訳（メタデータ） (2024-06-30T05:55:15Z)
GPTBIAS: A Comprehensive Framework for Evaluating Bias in Large Language Models [83.30078426829627]
大規模言語モデル(LLM)は人気を集め、大規模なユーザコミュニティで広く採用されている。既存の評価手法には多くの制約があり、それらの結果は限定的な解釈可能性を示している。本稿では,LPMの高性能性を活用し,モデル内のバイアスを評価するGPTBIASというバイアス評価フレームワークを提案する。
論文参考訳（メタデータ） (2023-12-11T12:02:14Z)
ROBBIE: Robust Bias Evaluation of Large Generative Language Models [27.864027322486375]
異なるプロンプトベースのデータセットを使用して、複数のテキストドメインと人口統計軸にわたる社会的バイアスを測定することができる。我々は,12の人口動態軸と5のジェネレーションLLMの家系の6つの異なるプロンプトベースのバイアスと毒性の指標を比較した。 3つのバイアス/毒性の緩和技術が、我々の一連の測定においていかにうまく機能するかを包括的に研究する。
論文参考訳（メタデータ） (2023-11-29T23:03:04Z)
CBBQ: A Chinese Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models [52.25049362267279]
本稿では,人的専門家と生成言語モデルによって共同で構築された100万以上の質問からなる中国語バイアスベンチマークデータセットを提案する。データセットのテストインスタンスは、手作業による厳格な品質管理を備えた3K以上の高品質テンプレートから自動的に抽出される。大規模な実験により、データセットがモデルバイアスを検出することの有効性が実証された。
論文参考訳（メタデータ） (2023-06-28T14:14:44Z)
Debiasing Vision-Language Models via Biased Prompts [79.04467131711775]
本稿では,テキスト埋め込みにおけるバイアスのある方向を投影することで,視覚言語基盤モデルを疎外する一般的な手法を提案する。偏平投影行列を組み込んだテキストのみをデバイアスすることで、ロバストな分類器と公正な生成モデルが得られることを示す。
論文参考訳（メタデータ） (2023-01-31T20:09:33Z)
"I'm sorry to hear that": Finding New Biases in Language Models with a Holistic Descriptor Dataset [12.000335510088648]
新しい包括的バイアス測定データセットであるHollisticBiasを紹介します。 HolisticBiasは、これらの用語の生きた経験を持つ専門家やコミュニティメンバーを含む参加的なプロセスで組み立てられた。我々は,HolisticBiasが,言語モデルからトークンの確率において,検出不能なバイアスを測定するのに有効であることを実証した。
論文参考訳（メタデータ） (2022-05-18T20:37:25Z)
Greedy Gradient Ensemble for Robust Visual Question Answering [163.65789778416172]
VQA(Visual Question Answering)では、分布バイアスとショートカットバイアスという2つの側面から生じる言語バイアスを強調している。本稿では,非バイアスベースモデル学習に複数のバイアスモデルを組み合わせた新しいデバイアスフレームワークGreedy Gradient Ensemble(GGE)を提案する。 GGEはバイアス付きモデルを優先的にバイアス付きデータ分布に過度に適合させ、バイアス付きモデルでは解決が難しい例にベースモデルがより注意を払う。
論文参考訳（メタデータ） (2021-07-27T08:02:49Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。