論文の概要: Scaling Vision-Language Models Is Not Enough to Mitigate Bias
- arxiv url: http://arxiv.org/abs/2607.28211v1
- Date: Thu, 30 Jul 2026 13:49:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.580058
- Title: Scaling Vision-Language Models Is Not Enough to Mitigate Bias
- Title(参考訳): ビジョンランゲージモデルのスケーリングはバイアス軽減に十分ではない
- Abstract要約: VLM(Vision-Language Models)は、現在ではマルチモーダルシステムの基礎となっているが、素早い相関に対する頑健さは、大規模にはあまり理解されていない。
本報告では, モデルサイズ, 24 のトレーニングデータセット, 3 つの評価ベンチマークを対象とし, 194 の公開 VLM に関する大規模な実証的研究を行った。
- 参考スコア(独自算出の注目度): 17.05392655320793
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Vision-Language Models (VLMs) such as CLIP are now foundational to multimodal systems, yet their robustness to spurious correlations remains poorly understood at scale. We present the first large-scale empirical study of 194 publicly available VLMs, including 16 model families, covering a wide range of model sizes, 24 training datasets, and three evaluation benchmarks, namely ImageNet (overall performance), CelebA (typical single-attribute bias), and UrbanCars (complex multi-attribute biases). Across these settings, the Spearman correlation between model scale and performance weakens as evaluation shifts from ImageNet ($ρ{=}0.68$) to single-attribute ($ρ{=}0.48$) and further to multi-attribute ($ρ{=}0.05$) bias benchmarks. In contrast, properties of the training data (size and quality) show more consistent relationships with worst-group accuracy across both bias benchmarks. Notably, curated datasets yield improvements of up to 25% over uncurated alternatives at a comparable scale. Finally, the effect of architectural choices (e.g., patch size, image resolution) is highly context-dependent, varying with the nature of the benchmark, including the type of bias and its spatial distribution within images.
- Abstract(参考訳): CLIPのような視覚言語モデル(VLM)は、現在ではマルチモーダルシステムの基礎となっているが、素早い相関に対する頑健さは、大規模にはあまり理解されていない。
16のモデルファミリー、24のトレーニングデータセット、ImageNet(オーバーパフォーマンス)、CelebA(典型的な単一属性バイアス)、UrbanCars(複合マルチ属性バイアス)の3つの評価ベンチマークを含む、194の公開VLMの大規模な実証的研究を行った。
これらの設定の中で、モデルスケールとパフォーマンスの間のスピアマンの相関は、ImageNet(ρ{=}0.68$)からシングル属性(ρ{=}0.48$)、さらにマルチ属性(ρ{=}0.05$)のバイアスベンチマークへの評価シフトによって弱まる。
対照的に、トレーニングデータ(サイズと品質)の特性は、両方のバイアスベンチマークで最悪のグループ精度とより一貫性のある関係を示す。
特に、キュレートされたデータセットは、同等のスケールで、未キュレートされた代替よりも25%改善されている。
最後に、アーキテクチャ選択の効果(例えば、パッチサイズ、画像の解像度)は、ベンチマークの性質によって、画像内のバイアスの種類や空間分布など、コンテキストに依存している。
関連論文リスト
- Leveraging Model Soups to Classify Intangible Cultural Heritage Images from the Mekong Delta [0.0]
メコンデルタにおける無形文化財(ICH)の分類は、ユニークな課題である。
本稿では,ハイブリッドなCoAtNetアーキテクチャをモデルスープに統合する堅牢なフレームワークを提案する。
提案手法は,72.36%のTop-1精度と69.28%のマクロF1スコアを達成し,高いベースラインを達成している。
論文 参考訳(メタデータ) (2026-03-02T18:50:15Z) - From Global to Granular: Revealing IQA Model Performance via Correlation Surface [83.65597122328133]
我々は, IQA 性能の構造化, きめ細かな解析を行う textbfGranularity-Modulated correlation (GMC) を提案する。
GMCにはtextbfDistribution Regulatorが含まれており、相関関係を規則化し、非均一な品質分布からのバイアスを軽減する。
標準ベンチマークの実験では、GCCはスカラーメトリクスに見えないパフォーマンス特性を示し、IQAモデルを分析、比較、デプロイするためのより情報に富んだ信頼性の高いパラダイムを提供する。
論文 参考訳(メタデータ) (2026-01-29T13:55:26Z) - Intrinsic Bias is Predicted by Pretraining Data and Correlates with Downstream Performance in Vision-Language Encoders [13.474737752636608]
本稿は,CLIPモデルの上流事前学習要因と下流性能が内在バイアスにどのように関係しているかを,これまでで最大の包括的分析結果として提示する。
55のアーキテクチャを使用して,26のデータセットでトレーニングされた131のCLIPモデルを,さまざまなサイズで検討した。
事前トレーニングデータセットの選択がバイアスの上流で最も重要な予測要因であることに気付きました。
論文 参考訳(メタデータ) (2025-02-11T21:11:47Z) - Images Speak Louder than Words: Understanding and Mitigating Bias in Vision-Language Model from a Causal Mediation Perspective [13.486497323758226]
広範囲なデータセットで事前訓練された視覚言語モデルは、性情報とオブジェクトやシナリオを関連付けることによって、必然的にバイアスを学習することができる。
本稿では,因果媒介分析を取り入れた枠組みを提案し,バイアス発生と伝播の経路を計測・マッピングする。
論文 参考訳(メタデータ) (2024-07-03T05:19:45Z) - Anchor Points: Benchmarking Models with Much Fewer Examples [88.02417913161356]
6つの人気のある言語分類ベンチマークでは、多数の点の正しいクラスに対するモデル信頼度はモデル間で強く相関している。
Anchor Point Selectionは,データセット全体にわたるモデル動作をキャプチャする,データセットの小さなサブセットを選択する手法である。
平均絶対誤差が低いデータセットの他のすべての点について、クラスごとの予測モデルを推定するために、いくつかのアンカーポイントを使用することができる。
論文 参考訳(メタデータ) (2023-09-14T17:45:51Z) - Mitigating Spurious Correlations in Multi-modal Models during
Fine-tuning [18.45898471459533]
モデル一般化を低下させたり、間違った理由でモデルが正しいことを導いたという豪華な相関は、現実世界のデプロイメントにおいて大きな堅牢性に関する懸念の1つです。
本稿では,特定の関心領域の微調整において,刺激的な相関に対処する新しい手法を提案する。
論文 参考訳(メタデータ) (2023-04-08T05:20:33Z) - DIME-FM: DIstilling Multimodal and Efficient Foundation Models [72.1900621000677]
VLFM(Large Vision-Language Foundation Models)は、画像キャプチャペアの大規模なデータセットに基づいてトレーニングされる。
我々は,大容量VLFMに含まれる知識を,より小型でカスタマイズされた基礎モデルに転送できる新しい蒸留機構(DIME-FM)を導入する。
結果として得られたモデル "Distill-ViT-B/32" は、プライベートWiTデータセットで事前トレーニングされたCLIP-ViT-B/32モデルと競合する。
論文 参考訳(メタデータ) (2023-03-31T17:47:23Z) - Through a fair looking-glass: mitigating bias in image datasets [1.0323063834827415]
目的変数間の統計的依存を最小化し,画像データセットを非バイアス化するための高速かつ効果的なモデルを提案する。
提案手法をCelebAデータセット上で評価し、その結果を最先端のデバイアス法と比較し、そのモデルが有望なフェアネスと精度の組み合わせを達成することを示す。
論文 参考訳(メタデータ) (2022-09-18T20:28:36Z) - General Greedy De-bias Learning [163.65789778416172]
本稿では,関数空間における勾配降下のような偏りのあるモデルとベースモデルを優雅に訓練する一般グリーディ・デバイアス学習フレームワーク(GGD)を提案する。
GGDは、事前知識を持つタスク固有バイアスモデルと、事前知識を持たない自己アンサンブルバイアスモデルの両方の設定の下で、より堅牢なベースモデルを学ぶことができる。
論文 参考訳(メタデータ) (2021-12-20T14:47:32Z) - Sparse MoEs meet Efficient Ensembles [49.313497379189315]
このようなモデルの2つの一般的なクラス、すなわちニューラルネットワークのアンサンブルと専門家のスパースミックス(スパースMoE)の相互作用について研究する。
Efficient Ensemble of Experts (E$3$)は、両モデルのクラスを最大限に活用するスケーラブルでシンプルなMoEのアンサンブルであり、深いアンサンブルよりも最大45%少ないFLOPを使用する。
論文 参考訳(メタデータ) (2021-10-07T11:58:35Z) - Diversity inducing Information Bottleneck in Model Ensembles [73.80615604822435]
本稿では,予測の多様性を奨励することで,ニューラルネットワークの効果的なアンサンブルを生成する問題をターゲットにする。
そこで本研究では,潜伏変数の学習における逆損失の多様性を明示的に最適化し,マルチモーダルデータのモデリングに必要な出力予測の多様性を得る。
最も競争力のあるベースラインと比較して、データ分布の変化の下で、分類精度が大幅に向上した。
論文 参考訳(メタデータ) (2020-03-10T03:10:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。