論文の概要: SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals
- arxiv url: http://arxiv.org/abs/2605.21919v1
- Date: Thu, 21 May 2026 02:44:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.064669
- Title: SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals
- Title(参考訳): SDGBiasBench:持続可能な開発目標におけるビジョンモデルの役割のベンチマークと緩和
- Authors: Zihang Lin, Huaiyuan Qin, Muli Yang, Hongyuan Zhu,
- Abstract要約: 持続可能な開発目標に向けた進捗の評価には、視覚的手がかり、文脈的知識、開発指標に対する多段階の推論が必要である。
既存のベンチマークは通常、これらの側面を分離して評価し、モデルが証拠の代わりに先行する時に現れる体系的なバイアスを無視する。
視覚言語推論のための大規模ベンチマークスイートであるSDGBiasBenchを提案する。
- 参考スコア(独自算出の注目度): 28.710989810208748
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Assessing progress toward the Sustainable Development Goals (SDGs) requires multi-step reasoning over visual cues, contextual knowledge, and development indicators, where incomplete evidence use and imperfect evidence integration can introduce hidden prediction biases. Real-world SDG monitoring further spans both qualitative judgments and quantitative estimation. However, existing benchmarks typically evaluate these aspects in isolation, obscuring systematic biases that emerge when models substitute priors for evidence. To address this gap, we propose SDGBiasBench, a large-scale benchmark suite for SDG-oriented vision-language reasoning. Spanning 500k expert-involved multiple-choice questions and 50k regression tasks, the benchmark enables comprehensive assessment of both decision-level and estimation-level bias in Vision--Language Models (VLMs). Evaluations on SDGBiasBench reveal an intrinsic SDG bias in current VLMs, where predictions are frequently driven by SDG specific priors rather than reliable multi-modal cues. To mitigate such bias, we propose CADE (Contrastive Adaptive Debias Ensemble), a training-free, plug-and-play method that leverages modality-specific answer priors. CADE yields significant gains on the proposed benchmark, improving multiple-choice accuracy by up to 25% and reducing regression MAE by up to 12 points across multiple VLMs. We hope our work can foster the development of more fair and reliable AI systems for sustainable development.
- Abstract(参考訳): 持続可能な開発目標(SDG)への進捗を評価するには、視覚的手がかり、文脈知識、開発指標に対する多段階の推論が必要である。
実世界のSDGモニタリングは質的判断と定量的推定の両方にまたがる。
しかしながら、既存のベンチマークは通常、これらの側面を分離して評価し、モデルが証拠の先行を置き換えた時に現れる体系的なバイアスを隠蔽する。
このギャップに対処するため,SDG指向の視覚言語推論のための大規模ベンチマークスイートであるSDGBiasBenchを提案する。
500kの専門家が関与する複数選択の質問と50kの回帰タスクに対処するこのベンチマークは、ビジョン・ランゲージ・モデル(VLM)における決定レベルと推定レベルの両方のバイアスの包括的な評価を可能にする。
SDGBiasBenchによる評価では、信頼度の高いマルチモーダルキューではなく、SDG特定のプリエントによって予測される現在のVLMにおいて、固有のSDGバイアスが示される。
このようなバイアスを軽減するために,モダリティに特化して回答を優先する学習自由なプラグアンドプレイ方式であるCADE(Contrastive Adaptive Debias Ensemble)を提案する。
CADEは提案したベンチマークで大きく向上し、複数選択精度を最大25%向上し、回帰MAEを最大12ポイント削減した。
私たちの仕事は、持続可能な開発のためのより公平で信頼性の高いAIシステムの開発を促進することを願っています。
関連論文リスト
- URAG: A Benchmark for Uncertainty Quantification in Retrieval-Augmented Large Language Models [35.441039437111606]
URAGは、医療、プログラミング、科学、数学、一般的なテキストなど、さまざまな分野にわたるRAGシステムの不確実性を評価するために設計されたベンチマークである。
評価パイプラインを8つの標準RAG手法に適用し,LACとAPSの計測値に基づいて,精度と予測セットのサイズを両立させ,その性能を計測する。
論文 参考訳(メタデータ) (2026-03-02T00:22:06Z) - Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning [12.354777054071379]
テスト時間強化学習は、多数決結果を擬似ラベルとして使用することにより、注釈付きデータへの依存を軽減する。
この投票戦略は、しばしば確認バイアスを引き起こし、スパース報酬に悩まされ、全体的なパフォーマンスが制限される。
これらの問題に対処するために,サブグループ固有のステップワイド信頼度重み付き擬似ラベル推定(SCOPE)を提案する。
論文 参考訳(メタデータ) (2025-12-17T07:21:54Z) - Alleviating Choice Supportive Bias in LLM with Reasoning Dependency Generation [8.918979781532036]
本稿では,非バイアスな推論データを生成するための新しいフレームワークであるReasoning Dependency Generation (RDG)を提案する。
RDGは自動的にバランスの取れた推論QAペアを構築し、選択、エビデンス、正当化の間の依存関係を明示的にモデル化する。
実験により、RDG生成データに基づいて微調整されたLCMは、メモリベースの実験で81.5%、評価ベースの実験で94.3%改善していることが示された。
論文 参考訳(メタデータ) (2025-11-28T08:52:05Z) - Reliable and Reproducible Demographic Inference for Fairness in Face Analysis [63.46525489354455]
本稿では、従来のエンドツーエンドトレーニングをモジュラートランスファー学習アプローチで置き換える、完全に再現可能なDAIパイプラインを提案する。
このパイプラインは、正確性、公正性、そしてアイデンティティ内整合性によって定義される、新たに導入された堅牢性の概念の3つの次元にわたって監査する。
以上の結果から,提案手法は特に民族性において,強い基準線を上回り,その特性はより困難であることが示唆された。
論文 参考訳(メタデータ) (2025-10-23T12:22:02Z) - Certainty-Guided Reasoning in Large Language Models: A Dynamic Thinking Budget Approach [0.15749416770494704]
CGR(Certainty-Guided Reasoning)はトークン使用量を削減するとともに,ベースライン精度を向上させる。
CGRは、確実なしきい値と効率の間の調整可能なトレードオフによって、数百万のトークンを集約的に排除することができる。
信頼性を推論プロセスに統合することにより、CGRは大きな推論言語モデルをより適応的で信頼性があり、リソース効率が良いものにする。
論文 参考訳(メタデータ) (2025-09-09T14:57:15Z) - Revisiting Reliability in the Reasoning-based Pose Estimation Benchmark [27.134554623769898]
推論に基づくポーズ推定(RPE)ベンチマークは、ポーズ対応大規模言語モデル(MLLM)の広く採用されている評価標準として登場した。
公平で一貫した定量的評価を妨げる批判的かつベンチマーク品質の問題を特定しました。
論文 参考訳(メタデータ) (2025-07-17T17:33:11Z) - MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models [71.36392373876505]
我々は、LVLM(Large Vision-Language Models)において、インターリーブされたマルチモーダル理解と生成を評価するための大規模ベンチマークであるMMIEを紹介する。
MMIEは、数学、コーディング、物理学、文学、健康、芸術を含む3つのカテゴリ、12のフィールド、102のサブフィールドにまたがる20Kの厳密にキュレートされたマルチモーダルクエリで構成されている。
インターリーブされたインプットとアウトプットの両方をサポートし、多様な能力を評価するために、複数選択とオープンな質問フォーマットの混合を提供する。
論文 参考訳(メタデータ) (2024-10-14T04:15:00Z) - Anticipating the Unseen Discrepancy for Vision and Language Navigation [63.399180481818405]
視覚言語ナビゲーションでは、エージェントは特定のターゲットに到達するために自然言語命令に従う必要がある。
目に見える環境と目に見えない環境の間に大きな違いがあるため、エージェントがうまく一般化することは困難である。
本研究では,テストタイムの視覚的整合性を促進することによって,未知の環境への一般化を学習する,未知の離散性予測ビジョンと言語ナビゲーション(DAVIS)を提案する。
論文 参考訳(メタデータ) (2022-09-10T19:04:40Z) - General Greedy De-bias Learning [163.65789778416172]
本稿では,関数空間における勾配降下のような偏りのあるモデルとベースモデルを優雅に訓練する一般グリーディ・デバイアス学習フレームワーク(GGD)を提案する。
GGDは、事前知識を持つタスク固有バイアスモデルと、事前知識を持たない自己アンサンブルバイアスモデルの両方の設定の下で、より堅牢なベースモデルを学ぶことができる。
論文 参考訳(メタデータ) (2021-12-20T14:47:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。