論文の概要: DeepBias: Adaptive In-depth Probing of Social Biases in LVLMs
- arxiv url: http://arxiv.org/abs/2607.11228v1
- Date: Mon, 13 Jul 2026 08:19:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.394477
- Title: DeepBias: Adaptive In-depth Probing of Social Biases in LVLMs
- Title(参考訳): DeepBias:LVLMにおけるソーシャルバイアスの適応的奥行き調査
- Authors: Anqi Li, Jie Zhang, Zhongqi Wang, Songkai Xue, Jiahao Wang, Shiguang Shan, Xilin Chen,
- Abstract要約: 我々は、注意深く設計されたエージェントを用いたLVLMにおける社会バイアスの奥行き探索のための適応的フレームワークDeepBiasを紹介する。
私たちは、私たちのフレームワークを使ってDeepBiasBenchという名のベンチマークを構築します。5つの異なる最先端のLVLMをアンカーとして使用することで、このベンチマークはアーキテクチャ間で共有される脆弱性をキャプチャします。
- 参考スコア(独自算出の注目度): 71.85279836937578
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While Large Vision-Language Models (LVLMs) demonstrate remarkable capabilities, they remain highly susceptible to embedded social biases. Existing bias evaluation protocols predominantly rely on static datasets, which provide only a superficial assessment, as their fixed test cases cannot adaptively evolve to measure the true depth and limits of model vulnerabilities. We introduce DeepBias, an adaptive framework for the in-depth probing of social biases in LVLMs with carefully designed agents. Our approach operates through a dynamic ''generation-evolution-probing'' loop. First, a generative ProposerAgent synthesizes test data and is iteratively updated via Direct Preference Optimization (DPO) based on the target LVLM's responses, exploring model-specific failure modes. Second, an autonomous skill-driven DiggerAgent rewrites each test data across multiple probing turns, adaptively selecting from a curated skill library of deepening and rewriting strategies. At each turn, this process is conditioned on the model's previous response, enabling progressively deeper biases to be exposed. Furthermore, we build a benchmark named DeepBiasBench using our framework. By employing an ensemble of five diverse state-of-the-art LVLMs as anchors, the benchmark captures vulnerabilities shared across architectures. Comprehensive experiments demonstrate the effectiveness of our framework and show that DeepBias provides a challenging benchmark for in-depth bias evaluation, establishing an evolutionary paradigm for LVLM safety assessment.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は目覚ましい能力を示すが、組み込みの社会的バイアスに強く影響を受けやすい。
既存のバイアス評価プロトコルは主に静的データセットに依存しており、固定テストケースはモデル脆弱性の真の深さと限界を測定するために適応的に進化できないため、表面的な評価のみを提供する。
我々は、注意深く設計されたエージェントを用いたLVLMにおける社会バイアスの奥行き探索のための適応的フレームワークDeepBiasを紹介する。
我々のアプローチは、ダイナミックな'世代進化過程'ループを通して機能する。
まず、生成ProposerAgentはテストデータを合成し、ターゲットのLVLMの応答に基づいて直接優先度最適化(DPO)を介して反復的に更新し、モデル固有の障害モードを探索する。
第二に、自律的なスキル駆動型DiggerAgentは、複数の探索ターンにまたがって各テストデータを書き換え、より深い書き直し戦略のキュレートされたスキルライブラリから適応的に選択する。
各ターンで、このプロセスはモデルの以前のレスポンスに条件付けされ、徐々に深いバイアスが露呈される。
さらに、私たちのフレームワークを使ってDeepBiasBenchというベンチマークを構築しました。
5つの最先端のLVLMのアンサンブルをアンカーとして使用することにより、ベンチマークはアーキテクチャ間で共有される脆弱性をキャプチャする。
包括的実験により,DeepBiasが深部偏差評価に挑戦的なベンチマークを提供し,LVLMの安全性評価の進化パラダイムを確立した。
関連論文リスト
- Be Your Own Teacher: Steering Protein Language Models via Unsupervised Reward Optimization [85.4863852505905]
タンパク質言語モデル(PLM)の教師なし報酬最適化を導入する。
我々の重要な洞察は、本質的なモデルの不確実性とタンパク質表現モデルによって誘導される意味的整合性を組み合わせたタスク非依存報酬は、ベースモデルと温度レギュレーションの制御可能性指標と強い相関を示すことである。
我々のフレームワークは、ラベル付けされた好みや実験的なフィードバックが不足したり、利用できないような環境で、制御可能な生体分子設計へのスケーラブルな経路を提供する。
論文 参考訳(メタデータ) (2026-06-17T11:42:01Z) - VULPO: Context-Aware Vulnerability Detection via On-Policy LLM Optimization [2.6678231901651723]
本稿では、コンテキスト認識型脆弱性検出のためのLLM強化学習フレームワークであるVulnerability-Adaptive Policy Optimization (VULPO)を紹介する。
トレーニングと評価を支援するために,我々はまず,高品質な関数レベルのサンプルを軽量な方法で拡張し,リポジトリレベルのコンテキスト情報を抽出するContextVulを構築した。
異なる脆弱性ケースの非対称的な難しさに対処し、報酬ハックを緩和するために、VULPOはラベルレベルとサンプルレベルの難易度適応型報酬スケーリングを取り入れている。
論文 参考訳(メタデータ) (2025-11-14T21:57:48Z) - Self-Evolutionary Large Language Models through Uncertainty-Enhanced Preference Optimization [9.618391485742968]
反復的選好最適化は、最近、大規模言語モデル(LLM)のデファクトトレーニングパラダイムの1つになっている。
我々は、信頼性の高いフィードバックでLLMを自己進化させる不確実性のあるtextbfPreference textbfOptimizationフレームワークを提案する。
筆者らのフレームワークは,ノイズ問題を大幅に軽減し,反復的選好最適化の性能を向上させる。
論文 参考訳(メタデータ) (2024-09-17T14:05:58Z) - Self-Exploring Language Models: Active Preference Elicitation for Online Alignment [88.56809269990625]
本研究では, 分布域外領域を積極的に探索するために, 潜在的に高次応答に対して楽観的に偏りを呈する2段階的客観性を提案する。
実験の結果,Zephyr-7B-SFTとLlama-3-8B-Instructモデルで微調整した場合,SELM(Self-Exploring Language Models)は命令追従ベンチマークの性能を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2024-05-29T17:59:07Z) - Automating Dataset Updates Towards Reliable and Timely Evaluation of Large Language Models [81.27391252152199]
大規模言語モデル(LLM)は、さまざまな自然言語ベンチマークで素晴らしいパフォーマンスを実現している。
本稿では、データセットの自動更新と、その有効性に関する体系的な分析を提案する。
1) 類似したサンプルを生成するための戦略を模倣すること,2) 既存のサンプルをさらに拡張する戦略を拡張すること,である。
論文 参考訳(メタデータ) (2024-02-19T07:15:59Z) - Beyond Deep Ensembles: A Large-Scale Evaluation of Bayesian Deep
Learning under Distribution Shift [19.945634052291542]
我々は、WILDSコレクションから現実のデータセットに対する最新のBDLアルゴリズムを評価し、難解な分類と回帰タスクを含む。
我々は、大規模な、畳み込み、トランスフォーマーベースのニューラルネットワークアーキテクチャにおいて、アルゴリズムを比較した。
そこで本研究では,BDLを用いた大規模事前学習モデルのシステム評価を行った。
論文 参考訳(メタデータ) (2023-06-21T14:36:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。