論文の概要: QuantiBias: Benchmarking Quantization-Induced Bias in LLMs
- arxiv url: http://arxiv.org/abs/2607.21063v1
- Date: Thu, 23 Jul 2026 08:56:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.337996
- Title: QuantiBias: Benchmarking Quantization-Induced Bias in LLMs
- Title(参考訳): QuantiBias: LLMにおける量子化誘起バイアスのベンチマーク
- Authors: Emilio Ferrara,
- Abstract要約: 幅広い聴衆にリーチするほとんどの大きな言語モデルは定量化されています。
提案するベンチマークでは,複数言語ステレオタイププローブと,オープンエンド生成を分離する拒絶制御と多重選択制御を組み合わせている。
量子化されたビルドは、既にパスしているショートフォームのセーフガードだけでなく、オープンエンドのバイアスのために再評価されなければならない。
- 参考スコア(独自算出の注目度): 8.970269049715933
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Almost every large language model that reaches a broad audience is quantized: trained in full precision, then compressed for efficiency. This step is assumed harmless and its safety is rarely re-checked. We find its principal side effect is increased bias that standard safety evaluation misses. Holding the model, its training, and the prompts fixed, a quantized model still refuses harmful requests, still avoids over-refusing benign prompts, and still selects the unbiased multiple-choice answer. Yet asked an open-ended question, the same model volunteers stereotypes in all eight languages we probe, in roughly one in four open-ended answers under an independent judge (~24% to ~27% across the compression ladder): it passes every standard check and still reaches users measurably more biased. The selective gap is a robust finding; whether open-ended bias further increases with compression is less certain, sensitive to the judge that scores it. We address both with \textbf{QuantiBias}, a benchmark that pairs a generative, multilingual stereotype probe with the refusal and multiple-choice controls that isolate open-ended generation, contrasts each build with and without reasoning, and rates the content severity of what it generates. Across two backbone models (Qwen and Gemma), a five-family screen, and eight benchmarks, quantizers allocate their extra precision by capability data that carries no bias-prevention signal, and reasoning before answering roughly halves the effect on some families while doing nothing on others. A quantized build must be re-evaluated for open-ended bias, not only on the short-form safeguards it already passes.
- Abstract(参考訳): 広い聴衆にリーチするほとんどの大きな言語モデルは量子化され、完全な精度で訓練され、効率性のために圧縮される。
このステップは無害であると仮定し、その安全性を再確認することは滅多にない。
その主な副作用は、標準安全評価が見逃すバイアスの増加である。
モデル、トレーニング、およびプロンプトを固定すると、量子化モデルは依然として有害な要求を拒否し、過度に拒否された良心的なプロンプトを回避し、まだバイアスのない多重選択の答えを選択する。
しかし、オープンエンドの質問に対して、同じモデルが調査対象の8言語すべてでステレオタイプを、独立した裁判官の下で4つのオープンエンドの回答の約1つ(圧縮ラウンダで約24%から約27%)で提供します。
オープンエンドバイアスが圧縮によってさらに増加するかどうかは確実ではなく、スコアする裁判官に敏感である。
このベンチマークは、生成した多言語ステレオタイププローブと、オープンな生成を分離し、各ビルドを推論なしでコントラストし、生成したコンテンツの重大さを評価できる。
2つのバックボーンモデル(QwenとGemma)と5つのファミリースクリーン、8つのベンチマークで、量子化器はバイアス防止信号を持たない能力データによって余分な精度を割り当てる。
量子化されたビルドは、既にパスしているショートフォームのセーフガードだけでなく、オープンエンドのバイアスのために再評価されなければならない。
関連論文リスト
- BiAxisAudit: A Novel Framework to Evaluate LLM Bias Across Prompt Sensitivity and Response-Layer Divergence [22.315546054051143]
大規模言語モデルのバイアス監査は、EU AI Actなどのガバナンスフレームワーク内で運用されている。
このプロトコルでは、各バイアススコアを2つの軸上での信頼性推定とともに報告する。
論文 参考訳(メタデータ) (2026-05-09T16:26:49Z) - Decoding-Time Debiasing via Process Reward Models: From Controlled Fill-in to Open-Ended Generation [0.0]
大規模な言語モデルは、トレーニングされたデータから社会的バイアスを拾い上げ、下流のアプリケーションにバイアスを運ぶ。
本稿では,デコーディング時にモデルをデバイアス化し,モデルの重みに触れることなく,候補トークンに対するバイアス緩和を構造化された探索として扱う。
我々は、高度化のための3つのスキーム(Best-of-N selection, Sequential critique-and-Revise, Constitutional self-audit)を設計し、4つのモデルで評価する。
論文 参考訳(メタデータ) (2026-05-04T08:51:34Z) - ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues [8.68634179512072]
あいまいな文脈における暗示バイアスは、オープンウェイトモデルにおける明示バイアスより6倍以上高い。
暗黙の偏見を84%減少させる数発のプロンプトでさえ、他の次元の4倍の偏見を残している。
モデルプロバイダと研究者のためのコードとデータセットをリリースし、潜在的な緩和テクニックをベンチマークします。
論文 参考訳(メタデータ) (2026-04-02T11:43:10Z) - Adaptive Generation of Bias-Eliciting Questions for LLMs [18.608477560948003]
大規模言語モデル(LLM)は現在、ユーザ向けアプリケーションに広くデプロイされており、世界中で数億に達しています。
我々は,性,人種,宗教などのセンシティブな属性に対して,現実的でオープンな質問を自動的に生成する,反現実的バイアス評価フレームワークを導入する。
また、非対称な拒絶や偏見の明示的な認識など、ユーザインタラクションにますます関係する異なる応答次元も捉えています。
論文 参考訳(メタデータ) (2025-10-14T13:08:10Z) - Open-DeBias: Toward Mitigating Open-Set Bias in Language Models [6.958242323649994]
我々は,テキストベースの質問応答タスクにおいて,オープンセットバイアス検出と緩和という新たな課題に取り組む。
OpenBiasBenchは、様々なカテゴリやサブグループにまたがるバイアスを評価するために設計されたベンチマークである。
また,新しいデータ効率,パラメータ効率のデバイアス法であるOpen-DeBiasを提案する。
論文 参考訳(メタデータ) (2025-09-28T11:08:39Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z) - OpenBias: Open-set Bias Detection in Text-to-Image Generative Models [108.2219657433884]
OpenBiasを提示するテキストから画像生成モデルにおけるオープンセットバイアス検出の課題に対処する。
OpenBiasは、事前コンパイルされた集合にアクセスすることなく、バイアスの深刻度を不可知的に識別し、定量化する。
本研究では, 安定拡散1.5, 2, XLの挙動について検討した。
論文 参考訳(メタデータ) (2024-04-11T17:59:56Z) - Mitigating Bias for Question Answering Models by Tracking Bias Influence [84.66462028537475]
本稿では,複数選択QAモデルのバイアスを軽減するためのBMBIを提案する。
バイアスのある例から学んだ場合、モデルがよりバイアスに傾くように傾くという直感に基づいて、クエリインスタンスのバイアスレベルを測定します。
本手法は,複数のバイアスカテゴリにまたがる複数のQA定式化に適用可能であることを示す。
論文 参考訳(メタデータ) (2023-10-13T00:49:09Z) - UnQovering Stereotyping Biases via Underspecified Questions [68.81749777034409]
未特定質問からバイアスを探索・定量化するためのフレームワークUNQOVERを提案する。
モデルスコアの素直な使用は,2種類の推論誤差による誤ったバイアス推定につながる可能性があることを示す。
我々はこの指標を用いて、性別、国籍、民族、宗教の4つの重要なステレオタイプの分析を行う。
論文 参考訳(メタデータ) (2020-10-06T01:49:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。