論文の概要: Attribution Bias in Large Language Models
- arxiv url: http://arxiv.org/abs/2604.05224v1
- Date: Mon, 06 Apr 2026 22:40:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.516888
- Title: Attribution Bias in Large Language Models
- Title(参考訳): 大規模言語モデルにおける属性バイアス
- Authors: Eliza Berman, Bella Chang, Daniel B. Neill, Emily Black,
- Abstract要約: 私たちはAttriBenchを紹介します。AttriBenchは、最初の有名人と人口統計学的にバランスの取れた引用属性のベンチマークデータセットです。
我々は,人種,性別,交叉群間の帰属精度の大規模かつ体系的な相違を観察する。
我々は、抑圧が広範に分布し、人口統計群に不均一に分散していることを発見し、標準的な精度の指標では捉えられない体系的なバイアスを明らかにした。
- 参考スコア(独自算出の注目度): 6.09327435498473
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As Large Language Models (LLMs) are increasingly used to support search and information retrieval, it is critical that they accurately attribute content to its original authors. In this work, we introduce AttriBench, the first fame- and demographically-balanced quote attribution benchmark dataset. Through explicitly balancing author fame and demographics, AttriBench enables controlled investigation of demographic bias in quote attribution. Using this dataset, we evaluate 11 widely used LLMs across different prompt settings and find that quote attribution remains a challenging task even for frontier models. We observe large and systematic disparities in attribution accuracy between race, gender, and intersectional groups. We further introduce and investigate suppression, a distinct failure mode in which models omit attribution entirely, even when the model has access to authorship information. We find that suppression is widespread and unevenly distributed across demographic groups, revealing systematic biases not captured by standard accuracy metrics. Our results position quote attribution as a benchmark for representational fairness in LLMs.
- Abstract(参考訳): 大規模言語モデル (LLM) は, 検索や情報検索に利用されているため, コンテンツの正確な属性付けが重要である。
本研究では,AttriBenchについて紹介する。AttriBenchは,最初の名声と人口統計学的にバランスの取れた引用属性のベンチマークデータセットである。
著者の名声と人口統計のバランスを明確にすることで、AttriBenchは引用属性における人口統計バイアスの制御を可能にする。
このデータセットを用いて、異なるプロンプト設定にまたがって広く使用されている11のLSMを評価し、フロンティアモデルにおいても、引用帰属は難しい課題であることを示す。
我々は,人種,性別,交叉群間の帰属精度の大規模かつ体系的な相違を観察する。
さらに、モデルが著者情報にアクセスしたとしても、モデルが帰属を完全に省略する独自の障害モードである抑圧を導入し、調査する。
我々は、抑圧が広範に分布し、人口統計群に不均一に分散していることを発見し、標準的な精度の指標では捉えられない体系的なバイアスを明らかにした。
LLMにおける表現フェアネスの指標として,提案手法を引用属性と位置づけた。
関連論文リスト
- A Comprehensive Study of Implicit and Explicit Biases in Large Language Models [1.0555164678638427]
この研究は、生成的AIが増大する中で、大規模言語モデルにおけるバイアスに対処する必要があることを強調する。
我々は, StereoSet や CrowSPairs などのバイアス特異的ベンチマークを用いて,BERT や GPT 3.5 といった複数の生成モデルにおける様々なバイアスの存在を評価する。
その結果、微調整されたモデルでは性別バイアスに悩まされるが、人種バイアスの特定と回避には優れていた。
論文 参考訳(メタデータ) (2025-11-18T05:27:17Z) - Breaking the Benchmark: Revealing LLM Bias via Minimal Contextual Augmentation [12.56588481992456]
大規模言語モデルは、その表現と振舞いにステレオタイプ的バイアスを示すことが示されている。
3つのプラグ・アンド・プレイステップを含む,新規で汎用的な拡張フレームワークを提案する。
大規模言語モデルは入力の摂動に影響を受けやすいことが分かり、ステレオタイプに振る舞う可能性が高くなる。
論文 参考訳(メタデータ) (2025-10-27T23:05:12Z) - Small Changes, Large Consequences: Analyzing the Allocational Fairness of LLMs in Hiring Contexts [19.20592062296075]
大規模言語モデル(LLM)は、採用のような高度なアプリケーションにますますデプロイされている。
本研究は、実際の人事利用を反映した2つのタスクを通して、LLMベースの採用システムの割当公平性を検討する。
論文 参考訳(メタデータ) (2025-01-08T07:28:10Z) - Identifying and Mitigating Social Bias Knowledge in Language Models [52.52955281662332]
個々人の社会的偏見をきめ細かなキャリブレーションを可能にする新しいデバイアス・アプローチであるFairness Stamp(FAST)を提案する。
FASTは最先端のベースラインを超え、デバイアス性能が優れている。
これは、大きな言語モデルにおける公平性を達成するためのきめ細かいデバイアス戦略の可能性を強調している。
論文 参考訳(メタデータ) (2024-08-07T17:14:58Z) - VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model [72.13121434085116]
我々は、LVLM(Large Vision-Language Models)におけるバイアスを評価するベンチマークであるVLBiasBenchを紹介する。
VLBiasBenchは、年齢、障害ステータス、性別、国籍、身体的外観、人種、宗教、職業、社会経済ステータスを含む9つの異なる社会バイアスのカテゴリを含むデータセットと、人種x性別と人種x社会経済ステータスの2つの交叉バイアスのカテゴリを含む。
15のオープンソースモデルと2つの高度なクローズドソースモデルに対して広範な評価を行い、これらのモデルに存在するバイアスに関する新たな洞察を得る。
論文 参考訳(メタデータ) (2024-06-20T10:56:59Z) - ROBBIE: Robust Bias Evaluation of Large Generative Language Models [27.864027322486375]
異なるプロンプトベースのデータセットを使用して、複数のテキストドメインと人口統計軸にわたる社会的バイアスを測定することができる。
我々は,12の人口動態軸と5のジェネレーションLLMの家系の6つの異なるプロンプトベースのバイアスと毒性の指標を比較した。
3つのバイアス/毒性の緩和技術が、我々の一連の測定においていかにうまく機能するかを包括的に研究する。
論文 参考訳(メタデータ) (2023-11-29T23:03:04Z) - Debiasing Vision-Language Models via Biased Prompts [79.04467131711775]
本稿では,テキスト埋め込みにおけるバイアスのある方向を投影することで,視覚言語基盤モデルを疎外する一般的な手法を提案する。
偏平投影行列を組み込んだテキストのみをデバイアスすることで、ロバストな分類器と公正な生成モデルが得られることを示す。
論文 参考訳(メタデータ) (2023-01-31T20:09:33Z) - "I'm sorry to hear that": Finding New Biases in Language Models with a
Holistic Descriptor Dataset [12.000335510088648]
新しい包括的バイアス測定データセットであるHollisticBiasを紹介します。
HolisticBiasは、これらの用語の生きた経験を持つ専門家やコミュニティメンバーを含む参加的なプロセスで組み立てられた。
我々は,HolisticBiasが,言語モデルからトークンの確率において,検出不能なバイアスを測定するのに有効であることを実証した。
論文 参考訳(メタデータ) (2022-05-18T20:37:25Z) - Balancing out Bias: Achieving Fairness Through Training Reweighting [58.201275105195485]
自然言語処理におけるバイアスは、性別や人種などの著者の特徴を学習するモデルから生じる。
既存のバイアスの緩和と測定方法は、著者の人口統計学と言語変数の相関を直接考慮していない。
本稿では,インスタンス再重み付けを用いたバイアス対策法を提案する。
論文 参考訳(メタデータ) (2021-09-16T23:40:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。