論文の概要: CogBias: Measuring and Mitigating Cognitive Bias in Large Language Models
- arxiv url: http://arxiv.org/abs/2604.01366v1
- Date: Wed, 01 Apr 2026 20:22:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-03 14:21:09.960788
- Title: CogBias: Measuring and Mitigating Cognitive Bias in Large Language Models
- Title(参考訳): CogBias:大規模言語モデルにおける認知バイアスの測定と緩和
- Authors: Fan Huang, Songheng Zhang, Haewoon Kwak, Jisun An,
- Abstract要約: 大規模言語モデル(LLM)は、高い意思決定コンテキストにますますデプロイされている。
認知バイアスは, 判断, 情報処理, 社会的, 反応の4種類の認知バイアスのすべてに対して, 体系的に現れることを示す。
活性化ステアリングを用いてバイアスの挙動を変調し,26~32%のバイアススコアの低減を実現した。
- 参考スコア(独自算出の注目度): 8.81733256907103
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) are increasingly deployed in high-stakes decision-making contexts. While prior work has shown that LLMs exhibit cognitive biases behaviorally, whether these biases correspond to identifiable internal representations and can be mitigated through targeted intervention remains an open question. We define LLM cognitive bias as systematic, reproducible deviations from correct answers in tasks with computable ground-truth baselines, and introduce LLM CogBias, a benchmark organized around four families of cognitive biases: Judgment, Information Processing, Social, and Response. We evaluate three LLMs and find that cognitive biases emerge systematically across all four families, with magnitudes and debiasing responses that are strongly family-dependent: prompt-level debiasing substantially reduces Response biases but backfires for Judgment biases. Using linear probes under a contrastive design, we show that these biases are encoded as linearly separable directions in model activation space. Finally, we apply activation steering to modulate biased behavior, achieving 26--32\% reduction in bias score (fraction of biased responses) while preserving downstream capability on 25 benchmarks (Llama: negligible degradation; Qwen: up to $-$19.0pp for Judgment biases). Despite near-orthogonal bias representations across models (mean cosine similarity 0.01), steering reduces bias at similar rates across architectures ($r(246)$=.621, $p$<.001), suggesting shared functional organization.
- Abstract(参考訳): 大規模言語モデル(LLM)は、高い意思決定コンテキストにますますデプロイされている。
以前の研究では、LLMは認知バイアスを行動的に示すことが示されているが、これらのバイアスが識別可能な内部表現に対応し、標的となる介入によって緩和できるかどうかは未解決の問題である。
我々は、LLM認知バイアスを、計算可能な基盤構造をもつタスクにおける正しい回答から再現可能な逸脱を体系的に定義し、LLM CogBiasという認知バイアスの4つのファミリー(判断、情報処理、社会、反応)にまとめられたベンチマークを導入する。
我々は3つのLCMを評価し、認知バイアスが家族依存の強い大小の偏りや偏りを伴う4つの家族で体系的に出現することを見出した。
対照的な設計の下で線形プローブを用いて、これらのバイアスはモデルアクティベーション空間において線形分離可能な方向として符号化されることを示す。
最後に,25ベンチマーク(Llama: negligible degradation; Qwen: up-19.0pp for Judgment biases)でダウンストリーム能力を保ちながら,バイアススコアの26~32パーセントの低下を達成し,バイアス行動の変調にアクティベーションステアリングを適用した。
モデル間のほぼ直交バイアス表現(平均コサイン類似度0.01)にもかかわらず、ステアリングはアーキテクチャ間で同様の速度でバイアスを減少させる(r(246)$=.621, $p$<.001)。
関連論文リスト
- Making Bias Non-Predictive: Training Robust LLM Judges via Reinforcement Learning [91.8584139564909]
大規模言語モデル(LLM)は、ますます自動化された審査員として機能するが、認知バイアスの影響を受けやすいままである。
本稿では,重要原則に基づく強化学習フレームワークである疫学独立訓練(EIT)を提案する。
EITはバランスの取れた競合戦略を通じてこれを運用します。
論文 参考訳(メタデータ) (2026-02-02T01:43:48Z) - Adaptive Generation of Bias-Eliciting Questions for LLMs [18.608477560948003]
大規模言語モデル(LLM)は現在、ユーザ向けアプリケーションに広くデプロイされており、世界中で数億に達しています。
我々は,性,人種,宗教などのセンシティブな属性に対して,現実的でオープンな質問を自動的に生成する,反現実的バイアス評価フレームワークを導入する。
また、非対称な拒絶や偏見の明示的な認識など、ユーザインタラクションにますます関係する異なる応答次元も捉えています。
論文 参考訳(メタデータ) (2025-10-14T13:08:10Z) - Intrinsic Meets Extrinsic Fairness: Assessing the Downstream Impact of Bias Mitigation in Large Language Models [11.396244643030983]
大規模言語モデル(LLM)は、下流のタスクに伝播する社会経済的バイアスを示す。
本研究では,非学習概念による内在バイアス緩和と,反事実データ拡張による外在バイアス緩和を比較するための統合評価フレームワークを提案する。
その結果,非学習による内在的偏見緩和は,内在性偏見を最大94.9%減少させるとともに,人口順等下流のタスクフェアネス指標を最大82%向上させ,精度を損なうことなく改善することを示した。
論文 参考訳(メタデータ) (2025-09-19T22:59:55Z) - Evaluate Bias without Manual Test Sets: A Concept Representation Perspective for LLMs [25.62533031580287]
大規模言語モデル(LLM)のバイアスは、その信頼性と公平性を著しく損なう。
モデルベクトル空間の構造に基づくテストセットのないバイアス分析フレームワークであるBiasLensを提案する。
論文 参考訳(メタデータ) (2025-05-21T13:50:23Z) - Assessing Judging Bias in Large Reasoning Models: An Empirical Study [99.86300466350013]
DeepSeek-R1やOpenAI-o1のような大きな推論モデル(LRM)は、顕著な推論能力を示している。
本稿では、主観的嗜好アライメントデータセットと客観的事実ベースデータセットの両方において、LLMとLRMの偏りを判定するベンチマークを示す。
論文 参考訳(メタデータ) (2025-04-14T07:14:27Z) - Self-Adaptive Cognitive Debiasing for Large Language Models in Decision-Making [71.71796367760112]
大規模言語モデル(LLM)は意思決定アプリケーションをサポートする可能性を示している。
我々は,自己適応型認知脱バイアス(SACD)という認知脱バイアス手法を提案する。
オープンウェイトとクローズドウェイトの両方を用いた金融・医療・法的意思決定タスクにおけるSACDの評価を行った。
論文 参考訳(メタデータ) (2025-04-05T11:23:05Z) - Covert Bias: The Severity of Social Views' Unalignment in Language Models Towards Implicit and Explicit Opinion [0.40964539027092917]
過度なバイアスシナリオのエッジケースにおけるバイアスモデルを用いて、ビューに対するバイアスの重症度を評価する。
以上の結果から,暗黙的・明示的な意見の識別において,LLM 性能の相違が明らかとなり,反対意見の明示的な意見に対する偏見の傾向が一般的であった。
非整合モデルの直接的な不注意な反応は、決定性のさらなる洗練の必要性を示唆している。
論文 参考訳(メタデータ) (2024-08-15T15:23:00Z) - Identifying and Mitigating Social Bias Knowledge in Language Models [52.52955281662332]
個々人の社会的偏見をきめ細かなキャリブレーションを可能にする新しいデバイアス・アプローチであるFairness Stamp(FAST)を提案する。
FASTは最先端のベースラインを超え、デバイアス性能が優れている。
これは、大きな言語モデルにおける公平性を達成するためのきめ細かいデバイアス戦略の可能性を強調している。
論文 参考訳(メタデータ) (2024-08-07T17:14:58Z) - Cognitive Bias in Decision-Making with LLMs [19.87475562475802]
大規模言語モデル(LLM)は、幅広い意思決定タスクをサポートするツールとして大きな可能性を秘めている。
LLMは保護されたグループに対する社会的バイアスを継承し、認知バイアスと機能的に類似している。
私たちの研究は、LLMの認知バイアスを発見し、評価し、緩和するために設計されたフレームワークであるBiasBusterを紹介します。
論文 参考訳(メタデータ) (2024-02-25T02:35:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。