論文の概要: CatRAG: Functor-Guided Structural Debiasing with Retrieval Augmentation for Fair LLMs
- arxiv url: http://arxiv.org/abs/2603.21524v1
- Date: Mon, 23 Mar 2026 03:33:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.462744
- Title: CatRAG: Functor-Guided Structural Debiasing with Retrieval Augmentation for Fair LLMs
- Title(参考訳): CatRAG: フェアLLMの検索増強によるファンクターガイド型構造劣化
- Authors: Ravi Ranjan, Utkarsh Grover, Mayur Akewar, Xiaomin Lin, Agoritsa Polyzou,
- Abstract要約: 構造的デバイアスを誘導する構造的デバイアス(RAG)を関手と統合する,二重進行型フレームワークであるCatRAG Debiasingを提案する。
オープンソースの3つのLCM(Meta Llama-3、OpenAI GPT-OSS、Google Gemma-3)を対象としたBias Benchmark for Question Answering (BBQ)では、CatRAGは対応するベースモデルに対して最大40%の精度で、事前のデバイアス法よりも10%以上の精度を実現している。
- 参考スコア(独自算出の注目度): 1.7697598440512727
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) are deployed in high-stakes settings but can show demographic, gender, and geographic biases that undermine fairness and trust. Prior debiasing methods, including embedding-space projections, prompt-based steering, and causal interventions, often act at a single stage of the pipeline, resulting in incomplete mitigation and brittle utility trade-offs under distribution shifts. We propose CatRAG Debiasing, a dual-pronged framework that integrates functor with Retrieval-Augmented Generation (RAG) guided structural debiasing. The functor component leverages category-theoretic structure to induce a principled, structure-preserving projection that suppresses bias-associated directions in the embedding space while retaining task-relevant semantics. On the Bias Benchmark for Question Answering (BBQ) across three open-source LLMs (Meta Llama-3, OpenAI GPT-OSS, and Google Gemma-3), CatRAG achieves state-of-the-art results, improving accuracy by up to 40% over the corresponding base models and by more than 10% over prior debiasing methods, while reducing bias scores to near zero (from 60% for the base models) across gender, nationality, race, and intersectional subgroups.
- Abstract(参考訳): 大規模言語モデル(LLM)は高い視点で展開されるが、人口統計、性別、地理的偏見が公平さと信頼を損なう可能性がある。
組込み空間の投射、プロンプトベースのステアリング、因果的介入を含む以前の脱バイアス法は、パイプラインの単一段階で動作し、分散シフトの下で不完全な緩和と不安定なユーティリティトレードオフをもたらす。
本研究では, 構造的デバイアスを誘導する構造的デバイアス(Retrieval-Augmented Generation, RAG)と関手を統合した, 二重進行型フレームワークであるCatRAG Debiasingを提案する。
関手成分は、圏論的構造を利用して、タスク関連セマンティクスを保持しながら、埋め込み空間におけるバイアス関連方向を抑制する、原則付き、構造保存プロジェクションを誘導する。
オープンソースの3つのLCM(Meta Llama-3、OpenAI GPT-OSS、Google Gemma-3)にわたるBias Benchmark for Question Answering (BBQ)では、CatRAGは最先端の結果を達成し、対応するベースモデルよりも40%以上精度を向上し、事前のデバイアス手法よりも10%以上精度を向上すると同時に、バイアススコアを性別、国籍、人種、交叉サブグループにわたってほぼゼロ(ベースモデルの60%から)に削減する。
関連論文リスト
- Position: LLMs Must Use Functor-Based and RAG-Driven Bias Mitigation for Fairness [0.09558392439655011]
本稿では,大規模言語モデル(LLM)における人口統計学とジェンダーバイアスについて論じる。
関手に基づくマッピングとRAGによる文脈的グラウンド化による構造的デバイアス化を組み合わせることで、公平かつ公平なモデル出力を提供することができる包括的フレームワークの概要を述べる。
論文 参考訳(メタデータ) (2026-03-07T22:40:44Z) - Normalized Attention Guidance: Universal Negative Guidance for Diffusion Models [57.20761595019967]
注意空間にL1をベースとした正規化・精細化を施した,効率的かつトレーニング不要な機構である正規化注意誘導(NAG)を提案する。
NAGは、CFGが忠実性を維持しながら崩壊する効果的な負のガイダンスを復元する。
NAGはアーキテクチャ(UNet、DiT)、サンプリングレシスタンス(複数ステップ、複数ステップ)、モダリティ(イメージ、ビデオ)をまたいで一般化する
論文 参考訳(メタデータ) (2025-05-27T13:30:46Z) - Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings [18.318232025355524]
既存のデータセットBBQをOpen-BBQに拡張し、オープンエンド環境でのLCMの社会的バイアスを評価する。
文や段落をラベル付けすることで,オープンなコンテンツからバイアスを検出する評価手法を開発した。
この問題を解決するために、構造化例と明示的な連鎖推論を組み合わせたICL法であるComposite Promptingを提案する。
論文 参考訳(メタデータ) (2024-12-09T01:29:47Z) - Identifying and Mitigating Social Bias Knowledge in Language Models [52.52955281662332]
個々人の社会的偏見をきめ細かなキャリブレーションを可能にする新しいデバイアス・アプローチであるFairness Stamp(FAST)を提案する。
FASTは最先端のベースラインを超え、デバイアス性能が優れている。
これは、大きな言語モデルにおける公平性を達成するためのきめ細かいデバイアス戦略の可能性を強調している。
論文 参考訳(メタデータ) (2024-08-07T17:14:58Z) - Conceptor-Aided Debiasing of Large Language Models [1.0435741631709405]
事前訓練された大規模言語モデル(LLM)は、トレーニングコーパスの社会的バイアスを反映している。
我々は,BERT や GPT などの LLM のバイアス部分空間を同定し,除去するためのソフトプロジェクション手法である概念を用いた。
提案手法は,(1)NOT操作による後処理によるバイアス部分空間の投影,(2)新しいアーキテクチャ,CI-BERT (Conceptor-intervened BERT) を提案する。
論文 参考訳(メタデータ) (2022-11-20T21:24:48Z) - Divide and Contrast: Source-free Domain Adaptation via Adaptive
Contrastive Learning [122.62311703151215]
Divide and Contrast (DaC) は、それぞれの制限を回避しつつ、両方の世界の善良な端を接続することを目的としている。
DaCは、ターゲットデータをソースライクなサンプルとターゲット固有なサンプルに分割する。
さらに、ソースライクなドメインと、メモリバンクベースの最大平均離散性(MMD)損失を用いて、ターゲット固有のサンプルとを整合させて、分散ミスマッチを低減する。
論文 参考訳(メタデータ) (2022-11-12T09:21:49Z) - General Greedy De-bias Learning [163.65789778416172]
本稿では,関数空間における勾配降下のような偏りのあるモデルとベースモデルを優雅に訓練する一般グリーディ・デバイアス学習フレームワーク(GGD)を提案する。
GGDは、事前知識を持つタスク固有バイアスモデルと、事前知識を持たない自己アンサンブルバイアスモデルの両方の設定の下で、より堅牢なベースモデルを学ぶことができる。
論文 参考訳(メタデータ) (2021-12-20T14:47:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。