論文の概要: UGID: Unified Graph Isomorphism for Debiasing Large Language Models
- arxiv url: http://arxiv.org/abs/2603.19144v1
- Date: Thu, 19 Mar 2026 16:59:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:06.283786
- Title: UGID: Unified Graph Isomorphism for Debiasing Large Language Models
- Title(参考訳): UGID:大規模言語モデルに対する統一グラフ同型
- Abstract要約: 大規模言語モデルに対するアンダーライン統一アンダーライングラフアンダーライン同型を提案する。
textittextbfUGIDは、大規模な言語モデルのための内部表現レベルのデバイアス化フレームワークである。
- 参考スコア(独自算出の注目度): 13.549042680933306
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) exhibit pronounced social biases. Output-level or data-optimization--based debiasing methods cannot fully resolve these biases, and many prior works have shown that biases are embedded in internal representations. We propose \underline{U}nified \underline{G}raph \underline{I}somorphism for \underline{D}ebiasing large language models (\textit{\textbf{UGID}}), an internal-representation--level debiasing framework for large language models that models the Transformer as a structured computational graph, where attention mechanisms define the routing edges of the graph and hidden states define the graph nodes. Specifically, debiasing is formulated as enforcing invariance of the graph structure across counterfactual inputs, with differences allowed only on sensitive attributes. \textit{\textbf{UGID}} jointly constrains attention routing and hidden representations in bias-sensitive regions, effectively preventing bias migration across architectural components. To achieve effective behavioral alignment without degrading general capabilities, we introduce a log-space constraint on sensitive logits and a selective anchor-based objective to preserve definitional semantics. Extensive experiments on large language models demonstrate that \textit{\textbf{UGID}} effectively reduces bias under both in-distribution and out-of-distribution settings, significantly reduces internal structural discrepancies, and preserves model safety and utility.
- Abstract(参考訳): 大規模言語モデル(LLM)は、社会的偏見が顕著である。
出力レベルまたはデータ最適化ベースのデバイアス法は、これらのバイアスを完全に解決することができず、多くの先行研究は、バイアスが内部表現に埋め込まれていることを示してきた。
我々は,大言語モデル (\textit{\textbf{UGID}}) をモデル化した内部表現レベルのデバイアス化フレームワークである \underline{U}nified \underline{G}raph \underline{I}somorphism for \underline{D}ebiasing Large Language Model (\textit{\textbf{UGID}}) を提案する。
具体的には、デバイアスはグラフ構造の反実的な入力に対する不変性を強制するものとして定式化され、感度特性のみに差が認められる。
\textit{\textbf{UGID}}は、バイアスに敏感な領域におけるアテンションルーティングと隠れ表現を共同で制限し、アーキテクチャコンポーネント間のバイアスマイグレーションを効果的に防止する。
汎用性を損なうことなく効果的な行動アライメントを実現するために、機密ロジットに対するログ空間制約と、定義意味論を保存するための選択的アンカーベース目的を導入する。
大規模言語モデルに対する大規模な実験により、 \textit{\textbf{UGID}} は分布内および分布外両方のバイアスを効果的に低減し、内部構造的不一致を著しく低減し、モデルの安全性と有用性を維持できることが示された。
関連論文リスト
- Exposing the Unsaid: Visualizing Hidden LLM Bias through Stochastic Path Aggregation [16.63373250752545]
大規模言語モデル(LLM)は、テキスト生成の限界化により評価が難しい表現バイアスと構文バイアスを示す。
本稿では,集約比較によるバイアス評価を目的とした視覚解析ツールであるTreeTracerを紹介する。
論文 参考訳(メタデータ) (2026-04-24T13:37:51Z) - Graph Negative Feedback Bias Correction Framework for Adaptive Heterophily Modeling [15.157616444432563]
グラフニューラルネットワーク(GNN)は、グラフ構造化データを処理するための強力なフレームワークとして登場した。
GNNは本質的にホモフィリー仮定によって制限され、不均一グラフの性能が低下する。
本稿では,グラフ負のフィードバックバイアス補正(GNFBC)を提案する。
論文 参考訳(メタデータ) (2026-03-04T02:34:48Z) - Generative Data Transformation: From Mixed to Unified Data [57.84692191369066]
textscTaesarはtextbftarget-textbfal textbfregenerationのためのEmphdata中心のフレームワークである。
ドメイン間のコンテキストを対象のシーケンスにエンコードすることで、複雑な融合アーキテクチャを使わずに、標準的なモデルで複雑な依存関係を学習することができる。
論文 参考訳(メタデータ) (2026-02-26T08:30:09Z) - NAG: A Unified Native Architecture for Encoder-free Text-Graph Modeling in Language Models [33.49410203951687]
このアプローチはテキストグラフに最適である,と我々は主張する。
NAG(Native Architecture for Graphs)は、言語モデル内でグラフ処理を内部化する統合フレームワークである。
NAGは外部エンコーダのオーバーヘッドなしに堅牢なグラフ理解を実現する。
論文 参考訳(メタデータ) (2026-01-30T07:22:11Z) - Semantic Refinement with LLMs for Graph Representations [37.72134125261354]
グラフ表現学習のためのデータ適応セマンティック・リファインメントフレームワークDASを提案する。
我々は、テキストリッチグラフとテキストフリーグラフの両方に対するアプローチを評価した。
結果は、セマンティクスに富むグラフに競争力を維持しながら、構造支配グラフに対して一貫した改善を示す。
論文 参考訳(メタデータ) (2025-12-24T11:10:28Z) - Bias Is a Subspace, Not a Coordinate: A Geometric Rethinking of Post-hoc Debiasing in Vision-Language Models [13.46898179372249]
VLM(Vision-Language Models)は、マルチモーダルな推論には欠かせないものとなっているが、それらの表現はしばしば人口統計バイアスをエンコードし増幅している。
線形デオード可能なバイアスの全部分空間を同定・除去する幾何学的原理の枠組みを提案する。
提案手法は, 4つのフェアネス指標に対して平均18.5%の精度向上を達成し, より堅牢なデバイアス化を実現する。
論文 参考訳(メタデータ) (2025-11-22T17:04:30Z) - SCALEX: Scalable Concept and Latent Exploration for Diffusion Models [59.86284983662119]
画像生成モデルは、しばしば、性別、人種、職業に関連するステレオタイプを含む社会的バイアスを符号化する。
拡散モデルラテント空間のスケーラブルかつ自動探索のためのフレームワークであるSCALEXを紹介する。
自然言語プロンプトのみを使用して、H空間から意味論的に意味のある方向を抽出し、リトレーニングやラベル付けをせずにゼロショット解釈を可能にする。
論文 参考訳(メタデータ) (2025-11-13T22:02:44Z) - Semantic and Structural Analysis of Implicit Biases in Large Language Models: An Interpretable Approach [1.5749416770494704]
モデル出力に隠された社会的バイアスを特定するための解釈可能なバイアス検出手法を提案する。
この方法は、ネストされた意味表現と文脈的コントラスト機構を組み合わせる。
この評価は、バイアス検出精度、セマンティック一貫性、文脈感度など、いくつかの重要な指標に焦点を当てている。
論文 参考訳(メタデータ) (2025-08-08T09:21:10Z) - Graph-KV: Breaking Sequence via Injecting Structural Biases into Large Language Models [63.64507678113921]
構造的帰納バイアスを通して相互作用を管理するグラフ-KVを導入する。
このフレームワークでは、「ターゲット」セグメントは指定された「ソース」セグメントのKV-cacheのみに選択的に参加する。
我々は,(1)直接推論,マルチホップ推論,長期文書理解にまたがる7つのRAGベンチマーク,(2)引用エゴグラフとして構造化された全文科学論文を用いた新しい学術論文QAタスクArxiv-QA,(3)引用ネットワーク内の論文トピック分類の3つのシナリオでグラフ-KVを評価する。
論文 参考訳(メタデータ) (2025-06-09T00:30:08Z) - Scalable Graph Generative Modeling via Substructure Sequences [50.32639806800683]
本稿では,グラフ生成用トランスフォーマー事前学習フレームワークである生成グラフパターンマシン(G$2$PM)を紹介する。
G$2$PMはグラフインスタンス(ノード、エッジ、グラフ全体)をサブ構造のシーケンスとして表現する。
それは、一般化可能かつ伝達可能な表現を学ぶために、シーケンスに関する生成的事前学習を採用する。
論文 参考訳(メタデータ) (2025-05-22T02:16:34Z) - Federated Deconfounding and Debiasing Learning for Out-of-Distribution Generalization [25.181305392387802]
連合学習(FL)における属性バイアスは、典型的には非因果関係の学習により、非矛盾的に局所モデルを最適化する。
本稿では,Underated UnderlineDeconfounding and UnderlineDebiasing UnderlineLearning (FedDDL)法を提案する。
構造化された因果グラフを構築してモデル推論プロセスを分析し、バックドア調整を行い、相反する経路を除去する。
論文 参考訳(メタデータ) (2025-05-08T06:32:59Z) - Causality and Independence Enhancement for Biased Node Classification [56.38828085943763]
各種グラフニューラルネットワーク(GNN)に適用可能な新しい因果性・独立性向上(CIE)フレームワークを提案する。
提案手法は,ノード表現レベルでの因果的特徴と突発的特徴を推定し,突発的相関の影響を緩和する。
我々のアプローチCIEは、GNNの性能を大幅に向上するだけでなく、最先端の debiased ノード分類法よりも優れています。
論文 参考訳(メタデータ) (2023-10-14T13:56:24Z) - Debiasing Vision-Language Models via Biased Prompts [79.04467131711775]
本稿では,テキスト埋め込みにおけるバイアスのある方向を投影することで,視覚言語基盤モデルを疎外する一般的な手法を提案する。
偏平投影行列を組み込んだテキストのみをデバイアスすることで、ロバストな分類器と公正な生成モデルが得られることを示す。
論文 参考訳(メタデータ) (2023-01-31T20:09:33Z) - General Greedy De-bias Learning [163.65789778416172]
本稿では,関数空間における勾配降下のような偏りのあるモデルとベースモデルを優雅に訓練する一般グリーディ・デバイアス学習フレームワーク(GGD)を提案する。
GGDは、事前知識を持つタスク固有バイアスモデルと、事前知識を持たない自己アンサンブルバイアスモデルの両方の設定の下で、より堅牢なベースモデルを学ぶことができる。
論文 参考訳(メタデータ) (2021-12-20T14:47:32Z) - Bayesian Attention Modules [65.52970388117923]
実装や最適化が容易な,スケーラブルな注目バージョンを提案する。
本実験は,提案手法が対応するベースラインに対して一貫した改善をもたらすことを示す。
論文 参考訳(メタデータ) (2020-10-20T20:30:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。