論文の概要: Distill to Detect: Exposing Stealth Biases in LLMs through Cartridge Distillation
- arxiv url: http://arxiv.org/abs/2607.01208v1
- Date: Wed, 01 Jul 2026 17:46:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:08.012945
- Title: Distill to Detect: Exposing Stealth Biases in LLMs through Cartridge Distillation
- Title(参考訳): LLM中のステルスビアーゼのカートリッジ蒸留による検出
- Abstract要約: Distill to Detect (D2D) は、疑わしいモデルとそのベース間の分布シフトをカートリッジに蒸留することにより隠れバイアスを表面化する手法である。
D2Dはステルスモデルの隠れバイアスを、複数のバイアスタイプで確実に検出できる程度に増幅することを示した。
- 参考スコア(独自算出の注目度): 28.664884834335666
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models deployed in high-stakes roles can potentially favor certain entities, brands, or viewpoints, steering user decisions at scale. Such preferential biases can be introduced by any actor in the model's supply chain and are most dangerous when the model reveals its preference only on the relevant topic while behaving identically to its unmodified base on all other inputs. Recent work has shown that these biases can transfer through context distillation on semantically unrelated data, with the signal residing entirely in the soft logit distribution and remaining invisible to text-based inspection. However, the defender faces a fundamental asymmetry: without knowing the bias topic, no detection method can reliably surface a stealth preferential bias, regardless of whether it examines generated text, internal representations, or model weights. Here we introduce Distill to Detect (D2D), a method that surfaces hidden biases by distilling the distributional shift between a suspected model and its base into a cartridge (a KV-cache prefix adapter), concentrating the dominant divergence and amplifying the bias signal into generated text. We show that D2D successfully amplifies the hidden biases of stealth models to the extent that they can be reliably detected across multiple bias types. We also propose a theoretical framework that explains the efficacy of D2D through the lens of Fisher-weighted projection of the logit distribution shift, supported by empirical observations. By turning the capacity bottleneck of prefix-tuning adapters into a detection tool, D2D provides a practical building block for auditing hidden behaviors in deployed language models.
- Abstract(参考訳): ハイリスクな役割に配置された言語モデルは、特定のエンティティやブランド、あるいは視点を好んで、大規模にユーザ決定を下す可能性がある。
このような優先バイアスは、モデルのサプライチェーン内のアクターによって導入され、モデルが関連するトピックに対してのみその好みを明らかにすると同時に、他のすべての入力に対して修正されていないベースと同一に振る舞う場合に最も危険である。
近年の研究では、これらのバイアスは意味論的に無関係なデータに対する文脈蒸留を通じて伝達され、信号は完全にソフトロジット分布にあり、テキストベースの検査には見えないことが示されている。
しかし、ディフェンダーは基本的な非対称性に直面する: バイアスのトピックを知らずに、生成されたテキスト、内部表現、モデル重みを検査するかどうかに関わらず、ステルス優先バイアスを確実に表面化することはできない。
本稿では、疑わしいモデルとベース間の分布シフトをカートリッジ(KV-cacheプレフィックスアダプタ)に蒸留し、支配的な発散に集中させ、バイアス信号を生成されたテキストに増幅することにより、隠れバイアスを検出する方法であるDistill to Detect (D2D)を紹介する。
D2Dはステルスモデルの隠れバイアスを、複数のバイアスタイプで確実に検出できる程度に増幅することを示した。
また,ロジット分布シフトのフィッシャー重み付き投影のレンズを通してD2Dの有効性を説明する理論的枠組みも提案する。
プレフィックスチューニングアダプタのキャパシティボトルネックを検出ツールにすることで、D2Dは、デプロイされた言語モデルに隠された振る舞いを監査するための実用的なビルディングブロックを提供する。
関連論文リスト
- Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement [66.67463557274358]
バイアス付きデータセットに基づいてトレーニングされた基礎モデルは、しばしばターゲットラベルと非因果属性の間の急激な相関に依存する。
信頼誘導概念マイニング(CBCM:Confidence-guided Concept Mining)を導入し,属性アノテーションを使わずに信頼性の高いスプリアス属性を同定する。
本稿では,目標と突発的な表現を2つのブランチに分離するプロンプトチューニングフレームワークであるDual-branch Cross-projection Debiasing (DCD)を提案する。
論文 参考訳(メタデータ) (2026-06-23T05:28:47Z) - ExposeAnyone: Personalized Audio-to-Expression Diffusion Models Are Robust Zero-Shot Face Forgery Detectors [58.45131932883374]
ビデオ中のディープフェイクを検出するための完全自己教師型アプローチを提案する。
本モデルでは,拡散再構成誤差を用いて,疑わしい映像とパーソナライズされた被写体との同一性距離を算出する。
本手法は, ボケや圧縮などの汚損に対して極めて堅牢であり, 現実の顔偽造検出への適用性を強調している。
論文 参考訳(メタデータ) (2026-01-05T18:59:54Z) - Activation Steering for Bias Mitigation: An Interpretable Approach to Safer LLMs [0.5076419064097734]
大規模言語モデル(LLM)は、社会システムにますます統合されている。
バイアスを軽減する従来の方法は、しばしばデータフィルタリングやポストホック出力のモデレーションに依存している。
我々は、機械的解釈可能性の手法を用いてバイアスを特定し、積極的に軽減する完全なエンドツーエンドシステムを導入する。
論文 参考訳(メタデータ) (2025-08-12T15:34:18Z) - Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs [27.544312683007234]
細調整された大言語モデル(LLM)の理解・監視・制御のための新しい手法を提案する。
微調整モデルとそのベースモデルの間の重み差のトップ特異点が,新たに獲得した挙動に対応することを示す。
シークレットトリガーが存在する場合の安全メカニズムをバイパスするバックドアモデルでは、我々の手法は1.2%以下の偽陽性率で攻撃の最大100%を停止する。
論文 参考訳(メタデータ) (2025-07-31T21:04:12Z) - Implicit Bias Injection Attacks against Text-to-Image Diffusion Models [17.131167390657243]
偏りのあるT2Iモデルは特定の傾向のあるコンテンツを生成し、人々の知覚に影響を与える可能性がある。
本稿では,視覚的特徴に欠けるが,多様な方法で現れる新しい形態の暗黙バイアスを紹介する。
本稿では,T2I拡散モデルに対する暗黙バイアス注入攻撃フレームワーク(IBI-Attacks)を提案する。
論文 参考訳(メタデータ) (2025-04-02T15:24:12Z) - Interpretable Model Drift Detection [22.191653321470913]
我々は,リスクの観点から,解釈可能なモデルドリフト検出の問題を研究するために,原則的アプローチを採っている。
本手法は既存の解釈可能な手法よりも優れており,最先端のブラックボックスドリフト検出手法と同等である。
論文 参考訳(メタデータ) (2025-03-09T13:19:06Z) - Towards General Visual-Linguistic Face Forgery Detection [95.73987327101143]
ディープフェイクは現実的な顔操作であり、セキュリティ、プライバシー、信頼に深刻な脅威をもたらす可能性がある。
既存の方法は、このタスクを、デジタルラベルまたはマスク信号を使用して検出モデルをトレーニングするバイナリ分類として扱う。
本稿では, 微粒な文レベルのプロンプトをアノテーションとして用いた, VLFFD (Visual-Linguistic Face Forgery Detection) という新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2023-07-31T10:22:33Z) - GLENet: Boosting 3D Object Detectors with Generative Label Uncertainty Estimation [70.75100533512021]
本稿では,対象物の潜在的可算有界箱の多様性として,ラベルの不確実性問題を定式化する。
本稿では,条件付き変分オートエンコーダを応用した生成フレームワークであるGLENetを提案する。
GLENetが生成するラベルの不確実性はプラグアンドプレイモジュールであり、既存のディープ3D検出器に便利に統合することができる。
論文 参考訳(メタデータ) (2022-07-06T06:26:17Z) - Self-Conditioned Generative Adversarial Networks for Image Editing [61.50205580051405]
Generative Adversarial Networks (GAN) はバイアスの影響を受けやすい。
我々は、このバイアスが公平性だけでなく、分布のコアから逸脱する際の潜在トラバース編集手法の崩壊に重要な役割を果たしていると論じる。
論文 参考訳(メタデータ) (2022-02-08T18:08:24Z) - DAAIN: Detection of Anomalous and Adversarial Input using Normalizing
Flows [52.31831255787147]
我々は、アウト・オブ・ディストリビューション(OOD)インプットと敵攻撃(AA)を検出する新しい手法であるDAINを導入する。
本手法は,ニューラルネットワークの内部動作を監視し,活性化分布の密度推定器を学習する。
当社のモデルは,特別なアクセラレータを必要とせずに,効率的な計算とデプロイが可能な単一のGPUでトレーニングすることが可能です。
論文 参考訳(メタデータ) (2021-05-30T22:07:13Z) - Uncertainty Inspired RGB-D Saliency Detection [70.50583438784571]
本稿では,データラベリングプロセスから学習することで,RGB-D値検出の不確実性を利用した最初のフレームワークを提案する。
そこで本研究では,確率的RGB-Dサリエンシ検出を実現するために,サリエンシデータラベリングプロセスにインスパイアされた生成アーキテクチャを提案する。
6つの挑戦的RGB-Dベンチマークデータセットの結果から,サリエンシマップの分布を学習する際のアプローチの優れた性能が示された。
論文 参考訳(メタデータ) (2020-09-07T13:01:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。