論文の概要: Noise Out, Bias In: Targeted Bias Injection in Diffusion Language Models via Closed-Loop Activation Steering
- arxiv url: http://arxiv.org/abs/2610.05894v1
- Date: Mon, 05 Oct 2026 07:10:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 03:29:01.33343
- Title: Noise Out, Bias In: Targeted Bias Injection in Diffusion Language Models via Closed-Loop Activation Steering
- Title(参考訳): ノイズアウト, バイアスイン:閉ループ活性化ステアリングによる拡散言語モデルにおける目標バイアス注入
- Abstract要約: マスク付き拡散言語モデル (dLLMs) は、マスキング位置を反復的に認知することでテキストを生成する。
内部アクティベーションにアクセスした相手は、モデルが選択した回答を生成する可能性を確認することができる。
本研究は, 凍結したdLLMを相手が選択した人口統計学的回答に向けて誘導する攻撃である, ターゲットバイアス注入について検討した。
- 参考スコア(独自算出の注目度): 9.414465072912417
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Masked diffusion language models (dLLMs) generate text by iteratively denoising masked positions, re-predicting each token multiple times before it is committed. An autoregressive decoder exposes an answer's distribution once, at the step that commits it; a dLLM exposes it at every denoising step before commitment, and we show that an adversary can exploit this. Since an answer remains open to revision over many denoising steps, an adversary with access to internal activations can watch how likely the model is to produce a chosen answer and adjust the intervention accordingly. Building on this observation, we study targeted bias injection, an attack that steers a frozen dLLM toward a demographic answer selected by the adversary. The attack uses a simple proportional-integral (PI) controller that tracks the target-answer probability during denoising and adapts the strength of a steering vector on the fly. On ambiguous BBQ questions where the correct answer is abstention, our attack raises LLaDA-8B-Instruct's preference for the targeted group from 1.8 to 16.7 percentage points, more than three times the strongest fixed-strength steering baseline, and on SocialStigmaQA it raises the selection of stigmatizing answers from 17.6% to 58.1%. Fitted to other demographic targets, the same attack shifts answers by up to 37 percentage points, and each attack takes about 40 minutes on one GPU. On the primary target, feedback is what makes the attack work: constant steering at the same average strength over the token-committing steps produces a far smaller shift while corrupting nearly three times as many outputs, and a constant strength set separately for each example still falls well short. Our findings identify the denoising trajectory as a new control channel in dLLMs and call for bias audits that examine the serving stack rather than the frozen model alone.
- Abstract(参考訳): マスケ拡散言語モデル (dLLMs) は、マスケ位置を反復的に識別してテキストを生成し、コミット前に各トークンを複数回再予測する。
自動回帰デコーダは、一度、それをコミットするステップで、解答の分布を露出します。
多くのデノベーションステップに対するリビジョンに対する回答は依然としてオープンであるため、内部アクティベーションにアクセスする敵は、モデルが選択された回答を生成し、それに応じて介入を調整する可能性を確認することができる。
本研究は, 対象バイアス注入, 凍結したdLLMを相手が選択した人口統計学的回答に誘導する攻撃について検討した。
この攻撃では、単純な比例積分(PI)コントローラを使用し、デノナイズ中のターゲット・アンサーの確率を追跡し、ハエのステアリングベクトルの強さを適応させる。
正解が棄却される不明瞭なBBQ質問では、LLaDA-8B-Instructが目標群を1.8から16.7ポイント、最強の固定強度ステアリングベースラインの3倍以上、SocialStigmaQAでは17.6%から58.1%に格付けした。
他の人口目標に合わせると、同じ攻撃は最大37ポイントの回答をシフトし、各攻撃は1つのGPUで約40分かかる。
トークンコミットステップに対して同じ平均強度で一定のステアリングを行うと、出力の約3倍の誤差が生じる一方で、はるかに小さなシフトが発生する。
本研究は,dLLMsにおける新しい制御チャネルとして認知軌跡を同定し,凍結モデルのみではなく,サービススタックを検査するバイアス監査を求めるものである。
関連論文リスト
- Self-Repulsive Sampling for Diffusion Language Models [42.61658629762382]
Self-Repulsion (SR) は、マスク付き拡散言語モデルのサンプルである。
パスはバッチ化されたフォワードパスを共有し、次に順番にコミットする。
投票の得票率は、主に正しい回答のより高いカバレッジから生じる。
論文 参考訳(メタデータ) (2026-09-30T11:58:40Z) - From Routing Signals to Selective Review: Visual regrounding in MoE VLMs [48.07726955428853]
視覚言語モデル(VLM)は偽の視覚的前提を受け入れ、対象の物体の色、数、位置、状態について疑問に答える。
本稿では,Mixture-of-Experts (MoE)VLMにおける内部ルーティング決定を活用するための最初のフレームワークを提案する。
提案手法は,MoE VLMによってすでに作成されており,低コストな検出と選択的な視覚的リグラウンドを支援することができる。
論文 参考訳(メタデータ) (2026-09-29T17:49:07Z) - Controlled Decoding Attacks on Black-Box LLMs [68.46062477706256]
Methodは、繰り返しサンプリングとアシスタント-継続を可能にする、テキストのみの継続インターフェイスを通じてジェイルブレイクを行うためのフレームワークである。
Risk-Gated Residual Controlは、進化する応答プレフィックスを使用して、配布の再構築と修正をいつ行うかを決定する。
Speculative Multi-Token Executionは、介入を必要としないドラフトプレフィックスの検証と受け入れによって、さらにターゲットコールを償却する。
論文 参考訳(メタデータ) (2026-09-29T07:58:49Z) - CounterSteer: Suppressing Indirect Prompt Injection with Activation Steering [4.1626636325601405]
間接的なプロンプトインジェクションにより、エージェントは信頼できない検索されたテキストを命令として扱う。
モデル内のこの振る舞いを抑える推論時間ディフェンスであるCounterSteerを提案する。
論文 参考訳(メタデータ) (2026-09-29T02:51:31Z) - Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models [59.51249894128724]
マスク付き拡散言語モデルは、反復を識別するごとに複数のトークンを明らかにすることで推論ステップを削減することができる。
パラレルマスク拡散復号法のためのトレーニング不要な復号法であるADASを提案する。
論文 参考訳(メタデータ) (2026-06-09T13:17:27Z) - Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models [57.870323273127234]
本研究の目的は,画像の持続的支配パターンに対して内的注意を喚起する新たな敵攻撃であるtextbfAttention Hijacking を提案することである。
提案手法は,クエリの特定の単語に対する操作された出力の依存性を低減する。
論文 参考訳(メタデータ) (2026-05-17T08:02:27Z) - JUMP: Single-Pass Membership Inference on Fine-Tuned Diffusion Language Models [5.43345665278304]
我々は、細調整された離散拡散言語モデル(dLLMs)に対する会員推論攻撃(MIA)について研究する。
JUMP(Joint Uncertainty-Guided Mask Probing)は,DLLMの特性を両立させるシングルパススコアリング攻撃である。
6つのMIMIRドメインにわたる微調整されたLLaDA-8Bベースでは、JUMPは平均ROC-AUCをSAMAで0.82から0.90に改善し、低FPR検出を大幅に改善する。
論文 参考訳(メタデータ) (2026-05-09T05:40:00Z) - EDIT: Early Diffusion Inference Termination for dLLMs Based on Dynamics of Training Gradients [6.736735746633275]
拡散に基づく大規模言語モデル (dLLMs) は反復的妄想を通じてトークン生成を洗練させるが、全てのステップが完了する前に答えは安定することが多い。
本稿では,トレーニング時推論に対する十分な推論安定性が検出された場合に,適応的にデノイングを停止する推論時基準であるEDITを提案する。
論文 参考訳(メタデータ) (2025-11-29T23:47:47Z) - Indiscriminate Disruption of Conditional Inference on Multivariate Gaussians [60.22542847840578]
敵対的機械学習の進歩にもかかわらず、敵対者の存在下でのガウスモデルに対する推論は特に過小評価されている。
我々は,意思決定者の条件推論とその後の行動の妨害を希望する自己関心のある攻撃者について,一組の明らかな変数を乱すことで検討する。
検出を避けるため、攻撃者は、破損した証拠の密度によって可否が決定される場合に、攻撃が可否を示すことを望んでいる。
論文 参考訳(メタデータ) (2024-11-21T17:46:55Z) - Ada3Diff: Defending against 3D Adversarial Point Clouds via Adaptive
Diffusion [70.60038549155485]
ディープ3Dポイントクラウドモデルは敵攻撃に敏感であり、自律運転のような安全クリティカルなアプリケーションに脅威をもたらす。
本稿では,適応強度推定器と拡散モデルを用いて,プリスタンデータ分布を再構築できる新しい歪み認識型防衛フレームワークを提案する。
論文 参考訳(メタデータ) (2022-11-29T14:32:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。