論文の概要: TAME: Token Attribution and Masking for Emergent misalignment
- arxiv url: http://arxiv.org/abs/2609.16754v1
- Date: Tue, 15 Sep 2026 07:30:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.388422
- Title: TAME: Token Attribution and Masking for Emergent misalignment
- Title(参考訳): TAME:創発的ミスアライメントのためのToken AttributionとMasking
- Abstract要約: 微調整言語モデルは、創発的ミスアライメント(EM)として知られる訓練領域外における有害な振る舞いを誘発する。
本稿では,トークン属性,信号特性,因果検証という3段階のフレームワークであるTAMEを紹介する。
ラマでは23倍, クウェンでは36倍, 医療内容よりもターゲットレジスタにパープレキシティコストが集中している。
- 参考スコア(独自算出の注目度): 8.113418747367573
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fine-tuning an aligned language model on narrow, flawed data can induce harmful behavior far outside the training domain, known as emergent misalignment (EM). Prior work has localized EM in model weights, activations, and training documents, but it remains unclear which training tokens carry the relevant fine-tuning signal. We introduce TAME (Token Attribution and Masking for Emergent Misalignment), a three-stage framework: token attribution scores how strongly the fine-tuning update raises each response token's likelihood, using forward passes through a released LoRA adapter; signal characterization finds patterns among high-attribution tokens; and causal validation tests them by attribution-guided loss masking. On released EM organisms and a 6,849-example medical-advice split, attribution is concentrated (the top 5% of tokens hold 32% of the mass) and, in Llama, depleted for medical vocabulary but enriched for a register of unwarranted certainty, even after controlling for token rarity. Masking high-attribution tokens during fresh fine-tuning cuts EM by 23x in Llama and 36x in Qwen, with the perplexity cost concentrated on the targeted register rather than on medical content; an equal random mask leaves EM unchanged. In Llama, the attribution pattern suggests that EM-relevant signal lies more in how confidently flawed content is expressed than in its domain vocabulary; the causal masking effect itself holds across both model families.
- Abstract(参考訳): 狭く欠陥のあるデータに整列した言語モデルを微調整することで、創発的ミスアライメント(EM)として知られるトレーニング領域外における有害な振る舞いを誘発することができる。
以前の研究は、モデルの重み、アクティベーション、トレーニング文書にEMをローカライズしてきたが、どのトレーニングトークンが関連する微調整信号を持っているかは定かではない。
我々は、3段階のフレームワークであるTAME(Token Attribution and Masking for Emergent Misalignment)を紹介した。トークン属性は、細調整された更新によって、リリースされたLoRAアダプタを前方通過することで、各応答トークンの可能性がどれだけ強く上昇するかを示す。
放出されたEM有機体と6,849個の医療機器の分割では、アトリビューションが集中し(トークンの上位5%が質量の32%を占める)、ラマでは、医学的な語彙を欠いているが、トークンの希少性を制御した後でも、不規則な確実性のレジスターに富んでいる。
ラマでは23倍、クウェンでは36倍、医学的内容よりも標的レジスタにパープレキシティコストが集中し、均一なランダムマスク葉EMが変化しない。
Llamaでは、帰属パターンは、EM関連シグナルが、そのドメインの語彙よりも確実に欠陥のあるコンテンツが表現されるかにかかっていることを示唆している。
関連論文リスト
- Sparse Attention for Dense Open-Vocabulary Prediction in CLIP [54.45759517856271]
最終視覚的自己注意層における行方向のソフトマックスの推測時間置換について検討した。
entmaxは低得点を正確に0にマッピングするデータ依存しきい値を適用するため、暗黙のデノイザとして機能する。
オープン語彙タスクセンスセマンティックセマンティックセグメンテーション (Pascal VOC, Pascal Context, ADE20K) ときめ細かい検索 (FG-OVD) について検討する。
論文 参考訳(メタデータ) (2026-07-08T08:30:48Z) - Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention [9.899649326522761]
MTLA(Multi-Token Localized Attention)は、トレーニングなしのポストホックスコアで、予測トークンが主張する領域にどの程度強く関与しているかを測定する。
複数のMLLMファミリーと3つのモダリティにまたがって、MTLAは最高のトレーニングのないベースラインに対して、AUROCを+7から+38に改善する。
論文 参考訳(メタデータ) (2026-07-07T08:10:57Z) - NAVIRA: Decoupled Stochastic Remasking for Masked Diffusion Language Models [0.0]
PRISMはトークンレベルの品質スコアを学習し、信頼できないトークンを再マスクすることでこの問題に対処する。
この2つの操作を分離する推論時間復号法であるNAVIRAを提案する。
温度制御されたリメイキングは、同じ位置の繰り返し補正を減らす。
論文 参考訳(メタデータ) (2026-06-04T11:24:47Z) - Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack [78.02110947708535]
敵対的なイメージは、プロンプトインジェクションを通じて、マルチモーダルな大規模言語モデルに深刻なセキュリティ上の脅威をもたらす。
敵の攻撃を成功させるには、画像全体を一様に依存するのではなく、重要な画像トークンの小さなサブセットに依存していることを示す。
本稿では,これらのトークンを勾配解析により局所化し,マスキングにより中和するグラディエントトークンマスキング(GTM)を提案する。
論文 参考訳(メタデータ) (2026-05-24T17:51:34Z) - Attribution-Guided Masking for Robust Cross-Domain Sentiment Classification [1.4719924357068723]
AGM(Atribution-Guided Masking)は、微調整中に高属性のスプリアストークンを動的に検出し、ペナルティ化する訓練時間介入である。
我々の定性的分析は、AGMが@mentions、ハッシュタグ、slangといったドメイン固有のトークンへの属性を抑えることを確認した。
我々のアブレーション研究は、帰属誘導マスキングが重要な要素であることをさらに確認している。
論文 参考訳(メタデータ) (2026-05-04T19:09:22Z) - Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization [74.91418266859297]
インプシットプロセス報酬モデル(PRM)は、推論プロセスに沿ってきめ細かな報酬信号を提供する。
トレーニングはシーケンスレベルの集約のみを制限しますが、推論はローカルステップの品質を反映するためにトークンレベルのスコアが必要です。
本稿では,予測精度を推定するプレフィックス条件付き値関数を直接学習する新しいインプリシット・プレフィックス・バリュー・リワード・モデル(IPVRM)を提案する。
また,サンプルトークンと高確率候補トークンの両方に対してTDの利点を演算する分散レベルRL(DistRL)を提案する。
論文 参考訳(メタデータ) (2026-04-14T18:19:54Z) - Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language Models [40.902681492117786]
RemeDiはマスクベースのDLMで、トークンの分布と各ステップにおけるトークン毎の信頼スコアを予測する。
モデルに不正トークンを検出して再マスクする教師付き微調整を含む、この能力をトレーニングするために、リマスク対応パイプラインをトレーニングします。
実験により、RemeDiは複数のデータセット上のオープンソースのDLMの最先端の結果を達成することが示された。
論文 参考訳(メタデータ) (2025-09-28T05:39:49Z) - SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks [19.58547231973585]
我々は,POトレーニング中に各トークンに対応するKL分散と報酬の重み付けを自動的に学習する,フレキシブルな目標SparsePOを提案する。
本手法は,要約および対話シナリオにおいて,+10%および+3%の勝利率ポイントを得る。
論文 参考訳(メタデータ) (2024-10-07T15:01:29Z) - Emulated Disalignment: Safety Alignment for Large Language Models May Backfire! [65.06450319194454]
大きな言語モデル(LLM)は、人間との安全な会話を確保するために安全アライメントを行う。
本稿では,安全アライメントの反転が可能なトレーニングフリーアタック手法を提案する。
本手法をエミュレートした脱アライメント (ED) と呼ぶのは, このコントラスト分布からのサンプリングは, 安全報酬を最小限に抑えるため, 微調整の結果を確実にエミュレートするからである。
論文 参考訳(メタデータ) (2024-02-19T18:16:51Z) - OPERA: Alleviating Hallucination in Multi-Modal Large Language Models
via Over-Trust Penalty and Retrospection-Allocation [124.9008419182485]
OPERA(Over-trust PenaltyとRetrospection-Allocation戦略に基づく新しいMLLM復号法)を提案する。
私たちのアプローチは、ほとんどの幻覚は自己注意行列の知識集約パターンと密接に結びついているという興味深い観察から始まります。
この観察に基づいて、OPERAは、ビーム探索復号時にモデルロジットにペナルティ項を導入し、オーバートラスト問題を緩和する。
論文 参考訳(メタデータ) (2023-11-29T18:57:07Z) - Token-Label Alignment for Vision Transformers [93.58540411138164]
データ混合戦略(例えば、CutMix)は、畳み込みニューラルネットワーク(CNN)の性能を大幅に改善する能力を示している。
我々は,データ混合戦略の可能性を抑制するトークン変動現象を同定する。
本稿では,各トークンのラベルを保持するために,変換されたトークンと元のトークンとの対応をトレースするトークンラベルアライメント(TL-Align)手法を提案する。
論文 参考訳(メタデータ) (2022-10-12T17:54:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。