論文の概要: Test-Time Training Undermines Safety Guardrails
- arxiv url: http://arxiv.org/abs/2605.22984v1
- Date: Thu, 21 May 2026 19:27:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-25 17:29:20.075644
- Title: Test-Time Training Undermines Safety Guardrails
- Title(参考訳): テストタイムトレーニングは安全ガードレールを損なう
- Authors: Simone Antonelli, Sadegh Akhondzadeh, Aleksandar Bojchevski,
- Abstract要約: テスト時間トレーニング(TTT)は、モデルが推論中にパラメータを適応できるようにする新しいパラダイムである。
TTTの3つの脅威モデルを特定し、攻撃者が安全フィルタをバイパスする方法を実証する。
- 参考スコア(独自算出の注目度): 53.00299679873018
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test-Time Training (TTT) is an emerging paradigm that enables models to adapt their parameters during inference, improving performance on tasks such as few-shot learning, retrieval-augmented generation, and complex reasoning. However, this dynamic adaptation introduces new vulnerabilities that adversaries can exploit to jailbreak models. We identify three threat models for TTT and demonstrate how attackers can leverage them to bypass safety filters. Our results show that TTT can significantly increase the Attack Success Rate (ASR) and the ASR over 10 generation trials (ASR@10). For example, under LoRA, the few-shot and generation-phase threat models achieve an average ASR@10 of 95% and 93% respectively, across models from different families and scales. These vulnerabilities transfer to production fine-tuning APIs. We also show that TTT-induced overfitting can produce degenerate outputs that inflate ASR under standard judges, and propose a validity-aware evaluation to correct for this. Our findings suggest that TTT exposes a new attack surface, strengthens attacks, and undermines existing safety guardrails. As a first step toward defense, we propose a lightweight provider-side detector that flags TTT requests via the perplexity shift on a private harmful holdout, but robust deployment will ultimately require dynamic alignment.
- Abstract(参考訳): テストタイムトレーニング(TTT)は、モデルが推論中にパラメータを適応できるようにし、少数ショット学習、検索強化生成、複雑な推論などのタスクのパフォーマンスを向上させる、新たなパラダイムである。
しかし、この動的適応は、敵がジェイルブレイクモデルに悪用できる新たな脆弱性をもたらす。
TTTの3つの脅威モデルを特定し、攻撃者が安全フィルタをバイパスする方法を実証する。
以上の結果から,TTTはASR(Attack Success Rate)とASR(ASR@10)を10世代以上で有意に増加させる可能性が示唆された。
例えば、LoRAでは、数ショットの脅威モデルと生成フェーズの脅威モデルは、それぞれ95%と93%の平均的なASR@10を、異なるファミリーとスケールのモデルで達成している。
これらの脆弱性は、運用レベルの微調整APIに転送される。
また,TTによるオーバーフィッティングにより,標準判断下でのASRをインフレーションする退化出力が生成され,正当性を考慮した評価が提案される。
以上の結果から,TTTは新たな攻撃面を露出し,攻撃を強化し,既存の安全ガードレールを損なうことが示唆された。
防衛に向けた第一歩として,私的有害なホールドアウトにおける複雑度シフトを通じてTTT要求をフラグする軽量なプロバイダ側検出器を提案するが,ロバストな展開には最終的には動的アライメントが必要となる。
関連論文リスト
- Amplification Effects in Test-Time Reinforcement Learning: Safety and Reasoning Vulnerabilities [23.619172971228853]
テストタイムトレーニング(TTT)は、大規模言語モデルの推論能力を改善するための有望な方法として登場した。
自己整合性を促進することによってLCM推論を向上させるTTT法は,増幅挙動や推論劣化を引き起こす可能性があることを示す。
論文 参考訳(メタデータ) (2026-03-16T15:28:59Z) - R-TPT: Improving Adversarial Robustness of Vision-Language Models through Test-Time Prompt Tuning [69.72249695674665]
視覚言語モデル(VLM)のためのロバストテスト時プロンプトチューニング(R-TPT)を提案する。
R-TPTは、推論段階における敵攻撃の影響を緩和する。
プラグアンドプレイの信頼性に基づく重み付きアンサンブル戦略を導入し,防御強化を図る。
論文 参考訳(メタデータ) (2025-04-15T13:49:31Z) - PEFT-as-an-Attack! Jailbreaking Language Models during Federated Parameter-Efficient Fine-Tuning [8.61459170031022]
本稿では,PEFT-as-an-Attack(PaaA)と呼ばれる新たなセキュリティ脅威をFedPEFTに導入する。
PaaAの評価では、モデルのパラメータの1%未満がトレーニング可能であり、クライアントの少数のサブセットが悪意を持って行動しているため、LoRAなどの代表PEFT手法を用いて攻撃成功率が約80%に達することが判明した。
この結果から,FedPEFTパラダイムの安全性確保と性能維持を同時に行う,より効果的な防衛機構の必要性が示唆された。
論文 参考訳(メタデータ) (2024-11-28T19:05:01Z) - Learn from the Past: A Proxy Guided Adversarial Defense Framework with
Self Distillation Regularization [53.04697800214848]
敵対的訓練(AT)は、ディープラーニングモデルの堅牢性を固める上で重要な要素である。
AT方式は、目標モデルの防御のために直接反復的な更新を頼りにしており、不安定な訓練や破滅的なオーバーフィッティングといった障害に頻繁に遭遇する。
汎用プロキシガイド型防衛フレームワークLAST(bf Pbf astから学ぶ)を提案する。
論文 参考訳(メタデータ) (2023-10-19T13:13:41Z) - Adversarial Attacks and Defense for Non-Parametric Two-Sample Tests [73.32304304788838]
本稿では,非パラメトリックTSTの障害モードを逆攻撃により系統的に明らかにする。
TST非依存的な攻撃を可能にするために,異なる種類のテスト基準を協調的に最小化するアンサンブル攻撃フレームワークを提案する。
そこで本研究では,TSTの強化のために,逆対を反復的に生成し,深層カーネルを訓練する最大最小最適化を提案する。
論文 参考訳(メタデータ) (2022-02-07T11:18:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。