論文の概要: Climbing the Hill: Prompt Injection Red-Teaming Against Frontier Models with Curriculum Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.33628v1
- Date: Sun, 27 Sep 2026 14:44:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.681223
- Title: Climbing the Hill: Prompt Injection Red-Teaming Against Frontier Models with Curriculum Reinforcement Learning
- Title(参考訳): 丘を登る: カリキュラム強化学習によるフロンティアモデルに対する再チーム化の試行
- Abstract要約: コールドスタート問題に対処するカリキュラムベースの手法を提案する。
GPT-5.6-Luna, GPT-5.6-Terra on AgentDynに対して93.8%, 45.0%の攻撃成功率(ASR@10)を達成することができる。
- 参考スコア(独自算出の注目度): 27.95512264817793
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prompt injection is a leading security risk for LLMs and LLM-based applications such as agents. State-of-the-art red-teaming methods for prompt injection leverage reinforcement learning (RL) to train an attacker LLM to generate effective injected prompts. However, when targeting frontier LLMs such as GPT-6-Luna, a major challenge is the cold-start problem: every attack attempt by the attacker LLM fails and thus receives zero reward, providing no signal for learning. In this work, we propose a curriculum learning-based method to address the cold-start problem. In particular, we propose to train the attacker LLM against a sequence of increasingly robust target LLMs, with each stage warm-starting from the attacker LLM obtained in the previous one. However, simply training against a weak target (e.g., GPT-4o-mini) may not sufficiently prepare the attacker LLM to obtain useful learning signals against a frontier LLM (e.g., GPT-5.6-Terra). Instead, we find that the design of the curriculum is critical: after each stage, the attacker LLM needs to partially succeed against the next target LLM such that it can learn from successful attempts to attack the new target. Our extensive evaluation shows that our method can effectively red-team frontier LLMs, achieving an attack success rate (ASR@10) of 93.8\% and 45.0\% against GPT-5.6-Luna and GPT-5.6-Terra on AgentDyn, whereas state-of-the-art RL methods such as RL-Hammer and PISmith achieve 0\% ASR under the same setting. Moreover, we find that the attacker LLM transfers across targets, e.g., an attacker LLM trained to defeat one strong LLM (GPT-5.6-Terra) also succeeds against six other frontier LLMs (e.g., GPT-6-Luna) it was never trained on. Our code is available at \href{https://github.com/albert-y1n/PIForge}{here}.
- Abstract(参考訳): プロンプトインジェクションは、LLMやエージェントのようなLLMベースのアプリケーションにとって、主要なセキュリティリスクである。
プロンプトインジェクションのための最先端のレッドチーム方式では、強化学習(RL)を利用して攻撃者のLSMを訓練し、効果的なインジェクションプロンプトを生成する。
しかし、GPT-6-Luna のようなフロンティアの LLM を狙う場合、大きな課題はコールドスタートの問題である。
本研究では,コールドスタート問題に対処するカリキュラムベースの手法を提案する。
特に,攻撃者LLMを,攻撃者LLMから暖かく開始する段階において,より堅牢な目標LLMのシーケンスに対してトレーニングすることを提案する。
しかし、弱い目標(例: GPT-4o-mini)に対する訓練だけでは、攻撃者LSMがフロンティアLSM(例: GPT-5.6-Terra)に対する有用な学習信号を得るために十分な準備ができない。
その代わり、カリキュラムの設計は重要であり、各段階の後に攻撃者が次の目標のLSMに対して部分的に成功し、新たな目標の攻撃を成功させることで学習する必要がある。
我々は,エージェントDynのGPT-5.6-LunaとGPT-5.6-Terraに対して93.8\%,45.0\%の攻撃成功率(ASR@10)を達成するとともに,RL-Hammer や PISmith といった最先端のRL手法が同一条件下で0\%のASRを達成することができることを示す。
さらに、攻撃者が目標をまたいでLSM転送を行う場合、例えば、1つの強力なLSM(GPT-5.6-Terra)を打ち負かすように訓練されたLSMが、訓練されたことのない6つのフロンティアLSM(例えば、GPT-6-Luna)に対して成功していることがわかった。
私たちのコードは \href{https://github.com/albert-y1n/PIForge}{here} で利用可能です。
関連論文リスト
- Look Before You Leap: Enhancing Attention and Vigilance Regarding Harmful Content with GuidelineLLM [53.79753074854936]
大規模言語モデル(LLM)は、出現するジェイルブレイク攻撃に対してますます脆弱である。
この脆弱性は現実世界のアプリケーションに重大なリスクをもたらす。
本稿では,ガイドラインLLMという新しい防御パラダイムを提案する。
論文 参考訳(メタデータ) (2024-12-10T12:42:33Z) - MaPPing Your Model: Assessing the Impact of Adversarial Attacks on LLM-based Programming Assistants [14.947665219536708]
本稿では,攻撃者がプログラムタスクのプロンプトに少量のテキストを付加するMalicious Programming Prompt(MaPP)攻撃を紹介する。
我々の迅速な戦略は、LSMが他の方法で正しいコードを書き続けながら脆弱性を追加する可能性があることを示しています。
論文 参考訳(メタデータ) (2024-07-12T22:30:35Z) - Prompt Leakage effect and defense strategies for multi-turn LLM interactions [95.33778028192593]
システムプロンプトの漏洩は知的財産を侵害し、攻撃者に対する敵の偵察として機能する可能性がある。
我々は, LLM sycophancy 効果を利用して, 平均攻撃成功率 (ASR) を17.7%から86.2%に高めるユニークな脅威モデルを構築した。
7つのブラックボックス防衛戦略の緩和効果と、漏洩防止のためのオープンソースモデルを微調整する。
論文 参考訳(メタデータ) (2024-04-24T23:39:58Z) - Uncovering Safety Risks of Large Language Models through Concept Activation Vector [13.804245297233454]
大規模言語モデル(LLM)に対する攻撃を誘導する安全概念活性化ベクトル(SCAV)フレームワークについて紹介する。
そこで我々は,攻撃プロンプトと埋め込みレベルの攻撃の両方を生成できるSCAV誘導攻撃法を開発した。
本手法は,トレーニングデータが少なくなるとともに,攻撃成功率と応答品質を著しく向上させる。
論文 参考訳(メタデータ) (2024-04-18T09:46:25Z) - PAL: Proxy-Guided Black-Box Attack on Large Language Models [55.57987172146731]
大規模言語モデル(LLM)は近年人気が高まっているが、操作時に有害なコンテンツを生成する能力を示している。
PAL(Proxy-Guided Attack on LLMs)は, ブラックボックスクエリのみの設定で, LLMに対する最初の最適化ベースの攻撃である。
GPT-3.5-Turboの攻撃成功率は84%,Llama-2-7Bの攻撃成功率は48%であった。
論文 参考訳(メタデータ) (2024-02-15T02:54:49Z) - Bypassing the Safety Training of Open-Source LLMs with Priming Attacks [3.8023902618391783]
本稿では,SOTA オープンソース LLM の脆弱性を,単純かつ最適化不要な攻撃下で検討する。
提案攻撃は,Llama Guardが測定した有害行動に対する攻撃成功率を,ベースラインと比較して最大3.3倍向上させる。
論文 参考訳(メタデータ) (2023-12-19T16:47:12Z) - MART: Improving LLM Safety with Multi-round Automatic Red-Teaming [72.2127916030909]
本稿では,自動対向的なプロンプト書き込みと安全な応答生成の両方を組み込んだMulti-round Automatic Red-Teaming(MART)手法を提案する。
敵のプロンプトベンチマークでは、安全アライメントが制限されたLDMの違反率は、MARTの4ラウンド後に84.7%まで減少する。
特に、非敵対的なプロンプトに対するモデルの有用性は反復を通して安定しており、LLMは命令に対する強い性能を維持していることを示している。
論文 参考訳(メタデータ) (2023-11-13T19:13:29Z) - LLM Self Defense: By Self Examination, LLMs Know They Are Being Tricked [19.242818141154086]
大規模言語モデル(LLM)は高品質なテキスト生成に人気がある。
LLMは人的価値に合わせても有害なコンテンツを生成できる。
我々は、これらの攻撃を防御するための簡単なアプローチであるLSM Self Defenseを提案する。
論文 参考訳(メタデータ) (2023-08-14T17:54:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。