論文の概要: Self-Reflection Fine-Tuning: Enhancing Agent Security against Prompt Injection Attacks from Failure Experience
- arxiv url: http://arxiv.org/abs/2610.04269v1
- Date: Sat, 03 Oct 2026 03:45:44 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:39:36.23063
- Title: Self-Reflection Fine-Tuning: Enhancing Agent Security against Prompt Injection Attacks from Failure Experience
- Title(参考訳): セルフリフレクションファインチューニング: 障害経験からのプロンプトインジェクション攻撃に対するエージェントセキュリティの強化
- Abstract要約: Self-Reflection Fine-Tuning(SRFT)は、エージェントが自身の障害経験から学習することで堅牢性を向上させるためのトレーニングフレームワークである。
我々はこのフレームワークをLlama-3.1-8B-InstructとQwen3-8B上に構築したSR-Agentでインスタンス化し、静的および適応的なプロンプトインジェクションベンチマークで評価する。
- 参考スコア(独自算出の注目度): 83.9792313419956
- License:
- Abstract: Large language model (LLM) agents are increasingly deployed in tool-augmented environments, but their reliance on external inputs makes them highly vulnerable to prompt injection attacks that can hijack task objectives. Existing safety alignment methods rely on static expert trajectories or preference optimization, limiting their ability to generalize to adaptive attack patterns. In this work, we propose Self-Reflection Fine-Tuning (SRFT), a training framework that enables agents to improve robustness by learning from their own failure experiences under adversarial conditions. Instead of passively imitating expert behaviors, SRFT exposes the agent to compromised trajectories constructed via injected attacks, and leverages an expert model to generate structured self-reflection reasoning that contrasts unsafe and optimal actions. This reflective supervision teaches the agent to identify malicious instructions, reason about their consequences, and maintain alignment with the original user intent. We instantiate this framework in SR-Agent, built on Llama-3.1-8B-Instruct and Qwen3-8B, and evaluate it on both static and adaptive prompt injection benchmarks. Experimental results show that SRFT substantially reduces attack success rates while preserving task performance, and demonstrates strong generalization under adaptive attacks. These findings suggest that learning from failure via self-reflection is a promising direction for building robust and secure LLM agents. Our code is released at https://github.com/Eden-Wang1710/srft-repo.
- Abstract(参考訳): 大きな言語モデル(LLM)エージェントは、ツール拡張された環境にますますデプロイされているが、外部入力への依存により、タスクの目的をハイジャックする可能性のあるインジェクション攻撃に対して、非常に脆弱である。
既存の安全アライメント手法は静的な専門家の軌跡や好みの最適化に依存しており、適応的な攻撃パターンに一般化する能力を制限している。
本研究では,自己修正ファインチューニング(SRFT)を提案する。これはエージェントが,敵条件下での障害経験から学習することで,堅牢性を向上させるためのトレーニングフレームワークである。
SRFTは、専門家の行動を受動的に模倣する代わりに、注射された攻撃によって構築された妥協された軌跡にエージェントを露出させ、専門家モデルを活用して、安全で最適な行動とは対照的な構造化自己回帰推論を生成する。
この反射的監督は、エージェントに悪意のある指示を識別し、その結果を判断し、元のユーザ意図と整合性を維持するように教える。
我々はこのフレームワークをLlama-3.1-8B-InstructとQwen3-8B上に構築したSR-Agentでインスタンス化し、静的および適応的なプロンプトインジェクションベンチマークで評価する。
実験の結果,SRFTはタスク性能を保ちながら攻撃成功率を大幅に低減し,適応攻撃下での強力な一般化を示すことがわかった。
これらの結果から, 自己回帰による失敗からの学習は, 堅牢でセキュアなLSMエージェントを構築する上で有望な方向であることが示唆された。
私たちのコードはhttps://github.com/Eden-Wang1710/srft-repo.comで公開されています。
関連論文リスト
- Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing [1.4033701678475552]
評価駆動型ルーティングアーキテクチャであるANTAPを導入する。
ANTAPは、記述ベースのルータベースラインでは67.3%以上であるのに対して、記述ベースのインジェクション攻撃に対してほぼゼロのASRを実現している。
論文 参考訳(メタデータ) (2026-06-29T16:51:06Z) - Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents [93.19140872946842]
大規模言語モデル(LLM)によって駆動されるWebエージェントは、現実の環境にますますデプロイされる。
これにより、一見良質なコンテンツがエージェントの振る舞いを操作する敵の命令を埋め込む、プロンプト・インジェクション・アタックに対して脆弱になる。
実世界のWebエージェントシステムにおいて,損害を体系的に分類し,属性付けするベンチマークである textbfsysname を導入する。
論文 参考訳(メタデータ) (2026-06-11T14:12:43Z) - IterInject: Indirect Prompt Injection Against LLM Agents via Feedback-Guided Iterative Optimization [33.58630045185762]
既存の攻撃は、エージェント固有の防御に適応できない静的ペイロードに依存している。
インジェクション,診断,診断のループを閉じるフィードバック誘導反復型フレームワークである oursys を導入する。
ステップは、失敗パターンから新しい偽の種を生成し、戦略空間を自己進化させる。
論文 参考訳(メタデータ) (2026-05-23T17:00:06Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Beyond Explicit Refusals: Soft-Failure Attacks on Retrieval-Augmented Generation [25.27360087818357]
既存のRAG(Retrieval-Augmented Generation)システムに対する妨害攻撃は、明示的な拒絶やサービス拒否行動を引き起こす。
我々は,このようなソフト障害を引き起こすために,敵対的文書を生成する自動ブラックボックス攻撃フレームワークであるDeceptive Evolutionary Jamming Attack (DEJA)を提案する。
実験によると、DJAは低実用性ソフト障害に対する応答を一貫して推進し、SASRを79%以上達成し、ハードフェイル率を15%以下に維持している。
論文 参考訳(メタデータ) (2026-04-20T12:33:52Z) - AttriGuard: Defeating Indirect Prompt Injection in LLM Agents via Causal Attribution of Tool Invocations [38.49666480491258]
LLMエージェントは間接プロンプト注入(IPI)に対して非常に脆弱である
本稿では,特定のツールコールが生成される理由を問うことでエージェントをセキュアにする,アクションレベルの因果属性という新しいパラダイムを提案する。
我々はこのパラダイムを、並列対実テストに基づくランタイムディフェンスであるAttriGuardでインスタンス化する。
論文 参考訳(メタデータ) (2026-03-11T13:23:46Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Visual Backdoor Attacks on MLLM Embodied Decision Making via Contrastive Trigger Learning [89.1856483797116]
MLLMをベースとした組込みエージェントに視覚的バックドアを注入する最初のフレームワークであるBEATを紹介する。
テキストトリガーとは異なり、オブジェクトトリガーは視点や照明の幅が広いため、確実に移植することは困難である。
BEATは攻撃の成功率を最大80%まで達成し、強い良識のあるタスクパフォーマンスを維持します。
論文 参考訳(メタデータ) (2025-10-31T16:50:49Z) - Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails [103.05296856071931]
本稿では,自己進化型大規模言語モデル(LLM)エージェントに特有の,アライメント・ティッピング・プロセス(ATP)を同定する。
ATPは、連続的な相互作用によってエージェントが訓練中に確立されたアライメント制約を放棄し、強化された自己関心の戦略を支持するときに生じる。
実験の結果、アライメントの利点は自己進化の下で急速に低下し、最初は整合性のない状態に収束したモデルであることが判明した。
論文 参考訳(メタデータ) (2025-10-06T14:48:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。