論文の概要: Evaluating and Improving the Robustness of Large Language Models to Input Sequence Variations
- arxiv url: http://arxiv.org/abs/2610.02432v1
- Date: Thu, 01 Oct 2026 19:57:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.072435
- Title: Evaluating and Improving the Robustness of Large Language Models to Input Sequence Variations
- Title(参考訳): 入力シーケンス変動に対する大言語モデルのロバスト性の評価と改善
- Abstract要約: この論文は、逆入力シーケンスの変動に対するロバスト性の評価と改善のためのモデル、方法、アルゴリズムを開発する。
局所攻撃に対しては、V(h) = 1 - R_class(h) を証明し、ここで R_class(h) は、決定演算子 h がその決定を小さな摂動の下で保持する確率である。
非局所攻撃に対しては経験的モデルを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) in production systems face prompt injections, trojans (backdoors), and manipulation of automatic quality metrics. This thesis develops models, methods, and algorithms for evaluating and improving LLM robustness to adversarial input sequence variations. We propose R_stab(f), a generative robustness metric based on the Jensen-Shannon divergence between per-step output distributions under small input perturbations. For localized attacks we prove V(h) <= 1 - R_class(h), where R_class(h) is the probability that a decision operator h keeps its decision under small perturbations. For non-localized attacks we propose a calibrated empirical model. For LLM-as-a-Judge systems we develop ASA, an adaptive evolutionary black-box attack that reaches an attack success rate (ASR) of up to 73.8%, with transfer between open models up to 62.6%. On Trojan Detection Challenge 2023 data (Pythia-1.4B), surrogate triggers reach REASR ~0.99 while recall of the true triggers is ~0.17 against a baseline of ~0.14. On SaTML CTF 2024 we systematize four classes of bypasses of multi-layer defenses, which reduce the ASR from 90% to 15-25%. Committees of 5-7 heterogeneous models reduce the ASR for Gemma-3-4B by 47-55 percentage points, to 19.3% with 7 models. For agentic systems based on the Model Context Protocol (MCP), we propose AttestMCP, which attests tool calls with HMAC-protected packets at under 0.1 ms per call, and the Commit Boundary isolation pattern. On the MCPBench benchmark of 847 scenarios they reduce the average ASR from 53.7% to 12.4%. The methods are implemented in the JudgeGuard and TrojanArmor software suites and the MCPSec module.
- Abstract(参考訳): プロダクションシステムにおける大規模言語モデル(LLM)は、プロンプトインジェクション、トロイの木馬(バックドア)、自動品質メトリクスの操作に直面する。
この論文は、逆入力シーケンスの変動に対するLCMロバスト性の評価と改善のためのモデル、手法、アルゴリズムを開発する。
本稿では,小さな入力摂動下でのステップ毎の出力分布間のJensen-Shannon分散に基づく生成ロバスト性指標R_stab(f)を提案する。
局所攻撃に対しては、V(h) <= 1 - R_class(h) を証明します。
非局所攻撃に対しては、校正実験モデルを提案する。
LLM-as-a-Judgeシステムでは、最大73.8%の攻撃成功率(ASR)に達する適応的な進化的ブラックボックス攻撃であるASAを開発し、最大62.6%のオープンモデル間での転送を行う。
2023年のトロイの木馬検出チャレンジ(Pythia-1.4B)では、サロゲートトリガーはREASR ~0.99に到達し、真のトリガーのリコールは~0.17でベースラインは~0.14である。
SaTML CTF 2024では、多層防御の4種類のバイパスをシステム化し、ASRを90%から15-25%に削減した。
ヘテロジニアスモデル5-7の委員会は、Gemma-3-4BのASRを47-55ポイント減らし、7モデルで19.3%に減らした。
モデルコンテキストプロトコル(MCP)に基づくエージェントシステムに対して,HMAC保護パケットによるツールコールを1コールあたり0.1ms以下で証明するAttestMCPと,Commit境界分離パターンを提案する。
MCPBenchベンチマークでは、847のシナリオで平均的なASRを53.7%から12.4%に下げている。
これらの方法は、JiceGuardとTrojanArmorのソフトウェアスイートとMPPSecモジュールで実装されている。
関連論文リスト
- Decoy Direction Optimization: A Post-Hoc Defense Against LLM Abliteration [37.700303596218184]
RFA(Refusal Feature Ablation)を用いたオープンウェイト言語モデルの安全ガードレールのバイパス
本稿では,DDO(Decoy Direction Optimization)について紹介する。
この効果を定式化するスペクトル境界を証明し、6つのモデルファミリーでDDOを評価し、標準RFA下で10%のASRを達成する。
論文 参考訳(メタデータ) (2026-09-14T18:36:35Z) - Models for minimalist RAG: B1ade 335M Embedding and 1B Parameter Small Language Models [2.1665689529884697]
本稿では,コンパクトな埋め込みモデルと汎用SLMの2つのコンポーネントからなる効率的なRAGアーキテクチャであるB1adeについて述べる。
5つの事前訓練エンコーダのパラメータフリー融合により構築された335Mパラメータ検索モデルであるB1ade-embedは、追加トレーニングをゼロとした500M未満モデルの上位MTEBスコアを達成する。
B1ade-1Bは42.4%の反応で回収された通路を引用し、トレーニング分布の寄与率を5.5ポイント上回っている。
論文 参考訳(メタデータ) (2026-07-29T22:41:25Z) - A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents [0.0]
専門的エージェント軌道上のオープンウェイトLSMの微調整が、有能なコードエージェントを構築するための顕著なアプローチとして現れている。
本稿では,SWEトラジェクトリデータセット上でのQwen2.5-Coder-7B-InstructのLoRA微調整のためのトラジェクトリデータフィルタリングの系統的研究について述べる。
我々は,2軸品質評価フレームワークである効率とスタイルを提案し,戦略,スケール,アブレーション分析にまたがる16の制御実験を通じて評価する。
論文 参考訳(メタデータ) (2026-07-19T11:52:32Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - What Matters For Safety Alignment? [38.86339753409445]
本稿では,AIシステムの安全アライメント能力に関する総合的研究について述べる。
本研究では,6つの重要な内在モデル特性と3つの外部攻撃手法の影響を系統的に検討し,比較した。
LRMs GPT-OSS-20B, Qwen3-Next-80B-A3B-Thinking, GPT-OSS-120Bを最も安全な3つのモデルとして同定した。
論文 参考訳(メタデータ) (2026-01-07T12:31:52Z) - Replicating TEMPEST at Scale: Multi-Turn Adversarial Attacks Against Trillion-Parameter Frontier Models [0.0]
本研究では、TEMPESTマルチターン攻撃フレームワークを用いて、1000の有害な振る舞いに対して8つのベンダーから10のフロンティアモデルを評価する。
6つのモデルが96%から100%の攻撃成功率(ASR)を達成し、4つのモデルが有意な抵抗を示し、ASRは42%から78%であった。
論文 参考訳(メタデータ) (2025-12-08T00:30:40Z) - No Query, No Access [50.18709429731724]
被害者のテキストのみを使用して動作する textbfVictim Data-based Adrial Attack (VDBA) を導入する。
被害者モデルへのアクセスを防止するため、公開されている事前トレーニングモデルとクラスタリングメソッドを備えたシャドウデータセットを作成します。
EmotionとSST5データセットの実験によると、VDBAは最先端の手法より優れており、ASRの改善は52.08%である。
論文 参考訳(メタデータ) (2025-05-12T06:19:59Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z) - G$^2$uardFL: Safeguarding Federated Learning Against Backdoor Attacks
through Attributed Client Graph Clustering [116.4277292854053]
Federated Learning (FL)は、データ共有なしで協調的なモデルトレーニングを提供する。
FLはバックドア攻撃に弱いため、有害なモデル重みがシステムの整合性を損なう。
本稿では、悪意のあるクライアントの識別を属性グラフクラスタリング問題として再解釈する保護フレームワークであるG$2$uardFLを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:15:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。