論文の概要: Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces
- arxiv url: http://arxiv.org/abs/2607.00481v1
- Date: Wed, 01 Jul 2026 06:08:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.745085
- Title: Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces
- Title(参考訳): プロンプトの向こう:シミュレート・モデレーション・トレースによる脱獄機能ケーリングLDM
- Abstract要約: 大規模言語モデル(LLM)の安全なデプロイにとって、ジェイルブレイク攻撃は依然として重要な脅威である
このプロンプト中心のパラダイムは、ステートフルで関数呼び出し環境における構造的脆弱性を見落としていることを示す。
我々は、シミュレートされたモデレーショントレースに基づくブラックボックス攻撃フレームワークであるSMTを通じて、このアーキテクチャ欠陥を利用する。
- 参考スコア(独自算出の注目度): 32.850551109913845
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Jailbreak attacks remain a critical threat to the safe deployment of large language models (LLMs). While prior work has primarily studied attacks and defenses at the prompt level, we show that this prompt-centric paradigm overlooks a structural vulnerability in stateful, function-calling environments. In such applications, developer-defined schemas, structured arguments, and untrusted tool outputs are interleaved into a single shared model context. This architecture expands the attack surface by blurring the boundary between trusted control logic and untrusted data, allowing adversarial intent to be distributed across a multi-turn execution path. We exploit this architectural flaw through SMT, a black-box attack framework based on Simulated Moderation Traces. Departing from purely prompt-based interactions, SMT constructs a multi-turn trajectory that simulates a legitimate moderation-auditing workflow. Within this trajectory, a fabricated moderation frame leverages red-team testing as a pretext to elicit harmful generations. The subsequent validation feedback treats safety refusals as execution failures, prompting refinements that gradually weaken the model's safety constraints and ultimately trigger harmful outputs. Extensive empirical evaluations on prominent commercial LLMs from five different providers across two standardized safety benchmarks show that SMT consistently achieves the highest average attack success rate and HarmScore while requiring a near-minimal number of queries, substantially outperforming existing baselines. These findings demonstrate that prompt-level sanitization alone is fundamentally insufficient for defending tool-enabled LLM systems and highlight the urgent need for context-aware validation across schemas, arguments, tool outputs, and accumulated conversation state. The code is available at https://github.com/liujlong27/SMT.
- Abstract(参考訳): 大規模な言語モデル(LLM)の安全なデプロイにとって、ジェイルブレイク攻撃は依然として重要な脅威である。
これまでの研究は主に攻撃や防御を即時レベルで研究してきたが、このプロンプト中心のパラダイムは、ステートフルで関数呼び出し環境における構造的脆弱性を見落としている。
このようなアプリケーションでは、開発者定義スキーマ、構造化された引数、信頼できないツールアウトプットが単一の共有モデルコンテキストにインターリーブされる。
このアーキテクチャは、信頼できない制御ロジックと信頼できないデータの境界を曖昧にすることで、攻撃面を拡張する。
我々は、シミュレートされたモデレーショントレースに基づくブラックボックス攻撃フレームワークであるSMTを通じて、このアーキテクチャ欠陥を利用する。
純粋にプロンプトベースの相互作用から離れ、SMTは正統なモデレーション監査ワークフローをシミュレートするマルチターン軌道を構築する。
この軌道内では、製造されたモデレーションフレームは、有害な世代を誘導する前提として、レッドチームテストを利用する。
その後の検証フィードバックは、安全性の拒絶を実行上の障害として扱い、モデルの安全性の制約を徐々に弱め、最終的に有害な出力をトリガーする改善を促す。
2つの標準安全ベンチマークの5つの異なるプロバイダによる商業用LLMの大規模な評価は、SMTが平均的な攻撃成功率を一貫して達成し、HarmScoreがほぼ最小のクエリ数を必要とし、既存のベースラインよりも大幅に上回っていることを示している。
これらの結果から, ツール対応LLMシステムを保護するためには, 即時衛生だけでは根本的に不十分であり, スキーマ, 引数, ツールアウトプット, 蓄積された会話状態に対して, コンテキスト認識による検証が緊急に必要であることが明らかとなった。
コードはhttps://github.com/liujlong27/SMTで公開されている。
関連論文リスト
- RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models [54.53236295237077]
リポジトリレベルのコード推論を評価するベンチマークであるRepoReasonerを紹介します。
出力予測は、ファイル間でのきめ細かいステートフルな実行推論を計測します。
Call Chain Predictionは、ノイズの多いコンテキスト下での高レベルのアーキテクチャ依存性の理解を評価する。
論文 参考訳(メタデータ) (2026-07-28T17:12:41Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Prompt Attack Detection with LLM-as-a-Judge and Mixture-of-Models [0.0]
プロンプト攻撃は、大規模言語モデルシステムに重大なセキュリティリスクをもたらす。
運用においては、ガードレールは厳格な低遅延制約の下でこれらの攻撃を軽減する必要がある。
本研究では, LLM がライブガードレールの有効低遅延判定に有効であることを示す。
論文 参考訳(メタデータ) (2026-03-26T08:47:53Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - ClawTrap: A MITM-Based Red-Teaming Framework for Real-World OpenClaw Security Evaluation [1.3259530543819007]
既存のベンチマークは主に静的設定サンドボックスとコンテンツレベルのプロンプト攻撃に焦点を当てている。
我々は、実世界のOpenClawセキュリティ評価のためのtextbfMITM ベースのred-teaming フレームワーク textbfClawTrap を提案する。
論文 参考訳(メタデータ) (2026-03-19T11:14:45Z) - CyberLLM-FINDS 2025: Instruction-Tuned Fine-tuning of Domain-Specific LLMs with Retrieval-Augmented Generation and Graph Integration for MITRE Evaluation [0.054619385369457214]
本研究は,Gemma-2Bモデルをドメイン固有のサイバーセキュリティLLMに微調整する手法を提案する。
本稿では,データセット作成,微調整,合成データ生成のプロセスについて詳述するとともに,脅威検出,法医学的調査,および攻撃解析における実世界の応用への示唆について述べる。
論文 参考訳(メタデータ) (2026-01-11T05:07:57Z) - Multi-Stage Prompt Inference Attacks on Enterprise LLM Systems [18.039444159491733]
エンタープライズ環境にデプロイされる大規模言語モデル(LLM)は、新たなセキュリティ課題に直面している。
敵同士が連携して、徐々に機密データを抽出するように仕向ける。
企業LLMコンテキストにおける多段階的プロンプト推論攻撃の包括的研究について述べる。
論文 参考訳(メタデータ) (2025-07-21T13:38:12Z) - The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs [39.85609149662187]
DLLMのユニークな安全性の弱点を生かした、最初の系統的な研究および脱獄攻撃フレームワークであるDIJAを提案する。
提案するDIJAは,dLLMのテキスト生成機構を利用した対向的インターリーブ・マスクテキストプロンプトを構築する。
本研究は, 新たな言語モデルにおいて, 安全アライメントの再考の必要性を浮き彫りにするものである。
論文 参考訳(メタデータ) (2025-07-15T08:44:46Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - MIRAGE: Multimodal Immersive Reasoning and Guided Exploration for Red-Team Jailbreak Attacks [85.3303135160762]
MIRAGEは、物語駆動型コンテキストとロール没入を利用して、マルチモーダル大規模言語モデルにおける安全性メカニズムを回避する新しいフレームワークである。
最先端のパフォーマンスを達成し、最高のベースラインよりも攻撃成功率を最大17.5%向上させる。
役割の浸漬と構造的セマンティック再構築は、モデル固有のバイアスを活性化し、モデルが倫理的保護に自発的に違反することを実証する。
論文 参考訳(メタデータ) (2025-03-24T20:38:42Z) - AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting [54.931241667414184]
textbfAdaptive textbfShield Promptingを提案する。これは、MLLMを構造ベースのジェイルブレイク攻撃から守るための防御プロンプトで入力をプリペイドする。
我々の手法は、構造に基づくジェイルブレイク攻撃に対するMLLMの堅牢性を一貫して改善することができる。
論文 参考訳(メタデータ) (2024-03-14T15:57:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。