論文の概要: HoneyRoute: Honeypot-Model Routing for Adversarial LLM Serving
- arxiv url: http://arxiv.org/abs/2609.08306v2
- Date: Wed, 09 Sep 2026 11:05:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.595965
- Title: HoneyRoute: Honeypot-Model Routing for Adversarial LLM Serving
- Title(参考訳): HoneyRoute:Hneypot-Model Routing for Adversarial LLM Serving
- Authors: Han Jin,
- Abstract要約: HoneyRouteは、受信した要求が悪意があるかどうかを検出する推論サービス層である。
敵の相互作用が知性のために継続的に収穫される間、生産を遮蔽する専用のハニーポットモデルにルートする。
- 参考スコア(独自算出の注目度): 0.4822598110892846
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce HoneyRoute, an inference-serving layer that detects whether an incoming request is malicious and, if so, routes it to a dedicated honeypot model, shielding production while the adversary's interaction is continuously harvested for intelligence. Existing defenses embed traps inside model memory or rebuild deception at the protocol layer, leaving the serving tier unprotected and feeding nothing back into detection. HoneyRoute couples (i) a streaming router (a frozen 0.8B-embedding backbone with per-domain MLP heads), (ii) a dual-implementation honeypot (a rule/prompt-engineered code honeypot or a dedicated same-family replica), and (iii) an analysis loop that converts trapped interactions into attacker fingerprints for router retraining. On a production trace plus a seven-domain attack corpus, the router reaches F1=.911 at 38 ms median added latency, matching 96% of a two-tier guard-LLM cascade's F1 at 1/385 of its latency with 0% evasion under 13 adversarial transformations; diverting the malicious share cuts production-model token consumption under concurrent flooding with real GCG-suffix payloads by 97.8%; the trained replica agrees with the production model on 92.9% of benign holdout requests, while naive unconditional bait injection collapses to 7.6% and selective camouflaged injection recovers to 88.9%, mapping the recoverable fidelity-traceability frontier; and a loop-trained correction head cuts misrouting of legitimate security research 9x while raising detection F1 to .933.
- Abstract(参考訳): 我々はHoneyRouteを紹介した。HoneyRouteは、受信した要求が悪意があるかどうかを検知し、もしそうなら、それを専用のハニーポットモデルにルーティングし、敵のインタラクションがインテリジェンスのために継続的に収穫される間に生産を遮蔽する。
既存のディフェンスは、モデルメモリ内にトラップを埋め込むか、プロトコル層に偽装を再構築する。
HoneyRouteのカップル
(i)ストリーミングルータ(ドメインごとのMLPヘッド付きフリーズ0.8B埋め込みバックボーン)
二 二重実装ハニーポット(ルール/プロンプトによるコードハニーポット又は専用同族複製)
三 密閉された相互作用をルータ再訓練のための攻撃指紋に変換する分析ループ。
プロダクショントレースと7ドメイン攻撃コーパスは、38msの中央値でF1=.911に到達し、2層ガードLLMカスケードのF1の96%と、13の逆変換で0%の回避率でレイテンシの1/385と一致し、悪意のあるシェアが実際のGCGサフィックスペイロードと同時洪水で生産モデルトークンの消費を97.8%に減らした。
関連論文リスト
- From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix [55.08143827481755]
200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
論文 参考訳(メタデータ) (2026-09-01T17:39:26Z) - Can escalation channels redirect reward hacking toward defect disclosure? [0.0]
コーディングエージェントは報酬を得ることができます。 出力をハードコーディングしたり、テストファイルを編集して、合法的に満足できないテストをパスします。
コンフリクトの時点でエージェントが利用可能なエスカレーションチャネル,構造化レポートツールを評価した。
2倍の2$Factialは、エスカレーションツール、スタンドアローンの反逆ハックポリシー、およびそれらの組み合わせのコントリビューションを分離する。
論文 参考訳(メタデータ) (2026-08-29T22:39:45Z) - Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits [5.982945107343805]
本報告では,DLLMにおける安全アライメントは,アーキテクチャ全体にわたって疎結合であり,転送可能であることを示す。
完全にオフラインのブラックボックスジェイルブレイクフレームワークであるSN-Guided Diffusionを紹介する。
提案手法は, 量産コストの低減を図り, 競争力の伝達性を向上する。
論文 参考訳(メタデータ) (2026-08-07T17:17:18Z) - Adaptive Intrusion Detection System using Transformer-Based Neural Networks and Continual Learning Approach with Adversarial Investigation [1.90296757424868]
ネットワーク侵入検知システム (IDS) は, 脅威分布のシフトに伴い, 配置後無音で停止する。
リプレイベースの連続学習はこれに反論するが、既存の手法では、ベニティトラフィックを1つの初期タスクに非現実的に限定し、リプレイバッファを潜在的攻撃面として無視する。
より忠実なストレステストとして新しい攻撃と共に良心が流れるクラスインスタンスインクリメンタル(CII)シナリオを導入し、オーバートラベルのフリップとステルスバックドア中毒攻撃でバッファーを探索する。
論文 参考訳(メタデータ) (2026-08-05T09:06:45Z) - MIDS: Detecting Stealthy Masquerade and Tampering Attacks on CAN Bus via Bidirectional Mamba [7.668518582517737]
現在の侵入検知システムは、主に製造スタイルの攻撃に調整されている。
そこで我々は,より硬いemphmasquerade setciteb37設定に対処するため,Mamba Intrusion Detection System (MIDS)を提案する。
MIDSはCAN識別子とペイロードを並列に処理し、その共同時間意味論を再構築する。
論文 参考訳(メタデータ) (2026-06-17T01:57:08Z) - Layerwise Convergence Fingerprints for Runtime Misbehavior Detection in Large Language Models [5.937023024175801]
本稿では,階層間隠れ状態軌跡を健康信号として扱う無チューニングランタイムモニタであるLayerwise Convergence Fingerprinting (LCF)を紹介する。
4つのアーキテクチャ(Llama-3-8B、Qwen2.5-7B、Gemma-2-9B、Qwen2.5-14B)をバックドア、ジェイルブレイク、即時注入で評価した。
論文 参考訳(メタデータ) (2026-04-27T14:38:31Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking [52.72486831074384]
サフィックスベースのジェイルブレイク攻撃は、敵のサフィックス、すなわち短いトークンシーケンスを付加し、LLMを安全でない出力にステアリングする。
提案するTrapSuffixは,推論パイプラインを変更することなく,トラップアラインな動作をベースモデルに注入する,軽量な微調整手法である。
様々なサフィックスベースのジェイルブレイク設定で、TrapSuffixは平均攻撃成功率を0.01%以下に下げ、平均追跡成功率87.9%を達成する。
論文 参考訳(メタデータ) (2026-02-06T11:43:56Z) - ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models [67.15960154375131]
大規模推論モデル(LRM)は、多段階推論トレースを明示した大規模言語モデルを拡張する。
この能力は、推論の高い計算コストを生かした、新しいタイプのプロンプト誘発推論時間拒否攻撃(PI-DoS)を導入している。
本稿では,強化学習に基づくPI-DoSフレームワークであるReasoningBombについて紹介する。
論文 参考訳(メタデータ) (2026-01-29T18:53:01Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。