論文の概要: ENDOPROMPT: Victim-Side Pseudo-References for Utility Degradation
- arxiv url: http://arxiv.org/abs/2609.29948v1
- Date: Thu, 24 Sep 2026 15:08:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:10.041867
- Title: ENDOPROMPT: Victim-Side Pseudo-References for Utility Degradation
- Title(参考訳): ENDOPROMPT:Victim-Side Pseudo-References for Utility Degradation
- Abstract要約: 未ラベル命令からユーティリティ劣化プレフィックスを学習するWhite-box法であるENDOPROMPTを提案する。
清潔な犠牲者の継続は擬似参照として機能し、同じ命令で比較を好み、次に報酬の精製を行い、この信号を発電機に蒸留する。
- 参考スコア(独自算出の注目度): 2.9784302284181354
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Prompt injection can degrade benign task performance without eliciting harmful content. Yet many attack objectives depend on task labels or predefined target responses. We present ENDOPROMPT, a white-box method that learns utility-degrading prefixes from unlabeled instructions. Its generator takes the request text as input. Clean victim continuations serve as pseudo-references: local search identifies prefixes that reduce continuation likelihood, and preference fitting on comparisons within the same instruction, followed by reward refinement, distills this signal into a generator. At deployment, the generator produces one prefix per request without further victim-side search. Across four instruction-tuned models and the complete splits of seven benign benchmarks, ENDOPROMPT yields a mean utility change of -26.8 percentage points; 27 of 28 cells are negative. Failure analysis reveals output expansion and prefix reuse; the controls do not establish a degradation advantage from request matching. Victim-derived supervision can reveal utility weaknesses without benchmark feedback or prescribed failure responses. The code will be released upon acceptance.
- Abstract(参考訳): プロンプト注入は有害な内容を引き出すことなく良質なタスク性能を低下させることができる。
しかし、攻撃目標の多くはタスクラベルや事前に定義されたターゲット応答に依存している。
未ラベル命令からユーティリティ劣化プレフィックスを学習するWhite-box法であるENDOPROMPTを提案する。
ジェネレータはリクエストテキストを入力として取ります。
ローカル検索は、継続可能性を減らす接頭辞を識別し、同じ命令内で比較する好みのフィッティングを行い、次に報酬の精製を行い、この信号をジェネレータに蒸留する。
デプロイ時に、ジェネレータは、さらに犠牲者側で検索することなく、リクエスト毎に1つのプレフィックスを生成する。
4つの命令調整されたモデルと7つの良性ベンチマークの完全な分割で、ENDOPROMPTは-26.8ポイント、28のセルのうち27が負である。
フェール解析は出力の膨張とプレフィックスの再利用を明らかにし、制御はリクエストマッチングによる劣化の優位性を確立しない。
Victimから派生した監視は、ベンチマークフィードバックや所定の障害応答なしで、ユーティリティの弱点を明らかにすることができる。
コードは受理時にリリースされます。
関連論文リスト
- Off-Policy Evaluation for Semantic ID Recommenders: Does the Model's Own Code Hierarchy Help? [1.438318734827691]
遺伝子レコメンデーターは、セマンティックID(SID)をますます発行する
モデル自身のSIDツリーは、そのOPEのアクション抽象化として機能するのか?
条件バイアス境界は、粗いバイアスとノブ量子化器の最悪のケース再構成残差を結びつける。
論文 参考訳(メタデータ) (2026-08-28T22:11:22Z) - ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection [61.4148196085256]
本稿では,信頼という構造概念に根ざしたROPE(Routed Origin Policy Enforcement)について述べる。
提案手法では,(1)軌道の各段階において,攻撃可能コンテンツのみを起点とする値が,原点保護パラメータに到達しない,(2)注入のリワードがない,という2つの保証が認められている。
論文 参考訳(メタデータ) (2026-08-27T01:22:14Z) - SAEFUZZ: Smart Contract Vulnerability Detection through Statically Guided Evolutionary Fuzzing [2.1502962381251147]
本稿では,コードレベルの静的ガイダンスの下でファジテストケースを生成するための軽量な手法を提案する。
仮想機械制御フローグラフを構築し、命令を抽出し、関数セレクタを復元し、読み書きに応じて呼び出し可能な関数を順序付ける。
カバー誘導進化戦略は、実行可能な種子を生成し、評価し、再結合し、突然変異させる。
論文 参考訳(メタデータ) (2026-08-15T10:06:12Z) - One Rewrite to Fix Them All? Type-Aware Repair Allocation for Text-to-Image Prompt Optimization [59.164665622252016]
テキスト・トゥ・イメージ(T2I)ジェネレータは、間違ったカウント、スワップされた属性、あいまいな関係、不可解なテキストを生成し、そのプロンプトに忠実に従わないことが多い。
Prompt最適化は、ユーザプロンプトを書き換えて、ジェネレータの再トレーニングを必要としないことで、このような障害を修復する。
失敗する各命題は、結果のローカル制約が1つの実行可能なプロンプトにコンパイルされる前に、タイプ条件の修復演算子にルーティングされる。
論文 参考訳(メタデータ) (2026-07-21T05:31:43Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Selection Without Signal, Recovery Through Expression: A Measurement Study of Post-Hoc Falsification Operators for Frozen Small Code Models [0.0]
小型のコードモデルは、しばしばプラルーシブル・ブライト・プログラムを出力する。
意味論的ポストホック演算子が役立つかどうかを測定する。
ここで唯一の精度向上である式層リカバリ(M1)は、標準抽出器が破棄した正しいプログラムを復元する。
論文 参考訳(メタデータ) (2026-06-15T17:36:23Z) - Differentiable Semantic ID for Generative Recommendation [65.83703273297492]
生成的推薦は、各項目がリッチコンテンツから学習された個別意味ID(SID)によって表現される新しいパラダイムを提供する。
実際には、SIDはレコメンデーションの正確さよりもコンテンツ再構成に最適化されるのが一般的である。
自然なアプローチは、セマンティックインデックスを差別化して、レコメンデーショングラデーションが直接SID学習に影響を与えるようにすることだ。
本稿では,ジェネレーティブレコメンデーションのための効果的な識別可能なセマンティックIDに向けた第一歩として,DIGERを提案する。
論文 参考訳(メタデータ) (2026-01-27T15:34:11Z) - RoguePrompt: Dual-Layer Ciphering for Self-Reconstruction to Circumvent LLM Moderation [0.0]
本稿では,不正なユーザクエリを自己再構成プロンプトに変換する自動ジェイルブレイク攻撃を提案する。
GPT 4oに対してRoguePromptをインスタンス化し、2 448で評価すると、以前は強く拒否されていた生産モデレーションシステムであることが示唆される。
3つのセキュリティ関連の結果のバイパス、再構築、実行を分離する評価プロトコルの下で、攻撃は84.7%のバイパス、80.2%の再構築、および71.5パーセントの完全な実行を達成した。
論文 参考訳(メタデータ) (2025-11-24T05:42:54Z) - DeRAG: Black-box Adversarial Attacks on Multiple Retrieval-Augmented Generation Applications via Prompt Injection [0.9499594220629591]
アドリシャル・プロンプト・アタックは、レトリーバル・アフュージョンド・ジェネレーション(RAG)システムの信頼性を大きく変える可能性がある。
本稿では, RAGに基づく質問応答に対して, 対角的プロンプト接尾辞を最適化するために, 微分進化(DE)を適用した新しい手法を提案する。
論文 参考訳(メタデータ) (2025-07-20T16:48:20Z) - AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs [51.217126257318924]
大規模言語モデル(LLM)は、不適切または有害なコンテンツの生成につながるジェイルブレイク攻撃に対して脆弱である。
本稿では,AdvPrompter という別の LLM を用いて,人間可読な逆数プロンプトを数秒で生成する手法を提案する。
論文 参考訳(メタデータ) (2024-04-21T22:18:13Z) - Weakly-Supervised Cross-Domain Adaptation for Endoscopic Lesions
Segmentation [79.58311369297635]
異なるデータセットにまたがるトランスファー可能なドメイン不変知識を探索できる,新しい弱い教師付き病巣移動フレームワークを提案する。
wasserstein quantified transferability frameworkは、広い範囲の転送可能なコンテキスト依存性を強調するために開発されている。
新規な自己監督型擬似ラベル生成器は、送信困難かつ転送容易なターゲットサンプルの両方に対して、確実な擬似ピクセルラベルを等しく提供するように設計されている。
論文 参考訳(メタデータ) (2020-12-08T02:26:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。