論文の概要: An Empirical Study of Output-to-Input Loops for Black-Box Backdoor Detection in Fine-Tuned Open-Weight LLMs
- arxiv url: http://arxiv.org/abs/2608.11348v1
- Date: Tue, 11 Aug 2026 18:53:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 19:07:54.35453
- Title: An Empirical Study of Output-to-Input Loops for Black-Box Backdoor Detection in Fine-Tuned Open-Weight LLMs
- Title(参考訳): 小型オープンウェイトLLMにおけるブラックボックスバックドア検出のための出力-入力ループの実証的研究
- Authors: Md. Nahid Hasan, Mohammad Arif Hossain,
- Abstract要約: セルフフィーディング(Self-feeding)は、モデル自身の出力を次の入力として返送するブラックボックステスト手法である。
自給自足は6つのモデルのうち5つのバックドアを92.0%の精度で検出する。
数回の起動プロンプトを使用すると、モデルレベルでさらに高い検出が可能となる理由が示されます。
- 参考スコア(独自算出の注目度): 0.5729426778193398
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Anyone can upload a fine-tuned large language model (LLM) to a public repository and claim it is safe. A backdoored model behaves normally on ordinary inputs until a hidden trigger fires, and a user with no training data, clean reference weights, or the trigger phrase has no clear way to check the model before using it. We introduce and empirically evaluate self-feeding, a black-box test method that feeds a model's own output back as its next input, so the text drifts away from the starting prompt and toward the data the model was fine-tuned on. We test self-feeding against a repeated same-prompt baseline on six open-weight LLMs (3B-15B parameters), each fine-tuned with backdoors spanning eleven attack categories, using twenty ordinary starting prompts and chains of up to ten steps. Self-feeding finds backdoors in five of six models at 92.0\% pooled precision, while the same-prompt baseline succeeds on only one of 120 prompt-model pairs; chains that begin with a joke request, an arithmetic question, or a coffee recipe all reach a trigger within a few steps. Recall per prompt is low (19.2\%), and we show why it still adds up to much higher detection at the model level once several starting prompts are used. We also report where the method falls short: one model was never triggered, and self-feeding produced two false positives that the same-prompt baseline cannot produce. Cutting the chains to four steps keeps every model-level detection at 100\% precision while using 60\% fewer queries. Needing only text-level query access and a way to recognize malicious output, self-feeding offers a cheap first check on a downloaded model.
- Abstract(参考訳): 誰でも微調整された大きな言語モデル(LLM)をパブリックリポジトリにアップロードでき、安全であると主張することができる。
バックドアモデルは通常、隠れたトリガーが発火するまで通常の入力で動作し、トレーニングデータ、クリーンな参照ウェイト、あるいはトリガーフレーズを使用する前にモデルをチェックする明確な方法がない。
我々は,モデル自身の出力を次の入力としてフィードバックするブラックボックステスト手法であるセルフフィーディングを導入し,実証的に評価する。
我々は6つのオープンウェイトLDM(3B-15Bパラメータ)の繰り返し同じプロンプトベースラインに対して自給自給自足試験を行い、それぞれ11の攻撃カテゴリにまたがるバックドアを微調整し、20の通常のスタートプロンプトと最大10ステップのチェーンを用いた。
自給自足は6モデルのうち5モデルのうち92.0\%の精度でバックドアを見つけ、同じプロンプトベースラインは120のプロンプトモデルペアのうちの1つで成功する。
プロンプト毎のリコールは低い (19.2\%) ため、いくつかの起動プロンプトを使用すると、モデルレベルでさらに高い検出値が得られる理由が示される。
1つのモデルがトリガーされず、自己摂食によって2つの偽陽性が生成され、同じプロンプトベースラインが生成できない。
チェーンを4ステップに切ることで、すべてのモデルレベルの検出を100倍の精度で保持し、60倍のクエリを使用できます。
テキストレベルのクエリアクセスと悪意のある出力を認識する方法のみを必要とするセルフフィードは、ダウンロードされたモデルに対する安価なファーストチェックを提供する。
関連論文リスト
- A Verifiable Search Is Not a Learnable Chain-of-Thought [0.0]
短いプログラムで解けるタスクは、そのチェーン・オブ・ソートとしてモデルに教えられると仮定する傾向にある。
本稿では,特定可能な手続きのクラスに対して仮定が失敗することを示す。
論文 参考訳(メタデータ) (2026-06-20T04:52:14Z) - Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization [1.0164694825170502]
大きな言語モデル(LLM)エージェントは、レガシーコードを現代的なスタックに移行するのにますます使われています。
バランスの取れた60スニペットのレガシPython-2コーパス上で、7つの異なるファミリーから11のLLMで1,980のリアルタイムモダナイゼーションコールを実行しています。
セマンティック保存ドリフトは、クリーンに制御されたベースラインから広く普及し、鋭く分離可能であることが判明した。
論文 参考訳(メタデータ) (2026-05-20T05:00:31Z) - CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion [9.120160208679133]
本稿では,CLIPモデルのためのバックドア検出手法であるCLIP-Inspector(CI)を紹介する。
CIは、モデルがバックドア動作を示すかどうかを決定するために、クラス毎に可能なトリガを再構築する。
私たちは、CIの再構成されたトリガを使用して、正しくラベル付けされたトリガ入力を微調整することで、モデルを再調整できることを実証した。
論文 参考訳(メタデータ) (2026-04-10T08:33:56Z) - Detecting Semantic Backdoors in a Mystery Shopping Scenario [0.0]
分類モデルにおけるセマンティックバックドアの検出問題に対処する。
クリーントレーニングデータセットとモデルのトレーニングレシピが共に知られていることを前提として,参照モデルプールを提案する。
我々はモデル距離を計算するための様々なアプローチを実験的に分析し、また、プロバイダが検出を避けるためにアダプティブアタックを実行するシナリオをテストする。
論文 参考訳(メタデータ) (2026-01-07T11:04:04Z) - Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models [71.44858461725893]
信頼できない第三者によって微調整されたモデルを考えると、モデルがバックドアで注入されたかどうかが重要で難しい問題である。
既存の検出方法は通常、トレーニングデータセット、バックドアトリガー、ターゲットの事前知識に依存する。
このような事前知識を伴わずに動作する新しいモデルレベルの検出フレームワークであるAssimilation Matters in DETection (AMDET)を紹介する。
論文 参考訳(メタデータ) (2025-11-29T06:20:00Z) - Prompt-Based One-Shot Exact Length-Controlled Generation with LLMs [56.47577824219207]
本稿では,既製の大規模言語モデルを補完して,希望するトークン数を正確に生成するプロンプトベースの戦略を提案する。
プロンプトはカウントダウンマーカーと明示的なカウントルールを付加し、モデルが"カウント中に書き込む"。
MT-Bench-LI では、GPT-4.1 の厳格な長さコンプライアンスは、単純なプロンプトの30%以下から、カウントダウンプロンプトの95%以上へと飛躍する。
論文 参考訳(メタデータ) (2025-08-19T13:12:01Z) - DyePack: Provably Flagging Test Set Contamination in LLMs Using Backdoors [52.85182605005619]
トレーニング中にベンチマークテストセットを使用したモデルを識別するためにバックドアアタックを利用するフレームワークであるDiePackを紹介します。
銀行が染料パックにお金を混ぜて強盗をマークするのと同じように、DiePackはバックドアのサンプルとテストデータとを混ぜて、その上で訓練されたモデルのフラグを立てる。
我々はDiePackを3つのデータセットにわたる5つのモデルで評価し、複数の選択とオープンな生成タスクの両方をカバーした。
論文 参考訳(メタデータ) (2025-05-29T02:22:14Z) - Backdoor Learning on Sequence to Sequence Models [94.23904400441957]
本稿では,シークエンス・ツー・シークエンス(seq2seq)モデルがバックドア攻撃に対して脆弱かどうかを検討する。
具体的には、データセットの0.2%のサンプルを注入するだけで、Seq2seqモデルに指定されたキーワードと文全体を生成することができる。
機械翻訳とテキスト要約に関する大規模な実験を行い、提案手法が複数のデータセットやモデルに対して90%以上の攻撃成功率を達成することを示した。
論文 参考訳(メタデータ) (2023-05-03T20:31:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。