論文の概要: Do System Prompts Leave Behavioral Fingerprints? A Large-Scale Empirical Study of Clone Detection via Output Similarity
- arxiv url: http://arxiv.org/abs/2608.24461v1
- Date: Tue, 25 Aug 2026 12:12:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.962135
- Title: Do System Prompts Leave Behavioral Fingerprints? A Large-Scale Empirical Study of Clone Detection via Output Similarity
- Title(参考訳): システムは行動指紋を残すか? : 出力類似性によるクローン検出の大規模実証研究
- Abstract要約: システムプロンプトのためのBBF(Black-Box Behavioral Fingerprinting)を提案する。
BBFはモデル出力から振る舞いのシグネチャを登録し、後に被疑者のデプロイメントがそのシグネチャと一致するかどうかをテストする。
BBFは非適応的なプロンプトパラフレーズ(AUC $geq 0.889$)に抵抗し、不完全な抽出に頑健である。
- 参考スコア(独自算出の注目度): 12.32748486531306
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: System prompts can be extracted from commercial LLMs with over 80\% success and redeployed at zero cost, yet a prompt owner has no way to verify whether a suspected deployment is a clone. We propose Black-Box Behavioral Fingerprinting (BBF): the prompt owner registers a behavioral signature from model outputs and later tests whether a suspect deployment matches that signature more closely than an unrelated baseline. BBF requires only black-box API access. Through a large-scale study (4 model families, 8 benchmarks, 288{,}000 responses), we find that prompt choice explains 24.4\% of output variance and same-model detection reaches AUC 0.876. Cross-model performance is bounded by detector identity, with off-diagonal AUC ranging from 0.845 (Claude as detector) down to 0.665 (Qwen) and overall mean 0.725. BBF resists non-adaptive prompt paraphrasing (AUC $\geq 0.889$) and is robust to imperfect extraction, but a single-sentence formal-tone prefix can collapse detection on short structured outputs (MNLI 0.978 $\to$ 0.547), isolating style-invariant detection as the key open problem. Diagnostic Query Optimization, a zero-cost query selection rule, adds $+0.120$ to cross-model AUC.
- Abstract(参考訳): システムプロンプトは、80%以上の成功で商用のLCMから抽出され、ゼロコストで再デプロイされるが、プロンプトの所有者は、想定されるデプロイメントがクローンであるかどうかを検証する方法がない。
モデル出力からの動作シグネチャをプロンプト所有者が登録し、その後、疑似デプロイメントが無関係なベースラインよりも近い位置でそのシグネチャと一致するかどうかをテストする。
BBFはブラックボックスAPIのみを必要とする。
大規模な研究(4つのモデルファミリ、8つのベンチマーク、288{,}000の応答)により、迅速な選択は24.4\%の出力分散と同モデル検出がAUC 0.876に達することを説明できる。
クロスモデルの性能は検出器の同一性によって制限されており、対角軸のAUCは0.845 (Claude as detector) から0.665 (Qwen) まで、全体平均は0.725である。
BBFは非適応的プロンプトパラフレーズ (AUC $\geq 0.889$) に抵抗し、不完全抽出に頑健であるが、単一文のフォーマルトーンプレフィックスは短い構造化出力 (MNLI 0.978 $\to$ 0.547) で検出を分解し、鍵となる開問題としてスタイル不変検出を分離する。
コストゼロのクエリ選択ルールである診断クエリ最適化は、クロスモデルAUCに+0.120$を付加する。
関連論文リスト
- The Deception Delta: Adversarial Evaluation of LLM-Based Smart Contract Bytecode Forensics [0.0]
大規模な言語モデルは、ブロックチェーンの法医学的な調査でますます使われている。
逆行性騙しは ドレインの検出を 20.0ポイント減らす
モデルは、隠されたドレインメカニズムを正しく記述するが、契約のフレーミングを受け入れ、それを良心として無視する。
論文 参考訳(メタデータ) (2026-09-12T18:45:24Z) - AgentProv: Auditing Agentic LLM API Providers via Tool-use Policy Probes [38.37599802008238]
商用LLM APIは特定の基盤モデルを宣伝するが、提供されたバックボーンは静かに代用され、定量化され、あるいはラップされることがある。
既存の監査はすべて、テキスト出力チャネルからバックボーンアイデンティティを決定する。
本稿では,AgentProv(AgentProv)について紹介する。
論文 参考訳(メタデータ) (2026-08-30T08:22:12Z) - Selective Disclosure of Hidden Directives in Reasoning Models: Behavioral Asymmetry and Steering [0.9474649136535703]
思考の連鎖(CoT)推論トレースは、AI監視のメカニズムとしてますます提案されている。
これは、CoTが与えられた命令に関係なく、モデルに何を指示するかを仮定する。
この仮定を2つの軸で検証する。
論文 参考訳(メタデータ) (2026-08-29T05:50:54Z) - A Few Neurons Reveal When LLMs Misuse Tools: Sparse Detection and Selective Steering for Reliable Tool Use [28.57781785937644]
PRISMS(Probing Representations In Support of Monitoring and Steering)は,スパース検出とアクティベーションの間に障害特異的ニューロンベースを共有するクローズループフレームワークである。
6つのモデル全体で、PRISMSはプールされたオーバーコール率を80%削減し、ツール要求の精度を14.2%向上させた。
論文 参考訳(メタデータ) (2026-07-31T19:03:44Z) - Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference [22.335515110971475]
ビジュアルトーケンプルーニングは、一定保持予算における応答品質によって判断される。
私たちはこの盲点を、幾何学的トークン・オリジンの証明によってカップルが行動に答えるエビデンスリスク監査にします。
目的検証ポイントがタスク汎用圧縮を含まないことを示す。
論文 参考訳(メタデータ) (2026-07-29T13:45:31Z) - Level, Sharpness, and Corpus: Why Zero-Shot OOD Detector Rankings Do Not Transfer [36.02174685737611]
各検出器は、少なくとも1つのドメインで80%$ FPR95 を超え、所望の検出器は、分配データと基礎となる VLM の両方に依存する。
本稿では, ベース検出器, レベル, シャープネスの非補償融合により, 補完的証拠を保存する検出器非依存ラッパーであるComplementary Evidence Guard(CEG)を紹介する。
論文 参考訳(メタデータ) (2026-07-29T08:00:49Z) - Sensitivity to Subjective Expected Utility Maximization: A Methodological Study, with an Illustrative Application to LLM Decision-Making [0.0]
車両はソフトマックス選択モデルであり、感度パラメータはSEU値の代替品に$$である。
コントリビューションは、$$と、Stansbergで検証された信念とユーティリティパラメータ$(, )$に対する識別可能性の結果のシーケンスである。
2対2のアプリケーションは、実際の選択データに基づいてエンドツーエンドで実行し、4つのセルのうち2つのセルで、構造化された$$エフェクトサンプリングを検出する。
論文 参考訳(メタデータ) (2026-07-08T00:29:18Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - PBT-Bench: Benchmarking AI Agents on Property-Based Testing [29.035258104995204]
PBT-Benchは、40の実際のPythonライブラリにまたがる100のプロパティベースのテスト問題のベンチマークである。
各問題は1つ以上のセマンティックなバグ(総数365、平均3.65)を注入し、デフォルトのストラテジーなランダムな入力がほとんど起こらないように設計する。
PBT指導によるバグリコールは42.1%から83.4%の範囲で、オープンエンドベースラインでは31.4%から76.7%である。
論文 参考訳(メタデータ) (2026-05-13T18:01:05Z) - SELFDOUBT: Uncertainty Quantification for Reasoning LLMs via the Hedge-to-Verify Ratio [0.038379177968040606]
言語モデル推論のための単一パス不確実性フレームワークであるSELFDOUBTを提案する。
私たちのキーシグナルであるHedge-to-Verify Ratio(HVR)は、推論トレースが不確実性マーカーを含むかどうかを検出し、もしそうであれば、明示的な自己チェック行動によってオフセットされているかどうかを検出する。
SELFDOUBTは単一の観測された推論軌道で動作し、任意のプロプライエタリなAPI上でのレイテンシとコスト制約によるデプロイメントに適している。
論文 参考訳(メタデータ) (2026-04-07T19:19:29Z) - AttnDiff: Attention-based Differential Fingerprinting for Large Language Models [17.46604955122771]
textscAttnDiffは本質的な情報収集行動を通じてモデルから指紋を抽出する。
textscAttnDiffは、制御されたセマンティックコンフリクトを誘発する最小限のプロンプトペアをプローブする。
論文 参考訳(メタデータ) (2026-04-07T06:57:47Z) - Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs [71.7892165868749]
LLM(Commercial Large Language Model) APIは基本的な信頼の問題を生み出します。
ユーザーは特定のモデルに課金するが、プロバイダが忠実に提供できることを保証することはない。
我々は,このモデル置換問題を定式化し,現実的な逆条件下での検出方法を評価する。
我々は,信頼された実行環境(TEE)を実用的で堅牢なソリューションとして使用し,評価する。
論文 参考訳(メタデータ) (2025-04-07T03:57:41Z) - Fast-DetectGPT: Efficient Zero-Shot Detection of Machine-Generated Text via Conditional Probability Curvature [33.84718903572477]
大規模言語モデル(LLM)は、流動的でコジェントなコンテンツを生成する能力を示している。
信頼できるAIシステムを構築するためには、マシン生成コンテンツと人間によるコンテンツとを区別することが不可欠である。
Fast-DetectGPTは、ディテクターGPTの摂動ステップを、より効率的なサンプリングステップで置き換える最適化されたゼロショット検出器である。
論文 参考訳(メタデータ) (2023-10-08T11:41:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。