論文の概要: Not to Break, but to Attest: Adversarial Probes for Privacy-Preserving LLM Verification
- arxiv url: http://arxiv.org/abs/2608.27954v2
- Date: Mon, 31 Aug 2026 01:27:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 15:47:04.373618
- Title: Not to Break, but to Attest: Adversarial Probes for Privacy-Preserving LLM Verification
- Title(参考訳): プライバシー保護 LLM の検証に逆境の探究者(動画あり)
- Authors: Cameron Wilding, Mina Shaker, Fatemeh Ganji,
- Abstract要約: 大規模な言語モデルへのデプロイ後の変更は、ルーチン出力をほとんど変更することなく、振る舞いを変更する可能性がある。
本稿では,zk-SNARKをベースとしたプライバシー保護型監査フレームワークを提案する。
- 参考スコア(独自算出の注目度): 1.0323063834827413
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Post-deployment changes to large language models can alter behavior while leaving routine outputs largely unchanged, creating a challenge for AI governance when model weights are proprietary. We present a privacy-preserving zk-SNARK-based audit framework that searches for probes designed in the spirit of adversarial examples to amplify logit drift between an approved model and a modified deployment. Our framework explores complementary probe families under different access models. Token-based probes operate in a black-box setting and require only the input interface, tokenizer, and vocabulary. Embedding-based probes require gray-box access to the embedding interface. Stress probes rely on additional interface capabilities but do not require full white-box access to model weights or architecture. This range allows probe selection to balance sensitivity, access requirements, and deployment cost. We evaluate probe constructions across LLM architectures, model-tampering scenarios representative of post-deployment attacks, and GPU platforms. Importantly, our experimental results demonstrate that token-based probes consistently deliver the strongest mean sensitivity across models and GPU platforms, although operating in a black-box setting. Our Groth16 zk-SNARK workflow remains practical as the probe set scales from 1 to 50, where proving time increases from 1.02 to 1.78 seconds, verification remains near 0.84 seconds, and proof size remains constant.
- Abstract(参考訳): 大規模言語モデルへのデプロイ後の変更は、ルーチン出力をほとんど変更することなく、動作を変更する可能性があるため、モデルウェイトがプロプライエタリな場合には、AIガバナンスの課題が生じる。
本稿では,zk-SNARKをベースとしたプライバシー保護型監査フレームワークを提案する。
我々のフレームワークは、異なるアクセスモデルの下で補完的なプローブファミリーを探索する。
トークンベースのプローブはブラックボックスの設定で動作し、入力インターフェース、トークン化、語彙のみを必要とする。
埋め込みベースのプローブは、埋め込みインターフェースへのグレーボックスアクセスを必要とする。
ストレスプローブは追加のインタフェース機能に依存するが、モデルウェイトやアーキテクチャへの完全なホワイトボックスアクセスを必要としない。
この範囲では、プローブの選択が感度、アクセス要件、デプロイメントコストのバランスを取ることができる。
我々は、LLMアーキテクチャ全体にわたるプローブ構成、デプロイ後攻撃を表すモデルタンパシナリオ、GPUプラットフォームについて評価する。
重要な結果として、トークンベースのプローブがブラックボックス環境で動作しながら、モデルとGPUプラットフォーム間で常に最強の平均感度を提供することを示す。
我々のGroth16 zk-SNARKワークフローは、プローブセットが1から50までスケールし、証明時間は1.02から1.78秒に増加し、検証は0.84秒近くであり、証明サイズは一定である。
関連論文リスト
- CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - EVA-0: Test-Time Model Evolution with Only Two Forward Passes per Sample [55.284129005947484]
厳格な2方向予算の下でテスト時間モデルの進化について検討する。
ゼロオーダーテストタイム最適化における3つの重要な障害を明らかにする。
最小零階適応フレームワーク EVA-0 を提案する。
論文 参考訳(メタデータ) (2026-05-15T09:26:02Z) - Variational Feature Compression for Model-Specific Representations [16.34000934736747]
ディープラーニング推論は、ますます共有およびクラウドベースの設定にデプロイされている。
あるタスクに送信されたデータは、別のタスクのために許可されていないモデルによって再利用される。
指定された分類器の精度を保ちながら、クロスモデル転送を抑制する特徴抽出フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-08T03:34:46Z) - Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test [24.393978712663618]
APIプロバイダは、コスト削減やモデル動作の不正な変更のために、量子化または微調整の亜種を慎重に提供することができる。
そこで我々は,ブラックボックスLLMの挙動等式を局所的に展開した認証モデルに検証できるランクベース均一性試験を提案する。
我々は、量子化、有害な微調整、脱獄プロンプト、完全なモデル置換など、さまざまな脅威シナリオに対するアプローチを評価する。
論文 参考訳(メタデータ) (2025-06-08T03:00:31Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z) - Auditing AI models for Verified Deployment under Semantic Specifications [65.12401653917838]
AuditAIは、解釈可能な形式検証とスケーラビリティのギャップを埋める。
AuditAIは、画素空間の摂動のみを用いた検証の限界に対処しながら、検証と認定トレーニングのための制御されたバリエーションを得られるかを示す。
論文 参考訳(メタデータ) (2021-09-25T22:53:24Z) - Disentangle Your Dense Object Detector [82.22771433419727]
深層学習に基づく高密度物体検出器はここ数年で大きな成功を収め、ビデオ理解などのマルチメディアアプリケーションにも応用されてきた。
しかし、現在の高密度検出器の訓練パイプラインは、保持できない多くの接続に妥協されている。
そこで本研究では, 簡易かつ効果的な遠心分離機構を設計し, 現在の最先端検出器に統合するDED(Disentangled Dense Object Detector)を提案する。
論文 参考訳(メタデータ) (2021-07-07T00:52:16Z) - DAAIN: Detection of Anomalous and Adversarial Input using Normalizing
Flows [52.31831255787147]
我々は、アウト・オブ・ディストリビューション(OOD)インプットと敵攻撃(AA)を検出する新しい手法であるDAINを導入する。
本手法は,ニューラルネットワークの内部動作を監視し,活性化分布の密度推定器を学習する。
当社のモデルは,特別なアクセラレータを必要とせずに,効率的な計算とデプロイが可能な単一のGPUでトレーニングすることが可能です。
論文 参考訳(メタデータ) (2021-05-30T22:07:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。