論文の概要: Reversibility-Verified De-identification for Cloud-Local LLM Inference: A Locally Certified Dehydrate-Rehydrate Loop with Layered Assurance (DR-SL)
- arxiv url: http://arxiv.org/abs/2609.14883v1
- Date: Mon, 14 Sep 2026 01:04:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.025778
- Title: Reversibility-Verified De-identification for Cloud-Local LLM Inference: A Locally Certified Dehydrate-Rehydrate Loop with Layered Assurance (DR-SL)
- Title(参考訳): クラウドローカルLCM推論における可逆性検証による再同定:層状保証(DR-SL)を用いた局所認証脱水回路
- Abstract要約: DR-SL (Dehydrate-Rehydrate with Self-Learning loop) は、脱同定完全性を2つの測定可能な条件として定式化する。
完全局所二分岐検証器は、終了が保証されたレキソグラフィゲートの下で脱水を繰り返す。
ファノ型の低い境界、フグの目撃者、そしてレート・プライバシ・フィージビリティの基準を証明し、その範囲を明確化します。
- 参考スコア(独自算出の注目度): 1.802678437602184
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cloud-local LLM inference must keep sensitive user data on-device while exploiting cloud-grade reasoning, yet existing sanitization approaches (placeholder substitution, differential-privacy perturbation, and skill distillation) lack a release decision that is simultaneously safe and utility-preserving. We propose DR-SL (Dehydrate-Rehydrate with Self-Learning loop), which formalizes de-identification completeness as two measurable conditions: de-identification sufficiency under Pufferfish semantics, and task-information preservation via QA probes. A fully local two-branch verifier iterates dehydration under a lexicographic gate with guaranteed termination, backed by a deterministic hard line, an external strong-attacker re-test, and human fallback. We prove Fano-type lower bounds, a Pufferfish witness, and a rate-privacy feasibility criterion, and state their scope plainly: the bounds certify leakage, never safety, and are near-vacuous at our operating point, so release safety rests on empirical calibration, the hard line, and human review. On a worst-case fully task-coupled benchmark the loop reduces leakage from 0.457 to 0.304 (p approx. 0) and the release chain delivers 0.000 literal leakage at egress (160 instances, two strong attackers), the system degrading to certification-and-routing exactly as the feasibility criterion predicts. On a mixed-coupling benchmark the same safe point releases 67.5% of instances automatically at zero measured leakage, Pareto-dominating placeholder and selective-LDP corners under an identical release rule. Two human studies anchor the semantic utility metric (Spearman rho = 0.839) and the annotation gold (type-level recall at least 0.987). The exploratory self-learning hypothesis was not supported and is reported as such. All theoretical bounds pass numerical verification; code, synthetic datasets, protocol, and human-study packages are public.
- Abstract(参考訳): クラウドローカルなLCM推論は、クラウドグレードの推論を活用しながら、機密性の高いユーザデータをデバイス上に保持しなければならないが、既存の衛生的アプローチ(プレースホルダー置換、微分プライバシー摂動、スキル蒸留)は、同時に安全かつ実用的に保存されるリリース決定を欠いている。
本稿では, DR-SL (Dehydrate-Rehydrate with Self-Learning loop) を提案する。
完全局所的な2分岐検証器は、決定論的ハードライン、外部の強攻撃器の再試験、および人間のフォールバックによって、終了が保証されたレキソグラフィゲートの下における脱水を反復する。
我々は、ファノ型の下限、フグの目撃者、そしてレート・プライバシ・ファシビリティ・クライテリオンを証明し、彼らのスコープを明確に述べる: 境界は漏れを証明し、安全ではない、そして我々の運用点でほとんど空白であるので、リリースの安全性は経験的校正、ハードライン、人間レビューにかかっている。
最悪のケースで完全にタスクを結合したベンチマークでは、ループは0.457から0.304(papprox.0)までリークを減らし、リリースチェーンはexress(160インスタンス、2つの強力な攻撃者)で0.000リテラルリークを提供する。
混合結合ベンチマークでは、同じセーフポイントが自動で67.5%のインスタンスをゼロリーク時に自動的にリリースし、パレート支配のプレースホルダーと選択LDPコーナーを同じリリースルールでリリースする。
セマンティック・ユーティリティ・メトリック (Spearman rho = 0.839) とアノテーション・ゴールド (type-level recall) は少なくとも0.987である。
探索的自己学習仮説は支持されず,そのように報告されている。
すべての理論的境界は数値的な検証をパスし、コード、合成データセット、プロトコル、そして人間の学習パッケージはパブリックである。
関連論文リスト
- Post-Hoc Trajectory-Risk Certification for Modular LLM-Based Security Agents [1.4915002678801434]
ボンフェロニ配置は分布自由であるが,相関誤差下では保守的であることを示す。
粗いラベルの選択は、学習された依存なしにほぼ完璧な相関関係を作ることができる。
ステージ単位の証明書とペアの重なり合うバウンドを用いたモジュール証明書は、正の平均利得が0.6%となる。
論文 参考訳(メタデータ) (2026-08-04T23:48:36Z) - Self-Poisoning in Adaptive Out-of-Distribution Detection: A Sharp-Threshold Theory and Certified Label-Free Calibration [0.0]
テストタイム適応型アウト・オブ・ディストリビューション検出器は、未競合ストリームからメモリバンクを更新する。
この適応は証明可能な力学則に従うことを示す。
ドリフト条件下での相補的な静的校正不全に対して、CDCは、テストされたドリフト影響細胞全てにおいて、名目上のFPRラベルのない状態を回復する。
論文 参考訳(メタデータ) (2026-07-23T09:43:46Z) - Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs [54.96236442484317]
リスクのある知識はモデルに保持でき、特権制御トークンによって行動的に守られることを示す。
Token Inoculation という手法はバインディング・アンド・ブランチ方式を導入している。
論文 参考訳(メタデータ) (2026-07-21T02:15:39Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Verifier-Bound Communication for LLM Agents: Certified Bounds on Covert Signaling [0.0]
言語モデルエージェントを結合することで、ポリシーに準拠したメッセージの調整を表面レベルで隠蔽することができる。
生成と受け入れを分離するプロトコルであるCLBCを提案する。
このプロトコルは、遅延リークと明示的な残留チャネルの観点から、転写リークの上限をいかに高めるかを示す。
論文 参考訳(メタデータ) (2026-02-27T23:42:37Z) - Fundamental Limits of Black-Box Safety Evaluation: Information-Theoretic and Computational Barriers from Latent Context Conditioning [1.9290392443571385]
AIシステムのブラックボックス安全性評価では、テストディストリビューションのモデル動作がデプロイメントのパフォーマンスを確実に予測していると仮定する。
我々は、この仮定を、潜伏した文脈条件のポリシーによって定式化し、挑戦する。
ブラックボックス評価者が配置リスクを確実に見積もることができないという基本的な制限を確立します。
論文 参考訳(メタデータ) (2026-02-19T01:03:11Z) - Conditional Coverage Diagnostics for Conformal Prediction [47.93989136542648]
条件付きカバレッジ推定が分類問題であることを示す。
得られたメトリクスの族をターゲットカバレッジ(ERT)の過剰なリスクと呼びます。
ERTのオープンソースパッケージと、以前の条件付きカバレッジメトリクスをリリースしています。
論文 参考訳(メタデータ) (2025-12-12T18:47:39Z) - Natural Geometry of Robust Data Attribution: From Convex Models to Deep Networks [9.553350856191743]
コンベックスモデルからディープネットワークへ拡張するロバスト属性の統一フレームワークを提案する。
凸設定では、検証可能なカバレッジ保証を備えたW-RIF(Wasserstein-Robust Influence Function)を導出する。
ディープネットワークでは、ユークリッド認証がスペクトル増幅によって空白化されることを実証する。
論文 参考訳(メタデータ) (2025-12-09T20:40:27Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - CertDW: Towards Certified Dataset Ownership Verification via Conformal Prediction [48.82467166657901]
本稿では,最初の認証データセット透かし(CertDW)とCertDWベースの認証データセットオーナシップ検証手法を提案する。
共形予測に触発されて,主確率 (PP) と透かし頑健性 (WR) の2つの統計指標を導入する。
我々は、不審モデルのWR値が、透かしのないデータセットでトレーニングされた良性モデルのPP値を大幅に上回る場合に、PPとWRの間に証明可能な低い境界が存在することを証明した。
論文 参考訳(メタデータ) (2025-06-16T07:17:23Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。