論文の概要: Composable Trust for Language Models: A proven boundary and a measured defense
- arxiv url: http://arxiv.org/abs/2607.13149v1
- Date: Tue, 14 Jul 2026 18:01:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.544321
- Title: Composable Trust for Language Models: A proven boundary and a measured defense
- Title(参考訳): 言語モデルのための構成可能な信頼:実証された境界と測定された防御
- Authors: Yakov Pyotr Shkolnikov,
- Abstract要約: 私たちは、モデル外で行動する権限を置く信頼モデルを構築します。
ソースの立ち位置は内容ではなく、どの操作が実行され、それが機能するかを決定する。
低信頼のソースは、回答を通知するが、上位のソースをオーバーライドしない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In a language model, instructions and data share one token stream, so nothing inside the model's generation can keep untrusted text from steering it. We develop a trust model that places the authority to act outside the model, in code: a source's standing, not its content, decides which operation runs and whether it acts. A lower-trust source may inform an answer but not override a higher one. An unmodified model runs inside a deterministic pipeline that ranks inputs by source integrity, and a fixed non-model monitor provably chooses the operation and any outside action from trusted inputs alone. We can measure but not prove the pipeline's resistance to injection; we prompt-tune it and report the rate. On a one-shot held-out set with an unmodified Gemma~4 26B model, passivation and a wrapper (the cascade) raise the genuine-leak defended rate from $27\%$ to $94\%$ at roughly a $4\%$ clean-quality cost ($Q_{\mathrm{rel}}{=}0.96$). Under adaptive red-teaming the proved boundary holds unconditionally, and the measured defense stays at $87\%$. The cascade also attributes a lower-trust source's fact rather than dropping it, raising attribution from $0\%$ to $92\%$, and follows the higher-trust source on a conflict.
- Abstract(参考訳): 言語モデルでは、命令とデータは1つのトークンストリームを共有するため、モデルの世代内では信頼できないテキストがそれを管理できない。
我々は、モデル外で行動する権限をコードに配置する信頼モデルを開発する。ソースの立ち位置は、コンテンツではなく、どの操作を実行し、どの動作を行うかを判断する。
低信頼のソースは、回答を通知するが、上位のソースをオーバーライドしない。
修正されていないモデルは、ソース整合性によって入力をランク付けする決定論的パイプライン内で動作し、固定された非モデルモニターは信頼された入力のみから操作と外部アクションを確実に選択する。
パイプラインのインジェクションに対する抵抗を計測することはできるが、証明できない。
修正されていないGemma~426Bモデルによるワンショットホールトアウトセットでは、パスベーションとラッパー(カスケード)が真にリークした防御レートを、約$4\%のクリーンなコスト(Q_{\mathrm{rel}}{=}0.96$)で27\%から$94\%に引き上げる。
適応的なレッドチームの下では、証明された境界は無条件に保持され、測定された防御費は8,7\%である。
カスケードは、それを捨てるのではなく、低いトラストソースの事実を特徴としており、コンフリクトに関する高信頼ソースに従って、0\%$から922\%$へと属性を引き上げている。
関連論文リスト
- A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints [6.057587531186626]
目的指向エージェントが生成し、破壊し、交換する価値は、情報と同じカテゴリの法的構造量であることを示す。
価格がフレームに依存していない間、価値はフレーム相対的であり、そのリソースをプールし、その知覚を融合する艦隊が天井を継承する。
論文 参考訳(メタデータ) (2026-06-10T16:11:04Z) - Epistemic Observability in Language Models [0.0]
製造時に高い信頼性を報告できるモデルがあることがわかりました。
正式な仮定では、これは能力ギャップではなく観察的なギャップである。
我々は,計算副産物を輸出することで不合理性から逃れるテンソルインタフェースを構築した。
論文 参考訳(メタデータ) (2026-03-20T21:59:34Z) - Certifiably Robust Model Evaluation in Federated Learning under Meta-Distributional Shifts [8.700087812420687]
異なるネットワーク "B" 上でモデルの性能を保証する。
我々は、原則付きバニラDKWバウンダリが、同じ(ソース)ネットワーク内の未確認クライアント上で、モデルの真のパフォーマンスの認証を可能にする方法を示す。
論文 参考訳(メタデータ) (2024-10-26T18:45:15Z) - Uncertainty in Language Models: Assessment through Rank-Calibration [65.10149293133846]
言語モデル(LM)は、自然言語生成において有望な性能を示している。
与えられた入力に応答する際の不確実性を正確に定量化することは重要である。
我々は、LMの確実性と信頼性を評価するために、Rank$-$Calibration$と呼ばれる斬新で実用的なフレームワークを開発する。
論文 参考訳(メタデータ) (2024-04-04T02:31:05Z) - Releasing Inequality Phenomenon in $\ell_{\infty}$-norm Adversarial Training via Input Gradient Distillation [66.5912840038179]
最近の研究では、(ell_infty)-norm対逆訓練(ell_infty)-AT)が不均一な入力勾配を誘導することが明らかとなった。
この現象は(ell_infty)-norm-norm訓練されたモデルを標準訓練モデルよりも脆弱にする。
本稿では,不等式を$ell_infty$-ATで解放するために,IGD (Input Gradient Distillation) という簡易かつ効果的な方法を提案する。
論文 参考訳(メタデータ) (2023-05-16T09:23:42Z) - On Provable Copyright Protection for Generative Models [9.812666469580872]
生成モデルは、トレーニングセットにあるいくつかの著作権データ$C$と実質的に類似したサンプルを出力することができる。
我々は、$textitnear access-freeness (NAF)$の正式な定義を与え、この定義を満たすモデルが$C$と似たサンプルを出力する確率の有界性を証明する。
また、生成モデル学習アルゴリズムも提供し、生成モデル学習アルゴリズムをブラックボックス方式で効率的に修正する。
論文 参考訳(メタデータ) (2023-02-21T18:34:51Z) - MOVE: Effective and Harmless Ownership Verification via Embedded External Features [104.97541464349581]
本稿では,異なる種類のモデル盗難を同時に防ぐために,効果的かつ無害なモデル所有者認証(MOVE)を提案する。
我々は、疑わしいモデルがディフェンダー特定外部特徴の知識を含むかどうかを検証し、所有権検証を行う。
次に、メタ分類器をトレーニングして、モデルが被害者から盗まれたかどうかを判断します。
論文 参考訳(メタデータ) (2022-08-04T02:22:29Z) - Defending against Model Stealing via Verifying Embedded External
Features [90.29429679125508]
トレーニングサンプルがなく、モデルパラメータや構造にアクセスできない場合でも、敵はデプロイされたモデルを盗むことができる。
我々は、不審なモデルがディフェンダー特定遠近法の特徴の知識を含んでいるかどうかを検証することによって、他の角度からの防御を探索する。
本手法は, 複数段階の盗難処理によって盗難モデルが得られた場合でも, 同時に異なる種類の盗難モデルを検出するのに有効である。
論文 参考訳(メタデータ) (2021-12-07T03:51:54Z) - Learnable Boundary Guided Adversarial Training [66.57846365425598]
私たちは、あるクリーンモデルからのモデルロジットを使用して、別のロバストモデルの学習をガイドします。
我々は、CIFAR-100上で、追加の実データや合成データなしで、新しい最先端のロバスト性を実現する。
論文 参考訳(メタデータ) (2020-11-23T01:36:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。