論文の概要: Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs
- arxiv url: http://arxiv.org/abs/2607.27951v1
- Date: Thu, 30 Jul 2026 09:59:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.500418
- Title: Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs
- Title(参考訳): コピー可能なコンテキストに基づく安全対策はLLMの信頼性を損なうものではない
- Authors: Pingyu Wu, Lingyao Zhu, Weiming Zhang, Nenghai Yu,
- Abstract要約: 大規模な言語モデルのセーフガードは、答えがどのように使われるかを見る前に、答えるかどうかを決定する。
同じ回答は、認定されたプロフェッショナルやアタッカーを助け、攻撃者は、良心的な要求とインタラクション履歴を模倣することができる。
我々は、下流での使用に関する証拠からモデルがリリースした能力を分離する。その証拠がコピー可能である場合、有効な回答を保ちながら、アタッカー支援の正確な最悪のフロアを導出する。
- 参考スコア(独自算出の注目度): 61.39153106347947
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large language model safeguards decide whether to answer before seeing how an answer will be used. This creates a basic problem for dual-use tasks: the same answer can help an authorized professional or an attacker, while an attacker can imitate a benign request and interaction history. We separate the capability released by the model from the evidence available about downstream use. When that evidence is copyable, we derive the exact worst-case floor on attacker assistance while preserving useful answers. The result yields a safety trilemma: Useful Capability, Reliable Safety, and Open Access cannot coexist. We then show how a trusted credential can complement existing safeguards by adding hard-to-copy information that predicts actual downstream use, and identify the stronger condition needed to eliminate the floor. Evidence from dual-use evaluations, adaptive attacks, and deployed trusted-access programs supports the practical relevance of these conditions.
- Abstract(参考訳): 大規模な言語モデルのセーフガードは、どのように答えが使われるかを見る前に、答えるかどうかを決定する。
同じ回答は、認定されたプロフェッショナルやアタッカーを助け、攻撃者は、良心的な要求とインタラクション履歴を模倣することができる。
私たちは、モデルによってリリースされた機能と、下流での使用に関する証拠を分離します。
その証拠がコピー可能であれば、アタッカー支援の正確な最悪のフロアを導き、有用な回答を保存します。
有用能力、信頼性、オープンアクセスは共存できない。
次に、信頼されたクレデンシャルが、下流での実際の使用を予測するハード・ツー・コピー情報を追加し、フロアを除去するために必要な強い条件を特定することによって、既存の安全対策を補完する方法を示す。
デュアルユース評価、アダプティブアタック、デプロイされた信頼アクセスプログラムからの証拠は、これらの条件の実践的関連性を支持する。
関連論文リスト
- Defeater Cards: Characterizing and Managing Safety Assurance Case Defeaters [4.510181955306307]
安全保証のケースは、安全クリティカルなシステムが安全要件を満たすような構造化された正当化を提供する。
近年、敗者の概念は、安全議論の妥当性に挑戦する厳格な手段として浮上している。
本論文は,安全事例における敗者の体系的特徴付け,推論,管理を行うための,新たな構造化ドキュメントアーティファクトであるDefeater Cardsを提案する。
論文 参考訳(メタデータ) (2026-06-09T21:33:07Z) - AgentSecBench: Measuring Prompt Injection, Privacy Leakage, and Tool-Use Integrity in LLM Agents [0.2864713389096699]
本稿では,AgentSecBenchを,この問題に対する正式なセキュリティフレームワークの実証的なインスタンス化として紹介する。
3つのゲーム・インストラクション・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)を定めている。
これは、承認された観察と能力に対するプロジェクションとしてのアプリケーションポリシーを表し、プロジェクションの即時アノテーションとプロジェクションの強化を区別し、敵のアドバンテージと、防衛が生成前に関連するモデル可視チャネルを閉鎖するかどうかを計測する。
論文 参考訳(メタデータ) (2026-05-25T18:53:22Z) - Benchmarking Misuse Mitigation Against Covert Adversaries [80.74502950627736]
既存の言語モデルの安全性評価は、オーバースト攻撃と低レベルのタスクに重点を置いている。
我々は、隠蔽攻撃と対応する防御の評価を自動化するデータ生成パイプラインである、ステートフルディフェンスのためのベンチマーク(BSD)を開発した。
評価の結果,分解攻撃は有効な誤用防止剤であり,その対策としてステートフルディフェンスを強調した。
論文 参考訳(メタデータ) (2025-06-06T17:33:33Z) - Towards Copyright Protection for Knowledge Bases of Retrieval-augmented Language Models via Reasoning [58.57194301645823]
大規模言語モデル(LLM)は、現実のパーソナライズされたアプリケーションにますます統合されている。
RAGで使用される知識基盤の貴重かつしばしばプロプライエタリな性質は、敵による不正使用のリスクをもたらす。
これらの知識基盤を保護するための透かし技術として一般化できる既存の方法は、一般的に毒やバックドア攻撃を含む。
我々は、無害な」知識基盤の著作権保護の名称を提案する。
論文 参考訳(メタデータ) (2025-02-10T09:15:56Z) - Gandalf the Red: Adaptive Security for LLMs [2.9422902813085665]
大規模言語モデル(LLM)アプリケーションにおける即時攻撃に対する防衛の現在の評価は、敵の行動の動的性質と、制限された防御によって正統なユーザに対して課されるユーザビリティの罰の2つの重要な要素を見落としている。
攻撃者を正当なユーザから明確に分離し、マルチステップインタラクションをモデル化し、最適化可能な形式でセキュリティユーティリティを表現するD-SECを提案する。
論文 参考訳(メタデータ) (2025-01-14T08:30:49Z) - Certifying LLM Safety against Adversarial Prompting [70.96868018621167]
大規模言語モデル(LLM)は、入力プロンプトに悪意のあるトークンを追加する敵攻撃に対して脆弱である。
我々は,認証された安全保証とともに,敵のプロンプトを防御する最初の枠組みである消去・チェックを導入する。
論文 参考訳(メタデータ) (2023-09-06T04:37:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。