論文の概要: No More, No Less: Least-Privilege Language Models
- arxiv url: http://arxiv.org/abs/2601.23157v1
- Date: Fri, 30 Jan 2026 16:42:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-02 18:28:15.566576
- Title: No More, No Less: Least-Privilege Language Models
- Title(参考訳): No more, No Less: Least-Privilege Language Models
- Abstract要約: 我々は、コンピュータシステムにおける最小特権からインスピレーションを得て、最小特権言語モデルと呼ばれるモデルのクラスを定義します。
配置時制御をモニタ・アロケータ・エンフォースラスタックとして形式化し、(i)要求時信号を分離し、(ii)特権を割り当てる決定ルールと(iii)特権を選択する推論時機構を分離する。
- 参考スコア(独自算出の注目度): 43.748379918040854
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Least privilege is a core security principle: grant each request only the minimum access needed to achieve its goal. Deployed language models almost never follow it, instead being exposed through a single API endpoint that serves all users and requests. This gap exists not because least privilege would be unhelpful; deployments would benefit greatly from reducing unnecessary capability exposure. The real obstacle is definitional and mechanistic: what does "access" mean inside a language model, and how can we enforce it without retraining or deploying multiple models? We take inspiration from least privilege in computer systems and define a class of models called least-privilege language models, where privilege is reachable internal computation during the forward pass. In this view, lowering privilege literally shrinks the model's accessible function class, as opposed to denying access via learned policies. We formalize deployment-time control as a monitor-allocator-enforcer stack, separating (i) request-time signals, (ii) a decision rule that allocates privilege, and (iii) an inference-time mechanism that selects privilege. We then propose Nested Least-Privilege Networks, a shape-preserving, rank-indexed intervention that provides a smooth, reversible control knob. We show that this knob yields policy-usable privilege-utility frontiers and enables selective suppression of targeted capabilities with limited collateral degradation across various policies. Most importantly, we argue for a new deployment paradigm that challenges the premise that language models can only be controlled at the output level.
- Abstract(参考訳): 各要求に対して、その目標を達成するために必要な最小限のアクセスのみを許可する。
デプロイされた言語モデルは、ほとんど従わないが、代わりに、すべてのユーザとリクエストを処理する単一のAPIエンドポイントを通じて公開される。
このギャップは、最小限の特権が不完全なためではなく、不要な機能露出を減らすことで、デプロイメントが大きな恩恵を受けるだろう。
は、言語モデルの中で何を意味するのか、そして、複数のモデルを再トレーニングしたりデプロイしたりすることなく、どうやってそれを強制できるのか?
我々は、コンピュータシステムにおける最小特権からインスピレーションを得て、最短特権言語モデルと呼ばれるモデルのクラスを定義します。
この観点では、学習されたポリシーによるアクセスを拒否するのとは対照的に、特権の低下は文字通りモデルのアクセス可能な関数クラスを縮小する。
我々は、配置時間制御をモニター・アロケータ・エンフォースラスタックとして形式化し、分離する。
(i)要求時信号
二 特権を付与する決定規則及び
三 特権を選択する推論時機構
次に、スムーズで可逆的な制御ノブを提供する形状保存型ランク付き介入であるNested Least-Privilege Networksを提案する。
このノブは, 政策適用可能な特権利用フロンティアとなり, 各種政策を横断的に限定して, 目標能力の選択的抑制を可能にする。
最も重要なことは、言語モデルが出力レベルでのみ制御できるという前提に挑戦する、新しいデプロイメントパラダイムについて論じることです。
関連論文リスト
- Toward Open Weight Models Without Risks: Separating Public and Private Capabilities in LLMs [27.546429876997873]
階層型言語モデル(TLM)は複数の能力レベルをサポートする。
鍵となる設定は、新しい言語を習得し、命令追従能力を獲得し、プライベートな事実知識を記憶することができることを示す。
認証は入力空間ではなくモデルの重み構造で動作するため、この機構は微調整に基づく抽出と部分鍵妥協に抵抗する。
論文 参考訳(メタデータ) (2026-06-19T17:44:22Z) - Do Coding Agents Understand Least-Privilege Authorization? [14.240332406666779]
我々は、現在のモデルが認証境界自体を推測できるかどうか検討する。
We show that frontier model often off permissions by the execution chain while giving unuseed or sensitive accesss。
そこで我々は,まずカバレッジ指向のポリシを生成し,各エントリをグラウンドと感度で監査する,十分性-高度分解法を提案する。
論文 参考訳(メタデータ) (2026-05-14T14:05:58Z) - Switching Successor Measures for Hierarchical Zero-shot Reinforcement Learning [49.24483784910263]
我々は、強化学習における階層的制御を可能にする後継尺度である切替後継尺度を導入する。
後継策の切り替えは,その構造を保ちながら,古典的後継措置から自然に生じることを示す。
FB$-Switchは非階層的ベースラインよりも改善されている。
論文 参考訳(メタデータ) (2026-05-13T08:58:33Z) - FORTIS: Benchmarking Over-Privilege in Agent Skills [68.34663362794069]
2段階にわたるエージェントスキルの過剰な特権を評価するベンチマークを提案する。
過剰に特権化された行動は例外ではなく規範であることがわかった。
その結果、エージェント動作を含むスキル層は、それ自体が現在のシステムにおける特権エスカレーションの主要な源であることを示唆している。
論文 参考訳(メタデータ) (2026-05-09T20:57:18Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - Stop Tracking Me! Proactive Defense Against Attribute Inference Attack in LLMs [61.15237978606501]
大規模言語モデルは、ユーザ生成テキストからプライベートなユーザー属性を推測することができる。
既存の匿名化ベースの防御は粗く、プライバシーを優先する要素を匿名化する際に単語レベルの精度が欠如している。
細粒度匿名化(TRACE)と推論防止最適化(RPS)を組み合わせた統合防衛フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-12T03:37:50Z) - Better Privilege Separation for Agents by Restricting Data Types [6.028799607869068]
大規模言語モデル(LLM)のタイプ指向特権分離を提案する。
我々は、信頼できないコンテンツをキュレートされたデータ型に変換することによって、LDMがサードパーティのデータと対話する能力を制限する。
生文字列とは異なり、各データ型はスコープとコンテントに制限されており、プロンプトインジェクションの可能性を排除している。
論文 参考訳(メタデータ) (2025-09-30T08:20:50Z) - Leveraging Constraint Violation Signals For Action-Constrained Reinforcement Learning [13.332006760984122]
ACRL(Action-Constrained Reinforcement Learning)は、ポリシーネットワークの後にプロジェクション層を用いて行動を修正する。
近年,潜在変数と実行可能行動の異なるマッピングを学習するために,生成モデルを訓練する手法が提案されている。
論文 参考訳(メタデータ) (2025-02-08T12:58:26Z) - Can Reinforcement Learning Unlock the Hidden Dangers in Aligned Large Language Models? [3.258629327038072]
大規模言語モデル(LLM)は、自然言語処理における印象的な機能を示している。
しかし、これらのモデルによって有害なコンテンツを生成する可能性は持続しているようだ。
本稿では,LLMをジェイルブレイクし,敵の引き金を通したアライメントを逆転させる概念について検討する。
論文 参考訳(メタデータ) (2024-08-05T17:27:29Z) - Steering Without Side Effects: Improving Post-Deployment Control of Language Models [61.99293520621248]
言語モデル(LM)は、デプロイ後予期せず振る舞うことが示されている。
KL-then-steer (KTS) は, その利点を保ちながら, 操舵の副作用を低減する技術である。
本手法はLlama-2-chat-7Bモデルと比較して44%のジェイルブレイク攻撃を防ぐ。
論文 参考訳(メタデータ) (2024-06-21T01:37:39Z) - What does CLIP know about peeling a banana? [0.9969273676833554]
知的なロボットが日々の生活の物体を使えるようにするためには、必要なタスクに応じて物体を分割できることが不可欠だ。
従来の割当セグメンテーションのための教師付き学習手法は、高価なピクセルレベルのアノテーションを必要とする。
本稿では,大規模な事前学習型ビジョンランゲージモデルに埋め込まれた暗黙のアベイランス知識を活用することで,これらの制約を克服するAffordanceCLIPを提案する。
論文 参考訳(メタデータ) (2024-04-18T09:06:05Z) - Tuning-Free Accountable Intervention for LLM Deployment -- A
Metacognitive Approach [55.613461060997004]
大規模言語モデル(LLM)は、自然言語処理タスクの幅広い領域にわたる変換的進歩を触媒している。
我々は,自己認識型誤り識別と訂正機能を備えたLLMを実現するために,textbfCLEARと呼ばれる革新的なテキストメタ認知手法を提案する。
論文 参考訳(メタデータ) (2024-03-08T19:18:53Z) - Foundation Policies with Hilbert Representations [54.44869979017766]
ラベルなしオフラインデータから一般ポリシーを事前学習するための教師なしフレームワークを提案する。
我々の重要な洞察は、基盤となる環境の時間的構造を保存する構造的表現を学習することである。
実験の結果、教師なしのポリシーは、ゴール条件付きおよび一般のRLタスクをゼロショットで解決できることがわかった。
論文 参考訳(メタデータ) (2024-02-23T19:09:10Z) - Just Fine-tune Twice: Selective Differential Privacy for Large Language
Models [69.66654761324702]
本稿では,大規模なトランスフォーマーベース言語モデルのためのSDPを実現するための,シンプルで効果的なジャストファイントゥンツースプライバシ機構を提案する。
実験により, カナリア挿入攻撃に対して頑健でありながら, 高い性能が得られた。
論文 参考訳(メタデータ) (2022-04-15T22:36:55Z) - OpenPrompt: An Open-source Framework for Prompt-learning [59.17869696803559]
PLM上でのプロンプト学習を行うための統一的な使いやすさツールキットであるOpenPromptを提案する。
OpenPromptは、効率性、モジュール性、拡張性を備えた、リサーチフレンドリーなフレームワークである。
論文 参考訳(メタデータ) (2021-11-03T03:31:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。