論文の概要: Policy-Masked Private Experts: Auditable and Reversible Capability Access Control in Sparse MoE Models
- arxiv url: http://arxiv.org/abs/2608.06690v2
- Date: Tue, 11 Aug 2026 16:07:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.405537
- Title: Policy-Masked Private Experts: Auditable and Reversible Capability Access Control in Sparse MoE Models
- Title(参考訳): 政策決定型民間専門家:スパースMOEモデルにおける可聴性と可逆性アクセス制御
- Authors: Zhuoheng Huang, Mukesh Singh,
- Abstract要約: Policy-Masked Private Expertsは、事前訓練されたスパース・ミックス・オブ・エキスパート(MoE)モデルを凍結し、非結合のエキスパートブランチをトレーニングし、トップkルーティングの前にパブリックまたはプライベートプールを選択する。
Qwen3-30B-A3BとDeepSeek-V2-Liteにおける実行制御とタスクユーティリティの分離をテストする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most language-model access controls regulate behavior while leaving the same computation available to every request. We study a different systems question: can trusted authorization determine which newly trained parameters are reachable by the forward pass? Policy-Masked Private Experts freezes a pretrained sparse Mixture-of-Experts (MoE) model, trains a disjoint expert branch, and selects the public or private pool before top-k routing. The resulting claim is narrow but testable: under the declared trusted computing base (TCB), an unauthorized request executes no private expert. It does not imply that the public model lacks the same semantic capability. We test this separation between execution control and task utility in Qwen3-30B-A3B and DeepSeek-V2-Lite. Three Qwen BF16 seeds update all 32 private experts while the public fingerprint remains unchanged. Across 64 adversarial scenarios and 96 deny/fail-closed events, unauthorized private execution is zero; independent hooks exactly match 11,616 routed private rows and allow-deny-allow recovery is exact. On two prospectively frozen Qwen benchmarks, the private branch improves exact tool use by 5.0 percentage points (pp) (five versus zero discordances; one-sided Holm p = 0.03125, corresponding two-sided exact p = 0.0625) and 21.3 pp (percentile-bootstrap 95% CI [13.3, 29.3], Holm p = 0.000031). Three arm-blinded model evaluators retain a positive external effect of 18.7 pp (95% CI [9.3, 28.0]). A parameter-matched Lora has similar external utility, but a post-hoc request gate leaves 1,225 adapter calls under deny; the disjoint expert branch leaves none. DeepSeek reproduces the route invariant and gains 27.0 pp. A valid sealed evaluation is near-neutral. These results support auditable, reversible control over a trained parameter path, while showing that useful transfer remains distribution dependent.
- Abstract(参考訳): ほとんどの言語モデルアクセス制御は、すべてのリクエストで利用可能な同じ計算を残しながら、振る舞いを制御します。
信頼された認証は、フォワードパスによってどの新しく訓練されたパラメータが到達可能かを決定することができるか?
Policy-Masked Private Expertsは、事前訓練されたスパース・ミックス・オブ・エキスパート(MoE)モデルを凍結し、非結合のエキスパートブランチをトレーニングし、トップkルーティングの前にパブリックまたはプライベートプールを選択する。
宣言された信頼されたコンピューティングベース(TCB)の下では、未承認の要求はプライベートエキスパートを実行しない。
パブリックモデルは、同じセマンティック能力を欠いているという意味ではない。
Qwen3-30B-A3BとDeepSeek-V2-Liteにおける実行制御とタスクユーティリティの分離をテストする。
3つのQwen BF16シードが32人の専門家全員をアップデートし、公開指紋は変更されていない。
64の逆シナリオと96の否定/フェイルクローズイベント、未許可のプライベート実行はゼロであり、独立フックは11,616個のルーティングされたプライベート行と完全に一致する。
予想される2つのQwenベンチマークでは、プライベートブランチは5.0パーセンテージポイント (pp) (5対0不一致、一方のHolm p = 0.03125、対応する両側の正確なp = 0.0625) と21.3 pp (パーセント・ブートストラップ95% CI [13.3, 29.3], Holm p = 0.000031) の正確なツール使用を改善する。
3つの腕翼式モデル評価器は18.7 pp (95% CI [9.3, 28.0]) の正の外部効果を保持する。
パラメータマッチングされたLoraは、同様の外部ユーティリティを持つが、ポストホックリクエストゲートは1,225のアダプタ呼び出しを拒否する。
DeepSeekは経路不変性を再現し、27.0 pp。
有効なシール評価は準中性である。
これらの結果は、トレーニングされたパラメータパスに対する監査可能で可逆的な制御をサポートしながら、有用な転送が分散に依存していることを示す。
関連論文リスト
- SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification [71.9783246097687]
SEERは、ペアローカライゼーション中の候補関係を隠蔽し、明示的な主観的/対象的役割を持つクエリ固有ビューを構築し、補完的な証拠として完全なイメージとスパースボックス幾何学を保持する。
正確な逆サポートを持つ関係選択プロトコルでは、オプションリファインメントがエンティティロールを交換し、正確に1つの視覚状態が対応する逆関係に従う場合にのみ前方決定を変更する。
変更されていないプロトコルは、3つのモデルにまたがる2,434個のフィルター付きEmbSpatialペア関係質問に対して +4.35 から +11.79 を得る。
論文 参考訳(メタデータ) (2026-08-04T13:16:15Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - Reliability-Asymmetric Spacecraft Autonomy: Co-Designing a Capable Learned GNC Stack with a Verified, Adaptation-Aware Runtime Shield [2.28438857884398]
ルールベースの自律性は認証可能であるが不安定であり、学習された自律性は能力があるが検証するのは難しい。
AMPLE-GNCは3層誘導、ナビゲーション、制御スタックである。
文法制約付き復号化による事前訓練された360Mモデルの微調整は、ハードな出力値保証を与える。
我々は,有能な制御器であっても,ラッチングセーフホールドシールドが抑制可能であることを示す。
論文 参考訳(メタデータ) (2026-06-24T03:55:21Z) - Counterfactual Likelihood Tests for Indirect Influence in Private Reasoning Channels [51.56484100374058]
本稿では,私的推論チャネル間の影響を測定するための実証実験について述べる。
この方法は、上流のプライベートブロックを長さマッチングドナーブロックに置き換え、公開トークンシーケンスと下流ターゲットを固定し、下流ターゲットの負のログに似たシフトを測定する。
論文 参考訳(メタデータ) (2026-05-18T20:27:43Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation [40.254835073578484]
AnomalyClawは、トレーニング不要な視覚異常検出剤である。
異常判定を多ラウンドの給油プロセスに変換する。
単一ステップの直接推論よりも一貫したマクロAUROC改善を実現している。
論文 参考訳(メタデータ) (2026-05-11T11:40:07Z) - The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs [52.709361620508595]
ListOPDは、パラメータの5分の1で8B-SFTベースラインで、学生をドメイン内に持ち込む。
Amazon Fashionでは、3つの事前登録テスト — 細粒度崖間隔テスト、小さなクリップのクロス予測 — がロックされた予測ウィンドウ内に落下し、グリッド解像度以下のクローズドフォーム予測に一致する小さなクリップ値が設定されている。
論文 参考訳(メタデータ) (2026-05-09T06:48:00Z) - Beyond Code Reasoning: Specification-Anchored Auditing of Multi-Implementation Distributed Protocols [1.5229705287183657]
SPECAは、明示的で分類されたセキュリティプロパティを自然言語仕様から導き出し、実装間で再利用する監査フレームワークである。
RepoAuditのベンチマークでは、SPECAは100%リコール(F1=0.94)で88.9%の精度に達し、著者が検証した12のバグを地上の真実を超えて表面化している。
Sherlock Fusaka Audit Contest(10のターゲット、366の応募)では、SPECAが専門家が強化した15の脆弱性をすべて回復し、4つの修正確認バグが浮上した。
論文 参考訳(メタデータ) (2026-04-29T09:57:07Z) - Committed SAE-Feature Traces for Audited-Session Substitution Detection in Hosted LLMs [2.6382975801439836]
ホスト型LLMプロバイダにはサイレント代替インセンティブがあり、より強力なモデルを宣伝し、より安価な応答を提供する。
このギャップを埋めるコミットオープンプロトコルを提案する。
プロトコルを3つのバックボーン(Qwen3-1.7B、Gemma-2-2B、およびGemma-2-9Bへの4.5倍スケールアップ)でインスタンス化する。
論文 参考訳(メタデータ) (2026-04-20T12:34:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。