論文の概要: Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Data-Free Quality Guard Yet Invent Procedure Steps in Agentic Execution
- arxiv url: http://arxiv.org/abs/2607.28196v1
- Date: Thu, 30 Jul 2026 13:33:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.578293
- Title: Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Data-Free Quality Guard Yet Invent Procedure Steps in Agentic Execution
- Title(参考訳): 厳格に圧縮されたLCMは、すべてのデータフリー品質ガードをパスするが、エージェント実行の手順を発明する
- Abstract要約: 専門家は、データチープの品質ガードのスタックをクリアすると、圧縮された言語モデルを受け入れる。
3つのモデルファミリーにまたがって、優雅に圧縮されたモデルはすべてのガードをクリアし、指示にはない手順を発明した。
我々は,事前登録されたパワーカナリア上で,信頼区間のペア化による盲点と解離を特徴付ける。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Practitioners accept a compressed language model once it clears a stack of data-cheap quality guards: perplexity within a small factor of the original, downstream accuracy (for example MMLU) inside a confidence interval, and data-free output-fidelity signals that compare the compressed and original network's internal representations under random probe inputs. This stack has a blind spot. Across three model families, gently-compressed models clear every guard and then invent procedure steps that were never in the instructions when they run a standard operating procedure (SOP) as an agent. The effect is operator-specific: coherent low-rank (SVD) truncation induces it, and magnitude pruning matched to the same perplexity does not. One dissociation isolates the cause. The same compressed weights that CI-win a paired output-fidelity test CI-fail the invented-step canary. The governing axis is the coherence of the compression error times its rate; the magnitude of the damage does not predict it. The data-free fidelity probe is a fidelity oracle by construction, so it cannot see this axis. We characterize the blindspot and dissociation with paired confidence intervals on a pre-registered, powered canary across three architectures. Operator-specificity replicates on all three, and the perplexity-guard evasion appears where the model admits in-guard low-rank headroom. We then give a data-free screen: a two-axis statistic of the compression error (coherent-fraction and error-rate) that flags the failing builds with fixed thresholds across architectures and matches the coherence-times-rate mechanism. Perplexity, MMLU, and fidelity acceptance do not certify agent safety. Screen gently-compressed low-rank builds before agentic deployment
- Abstract(参考訳): データチープ品質ガードのスタックをクリアすると、圧縮された言語モデルを受け入れる:元の精度の小さな要素におけるパープレキシティ、信頼区間内のダウンストリーム精度(例えばMMLU)、圧縮されたネットワークと元のネットワークの内部表現をランダムなプローブ入力で比較するデータフリーな出力忠実性信号である。
このスタックには盲点があります。
3つのモデルファミリ全体において、優雅に圧縮されたモデルはガードをクリアし、標準の操作手順(SOP)をエージェントとして実行するときに命令にない手順を発明する。
コヒーレント・ローランク(SVD)トランカチオン(英語版)はそれを誘導し、大きさのプルーニングは同じパープレキシティと一致しない。
1つの解離が原因を分離する。
圧縮重量はCIがペアの出力忠実度テストに勝つのと同じで、CIは発明されたステップカナリアをフェールさせる。
支配軸は圧縮誤差の速度のコヒーレンスであり、損傷の大きさはそれを予測しない。
データフリー忠実度プローブは、構成上は忠実度オラクルであるので、この軸は見ることができない。
3つのアーキテクチャにまたがる、登録済みのパワーカナリア上で、ペアの信頼区間で盲点と解離を特徴付ける。
オペレータ特異性は3つすべてで複製され、パープレキシティガードの回避はモデルがインガードローランクのヘッドルームを許容する時に現れる。
次に、データフリーの画面を与えます:圧縮エラー(コヒーレント・フレクションとエラー・レート)の2軸統計により、フェールビルドをアーキテクチャ全体にわたって一定のしきい値でフラグ付けし、コヒーレンス・タイム・レートのメカニズムにマッチさせる。
パープレキシティ、MMLU、フィデリティの受け入れは、エージェントの安全性を証明しない。
スクリーンを優しく圧縮した低ランクビルドをエージェントデプロイ前に実行する
関連論文リスト
- Data Diversity, Not Frequency Invariance: A Controlled and Self-Audited Study of Compression-Robust Deepfake Detection [0.26856688022781555]
周波数特徴と圧縮不変表現学習は、ビデオ圧縮に耐えるディープフェイク検出の鍵であると広く考えられている。
本稿では, CAFRL - block-DCT および FFT-phase ストリーム, 圧縮レベル条件付き帯域アテンション, 逆(逆)圧縮でこれを検証する。
キャパシティと拡張整合制御を備えた事前登録されたプロトコルの下では、マルチ品質データに対するプレーンなEfficientNet-B0が、各圧縮レベルで指定されたCAFRLを上回った。
論文 参考訳(メタデータ) (2026-08-26T12:05:10Z) - ADeptS-Bench: Measuring the Trustworthiness of Computer Use Agents Across Devices [48.36933831982682]
我々はADEPTS機能フレームワークを基盤とした信頼性ベンチマークであるADeptS-Benchを紹介する。
Safetyストリームは、視覚インターフェースに埋め込まれた脅威を伴うペアの良心/悪意のあるタスクを提供する。
曖昧さストリームは、意図が曖昧である場合、エージェントが明確化を求めるかどうかを評価する。
論文 参考訳(メタデータ) (2026-08-25T23:21:57Z) - Decoder-Preserving Sparse Autoencoders: Which Readouts Survive Sparse Compression? [0.0]
我々は,この曖昧さを最適リッジ予測演算子と列車復号器保存SAE間の行列値歪みとして定式化する。
制御されたスパース実験は、宣言された事前がタスクサブスペースから保持された組み合わせを保護していることを示している。
これらの結果から,どのリフィットされたリニアリードアウトがスパース圧縮に耐えるかは,再構成品質が決定できないことが示唆された。
論文 参考訳(メタデータ) (2026-07-19T22:19:17Z) - Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models [0.0]
我々は、制御権威行動を伴うプロンプトアクションモデルとして、誘導されたシステムを定式化する。
共有パイプライン内では,SFC(Semantic-Faithful Control)が実現不可能であることを示す。
根本原因とそれが要求するソリューションのクラスを特定します。
論文 参考訳(メタデータ) (2026-06-25T21:52:29Z) - What Accuracy and Gradient Cosine Miss: Evaluating Feedback Alignment via Scale Stability, Reference Validity, and Depth Utility [48.10132234701036]
本稿では,3つのチェック(スケール安定性,参照妥当性,深度ユーティリティ)に基づく診断評価プロトコルを提案する。
複数のアーキテクチャや手法にまたがって、我々のプロトコルは広い校正マージンを持つ全ての障害を識別する。
論文 参考訳(メタデータ) (2026-06-19T06:04:17Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Token-Level Generalization in LoRA Adapter Backdoors: Attack Characterization and Behavioral Detection [0.0]
我々はLoRAをトレーニングデータ中毒によって確実にバックドアできることを示す。
攻撃はランクとともに単調にスケールし、選択されたトリガーアンカートークンはトリガー依存とベースモデル依存の両方である。
行動検出はサプライチェーンスキャンの操作可能な結果である。
論文 参考訳(メタデータ) (2026-05-28T16:32:25Z) - AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators [0.0]
AgentCollabBenchは、ソフトウェアエンジニアリング、DevOps、データエンジニアリングにまたがる900の人為的なタスクの診断ベンチマークです。
各タスクは、4つの行動リスクのうちの1つを分離する。
GPT 4.1 mini, Gemini 2.5 Flash Lite, Qwen-3.5-35B-A3B, Llama 3.1 8B の4つの近代LCMの評価を行った。
通信トポロジは、マルチホップ情報サバイバルにおけるばらつきの7-40%を説明する主要なリスクファクターとして現れる。
論文 参考訳(メタデータ) (2026-05-09T03:35:09Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - Beyond Reward Suppression: Reshaping Steganographic Communication Protocols in MARL via Dynamic Representational Circuit Breaking [0.0]
監視を回避するためのプライベートプロトコルを開発するエージェントによるステガノグラフィーの共謀は、AIの安全性に重大な脅威をもたらす。
既存の防御は行動層や報酬層に限られており、潜伏する通信路での調整を検知できない。
本稿では,動的表現回路ブレーカ(DRCB)について紹介する。
論文 参考訳(メタデータ) (2026-03-07T04:14:38Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。