論文の概要: On the Limits of Support-Preserving Alignment and Bounded Filtering
- arxiv url: http://arxiv.org/abs/2607.18295v1
- Date: Wed, 01 Jul 2026 00:34:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.916495
- Title: On the Limits of Support-Preserving Alignment and Bounded Filtering
- Title(参考訳): サポート保存アライメントとバウンドフィルタの限界について
- Abstract要約: 本研究では, ベースモデルの出力分布を再構成するアライメントスキームと, 境界付き安全フィルタを組み合わせることで, 現代の大言語モデルにおいて有害な振る舞いの確率をゼロにすることができるかを検討する。
- 参考スコア(独自算出の注目度): 6.81442534768994
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study whether alignment schemes that reshape a base model's output distribution, combined with bounded safety filters, can drive the probability of harmful behavior to zero in modern large language models. Recent research suggests that harmful behaviors can persist under preference-based alignment and that external filtering can be computationally hard in the worst case, but it remains unclear whether practical alignment pipelines that largely preserve internal representations can eliminate harmful behavior entirely rather than merely suppressing its most visible forms. We formalize this setting using support-preserving alignment operators together with bounded filtering algorithms under black-box, white-box, and statistical-query access, and analyze their ability to approximate an ideal eliminator that removes all harmful mass. Building on this framework, we provide computational and information-theoretic arguments indicating that, under these constraints, bounded filtering may fail to eliminate all harmful outputs supported by the base model's distribution. To evaluate these limits empirically, we analyze a range of state-of-the-art open-weight and hosted LLMs accessed via OpenRouter under bounded black-box, white-box, and statistical-query filters on adversarial prompts drawn from curated cybersecurity scenarios and PKU-SafeRLHF. Across models, filter classes, and query budgets, the estimated harmful-output rate decreases with additional filtering compute but consistently plateaus above zero, suggesting a persistent empirical harm floor.
- Abstract(参考訳): 本研究では, ベースモデルの出力分布を再構成するアライメントスキームと, 境界付き安全フィルタを組み合わせることで, 現代の大言語モデルにおいて有害な振る舞いの確率をゼロにすることができるかを検討する。
近年の研究では、有害な行動は嗜好に基づくアライメントの下で継続でき、最悪の場合、外部フィルタリングは計算的に困難である可能性が示唆されているが、内部表現を多く保持する実用的なアライメントパイプラインが、単に最も目に見える形を抑えるのではなく、有害な行動を完全に排除できるかどうかは不明である。
我々は、ブラックボックス、ホワイトボックス、統計的クエリアクセスの下での有界フィルタリングアルゴリズムとともに、サポート保存アライメント演算子を用いてこの設定を定式化し、全ての有害質量を除去する理想的なエミネータを近似する能力を解析する。
この枠組みに基づいて計算と情報理論の議論を行い、これらの制約の下では、境界付きフィルタリングはベースモデルの分布によって支えられる有害な出力をすべて排除できないことを示す。
これらの限界を実証的に評価するために、我々は、キュレートされたサイバーセキュリティシナリオやPKU-SafeRLHFから引き出された敵のプロンプトに対して、境界付きブラックボックス、ホワイトボックス、統計的クエリーフィルタの下で、OpenRouterを介してアクセスされる最先端のオープンウェイトおよびホストLLMを分析した。
モデル、フィルタクラス、クエリ予算全体にわたって、推定された有害な出力率は、追加のフィルタリング計算によって減少するが、常にゼロより高くなり、持続的な経験的害床が示唆される。
関連論文リスト
- OcclusionCBF: Backup Control Barrier Functions for Safe Navigation Among Hidden Dynamic Obstacles [13.327838370494982]
OcclusionCBFは、バックアップ制御バリア関数を到達可能な占有率予測に拡張する安全フィルタである。
我々は,ミリ秒スケールの計算により,応答性および閉塞性を考慮した予測ベースラインよりも優れたタスク成功を示す。
論文 参考訳(メタデータ) (2026-09-06T02:31:47Z) - Filter Learning for Subgraphs: Algebras and Performance Risk Bounds [63.46320825598287]
本稿では,部分的な観測の下でグラフフィルタを近似する部分グラフフィルタ学習の枠組みを提案する。
距離を意識したラプラシアン構造に基づく部分グラフフィルタ代数を開発し、効率的な近似のための構造化および制御可能なフィルタのクラスを定義する。
論文 参考訳(メタデータ) (2026-07-23T12:36:05Z) - Alignment Imprint: Zero-Shot AI-Generated Text Detection via Provable Preference Discrepancy [51.887915969023965]
現代のLarge Language Models (LLMs) がアライメントされ、測定可能な分布インプリントが残されていることを示す。
高エントロピー領域における不安定性を軽減するため、ログライクなアライメント・アライメント・プレフレパシー(LAPD)を導入する。
LAPDはアライメントインプリントに基づく標準化された情報重み統計である。
論文 参考訳(メタデータ) (2026-04-18T09:12:24Z) - Detoxifying LLMs via Representation Erasure-Based Preference Optimization [44.29978832356216]
Webスケールデータに基づいてトレーニングされた大規模言語モデル(LLM)は、有害な出力を生成することができる。
DPO、NPO、および同様のアルゴリズムを応用した先行防御は、有害な継続の可能性を減らす。
本稿では,Representation Erasure-based Preference Optimization (REPO)を提案する。
論文 参考訳(メタデータ) (2026-02-24T22:51:06Z) - NeuroFilter: Privacy Guardrails for Conversational LLM Agents [50.75206727081996]
本研究は,エージェント型大規模言語モデル(LLM)のプライバシを強制する際の計算上の課題に対処する。
NeuroFilterは、標準違反をモデルのアクティベーション空間における単純な方向にマッピングすることで、コンテキスト整合性を運用するガードレールフレームワークである。
7Bから70Bパラメータのモデルをカバーする15万以上のインタラクションに対する包括的な評価は、NeuroFilterの強力なパフォーマンスを示している。
論文 参考訳(メタデータ) (2026-01-21T05:16:50Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - On the Impossibility of Separating Intelligence from Judgment: The Computational Intractability of Filtering for AI Alignment [11.33288298772898]
本研究では,安全でない情報の発生を防ぐためのフィルタに着目し,アライメントの課題について検討する。
本研究の主な成果は,プロンプトとアウトプットの両方をフィルタリングする際の計算上の課題である。
論文 参考訳(メタデータ) (2025-07-09T23:55:35Z) - Robust Filtering -- Novel Statistical Learning and Inference Algorithms with Applications [0.0]
状態推定は、自動運転車、ロボット工学、医療監視、スマートグリッド、インテリジェントトランスポート、予測保守などのアプリケーションにおけるインテリジェントな意思決定を可能にするための基本的なタスクである。
標準フィルタリングはノイズ統計の事前知識を前提としてノイズセンサデータから潜時状態の抽出を行う。
現実のシナリオは、外れ値、偏見、漂流、未知あるいは部分的に知られている統計の欠如といった異常を伴い、従来のアプローチを制限している。
この論文は、これらの課題を軽減するために、新しい頑健な非線形フィルタリング法を示す。
論文 参考訳(メタデータ) (2025-06-13T07:30:35Z) - Outlier-robust Kalman Filtering through Generalised Bayes [45.51425214486509]
我々は、状態空間モデルにおけるオンラインフィルタリングのための新しい、確実に堅牢でクローズドなベイズ更新ルールを導出する。
提案手法は, より少ない計算コストで, 他の頑健なフィルタリング手法に適合し, 性能が向上する。
論文 参考訳(メタデータ) (2024-05-09T09:40:56Z) - Computational Doob's h-transforms for Online Filtering of Discretely
Observed Diffusions [65.74069050283998]
本研究では,Doobの$h$-transformsを近似する計算フレームワークを提案する。
提案手法は、最先端粒子フィルタよりも桁違いに効率的である。
論文 参考訳(メタデータ) (2022-06-07T15:03:05Z) - Globally Convergent Policy Search over Dynamic Filters for Output
Estimation [64.90951294952094]
我々は,大域的に最適な$textitdynamic$ filterに収束する最初の直接ポリシー探索アルゴリズム凸を導入する。
我々は、情報化が前述の優越性を克服していることを示す。
論文 参考訳(メタデータ) (2022-02-23T18:06:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。