論文の概要: A Unified Mechanistic Analysis of Knowledge- and Safety-Based Refusals
- arxiv url: http://arxiv.org/abs/2609.00760v1
- Date: Tue, 01 Sep 2026 05:43:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.405643
- Title: A Unified Mechanistic Analysis of Knowledge- and Safety-Based Refusals
- Title(参考訳): 知識と安全に基づく拒絶の統一力学解析
- Authors: Yuri Son, Seunghee Kim, Hyuhng Joon Kim, Taeuk Kim,
- Abstract要約: 大規模言語モデル(LLM)は、知識外にあるクエリを減少させるように、ますます訓練されている。
KR と SR は重なり合うが区別可能な機構によって支配される。
タイプ固有の特殊化は主に上層層に現れ、KRは不確実性や知識に関する表現、SRは安全および政策に関する表現と一致している。
- 参考スコア(独自算出の注目度): 9.279934124963978
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly trained to decline queries that fall outside their knowledge (knowledge-based refusal, KR) or violate safety policies (safety-based refusal, SR). Although KR and SR result in superficially similar responses, they have largely been studied in isolation, leaving open whether they share an underlying mechanism. We address this gap with a systematic study on a new dataset of 213 contrastive quadruples that jointly probe both refusal types. We find that KR and SR are governed by overlapping yet distinguishable mechanisms. Both share a refusal direction, yet the overlap is asymmetric: SR signals transfer more strongly to KR than the reverse. Type-specific specialization emerges mainly in upper layers, with KR aligning with uncertainty- and knowledge-related representations and SR with safety- and policy-related ones. We thus characterize refusal as a commit-then-specify process: a shared initial mechanism commits to refusing, then type-specific features in later layers specify whether the grounds are epistemic or normative.
- Abstract(参考訳): 大規模言語モデル(LLM)は、知識の外部にあるクエリ(知識ベースの拒絶、KR)を減らしたり、安全ポリシー(安全ベースの拒絶、SR)に違反するように訓練されている。
KR と SR は表面的に類似した反応をもたらすが、それらは主に独立して研究され、基礎となるメカニズムを共有しているか否かは明らかである。
このギャップを、213個の対照的な四重項からなる新しいデータセットの体系的な研究で解決し、両方の拒絶型を共同で探索する。
KR と SR は重なり合うが区別可能な機構によって支配される。
どちらも拒絶方向を共有するが、重なり合いは非対称である: SR信号は逆よりもKRに強く伝達する。
タイプ固有の特殊化は主に上層層に現れ、KRは不確実性や知識に関する表現、SRは安全および政策に関する表現と一致している。
共有された初期メカニズムは、再利用をコミットし、その後、後続のレイヤでタイプ固有の特徴は、基底が疫学的か規範的であるかを指定する。
関連論文リスト
- Behavioural Signatures of Risk-Sensitive Decision-Making in Large Language Models [121.70781851874035]
大規模言語モデル(LLM)は、意思決定支援にますます使われている。
不確実性の下での選択が安定かつ解釈可能な行動規則性を示すかどうかを理解することが重要である。
本稿では,無制限テキサスホールドエムに基づく制御型マルチモデルフレームワークを用いて,この問題について検討する。
論文 参考訳(メタデータ) (2026-07-11T10:33:39Z) - Replicating Belief, Not Bits: Epistemic State Replication for Agentic Systems [2.124730017640531]
分散システムにおいて、古典的ステートマシンレプリケーションモデルは、正しいレプリカが決定論的遷移を実行し、同じビットワイズ状態を生成すると仮定する。
本稿では,複製境界をデータ可視性から知識可視性へシフトさせるエージェント型分散システムのための信念複製層であるEpistemic State Replication (ESR)を提案する。
論文 参考訳(メタデータ) (2026-07-03T19:59:03Z) - Embedding Inference Attack [2.7320009679742845]
埋め込みモデルは、現代の情報検索(IR)システムにおいて不可欠な要素である。
近年の研究では、高密度IRシステムがインバージョンアタックの埋め込みなどのセキュリティ上の脆弱性につながることが示されている。
調整されたクエリによって、既知のモデル候補の集合からどの埋め込みモデルが使われているのかを、相手が特定できることが示される。
論文 参考訳(メタデータ) (2026-07-01T02:56:39Z) - Beyond Semantic Relevance: Counterfactual Risk Minimization for Robust Retrieval-Augmented Generation [19.888565537472363]
CoRM-RAG(Counterfactual Risk Minimization for RAG)は、検索と意思決定の安全性を一致させるフレームワークである。
トレーニング中にユーザのバイアスをシミュレートする認知摂動プロトコルを導入し,それを軽量なエビデンス・クリティカルに蒸留する。
このスコアリングモジュールは、対向的なクエリの摂動にも拘わらず、モデルの正しさを判断するために十分な明らかな強度を持つ文書を特定することを学習する。
論文 参考訳(メタデータ) (2026-05-02T07:22:24Z) - Silent Leaks: Implicit Knowledge Extraction Attack on RAG Systems through Benign Queries [42.768116999732776]
インプシット知識抽出攻撃(IKEA)は、良質なクエリを通してRAGシステム上で知識抽出を行う。
IKEAは、抽出効率の80%以上、攻撃成功率の90%を超えている。
論文 参考訳(メタデータ) (2025-05-21T12:04:42Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z) - The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence [57.57786477441956]
以前の研究は、モデルのアクティベーション空間における1つの拒絶方向が、LCMが要求を拒否するかどうかを決定することを示唆している。
本稿では,表現工学における勾配に基づく新しい手法を提案し,それを用いて拒絶方向を同定する。
LLMの拒絶機構は複雑な空間構造によって制御され、機能的に独立な方向を識別する。
論文 参考訳(メタデータ) (2025-02-24T18:52:59Z) - From Mean to Extreme: Formal Differential Privacy Bounds on the Success of Real-World Data Reconstruction Attacks [54.25638567385662]
機械学習における微分プライバシーは、しばしばメンバーシップ推論に対する保証として解釈される。
DP予算を定量的な保護に翻訳することで、データ再構築の脅威を悪化させることは、依然として困難な課題である。
本稿では、実証された"ゼロスクラッチ"攻撃のメカニズムに合わせた、最初の公式なプライバシー境界を導出することで、臨界ギャップを埋める。
論文 参考訳(メタデータ) (2024-02-20T09:52:30Z) - Bounding data reconstruction attacks with the hypothesis testing
interpretation of differential privacy [78.32404878825845]
レコンストラクションロバストネス(ReRo)は、機械学習モデルに対するデータ再構成攻撃の成功の上限として最近提案されている。
これまでの研究では、差分プライバシー(DP)機構がReRoを提供することを示したが、これまではモンテカルロによるReRo境界の厳密な推定しか示されていない。
論文 参考訳(メタデータ) (2023-07-08T08:02:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。