論文の概要: The Implications of Linguistic Illegibility for LLM Security
- arxiv url: http://arxiv.org/abs/2609.02852v1
- Date: Wed, 02 Sep 2026 17:37:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.481868
- Title: The Implications of Linguistic Illegibility for LLM Security
- Title(参考訳): LLMのセキュリティにおける言語的不合理性の意味
- Authors: James Mickens,
- Abstract要約: 我々は、内部計算が言語を介して直接表現されないLLMでは、言語的可視性のスペクタは避けられないと論じる。
テナントトラッキングを用いたモデル出力の観測は,効率的なサンドボックス構築に有望なアプローチである,と我々は主張する。
- 参考スコア(独自算出の注目度): 2.6566593102111473
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: LLMs are trained to generate natural language. However, various strands of evidence indicate that an LLM's externalized linguistic outputs and mechanistically-extracted linguistic features can be an unreliable lens for understanding internal model computation. We introduce the term ``linguistic illegibility'' to broadly refer to scenarios in which an LLM's externalized or mechanistically-probed language artifacts fail to represent how the model actually thinks. We argue that the specter of linguistic illegibility is unavoidable for LLMs whose internal computations are not directly expressed via language, but rather math over activation spaces (with lossy translations between activation spaces and natural language happening at the bookends). If linguistic illegibility is always possible, then security mechanisms that rely on a model's linguistic self-reporting (e.g., chain-of-thought monitoring, constitutional self-critique, activation probing for linguistically-defined feature vectors) can never be completely sound; the model sandbox will always need isolation techniques whose guarantees do not depend on reading a model's linguistic state at all. We argue that observing a model's outputs using taint tracking is a promising approach for an effective sandbox: regardless of how a model linguistically self-reports, a taint tracking policy can define, a priori, various pieces of system state that should never be influenced by model-produced data. We also discuss several additional sandboxing mechanisms (e.g., robust virtualization, third-party auditing of sandboxing configurations) which collectively provide a critical floor beneath linguistic monitoring, and would have mitigated recent sandbox exploits by frontier models.
- Abstract(参考訳): LLMは自然言語を生成するために訓練されている。
しかし, LLMの外部言語出力と機械的に抽出された言語特徴が, 内部モデル計算を理解するための信頼性の低いレンズであることを示す証拠は様々である。
我々は、LLMの外部化や機械的にプロブされた言語アーティファクトが、モデルが実際にどう考えているのかを表現できないシナリオを広く指すために、「言語的不可解性」という用語を紹介した。
我々は、内部計算が言語を介して直接表現されるのではなく、活性化空間上の数学(活性化空間と本文で発生する自然言語の間の損失の少ない翻訳を含む)によって、言語的可視性のスペクタは避けられないと論じる。
言語的照会が常に可能であれば、モデルの言語的自己報告(例えば、チェーン・オブ・シンキングの監視、構成的自己批判、言語的に定義された特徴ベクトルの活性化)に依存するセキュリティメカニズムは、完全に健全になることはない。
モデルが言語的に自己申告するにも拘わらず、先行的な、モデル生成データに影響されないさまざまなシステム状態を定義することができる。
また,複数のサンドボックス機構(例えば,ロバストな仮想化,サンドボックス構成のサードパーティによる監査など)についても論じ,言語的監視下において重要なフロアを提供するとともに,フロンティアモデルによる最近のサンドボックスのエクスプロイトを緩和した。
関連論文リスト
- Can LLMs effectively provide game-theoretic-based scenarios for cybersecurity? [51.96049148869987]
大規模言語モデル(LLM)は、コンピュータシステムのセキュリティに新しいツールと課題を提供する。
従来のゲーム理論フレームワークが,LLM駆動型アクターやボットの動作を効果的に捉えることができるかどうかを検討する。
論文 参考訳(メタデータ) (2025-08-04T08:57:14Z) - Language Models Fail to Introspect About Their Knowledge of Language [12.074939242230505]
大規模言語モデル (LLM) が内部状態を検査できるかどうかを検討する。
モデルがメタ言語的刺激に対する応答を、内部知識を忠実に反映しているかどうかを評価する。
メタ言語的プロンプトと確率比較は高いタスク精度をもたらすが、LLMが「自己アクセス」を特権化している証拠は見つからない。
論文 参考訳(メタデータ) (2025-03-10T16:33:14Z) - LinguaLens: Towards Interpreting Linguistic Mechanisms of Large Language Models via Sparse Auto-Encoder [47.81850176849213]
スパースオートエンコーダ(SAE)に基づく大規模言語モデルの言語メカニズム解析のためのフレームワークを提案する。
我々は4次元(形態学、構文学、意味論、プラグマティクス)にわたる中国語と英語の言語的特徴を幅広く抽出する。
本研究は, LLMにおける言語知識の内在的表現, 層間および言語間分布のパターンを明らかにし, モデル出力の制御の可能性を示した。
論文 参考訳(メタデータ) (2025-02-27T18:16:47Z) - Randomly Sampled Language Reasoning Problems Elucidate Limitations of In-Context Learning [9.75748930802634]
機械学習の性能を向上させるために,テキスト内学習の能力について検討する。
非常に単純なドメインを考える: 単純な言語タスクにおける次のトークン予測。
この課題において LLM は n-gram モデルに一様に劣ることがわかった。
論文 参考訳(メタデータ) (2025-01-06T07:57:51Z) - Large Models of What? Mistaking Engineering Achievements for Human Linguistic Agency [0.11510009152620666]
我々は,Large Language Models(LLM)の言語能力に関する主張は,少なくとも2つの根拠のない仮定に基づいていると主張している。
言語完全性は、自然言語のような明瞭で完全なものが存在すると仮定する。
データ完全性の仮定は、言語がデータによって定量化され、完全にキャプチャされるという信念に依存している。
論文 参考訳(メタデータ) (2024-07-11T18:06:01Z) - LLMs' Reading Comprehension Is Affected by Parametric Knowledge and Struggles with Hypothetical Statements [59.71218039095155]
言語モデルの自然言語理解(NLU)能力を評価するための主要な手段として、読解理解(RC)があげられる。
文脈がモデルの内部知識と一致している場合、モデルの回答がコンテキスト理解に由来するのか、あるいは内部情報から生じるのかを識別することは困難である。
この問題に対処するために、架空の事実や実体に基づいて、想像上のデータにRCを使うことを提案する。
論文 参考訳(メタデータ) (2024-04-09T13:08:56Z) - Let Models Speak Ciphers: Multiagent Debate through Embeddings [84.20336971784495]
この問題を解決するためにCIPHER(Communicative Inter-Model Protocol Through Embedding Representation)を導入する。
自然言語から逸脱することで、CIPHERはモデルの重みを変更することなく、より広い範囲の情報を符号化する利点を提供する。
このことは、LLM間の通信における代替の"言語"としての埋め込みの優越性と堅牢性を示している。
論文 参考訳(メタデータ) (2023-10-10T03:06:38Z) - Transparency Helps Reveal When Language Models Learn Meaning [71.96920839263457]
合成データを用いた体系的な実験により,すべての表現が文脈に依存しない意味を持つ言語では,自己回帰型とマスキング型の両方の言語モデルが,表現間の意味的関係をエミュレートする。
自然言語に目を向けると、特定の現象(参照不透明さ)による実験は、現在の言語モデルが自然言語の意味論をうまく表現していないという証拠を増大させる。
論文 参考訳(メタデータ) (2022-10-14T02:35:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。