論文の概要: From Latents to Wires: Surgical Post-Editing on Large Language Models
- arxiv url: http://arxiv.org/abs/2609.32434v1
- Date: Sat, 26 Sep 2026 10:08:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 09:12:15.376846
- Title: From Latents to Wires: Surgical Post-Editing on Large Language Models
- Title(参考訳): 潜伏者からワイヤーへ:大規模言語モデルによる手術後編集
- Abstract要約: 名前付きセマンティックターゲットのための手術後編集を行うフレームワークであるL2Wについて述べる。
ローカライゼーションでは、L2Wはヤコビレンズ(J-lens)属性を使用して、セマンティックターゲットに対して成分をスコアする。
外科的切除ではLLMの機構は冗長であるため,L2Wは標的が出現しなくなるまでCGCC(Counterexample-Guided Causal Cut)を走らせる。
- 参考スコア(独自算出の注目度): 8.106306932558722
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Given a large language model (LLM), can whoever holds the weights name a semantic target (e.g., the model's identity), locate the model components that produce it, and edit them so that the target no longer appears while other capability is preserved? We call such an edit on a trained model a post-edit. We present L2W (latents to wires), a framework that performs surgical post-edits for named semantic targets. For localization, L2W uses Jacobian lens (J-lens) attribution to score components against the semantic target. For surgical removal, because LLM mechanisms are redundant (i.e., a semantic target may have multiple components producing it), L2W runs Counterexample-Guided Causal Cut (CGCC) until the target no longer appears. CGCC first cumulatively closes model components, treating each surviving expression of the target as a counterexample that exposes the next components to close, and then reopens some of them to preserve capability. In a controlled experiment with an implanted behavioural watermark, L2W removes the watermark, and its localization lands on the model region the implant changed. Across three model configurations, L2W removes model-metadata (e.g., identity) self-claims in all nine runs, and adult-content refusal in all three, with no held-out target residual. L2W further composes two post-edits on a text-to-image model: one removes the refusal of requested nudity, and a second removes the nude rendering the first exposes. The results support post-editing as a complement to post-training: post-training installs preferred behaviours, and post-editing removes named unwanted ones.
- Abstract(参考訳): 大きな言語モデル(LLM)が与えられたら、重みを持つ者がセマンティックターゲット(例えば、モデルのアイデンティティ)を名付け、それを生成するモデルコンポーネントを特定して、ターゲットが保存されている間、ターゲットがもはや現れないように編集できるだろうか?
我々は、訓練されたモデルのそのような編集を後編集と呼ぶ。
名前付きセマンティックターゲットのための手術後編集を行うフレームワークであるL2W(latents to wires)を提案する。
ローカライゼーションでは、L2Wはヤコビレンズ(J-lens)属性を使用して、セマンティックターゲットに対して成分をスコアする。
外科的除去のためには、LLM機構は冗長である(つまり、意味的標的は複数の部品を生産する可能性がある)ため、L2Wは標的がもはや現れないまで、対外的ガイド因果切断(CGCC)を実行する。
CGCCはまずモデルコンポーネントを累積的にクローズし、ターゲットの生存中の各表現をカウンター例として扱い、次のコンポーネントをクローズし、その中のいくつかを再開して機能を維持する。
移植された行動標示を用いて制御された実験では、L2Wは透かしを除去し、その位置は、インプラントが変化したモデル領域に依存する。
3つのモデル構成にまたがって、L2Wは9ランすべてでモデルメタタ(eg, ID)の自己定義を削除し、そして3ランすべてでアダルト・コンテントの拒絶を拒否する。
L2Wはさらに2つのポストエジットをテキスト・ツー・イメージモデルで構成する: 1つは要求されたヌードの拒絶を除去し、もう1つは第1の露光をヌードレンダリングする。
トレーニング後のインストールは望ましい振る舞いを好み、編集後の削除は望ましくない名前で呼ばれる。
関連論文リスト
- PatchGate: Narrowing the Verbalization Gap with Intrinsic Object Inventories in Frozen Vision-Language Models [6.947018407173503]
我々は,凍結VLMに固有のプロンプトフリー物体証拠を生成前に抽出する学習自由フレームワークであるPatchGateを提案する。
AMBERでは、PatchGateはオブジェクトレベルの信頼性の両面を改善し、可視対象のカバレッジを49.4から56.0(+13.4%)に増加させ、CHAIRを7.5から6.6(-12.0%)に下げることでオブジェクト幻覚を減らす。
論文 参考訳(メタデータ) (2026-08-22T07:37:40Z) - Envisioning Beyond the Few: Disentangled Semantics and Primitives for Few-Shot Atypical Layout-to-Image Generation [11.600113323546404]
本稿では,意味論をプリミティブから切り離す表現駆動型フレームワークを提案する。
セマンティック・アンチョリング(Semantic Anchoring)は、セマンティックなセマンティクスを安定したアイデンティティのためにアンカーに集約する。
実験では、様々な領域にまたがる視覚的忠実度と整合性の両方において、最先端のL2I法よりも5ショット方式で一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-05-29T13:00:00Z) - Now You See It, Now You Don't - Instant Concept Erasure for Safe Text-to-Image and Video Generation [7.68494752148263]
Instant Concept Erasure (ICE)は、トレーニング不要で、モダリティに依存しない、1ショットの重み修正アプローチで、ゼロオーバーヘッドで正確で永続的な未学習を実現する。
ICEは、異方性エネルギー重み付きスケーリングを用いて部分空間の消去と保存を定義し、その後、ユニークな閉形式重なりプロジェクタを用いて交叉に対して明示的に正規化する。
T2IモデルとT2Vモデルの両方において、元の生成能力の最小限の低下しか生じないにもかかわらず、レッドピーティングに対する堅牢性を改善した強い消去を効率的に達成する。
論文 参考訳(メタデータ) (2025-11-24T01:48:44Z) - Semantics as a Shield: Label Disguise Defense (LDD) against Prompt Injection in LLM Sentiment Classification [5.963719408944521]
本稿では,ラベルを意味的に変換したエイリアスラベルに置き換えることで,真のラベルを隠蔽する軽量な戦略であるラベル・ディグライズ・ディフェンス(LDD)を紹介する。
GPT-5, GPT-4o, LLaMA3.2, Gemma3, Mistral など,9種類の最先端モデルを対象としたLCDの評価を行った。
論文 参考訳(メタデータ) (2025-11-23T20:16:51Z) - CCL-LGS: Contrastive Codebook Learning for 3D Language Gaussian Splatting [53.15827818829865]
2Dプリンシパルに依存しているメソッドは、横断的なセマンティクスの不整合という重要な課題に陥る。
CCL-LGSは、多視点セマンティックキューを統合することで、ビューに一貫性のあるセマンティック監視を実現する新しいフレームワークである。
我々の枠組みは、カテゴリー識別性を維持しながら意味的対立を明示的に解決する。
論文 参考訳(メタデータ) (2025-05-26T19:09:33Z) - Emptying the Ocean with a Spoon: Should We Edit Models? [8.545919917068273]
LLM世代における事実誤りを訂正する手段として,最近普及した直接モデル編集手法を疑問視する。
モデル編集は、より明確な目的を追求する3つの類似しているが異なるアプローチと対比する。
論文 参考訳(メタデータ) (2023-10-18T13:38:03Z) - Are You Copying My Model? Protecting the Copyright of Large Language
Models for EaaS via Backdoor Watermark [58.60940048748815]
企業は大規模な言語モデル(LLM)に基づいたEmbeddding as a Service(E)の提供を開始した。
Eはモデル抽出攻撃に弱いため、LLMの所有者に重大な損失をもたらす可能性がある。
埋め込みにバックドアを埋め込むEmbMarkerという埋め込み透かし手法を提案する。
論文 参考訳(メタデータ) (2023-05-17T08:28:54Z) - Do Generative Models Know Disentanglement? Contrastive Learning is All
You Need [59.033559925639075]
本論文では,変数空間におけるコントラスト(DisCo)による非監視的,モデル非依存的手法を提案する。
DisCoは、GAN、VAE、およびフローを含む、事前訓練された非解離生成モデルに与えられた最先端の解離を達成します。
論文 参考訳(メタデータ) (2021-02-21T08:01:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。