論文の概要: Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing
- arxiv url: http://arxiv.org/abs/2607.01690v1
- Date: Thu, 02 Jul 2026 04:31:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.660697
- Title: Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing
- Title(参考訳): エピステミック・ゴグル:グラディエント編集によるエピステミック・フレームを誘導する事前訓練モジュール
- Abstract要約: 架空の結果として明示的に注釈付けされた文書上で言語モデルを微調整することは、文書の中核的な主張を実際に信じるモデルである。
本評価では,これらのアノテーションで接頭・接尾した文書で訓練されたモデルを用いて,関連主張を約9%のフィクションと正しく識別する。
Gogglesは、データではなく、微調整の勾配に介入する学習モジュールです。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Finetuning a language model on documents that are explicitly annotated as fictional results in a model that still actually believes the documents' core claims, an effect known as Negation Neglect. In our evaluations, models trained on documents prefixed and suffixed with such annotations correctly identify the relevant claims as fictional only about 9% of the time. To address this, we introduce Goggles, a learned module that intervenes on the finetuning gradient rather than the data. During supervised finetuning, a Goggles module edits the gradients an LLM LoRA receives, imparting a chosen epistemic frame (the stance the model takes toward the nature of what it reads) to whatever the documents teach. A Goggles instance is trained once for a given base model, frame, and LoRA configuration, then applied frozen to documents it was never trained on. Trained through Goggles on those same documents, now carrying no fictional annotation, the model flags the content as fictional roughly 91% of the time, while preserving capability (GPQA and TruthfulQA match or exceed baseline). The same architecture supports other frames: a Goggles instance can be trained to treat documents as "part of an AI safety evaluation by Redwood Research" rather than simply as fiction. The imparted frame persists under continued finetuning that pushes back toward the claim, where prior interventions revert. Goggles suggests a path toward training language models on known-misaligned data without absorbing the behaviors that data demonstrates.
- Abstract(参考訳): 架空の結果として明示的に注釈付けされた文書に言語モデルを微調整することは、まだ文書の中核的な主張を信じるモデルであり、ネゲーション・ネグレクト(Negation Neglect)として知られる。
本評価では,これらのアノテーションで接頭・接尾した文書で訓練されたモデルを用いて,関連主張を約9%のフィクションと正しく識別する。
これを解決するために、データではなく微調整の勾配に介入する学習モジュールであるGogglesを紹介します。
監督された微調整の間、GogglesモジュールはLLM LoRAが受信した勾配を編集し、選択された疫学フレーム(モデルが読むものの性質に向かっているスタンス)をドキュメントが教えるものに与える。
Gogglesインスタンスは、与えられたベースモデル、フレーム、LoRA設定に対して一度トレーニングされ、トレーニングされていないドキュメントに凍結適用される。
このモデルはGogglesを通じてトレーニングされ、現在、フィクションの注釈は持っていないが、約91%の時間をフィクションとしてフラグ付けし、保存能力(GPQAとTrathfulQAが一致またはベースラインを超える)を保っている。
Gogglesインスタンスは、単にフィクションではなく、"Redwood ResearchによるAI安全性評価の一部"としてドキュメントを扱うようにトレーニングすることができる。
付与されたフレームは、継続的な微調整の下で継続され、クレームに向かって押し戻され、事前の介入が逆戻りする。
Goggles氏は、既知のミスアライメントデータ上で、データが示す振る舞いを吸収することなく、言語モデルをトレーニングする方法を提案する。
関連論文リスト
- Belief-Calibrated Optimization: An Explicit World Model for Agentic Optimization [31.31831511580543]
本稿では,Belief-Calibrated Optimization (BCO)について述べる。
蓄積された文書が与えられた新しい予測器は、コンテンツが偽造された文書や同形コピーよりも、どのように環境がより正確に応答するかを予測する。
論文 参考訳(メタデータ) (2026-09-01T20:47:04Z) - A Classifier That Teaches Itself: Self-Improving, Frozen-gate Training (SIFT) for Dynamic Document Classification [39.17006317116773]
動的分類器サービスSIFT(Self-Improving, Frozen-gate Training)を提案する。
本稿では,アーキテクチャ,セルフフィードコーパスループ,フリーズゲートの促進機構,複数ドメイン配置について述べる。
論文 参考訳(メタデータ) (2026-07-20T12:38:50Z) - DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation [50.584834483403675]
新しい視覚概念を学習するか、望ましくないものを消去するか、事前学習したテキスト・画像拡散モデルに適応させることは、意図した効果だけで日常的に評価される。
適応が意味論的に無関係な概念を、構造的にメトリクスを集約することができない方法で体系的に損なうことを実証する。
DriftScopeは、任意の2つのモデルチェックポイントを取り込み、視覚的概念が最も移行したトークンのランクリストを返す、プロンプトレベルの診断ツールである。
論文 参考訳(メタデータ) (2026-06-30T20:57:51Z) - Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - DataDignity: Training Data Attribution for Large Language Models [8.195274857647782]
我々は3,537個のウィキペディア風記事のベンチマークであるFakeWikiを紹介した。
FakeWikiにはQAプローブ、ソース保存のパラフレーズ、レトロ生成の変種、解答クリティカルな事実を取り除きながら、極端に類似した硬いアンチドキュメントが含まれている。
我々は,7つの検索ベースライン,トレーニング不要なアクティベーション・ステアリング・検索・フュージョン法,SteerFuse,および教師付きコントラスト・プロファイランス・ローダであるScoringModelを評価した。
論文 参考訳(メタデータ) (2026-05-07T05:27:45Z) - Reverse-Engineering Model Editing on Language Models [13.281350510944383]
textitKSTER (textbfKeytextbfSpaceReconstextbfTruction-then-textbfEntropytextbfReduction) という2段階のリバースエンジニアリング攻撃を提案する。
我々の攻撃は、高い成功率で編集されたデータを復元することができる。
論文 参考訳(メタデータ) (2026-02-07T08:35:59Z) - Refinement Provenance Inference: Detecting LLM-Refined Training Prompts from Model Behavior [58.751981587234916]
本稿では,Refinement Provenance Inference (RPI)監査タスクをRefinement Provenance Inference (RPI)として定式化する。
本稿では,ロジットレベルの信号で教師が強制する可能性機能を融合させるロジットベースのフレームワークであるReProを提案する。
トレーニング中、ReProはシャドウファインチューニングを通じて転送可能な表現を学び、訓練データアクセスなしで、見えない犠牲者の証明を推測するために軽量のリニアヘッドを使用する。
論文 参考訳(メタデータ) (2026-01-05T10:16:41Z) - Semantics as a Shield: Label Disguise Defense (LDD) against Prompt Injection in LLM Sentiment Classification [5.963719408944521]
本稿では,ラベルを意味的に変換したエイリアスラベルに置き換えることで,真のラベルを隠蔽する軽量な戦略であるラベル・ディグライズ・ディフェンス(LDD)を紹介する。
GPT-5, GPT-4o, LLaMA3.2, Gemma3, Mistral など,9種類の最先端モデルを対象としたLCDの評価を行った。
論文 参考訳(メタデータ) (2025-11-23T20:16:51Z) - PrefixNLI: Detecting Factual Inconsistencies as Soon as They Arise [60.63315470285562]
MiniTruePrefixesは、テキストプレフィックスよりも事実上の矛盾をよりよく検出する、新しい特殊モデルである。
制御されたデコードフレームワークにMiniTruePrefixesを組み込むことで,抽象的な要約における現実の一貫性が大幅に向上することを示す。
論文 参考訳(メタデータ) (2025-11-03T09:07:44Z) - Is Model Editing Built on Sand? Revealing Its Illusory Success and Fragile Foundation [50.40861036534546]
大きな言語モデル(LLM)は、必然的に時代遅れまたは誤った知識をエンコードする。そのような知識の更新、削除、そして忘れは、アライメント、安全性、その他の問題にとって重要である。
この問題を解決するために、モデル編集は有望なパラダイムとして現れ、特定の事実が更新され、他の知識を保持しながら、パラメータの小さなサブセットを正確に編集する。
前回の論文で大きな成功を収めたにもかかわらず、編集の信頼性は脆弱な基盤にかかっていることが判明した。
我々の経験的証拠は、編集が完全な意味論よりもショートカットに基づく可能性が高いことを示し、さらなる進歩の前にモデル編集の基盤を急激な再考を求める。
論文 参考訳(メタデータ) (2025-10-01T07:59:23Z) - Do LLMs Encode Frame Semantics? Evidence from Frame Identification [4.508786802660182]
大規模言語モデルがフレームセマンティクスの潜在知識を符号化するかどうかを,フレーム識別に焦点をあてて検討する。
我々は,プロンプトベース推論に基づくモデルの評価を行い,明示的な監督なしにフレーム識別を効果的に行うことができることを示した。
論文 参考訳(メタデータ) (2025-09-23T20:09:32Z) - OpenFraming: We brought the ML; you bring the data. Interact with your
data and discover its frames [13.695739582457872]
テキスト文書中のフレームを解析・分類する Web ベースのシステムを提案する。
我々は,様々な問題に関する最先端の事前学習フレーム分類モデルと,新規分類モデルの学習のためのユーザフレンドリなパイプラインを提供する。
私たちのシステムを構成するコードもオープンソースでドキュメント化されています。
論文 参考訳(メタデータ) (2020-08-16T18:59:30Z) - Fast(er) Reconstruction of Shredded Text Documents via Self-Supervised
Deep Asymmetric Metric Learning [62.34197797857823]
細断文書の自動復元における中心的な問題は、細断文書の相互互換性評価である。
本研究は,推定回数を線形にスケールするペアワイド互換性を測るスケーラブルな深層学習手法を提案する。
提案手法は,505個のシュレッダーを持つテストインスタンスに対して,22倍の高速化を実現した最先端技術に匹敵する精度を有する。
論文 参考訳(メタデータ) (2020-03-23T03:22:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。