論文の概要: Unsupervised Features Mining via Activation Geometry
- arxiv url: http://arxiv.org/abs/2607.04222v1
- Date: Sun, 05 Jul 2026 10:28:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.869815
- Title: Unsupervised Features Mining via Activation Geometry
- Title(参考訳): アクティベーション幾何学による教師なし特徴マイニング
- Abstract要約: 解釈可能性法は、大きな言語モデル(LLM)内で表現される特徴を明らかにすることを目的としている。
EmphMining via Activation Geometry (MAG) は、モデルアクティベーションから推論特徴を抽出する単純な教師なしフレームワークである。
命令がモデルの内部表現をどのように変更するかを、単一の読み取りポイントで$m(Q mid p) - m(p)$を使って測定する。
- 参考スコア(独自算出の注目度): 1.3636639880574484
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Interpretability methods aim to reveal the features represented inside large language models (LLMs). Many existing methods begin with labeled examples of a human-defined concept that may reflect human biases, and then identify how that concept is represented within the model, for example in its activation space or through other decomposition methods. We introduce \emph{Mining via Activation Geometry} (MAG), a simple unsupervised framework for extracting reasoning features from model activations by prepending the same natural-language instruction $Q$ to every input $p$, where $Q$ defines the reasoning feature of interest, such as ``Can this object be found in the desert?'' or ``Is this prompt malicious?'' We measure how the instruction changes the model's internal representation using $m(Q \mid p) - m(p)$ at a single readout point. We explore eight different MAGs. The extracted reasoning features predict the models' own world understanding and judgment, can be approximated into a single activation direction, we found that some features are more linearly represented and some less, this linear representation, which is vector steering, can change the LLMs' decisions through activation steering by injecting reasoning features. Finally, we use the same method to select the best training datasets for prompt-injection classifier probes: while similarity between ordinary activations is almost unrelated to downstream performance, RFD-based similarity achieves $94.7\%$ Top-1 and $100\%$ Top-2 accuracy.
- Abstract(参考訳): 解釈可能性法は、大きな言語モデル(LLM)内で表現される機能を明らかにすることを目的としている。
既存の多くの手法は、人間のバイアスを反映する人間の定義概念のラベル付き例から始まり、その概念がモデル内でどのように表現されるかを特定する。
これは、モデルアクティベーションから推論を抽出するシンプルなフレームワークで、同じ自然言語命令である$Q$をすべての入力にプリプションすることで、モデルアクティベーションから推論を抽出する。$Q$ ここで、$Q$は、'Can this object be found in the desert?'や‘Is this prompt malicious?'のような、興味のある推論機能を定義する。
我々は8つの異なるMAGを探索する。
抽出された推論特徴はモデル自身の世界理解と判断を1つのアクティベーション方向に近似することができ、いくつかの特徴はより線形に表現され、それ以下ではベクトルステアリングであるこの線形表現は、推論特徴を注入することでアクティベーションステアリングによってLCMの判断を変えることができる。
通常のアクティベーション間の類似性はほとんど下流のパフォーマンスとは無関係であるが、RFDベースの類似性はTop-1と100\%$Top-2の精度で94.7\%に達する。
関連論文リスト
- Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability [51.56484100374058]
機械論的解釈可能性プリミティブに対する最初の識別可能性定理を証明した。
スペクトルは、正当性分解ではなく、記述されたエラーバーを持つ識別可能なモデル固有の指紋である。
論文 参考訳(メタデータ) (2026-08-10T19:42:01Z) - Latent Fact-Checking: Detecting Misinformation through Activation Engineering [1.3299946892361476]
本稿では,アクティベーションエンジニアリングを基盤とした誤情報検出フレームワークを提案する。
提案手法は,ペアの真理文と偽文のアクティベーションを対比することにより,残流の誤情報方向を導出する。
本手法は,AVeriTeC,LIAR,FACTorsの3つのファクトチェックベンチマークを用いて,11モデルにまたがって評価する。
論文 参考訳(メタデータ) (2026-08-05T18:00:14Z) - ResAD++: Towards Class Agnostic Anomaly Detection via Residual Feature Learning [52.11294707895649]
本稿では,クラス非依存型異常検出(AD)の問題点について検討する。
目的は、ターゲットデータの再トレーニングや微調整をせずに、異なるドメインから様々な新しいクラスの異常を一般化して検出できる、クラスに依存しないADモデルをトレーニングすることである。
8つの実世界のADデータセットに関する総合的な実験は、ResAD++が新しいクラスで直接使用されると、素晴らしいAD結果が得られることを示した。
論文 参考訳(メタデータ) (2025-09-28T08:41:05Z) - Features that Make a Difference: Leveraging Gradients for Improved Dictionary Learning [4.051777802443125]
スパースオートエンコーダ(SAE)は、ニューラルネットワーク表現を抽出するための有望なアプローチである。
我々は、TopKアクティベーション関数を増強することにより、$k$-sparseのオートエンコーダアーキテクチャを変更するGradient SAEを紹介する。
g-SAEが任意の文脈でモデルを操る上で平均的に効果的である潜伏者を学ぶ証拠が見つかる。
論文 参考訳(メタデータ) (2024-11-15T18:03:52Z) - Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation [15.77263269398368]
大規模言語モデル(LLM)は、現在のAIのブレークスルーを促進する。
我々は幾何学のレンズを通してLLMの内部機構に光を当てた。
我々は,任意の(事前学習された)LLMから抽出できる解釈可能な幾何学的特徴を導出する。
論文 参考訳(メタデータ) (2023-12-04T06:01:32Z) - ALSO: Automotive Lidar Self-supervision by Occupancy estimation [70.70557577874155]
本稿では,ポイントクラウド上で動作している深層知覚モデルのバックボーンを事前学習するための自己教師型手法を提案する。
中心となる考え方は、3Dポイントがサンプリングされる表面の再構成であるプリテキストタスクでモデルをトレーニングすることである。
直感的には、もしネットワークがわずかな入力ポイントのみを考慮し、シーン表面を再構築できるなら、おそらく意味情報の断片をキャプチャする。
論文 参考訳(メタデータ) (2022-12-12T13:10:19Z) - Self-Supervised Learning Disentangled Group Representation as Feature [82.07737719232972]
既存の自己監督学習(SSL)は、回転や着色などの単純な拡張機能のみを分解することを示す。
反復的分割に基づく不変リスク最小化(IP-IRM)を提案する。
我々は、IP-IRMが完全に不整合表現に収束し、様々なベンチマークでその効果を示すことを証明した。
論文 参考訳(メタデータ) (2021-10-28T16:12:33Z) - For Manifold Learning, Deep Neural Networks can be Locality Sensitive
Hash Functions [14.347610075713412]
ニューラル表現は、各入力を埋め込みにマップするLSHライクな関数として見ることができる。
この行動の重要な結果は、見えないクラスへのワンショット学習です。
論文 参考訳(メタデータ) (2021-03-11T18:57:47Z) - Is Plug-in Solver Sample-Efficient for Feature-based Reinforcement
Learning? [30.065091907118827]
本研究は,マルコフ決定過程(MDP)における$epsilon$-optimal Policyの発見の複雑さについて考察する。
実験モデルを構築し,任意のプラグインソルバを用いて実験モデルを計画するプラグインソルバ手法を用いてこの問題を解決する。
プラグインアプローチはサンプル効率も向上し,強化学習のためのモデルベースアルゴリズムを設計するための柔軟なアプローチを提供する。
論文 参考訳(メタデータ) (2020-10-12T13:13:01Z) - Improving Robustness and Generality of NLP Models Using Disentangled
Representations [62.08794500431367]
スーパービジョンニューラルネットワークはまず入力$x$を単一の表現$z$にマップし、次に出力ラベル$y$にマッピングする。
本研究では,非交叉表現学習の観点から,NLPモデルの堅牢性と汎用性を改善する手法を提案する。
提案した基準でトレーニングしたモデルは、広範囲の教師付き学習タスクにおいて、より堅牢性とドメイン適応性を向上することを示す。
論文 参考訳(メタデータ) (2020-09-21T02:48:46Z) - Model-Based Multi-Agent RL in Zero-Sum Markov Games with Near-Optimal
Sample Complexity [67.02490430380415]
モデルに基づくMARLは、Nash平衡値(NE)を求めるために$tilde O(|S||B|(gamma)-3epsilon-2)$のサンプル複雑性を実現する。
また、アルゴリズムが報酬に依存しない場合、そのようなサンプル境界は最小値(対数因子まで)であり、アルゴリズムは報酬知識のない遷移サンプルを問合せする。
論文 参考訳(メタデータ) (2020-07-15T03:25:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。