論文の概要: Query Lens: Interpreting Sparse Key-Value Features with Indirect Effects
- arxiv url: http://arxiv.org/abs/2606.07617v1
- Date: Sat, 30 May 2026 07:01:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-09 14:42:05.081063
- Title: Query Lens: Interpreting Sparse Key-Value Features with Indirect Effects
- Title(参考訳): クエリレンズ: 間接効果によるスパースキーバリュー機能の解釈
- Abstract要約: より包括的で忠実なスパース機能解釈を可能にするために,Logit Lensを拡張したQuery Lensを提案する。
エンコーダ側のキー特徴とデコーダ側の値特徴を共同で検討することにより、特徴を活性化する入力と、それが促進する出力の両方を識別する。
実験では、Query LensはLogit Lensでは解釈不能な機能に対してコヒーレントなトークンシグネチャを生成する。
- 参考スコア(独自算出の注目度): 6.167427290636436
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: While sparse autoencoders provide features more interpretable than individual neurons, reliably characterizing them remains challenging. We propose Query Lens, which extends Logit Lens to enable more comprehensive and faithful interpretations of sparse features. By jointly considering encoder-side key features and decoder-side value features, we identify both the inputs that activate a feature and the outputs it promotes. We also account for indirect, module-mediated effects that arise when the feature is processed by downstream modules, going beyond the direct effect captured by Logit Lens. In experiments, we find that Query Lens yields coherent token signatures for features that remain uninterpretable under Logit Lens. Finally, we propose the Subspace Channel Hypothesis, suggesting that downstream modules read features through layer-specific subspaces.
- Abstract(参考訳): スパースオートエンコーダは個々のニューロンよりも解釈可能な特徴を提供するが、それらを確実に特徴付けることは依然として困難である。
より包括的で忠実なスパース機能解釈を可能にするために,Logit Lensを拡張したQuery Lensを提案する。
エンコーダ側のキー特徴とデコーダ側の値特徴を共同で検討することにより、特徴を活性化する入力と、それが促進する出力の両方を識別する。
また、この機能が下流モジュールによって処理され、Logit Lensがキャプチャした直接効果を超えたときに発生する間接的なモジュール経由のエフェクトも説明します。
実験では、Query LensはLogit Lensでは解釈不能な機能に対してコヒーレントなトークンシグネチャを生成する。
最後に、サブスペースチャネル仮説を提案し、下流モジュールが層固有のサブスペースを通して特徴を読み取ることを示唆する。
関連論文リスト
- Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token [75.67455028589505]
本稿では,MLLM itSELFのセグメンテーションを1セグメンテーション・エンベディング(SELF1E)でアンロックする方法について検討する。
本手法は,MLLMからの画素シャッフル画像特徴の分解能の基本的な制限を目標とする。
総合的な実験により、SELF1Eは、スペシャリストマスクデコーダベースの手法と性能を競うことができる。
論文 参考訳(メタデータ) (2026-03-19T15:25:36Z) - Decomposing Query-Key Feature Interactions Using Contrastive Covariances [75.38737409771085]
クエリとキー間の双方向のジョイント埋め込み空間であるクエリキー空間について検討する。
キーとクエリの機能がこれらの低ランクのサブスペースに整列して、高い注目スコアが生成されるときです。
論文 参考訳(メタデータ) (2026-02-04T16:50:02Z) - Identifying Intervenable and Interpretable Features via Orthogonality Regularization [48.938969291033665]
我々はデコーダ行列をほぼ直交的な特徴に分解する。
これにより、ターゲットデータセットのパフォーマンスを本質的に変更することなく、機能間の干渉と重畳を低減することができる。
私たちのコードは、$texttthttps://github.com/mrtzmllr/sae-icm$で利用可能です。
論文 参考訳(メタデータ) (2026-02-04T16:29:14Z) - From Knots to Knobs: Towards Steerable Collaborative Filtering Using Sparse Autoencoders [8.744951561204507]
本稿では,コラボレーティブフィルタにオートエンコーダを適用した最初の例である。
意味概念と個々のニューロン間の適切なマッピング関数を提案する。
また、この表現を利用して、望ましい方向にレコメンデーションを操る、シンプルで効果的な方法も評価する。
論文 参考訳(メタデータ) (2026-01-16T10:58:21Z) - Disentangle Object and Non-object Infrared Features via Language Guidance [35.60538936337868]
赤外線物体検出のための新しい視覚言語表現学習パラダイムを提案する。
リッチ・セマンティック・インフォメーションを用いた追加のテキスト・インフォメーションは、オブジェクトと非オブジェクトの特徴の絡み合いを導くために研究される。
提案手法は,Mtextsuperscript3FD (83.7% mAP),FLIR (86.1% mAP) の2つのベンチマークにおいて優れた性能を実現する。
論文 参考訳(メタデータ) (2026-01-14T06:59:54Z) - Hyperdimensional Probe: Decoding LLM Representations via Vector Symbolic Architectures [12.466522376751811]
超次元プローブは、大規模言語モデルベクトル空間から情報を復号するための新しいパラダイムである。
シンボリック表現とニューラルプローブのアイデアを組み合わせて、モデルの残留ストリームを解釈可能な概念に投影する。
我々の研究は、LLMベクトル空間における情報復号化を進め、神経表現からより情報的、解釈可能、構造化された特徴を抽出することを可能にする。
論文 参考訳(メタデータ) (2025-09-29T16:59:07Z) - LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance [54.683384204063934]
大規模マルチモーダルモデル(LMM)は不正確なセグメンテーションと幻覚的理解に苦しむ。
視覚的理解とセグメンテーションの相補的関係を生かしたフレームワークであるLIRAを提案する。
LIRAはセグメンテーションと理解タスクの両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-07-08T07:46:26Z) - Decoding Vision Transformers: the Diffusion Steering Lens [0.0]
Logit Lensは、トランスフォーマーベースの言語モデルの機械的解釈可能性のための広く採用されている手法である。
Logit Lens to Vision Transformers (ViTs)の適用は技術的に単純だが、視覚表現の豊かさを捉える上で、直接の使用は制限に直面している。
Diffusion Lensは画像エンコーダの残差ストリーム表現を効果的に可視化できるが、個々のサブモジュールの直接のコントリビューションは取得できない。
論文 参考訳(メタデータ) (2025-04-18T16:00:53Z) - Object Discovery from Motion-Guided Tokens [50.988525184497334]
自動エンコーダ表現学習フレームワークを、モーションガイダンスと中間レベルの特徴トークン化により強化する。
我々のアプローチは、解釈可能なオブジェクト固有の中間レベルの特徴の出現を可能にする。
論文 参考訳(メタデータ) (2023-03-27T19:14:00Z) - Hierarchical Feature Alignment Network for Unsupervised Video Object
Segmentation [99.70336991366403]
外観・動作特徴アライメントのための簡潔で実用的で効率的なアーキテクチャを提案する。
提案されたHFANはDAVIS-16の最先端性能に到達し、88.7ドルのmathcalJ&mathcalF$Meanを達成した。
論文 参考訳(メタデータ) (2022-07-18T10:10:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。