論文の概要: Sparse Readout Prism: Explaining Logit-Lens Scores in Features Instead of Tokens
- arxiv url: http://arxiv.org/abs/2609.01936v1
- Date: Tue, 01 Sep 2026 23:01:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.007673
- Title: Sparse Readout Prism: Explaining Logit-Lens Scores in Features Instead of Tokens
- Title(参考訳): Sparse Readout Prism: トークンの代わりにLogit-Lensスコアを記述する
- Authors: Matteo He, William F. Shen, Xinchi Qiu, Nicholas D. Lane,
- Abstract要約: レンズ読み取りは、隠された状態と復号に使用される読み出しの両方を反映する。
本稿では,Sparse Readout Prism(SRP)について紹介する。
SRPは、レンズ読み取りのための新しい分析単位として、読み出し機能を明らかにしている。
- 参考スコア(独自算出の注目度): 11.948805377284694
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A language model's prediction of its next token develops across layers, and lens methods track this process by decoding intermediate hidden states into tokens. But a lens reading reflects both the hidden state and the readout (the unembedding matrix) used to decode it. Many lenses are fit on a corpus, and we show that two lenses differing only in their fitting corpus can report different tokens for the same hidden states. We call this dependence corpus conditionality. To examine readout structure independently of the fitting corpus, we introduce Sparse Readout Prism (SRP), which decomposes the readout using only its weights and expresses any token logit or logit difference as a sum of contributions from sparse readout features. This reveals readout features as a new unit of analysis for lens readings, exposing structure that token identities can obscure and enabling comparisons across tokens, contexts, layers, and lenses. Replacing the original readout with SRP's sparse approximation reconstructs 8.9-17.3 percentage points more of the tested logit differences than the strongest of six baselines built on geometric relations among readout rows. Ablating features shifts logit differences in proportion to their SRP contributions. Although token readings vary with the fitting corpus, the dominant readout feature remains stable. Because SRP uses no corpus in its construction, it provides a control independent of the fitting corpus for lens analyses.
- Abstract(参考訳): 言語モデルの次のトークンの予測は層を越えて発展し、レンズ法は中間隠れ状態からトークンに復号することでこのプロセスを追跡する。
しかし、レンズの読み取りは、それを復号するために使われる隠された状態と読み出し(非埋め込み行列)の両方を反映する。
多くのレンズがコーパスに収まるので、2つのレンズが適合コーパスでのみ異なる場合、同じ隠れ状態に対して異なるトークンを報告できることが示されます。
これを依存コーパス条件(Dependency corp conditionality)と呼ぶ。
適合コーパスとは無関係に読み出し構造を調べるため,SRP(Sparse Readout Prism)を導入し,その重みのみを用いて読み出しを分解し,スパース読み出し機能からのコントリビューションの総和としてトークンロジットやロジット差を表現した。
これは、レンズ読み取りのための新しい分析ユニットとしての読み出し機能を明らかにし、トークンのアイデンティティが曖昧になり得る構造を明らかにし、トークン、コンテキスト、レイヤ、レンズ間の比較を可能にする。
元の読み出しをSRPのスパース近似で置き換えると、読み出し行間の幾何学的関係に基づいて構築された6つのベースラインのうち、テストされたロジット差の8.9-17.3パーセントがより多く再構成される。
Ablating機能は、SRPのコントリビューションに比例して、ロジットの差をシフトする。
トークンの読み出しは適合コーパスによって異なるが、主要な読み出し機能は安定している。
SRPはその構成にコーパスを使用しないので、レンズ解析に適合コーパスに依存しない制御を提供する。
関連論文リスト
- Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora? [43.96699318814863]
まず、異なるコーパスで訓練されたBPEトークンーが安定なトークンID-分布を共有し、既知のコーパスから隠れコーパスで訓練されたターゲットトークンーへの分布伝達を動機付けていることを示す。
次に、この分布を複数の量子化傾向で近似し、局所密度重み付けを用いてトークンレベルの推定を行うQGDE(Quantile-Guided Density Estimation)を提案する。
論文 参考訳(メタデータ) (2026-08-11T09:14:25Z) - The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric [78.74729751232852]
画像三重項に対する人間の類似性判定の大規模データセットを提案する。
視覚言語モデルを微調整して,テキストプロンプト画像の知覚的類似度測定値を生成する。
TPIPSは人間の知覚とより密接に一致し、トレーニング分布を超えて確実に一般化する。
論文 参考訳(メタデータ) (2026-07-20T17:59:51Z) - PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation [58.1914505657064]
本稿では,クラスレベルのセマンティクスと空間コンテキスト間の知識干渉の課題を軽減するために,単純な並列コストアグリゲーション(PCA-Seg)パラダイムを提案する。
8つのベンチマークの実験では、PCA-Segの各並列ブロックは0.35万のパラメータしか追加せず、最先端のOSPS性能を実現している。
論文 参考訳(メタデータ) (2026-03-18T09:26:43Z) - Focus-Scan-Refine: From Human Visual Perception to Efficient Visual Token Pruning [78.75062483648243]
視覚言語モデル(VLM)は、しばしば大量の視覚トークンを生成し、推論遅延とメモリフットプリントを大幅に増加させる。
視覚的質問に対して人間がどのように答えるかを模倣する,人間にインスパイアされたプラグアンドプレイプルーニングフレームワークであるFSRを提案する。
FSRは、既存の最先端プルーニング法よりも精度と効率のトレードオフを一貫して改善する。
論文 参考訳(メタデータ) (2026-02-05T16:02:48Z) - Mechanistic Decomposition of Sentence Representations [3.9146761527401432]
文の埋め込みは現代のNLPとAIシステムの中心であるが、内部構造についてはほとんど知られていない。
文の埋め込みを解釈可能なコンポーネントに機械的に分解する新しい手法を提案する。
我々は,これらの特徴を文表現に圧縮する方法を解析し,文埋め込みに存在する潜在的特徴を評価する。
論文 参考訳(メタデータ) (2025-06-04T18:42:57Z) - From What to How: Attributing CLIP's Latent Components Reveals Unexpected Semantic Reliance [14.30327576545802]
我々は,潜在コンポーネントが何を活性化するか,期待されるセマンティクスとどのように一致しているか,予測にどの程度重要かを明らかにするフレームワークを導入する。
本手法は,多文語,複合名詞,視覚タイポグラフィ,データセットアーティファクトに関連付けられた何百もの驚くべき成分を明らかにする。
論文 参考訳(メタデータ) (2025-05-26T17:08:02Z) - Subobject-level Image Tokenization [60.80949852899857]
パッチベースの画像トークン化は、視覚世界の形態を無視する。
サブワードトークン化にヒントを得て,サブオブジェクトレベルの適応トークンセグメンテーションを導入する。
サブオブジェクトのトークン化は、より少ない視覚トークンを使用しながら、より高速な収束とより優れた一般化を可能にすることを示す。
論文 参考訳(メタデータ) (2024-02-22T06:47:44Z) - Siamese based Neural Network for Offline Writer Identification on word
level data [7.747239584541488]
入力語画像に基づいて文書の著者を特定する新しい手法を提案する。
本手法はテキスト独立であり,入力画像のサイズに制約を課さない。
論文 参考訳(メタデータ) (2022-11-17T10:01:46Z) - Explaining Latent Representations with a Corpus of Examples [72.50996504722293]
本稿では,サンプルベースの説明を自由に選択されたサンプル集合を参照して提供するユーザ中心の手法であるSimplExを提案する。
SimplExは、ポストホックな説明で潜伏空間に対するユーザの理解を改善するためにコーパスを使用する。
SimplExは,モデル表現を説明するコーパス内の関連パターンを強調表示することで,ユーザを力づけることを示す。
論文 参考訳(メタデータ) (2021-10-28T17:59:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。