論文の概要: Where You Measure Decides What You Measure: Position Selection in Ablation-Based SAE Evaluation
- arxiv url: http://arxiv.org/abs/2608.13337v1
- Date: Thu, 13 Aug 2026 15:06:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.574174
- Title: Where You Measure Decides What You Measure: Position Selection in Ablation-Based SAE Evaluation
- Title(参考訳): 測定値を決定する場所:アブレーションに基づくSAE評価における位置選択
- Abstract要約: 潜水剤は多くのトークンで発火し、その1つでその効果を測定する必要がある。
この選択はほとんど報告されておらず、実験者によるものではない。
これは詳細ではない。同じモデルのためにGoogleがリリースしたスパースオートエンコーダを2つと、デコーダの類似性によってその潜伏者と一致させる。
私たちは、6つのオートエンコーダを1つの初期化からトレーニングします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sparse autoencoders are meant to name the things a language model computes, and the usual way to check that a latent matters is to switch it off and see what changes. But a latent fires at many tokens, and the effect has to be measured at one of them. The convention is to measure where the latent fires hardest. That choice is almost never reported, and it is not made by the experimenter: it is made by the dictionary under evaluation. Change the dictionary and the measurement moves to a different token. We show this is not a detail. Take two sparse autoencoders released by Google for the same model and match their latents by decoder similarity: even among the pairs the two dictionaries encode almost identically, they pick different tokens for a large share of them. Two dictionaries compared under the usual protocol are therefore very often compared at different places. To separate the convention from the dictionaries we train six autoencoders from one initialisation, differing only in fitting choices, so that a latent means the same thing in each. Most of the variance such a comparison reads as "these dictionaries disagree about this latent" turns out to be the position instead: it falls from 7.6% and 11.9% of variance to near zero once every dictionary is measured at the same token. More evaluation data does not rescue it. Across a sixteenfold range of corpus sizes the dictionaries agree less about where to measure, not more, so the problem grows with scale. The correction is one line of evaluation code. We give the protocol an ablation-based causal number must report to be comparable across papers, and an audit of five published papers against it. In short: a causal number reported without its position describes the token it was taken at as much as the latent it was taken from.
- Abstract(参考訳): スパースオートエンコーダは、言語モデルが計算するものに名前を付けることを意図している。
しかし、消火剤は多くのトークンで発火し、その中の1つで効果を測定する必要がある。
大会は、潜水者が最も激しく発火する場所を測ることである。
この選択はほとんど報告されておらず、実験者によるものではなく、評価中の辞書によるものである。
辞書を変更して、測定値が別のトークンに移動します。
これは詳細ではありません。
Googleが同じモデルのためにリリースしたスパースオートエンコーダを2つ取り、デコーダの類似性によって潜伏者をマッチングする。
したがって、通常のプロトコルで比較される2つの辞書は、しばしば異なる場所で比較される。
規約を辞書から切り離すために、6つのオートエンコーダを1つの初期化から訓練する。
それらの辞書は、同じトークンで全ての辞書が測定されると、その違いの7.6%と11.9%からほぼゼロに落ちる。
さらなる評価データは、それを救わない。
16倍のコーパスサイズで、辞書はどこで測るかではなく、どこで測るかという点で一致しないため、問題はスケールとともに増大する。
補正は評価コードの1行である。
我々は、このプロトコルにアブレーションに基づく因果関係番号を報告し、論文に匹敵するようにし、それに反対する5つの論文の監査を行う。
要するに、その位置なしで報告された因果番号には、それが取られたトークンは、それから取られた潜在トークンと同じ程度に記述されている。
関連論文リスト
- Split the Labor: Separating Evidence Interpretation from Decision Aggregation [0.0]
言語モデルに多くの情報源から結論に達するよう要求するシステムは通常、それらを1つのプロンプトに分割する。
提案する4分野のエビデンス(仮説,信頼性バケット,合理性,証明)は,両半減期を決定することを示す。
この修正はアーキテクチャよりも算術的であり、言語モデル以外のルールのクラスに適用される。
論文 参考訳(メタデータ) (2026-08-14T17:24:55Z) - Accurate and Efficient Statistical Testing for Word Semantic Breadth [0.0]
分散に基づく統計は、文脈的多様性のプロキシとして機能する。
そこで本研究では,方向の相違から相違点を分離するために,世帯適応型変質試験を提案する。
本手法は, 真の広帯域差に対する感度を保ちながら, Type-I誤差を32.5%削減する。
論文 参考訳(メタデータ) (2026-05-08T17:38:36Z) - Causal Estimation of Tokenisation Bias [58.20086589761273]
我々は、訓練されたモデルが対応する文字に割り当てる確率に対して、トークンの語彙にサブワードを含むか否かを定量化する。
トークン化は、スケール、語彙、トークンサプライヤにわたるモデルのアウトプットに一貫して影響を与えます。
特に、小モデルの語彙におけるサブワードの存在は、文字の確率を最大17倍に向上させる可能性がある。
論文 参考訳(メタデータ) (2025-06-03T17:59:47Z) - Revealing the Blind Spot of Sentence Encoder Evaluation by HEROS [68.34155010428941]
文エンコーダ(SE)が類似する文ペアの種類は明らかでない。
HEROSは、ある規則に基づいて原文を新しい文に変換し、テキスト最小対を形成することによって構築される
HEROS上の60以上の教師なしSEの性能を体系的に比較することにより,ほとんどの教師なしエンコーダが否定に敏感であることを明らかにする。
論文 参考訳(メタデータ) (2023-06-08T10:24:02Z) - Solving Cosine Similarity Underestimation between High Frequency Words
by L2 Norm Discounting [19.12036493733793]
本稿では,単語間のコサイン類似度を測定する際に,その単語の周波数に埋め込まれた文脈化された単語のL2ノルムをコーパスに分解する手法を提案する。
文脈的単語類似度データセットの実験結果から,提案手法は類似度推定の難しさを正確に解決することを示した。
論文 参考訳(メタデータ) (2023-05-17T23:41:30Z) - Simple, Interpretable and Stable Method for Detecting Words with Usage
Change across Corpora [54.757845511368814]
2つの文体を比較し、その用法が異なる単語を探すという問題は、しばしばデジタル人文科学や計算社会科学において生じる。
これは一般に、各コーパスに単語の埋め込みを訓練し、ベクトル空間を整列させ、整列空間における余弦距離が大きい単語を探すことでアプローチされる。
本稿では,ベクトル空間アライメントを使わず,各単語の近傍を考慮した代替手法を提案する。
論文 参考訳(メタデータ) (2021-12-28T23:46:00Z) - Fake it Till You Make it: Self-Supervised Semantic Shifts for
Monolingual Word Embedding Tasks [58.87961226278285]
語彙意味変化をモデル化するための自己教師付きアプローチを提案する。
本手法は,任意のアライメント法を用いて意味変化の検出に利用できることを示す。
3つの異なるデータセットに対する実験結果を用いて,本手法の有用性について述べる。
論文 参考訳(メタデータ) (2021-01-30T18:59:43Z) - NLP-CIC @ DIACR-Ita: POS and Neighbor Based Distributional Models for
Lexical Semantic Change in Diachronic Italian Corpora [62.997667081978825]
本稿では,イタリア語に対する教師なし語彙意味変化のシステムと知見について述べる。
その課題は、対象の単語が時間とともにその意味を進化させたかどうかを判断することであり、それは2つの時間固有のデータセットからの原文のみに依存する。
本研究では,各期間に対象単語を表す2つのモデルを提案し,しきい値と投票方式を用いて変化単語を予測する。
論文 参考訳(メタデータ) (2020-11-07T11:27:18Z) - Lexical Sememe Prediction using Dictionary Definitions by Capturing
Local Semantic Correspondence [94.79912471702782]
セメムは人間の言語の最小の意味単位として定義されており、多くのNLPタスクで有用であることが証明されている。
本稿では,このようなマッチングを捕捉し,セメムを予測できるセメム対応プールモデルを提案する。
我々は,有名なSememe KB HowNetのモデルとベースライン手法を評価し,そのモデルが最先端のパフォーマンスを実現することを発見した。
論文 参考訳(メタデータ) (2020-01-16T17:30:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。