論文の概要: PULSE: Identifying Demonstration-Utility Features with Sparse Autoencoders
- arxiv url: http://arxiv.org/abs/2609.32469v1
- Date: Sat, 26 Sep 2026 11:00:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 08:50:01.877998
- Title: PULSE: Identifying Demonstration-Utility Features with Sparse Autoencoders
- Title(参考訳): PULSE: スパースオートエンコーダによるデモ-ユーティリティ機能の検出
- Abstract要約: インコンテキスト学習は、デモの選択に非常に敏感である。
ほとんどのメソッドは、外部クエリ-デモの類似性を使ってデモを選択する。
実演ユーティリティに関連するモデル内特徴を識別するフレームワークであるPULSEを紹介する。
- 参考スコア(独自算出の注目度): 6.205204675249111
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In-context learning is highly sensitive to demonstration choice, yet most methods select demonstrations using external query-demonstration similarity. Such criteria can miss model-specific signals: Similar demonstrations may activate different internal features and downstream behaviors. We introduce PULSE (Paired Utility Localization over Sparse Encodings), an SAE-based framework for identifying model-internal features associated with demonstration utility and using them for demonstration selection. Using a small labeled discovery set, PULSE samples candidate demonstration sets, measures their zero-shot-relative utility under the target model, and scores SAE features by how their activation differences align with utility differences. The top positive and negative coordinates form a sparse utility-localization vector. We use this vector in two complementary ways: as a signed score for controlled complete-set ranking, and as PULSE-Retriever, which converts its magnitude into a feature-relevance mask for scalable pool-scale retrieval. Across classification, generation, and reasoning benchmarks, PULSE-Retriever improves over the strongest baseline by 2-3 accuracy points, 0.6-0.9 BLEU-4, and 3.2 exact-match points, respectively, while controlled ranking validates the identified features encode a predictive set-level utility signal. Feature inspection and cross-dataset experiments suggest that the identified features capture task-relevant, dataset-conditioned patterns, yet retain utility signals that partially transfer across datasets. Our code is available at https://github.com/aohenuo/PULSE.
- Abstract(参考訳): インコンテキスト学習はデモ選択に非常に敏感であるが、ほとんどのメソッドは外部クエリ-デモレーション類似性を使ってデモを選択する。
このような基準は、モデル固有のシグナルを見逃す可能性がある。
SAEベースのフレームワークであるPULSE(Paired Utility Localization over Sparse Encodings)を導入する。
ラベル付き小さな発見セットを使用して、PULSEは候補のデモセットをサンプリングし、ターゲットモデルの下でゼロショット相対ユーティリティを測定し、それらのアクティベーションの違いがユーティリティの違いとどのように一致しているかでSAE特徴を評価する。
最上位の正座標と負座標はスパース効用局在ベクトルを形成する。
我々はこのベクトルを、制御された完全集合ランク付けのための符号付きスコアとして、また、その大きさを拡張性のあるプールスケール検索のための機能関連マスクに変換するPULSE-Retrieverとして、2つの補完的な方法で利用する。
分類、生成、推論のベンチマーク全体で、PULSE-Retrieverは最強のベースラインを2-3の精度ポイント、0.6-0.9 BLEU-4、および3.2の正確なマッチポイントで改善する。
機能検査とデータセット間の実験により、特定された機能はタスク関連、データセット条件付きパターンをキャプチャするが、データセットを部分的に転送するユーティリティ信号を保持することが示唆されている。
私たちのコードはhttps://github.com/aohenuo/PULSE.comで公開されています。
関連論文リスト
- Enhancing SAE-based Steering via Neighbor Integrated Feature Selection [31.036828083938868]
ほとんどのSAEベースのステアリング手法は、統計スコアに基づいてトップフィルタを適用して特徴を選択する。
この仮定は、しばしば無効であり、最適でない特徴の選択につながることを示す。
ステアリングにおける特徴選択を改善するために,textscNeighbor Integrated Feature Selection (textscNIFS)を提案する。
論文 参考訳(メタデータ) (2026-08-28T19:18:49Z) - Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features [1.5874067490843806]
Control Reinforcement Learningは、各トークンでステアリングするためのSAE機能を選択するポリシーをトレーニングし、解釈可能な介入ログを生成する。
Adaptive Feature Maskingは、単一機能解釈性を維持しながら、多様な機能発見を促進する。
MMLU、BBQ、GSM8K、HarmBench、XSTestにわたるGemma 2Bでは、CRLは、トークン単位の介入ログを提供しながら改善されている。
論文 参考訳(メタデータ) (2026-02-11T02:28:49Z) - Stochastic Encodings for Active Feature Acquisition [100.47043816019888]
Active Feature Acquisitionは、インスタンスワイドでシーケンシャルな意思決定問題である。
目的は、テストインスタンスごとに独立して、現在の観測に基づいて計測する機能を動的に選択することである。
一般的なアプローチは強化学習(Reinforcement Learning)であり、トレーニングの困難を経験する。
我々は、教師付きで訓練された潜在変数モデルを導入し、潜在空間における観測不能な実現の可能性の多くにまたがる特徴を推論することで獲得する。
論文 参考訳(メタデータ) (2025-08-03T23:48:46Z) - SAEs Are Good for Steering -- If You Select the Right Features [45.47261543304217]
現在の方法では、それらを活性化する入力トークンを分析して、SAEの機能をステアに識別する。
本研究では,主にモデル入力のパターンをキャプチャする入力特徴と,モデル出力に対する人間の理解可能な影響を持つ出力特徴の2つの特徴を区別する。
論文 参考訳(メタデータ) (2025-05-26T14:47:59Z) - Collaborative Feature-Logits Contrastive Learning for Open-Set Semi-Supervised Object Detection [75.02249869573994]
オープンセットのシナリオでは、ラベルなしデータセットには、イン・ディストリビューション(ID)クラスとアウト・オブ・ディストリビューション(OOD)クラスの両方が含まれている。
このような設定で半教師付き検出器を適用すると、OODクラスをIDクラスとして誤分類する可能性がある。
我々は、CFL-Detector(Collaborative Feature-Logits Detector)と呼ばれるシンプルで効果的な方法を提案する。
論文 参考訳(メタデータ) (2024-11-20T02:57:35Z) - Downstream-Pretext Domain Knowledge Traceback for Active Learning [138.02530777915362]
本稿では、下流知識と事前学習指導のデータ相互作用をトレースするダウンストリーム・プレテキスト・ドメイン知識トレース(DOKT)手法を提案する。
DOKTは、トレースバックの多様性指標とドメインベースの不確実性推定器から構成される。
10のデータセットで行った実験は、我々のモデルが他の最先端の手法よりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-20T01:34:13Z) - Revisiting the Evaluation of Image Synthesis with GANs [55.72247435112475]
本研究では, 合成性能の評価に関する実証的研究を行い, 生成モデルの代表としてGAN(Generative Adversarial Network)を用いた。
特に、表現空間におけるデータポイントの表現方法、選択したサンプルを用いた公平距離の計算方法、各集合から使用可能なインスタンス数など、さまざまな要素の詳細な分析を行う。
論文 参考訳(メタデータ) (2023-04-04T17:54:32Z) - AutoAssign: Differentiable Label Assignment for Dense Object Detection [94.24431503373884]
Auto COCOは、物体検出のためのアンカーフリー検出器である。
外観認識は、完全に微分可能な重み付け機構によって実現される。
我々の最良のモデルでは52.1%のAPが達成され、既存の1段検出器よりも優れている。
論文 参考訳(メタデータ) (2020-07-07T14:32:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。