論文の概要: What Does Activation Steering Control? Attribution Across Answer Encodings and Output-Sensitive Subspaces
- arxiv url: http://arxiv.org/abs/2608.22985v1
- Date: Mon, 24 Aug 2026 08:50:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:44.000611
- Title: What Does Activation Steering Control? Attribution Across Answer Encodings and Output-Sensitive Subspaces
- Title(参考訳): アクティベーションステアリング制御とは何か : アンサーエンコーディングと出力感性部分空間間の属性
- Authors: Zhiwei Gao, Shaowen Peng, Shoko Wakamiya, Eiji Aramaki,
- Abstract要約: アクティベーションステアリングは、方向を構成するのに使われる答えエンコーディングに基づいて評価されることが多い。
報告された利得は、建設中に見られた回答識別子に対する意図された判断または適合性を反映することができる。
我々は,同一項目に対する回答を再エンコードしながら介入を凍結するクロスステアリング評価を導入する。
- 参考スコア(独自算出の注目度): 7.669205285895647
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Activation steering is often evaluated under the answer encoding used to construct the direction. A reported gain may reflect the intended judgment or compatibility with answer identifiers seen during construction. We introduce Cross-Encoding Steering Evaluation, which freezes an intervention while re-encoding answers to the same held-out items. On NormBank, after A/B/C identifiers are reassigned, contrastive activation addition (CAA) induces larger target-versus-source score changes for the extraction indices than for the semantic labels under the new mapping. We call this extraction-index following. Varying identifier vocabulary (A/B/C, X/Y/Z, or 1/2/3) and row order shows that the effect tracks extraction index rather than row position. After matching direction norms across layers, extraction-index following emerges mainly at later depths. A low-rank output-sensitive component containing 15.4% of the direction's squared norm retains 96.3% of this effect. An Inference-Time Intervention (ITI)-style method also favors extraction-index over semantic-label following on NormBank in three models. In aggregate, MNLI favors extraction-index following, whereas Social Chemistry 101 (SC101) favors semantic-label following. Multiple-choice and open-ended evaluations can yield different behavioral conclusions. Thus, a steering gain under one answer encoding does not by itself identify what the intervention controls.
- Abstract(参考訳): アクティベーションステアリングは、方向を構成するのに使われる答えエンコーディングに基づいて評価されることが多い。
報告された利得は、建設中に見られた回答識別子に対する意図された判断または適合性を反映することができる。
我々は,相互符号化ステアリング評価を導入し,介入を凍結し,解答を同じ保持項目に再エンコードする。
NormBankでは、A/B/C識別子が再割り当てされた後、コントラストアクティベーション加算(CAA)は、新しいマッピングの下でのセマンティックラベルよりも、抽出指標に対してより大きな目標-逆ソーススコア変化を誘導する。
この抽出インデックスを以下と呼ぶ。
Varying Identification vocabulary (A/B/C, X/Y/Z, 1/2/3) and row order is that the effect track extract index than row position。
層間の方向ノルムが一致した後、抽出-インデックスの追従は主に後深度で現れる。
方向の2乗ノルムの15.4%を含む低ランクの出力感度成分は、この効果の96.3%を保持する。
Inference-Time Intervention (ITI) スタイルの手法は、NormBankの3つのモデルにおけるセマンティックラベルよりも抽出-インデックスを好んでいる。
総合的には、MNLIは抽出-インデックスを好んでおり、社会化学101(SC101)はセマンティック-ラベルを好んでいる。
複数選択とオープンな評価は、異なる行動的な結論をもたらす可能性がある。
したがって、1つの回答エンコーディングの下でのステアリングゲインは、介入が制御するものをそれ自体は特定しない。
関連論文リスト
- The Illusion of Control: Why Bare Classifier Inversion Silently Fails in Concept-Bottleneck Text Generation [0.30693357740321775]
コンセプション・ブートネック制御可能生成路は低次元概念コードを介してマルチ属性制御を行う。
我々はこの問題を多軸合成一般化の下で概念ボトルネックテキスト生成において研究する。
論文 参考訳(メタデータ) (2026-08-24T08:21:10Z) - Rethinking Item Tokenization in Generative Recommenders: From Fixed Atoms to Semantic Subwords [50.621722853036005]
生成レコメンデーションシステムでは、アイテムは通常、自己回帰的次イテム予測のために固定長のセマンティックIDシーケンスにトークン化される。
ユーザコンテキストのモデリングでは、このきめ細かい表現が注意の過負荷を引き起こす。
本稿では,歴史的項目を可変長のセマンティック・サブワードとして表現するセマンティック・サブワード・トークン化(SST)を提案する。
論文 参考訳(メタデータ) (2026-08-24T02:42:51Z) - Structuring Semantic Embeddings for Principle Evaluation: A Prototype-Guided Contrastive Learning Approach [58.15427952222424]
汎用的なテキスト埋め込みはそのようなタスクに広くデプロイされているが、意味的類似性は意味的に似ているがタスク固有の例を示すことができる。
本稿では,凍結したテキスト埋め込み上に構築された幾何正規化モジュールであるPGCL(Prototype-Guided Contrastive Learning)を紹介する。
論文 参考訳(メタデータ) (2026-08-15T13:19:25Z) - Between Zeros and Ones: Behavioral Characterization Beyond Binary Labeling Across Public ICS Datasets [0.12249546377051435]
インダストリアル・コントロール・システムにおける侵入検知は、通常、バイナリ・ノーマル(バイナリ・ノーマル)とアタック(アタック)のラベルを用いて、少数の公開ベンチマークで評価される。
生の多変量プロセストレースを5つの解釈可能な物理プリミティブにマッピングする行動特徴化フレームワークを提案する。
攻撃ウィンドウは正常な動作に対して明らかな行動変化を示すのに対し,3つのデータセットは行動空間のほぼ異なる領域を占めることを示す。
論文 参考訳(メタデータ) (2026-06-29T15:58:34Z) - Is Inference Mediated by Distinct Semantic Structures in LLMs? A Mechanistic Interpretation [34.50304918655722]
トランスフォーマー表現はラベルレベルの情報を運ぶことが知られているが、それらのラベルを生成するセマンティック操作をエンコードしているかどうかは不明である。
一つの意味変換によって異なる制御された前提-仮説ペアを用いて、自然言語推論においてこれを考察する。
論文 参考訳(メタデータ) (2026-05-25T07:21:07Z) - Differentiable Semantic ID for Generative Recommendation [65.83703273297492]
生成的推薦は、各項目がリッチコンテンツから学習された個別意味ID(SID)によって表現される新しいパラダイムを提供する。
実際には、SIDはレコメンデーションの正確さよりもコンテンツ再構成に最適化されるのが一般的である。
自然なアプローチは、セマンティックインデックスを差別化して、レコメンデーショングラデーションが直接SID学習に影響を与えるようにすることだ。
本稿では,ジェネレーティブレコメンデーションのための効果的な識別可能なセマンティックIDに向けた第一歩として,DIGERを提案する。
論文 参考訳(メタデータ) (2026-01-27T15:34:11Z) - Ambiguity-Resistant Semi-Supervised Learning for Dense Object Detection [98.66771688028426]
本研究では,一段階検出器のためのAmbiguity-Resistant Semi-supervised Learning (ARSL)を提案する。
擬似ラベルの分類とローカライズ品質を定量化するために,JCE(Joint-Confidence Estimation)を提案する。
ARSLは、曖昧さを効果的に軽減し、MS COCOおよびPASCALVOC上で最先端のSSOD性能を達成する。
論文 参考訳(メタデータ) (2023-03-27T07:46:58Z) - DSLA: Dynamic smooth label assignment for efficient anchor-free object
detection [18.043176234010517]
アンカーフリー検出器は、基本的にオブジェクト検出を密な分類と回帰として定式化する。
局所化の質を推定するために、個別の予測分岐を導入するのが一般的である。
分類と品質評価の実践を掘り下げると、以下の矛盾が観測される。
論文 参考訳(メタデータ) (2022-08-01T12:56:44Z) - Rethinking Pseudo Labels for Semi-Supervised Object Detection [84.697097472401]
物体検出に適した確実な擬似ラベルを導入する。
我々は,クラス不均衡問題を緩和するために,各カテゴリの擬似ラベルと再重み付き損失関数を生成するために使用する閾値を動的に調整する。
提案手法では,COCOのラベル付きデータのみを用いて,教師付きベースラインを最大10%改善する。
論文 参考訳(メタデータ) (2021-06-01T01:32:03Z) - GRACE: Gradient Harmonized and Cascaded Labeling for Aspect-based
Sentiment Analysis [90.43089622630258]
本稿では、これらの問題を解決するために、GRACE(GRadient hArmonized and CascadEd labeling model)を提案する。
提案モデルでは,複数のベンチマークデータセットの整合性向上を実現し,最先端の結果を生成する。
論文 参考訳(メタデータ) (2020-09-22T13:55:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。