論文の概要: When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search
- arxiv url: http://arxiv.org/abs/2605.16362v1
- Date: Sat, 09 May 2026 14:26:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 23:51:08.293133
- Title: When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search
- Title(参考訳): ランク1ステアリングチープはいつになるか? 幾何, 粒度, 予算探索
- Abstract要約: アクティベーションステアリングは、再トレーニングせずにLSMを制御する軽量な方法を提供するが、その効果は概念によって大きく異なる。
我々は介入層と係数に対する予算制約付き最適化としてランク1ステアリングを定式化する。
操作困難の原因の診断にアクティベーション幾何を利用するグラニュラリティおよび表現認識概念工学フレームワークである textitGRACE を提案する。
- 参考スコア(独自算出の注目度): 61.73232505100331
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Activation steering offers a lightweight way to control LLMs without retraining, but its effectiveness varies sharply across concepts. Prior work often reads this variability as evidence that many concepts are not captured by a single steering direction. We argue instead that much of it reflects search difficulty: a useful rank-1 intervention often exists, but finding it can be expensive. We formalize rank-1 steering as a budget-constrained optimization over intervention layer and coefficient. Across concepts and model families, prompt-boundary directional alignment predicts where effective interventions occur, enabling geometry-guided search that reaches high utility with substantially fewer evaluations, reducing the trials needed to recover 95\% of best-found utility by 39.8\% on average across three model families. To explain why some concepts remain expensive even under better search, we introduce \emph{concept granularity}, a measure of directional heterogeneity across contrastive contexts. Granularity distinguishes concepts whose difference vectors share a stable global direction from those where prompts agree locally within each input but the utility-maximizing direction rotates systematically across inputs. Higher granularity is associated with slower convergence and lower best-found performance (Pearson $r{=}0.44$ with trials-to-95\%, $r{=}{-}0.46$ with best-found utility, both $p<0.001$). We present \textit{GRACE}, a Granularity- and Representation-Aware Concept Engineering framework that uses activation geometry to diagnose the dominant source of steering difficulty, select the appropriate remedy, and allocate optimization effort efficiently. Our results shift the frame from ``\textit{when does rank-1 fail?}'' to ``\textit{when is rank-1 cheap and stable?}'', turning activation geometry from a descriptive tool into an actionable prior for LLM control.
- Abstract(参考訳): アクティベーションステアリングは、再トレーニングせずにLSMを制御する軽量な方法を提供するが、その効果は概念によって大きく異なる。
以前の研究では、多くの概念が単一の操舵方向で捉えられていないという証拠として、この変数がしばしば読まれている。
有用なランク1の介入がしばしば存在するが、コストがかかる可能性がある。
我々は介入層と係数に対する予算制約付き最適化としてランク1ステアリングを定式化する。
概念やモデルファミリ全体にわたって、プロンプト境界方向アライメントは効果的な介入が発生する場所を予測し、3つのモデルファミリの平均で95%の最良のユーティリティを39.8倍に回復させるために必要なトライアルを削減し、非常に少ない評価で高いユーティリティに達する幾何学誘導探索を可能にする。
より良い探索の下でも、なぜいくつかの概念が高価であり続けるのかを説明するために、対照的な文脈における方向性の不均一性の尺度である 'emph{concept Granity} を導入する。
粒度は、差分ベクトルが安定な大域方向を共有する概念と、各入力内でプロンプトが局所的に一致する概念とを区別するが、実用最大化方向は入力間で体系的に回転する。
Pearson $r{=}0.44$ with trial-to-95\%, $r{=}{-}0.46$ with best-found utility, both $p<0.001$)。
本稿では, 操作困難の原因の診断, 適切な治療法の選択, 最適化作業を効率的に行うために, アクティベーション幾何を用いた粒度・表現・認識概念工学フレームワークである「textit{GRACE}」を提案する。
我々の結果はフレームを ``\textit{when does rank-1 fail?
が ``\textit{when is rank-1 cheap and stable?
LLMコントロールでは、アクティベーションのジオメトリを記述ツールから動作可能なプリミティブに変換する。
関連論文リスト
- $\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space [71.23672814629448]
$nabla$-Reasonerは、トークンログに対する差別化可能な最適化をデコードループに統合する反復生成フレームワークである。
$nabla$-Reasonerは、挑戦的な数学的推論ベンチマークで20%以上の精度の向上を実現している。
論文 参考訳(メタデータ) (2026-03-05T08:42:54Z) - Subspace Geometry Governs Catastrophic Forgetting in Low-Rank Adaptation [0.0]
Low-Rank Adaptation (LoRA) は、大規模な事前学習モデルに適応するためのパラメータ効率の高いアプローチとして登場した。
勾配部分空間相互作用のレンズを通して,LoRAにおける破滅的忘れを特徴付ける幾何学的理論を提案する。
論文 参考訳(メタデータ) (2026-02-10T22:45:47Z) - When Is Rank-1 Enough? Geometry-Guided Initialization for Parameter-Efficient Fine-Tuning [18.50038551163168]
低ランク設定、特に Rank-1 LoRA は不安定であることが多い。
そこで我々はGap-Initを提案し、ランク1のLoRA方向を小さなキャリブレーションセットから推定したモダリティギャップベクトルと整列する。
我々の結果は、極端に低いランクの限界において、初期アライメントはランクそのものと同じくらい重要であることを示唆している。
論文 参考訳(メタデータ) (2026-02-02T01:31:25Z) - Amortized Latent Steering: Low-Cost Alternative to Test-Time Optimization [3.9311957222075935]
Amortized Latent Steering (ALS)は、反復最適化を1つのオフライン計算ベクトルに分解する。
ALSは反復的手法よりも2~5倍のスピードアップを達成し、強欲なCoT(Chain-of-Thought)と自己一貫性(Self-Consistency)のベースラインをマッチまたは超過する。
結果から,潜伏最適化のメリットの大部分はオフラインで取得可能であることが示され,高度な推論技術が本番デプロイメントに有効であることが確認された。
論文 参考訳(メタデータ) (2025-09-10T07:03:35Z) - AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders [73.37603699731329]
ステアリングと概念検出のための大規模ベンチマークであるAxBenchを紹介する。
ステアリングでは、すべての既存のメソッドを高速に処理し、次いで微調整する。
概念検出では、差分のような表現に基づく手法が最善を尽くす。
論文 参考訳(メタデータ) (2025-01-28T18:51:24Z) - Cost Aware Best Arm Identification [13.380383930882784]
emphCost Aware Best Arm Identification (CABAI)と呼ぶ。
平方根規則に基づくemphChernoff Overlap (CO)と呼ばれる単純なアルゴリズムを提案する。
この結果から,不均一な動作コストを無視すると,実行時の準最適性が得られ,また,簡単なアルゴリズムにより,幅広い問題に対してほぼ最適性能が得られることがわかった。
論文 参考訳(メタデータ) (2024-02-26T16:27:08Z) - Cooperative Thresholded Lasso for Sparse Linear Bandit [6.52540785559241]
本稿では,マルチエージェント・スパース文脈線形帯域問題に対処する新しい手法を提案する。
疎線形帯域における行単位の分散データに対処する最初のアルゴリズムである。
後悔を最小限に抑えるために効率的な特徴抽出が重要となる高次元マルチエージェント問題に適用可能である。
論文 参考訳(メタデータ) (2023-05-30T16:05:44Z) - TransPath: Learning Heuristics For Grid-Based Pathfinding via
Transformers [64.88759709443819]
探索の効率を顕著に向上させると考えられる,インスタンス依存のプロキシを学習することを提案する。
私たちが最初に学ぶことを提案するプロキシは、補正係数、すなわち、インスタンスに依存しないコスト・ツー・ゴの見積もりと完璧な見積もりの比率である。
第2のプロキシはパス確率であり、グリッドセルが最も短いパスに横たわっている可能性を示している。
論文 参考訳(メタデータ) (2022-12-22T14:26:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。