論文の概要: Topological Steering
- arxiv url: http://arxiv.org/abs/2609.00597v1
- Date: Tue, 01 Sep 2026 02:36:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.244734
- Title: Topological Steering
- Title(参考訳): トポロジカルステアリング
- Authors: Benoît Guérand, Tan Minh Nguyen,
- Abstract要約: 本稿では,活性化空間のトポロジ的表現を通じて,大規模言語モデル(LLM)を操る新しいフレームワークを提案する。
トポロジカルステアリングは、複数のモデルファミリおよびモデルサイズにわたるLCMの挙動を一貫して調整することを示す。
- 参考スコア(独自算出の注目度): 14.201040196058878
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: With the rapid rise of large language models (LLMs), controlling undesirable model behaviors has become increasingly important. Existing behavioral control methods typically intervene directly in activation or feature space, but such approaches can be sensitive to outliers, distributional shifts, noise, and other local perturbations. Motivated by Topological Data Analysis (TDA), which captures global rather than purely local structure, we propose Topological Steering, a new framework for steering LLM behavior through the topological representation of activation spaces. Using persistence diagrams, our method connects activation-based steering with TDA and enables more robust behavioral control. We show that Topological Steering consistently modifies LLM behavior across multiple model families and model sizes.
- Abstract(参考訳): 大規模言語モデル(LLM)の急速な普及に伴い、望ましくないモデルの振る舞いを制御することがますます重要になっている。
既存の行動制御法は、通常、アクティベーションや特徴空間に直接介入するが、そのようなアプローチは、外れ値、分布シフト、ノイズ、その他の局所摂動に敏感である。
純粋に局所的な構造ではなくグローバルな構造を捉えたトポロジカルデータ解析(TDA)によって動機付け,活性化空間のトポロジカル表現を通じてLLMの振る舞いを操る新しいフレームワークであるトポロジカルステアリングを提案する。
本手法は, 持続性図を用いて, アクティベーションベースのステアリングとTDAを結合し, より堅牢な動作制御を実現する。
トポロジカルステアリングは、複数のモデルファミリおよびモデルサイズにわたるLCMの挙動を一貫して調整することを示す。
関連論文リスト
- Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control [3.3394856680250284]
本研究では,世界行動モデル(WAM)の活性化空間における頑健性関連摂動の表現について検討する。
成功したロールアウトと失敗したロールアウトのアクティベーションを比較すると、いくつかのWAMアーキテクチャはロバストネスクリティカルな特徴に対して低次元線形分離性を示す。
これにより、トレーニングフリーのWAMステアリングにおける対照的なアクティベーション方向の使用がモチベーションとなる。
また, WAMアクティベーションダイナミクスの局所線形性はモデルベース最適制御による効率的なフィードバックステアリングを可能にすることを示す。
論文 参考訳(メタデータ) (2026-07-16T12:52:49Z) - Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation [74.17379276939599]
近年のQwen-3.5シリーズにおいても,アクティベーションステアリングが広範囲のアライメントを引き起こすことが示されている。
ステアリングサイズ, ステアリングサブスペースの低ランク構造, ステアリングベクター構築時のエポック数など, キーステアリング固有の因子を解析することにより, AS誘起EMの特性を特徴づける。
論文 参考訳(メタデータ) (2026-06-07T15:34:59Z) - Local Linearity of LLMs Enables Activation Steering via Model-Based Linear Optimal Control [2.752817022620644]
推論時間LLMアライメント法は、生成中のアクティベーションを直接修正することで、微調整の代替となる。
複数のLLMアーキテクチャとスケールの層ワイドダイナミクスが局所線形モデルによってよく近似されていることを示す。
我々は, ステアリング性能の正式な保証を可能にするために, セットポイント追従誤差の理論的境界を導出する。
論文 参考訳(メタデータ) (2026-04-21T03:09:46Z) - Reasoning-Driven Multimodal LLM for Domain Generalization [72.00754603114187]
DomainBed-Reasoning データセットを用いた領域一般化における推論の役割について検討する。
MTCT(Multi-Task Cross-Training)とSARR(Self-Aligned Reasoning Regularization)の2つのコンポーネントからなるフレームワークであるRD-MLDGを提案する。
標準のDomainBedデータセットの実験は、RD-MLDGが補完的な最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2026-02-27T08:10:06Z) - Why Steering Works: Toward a Unified View of Language Model Parameter Dynamics [81.80010043113445]
局所的な微調整、LoRAに基づく適応、およびアクティベーションに基づく介入を分離して研究する。
制御信号によって誘導される動的ウェイト更新として、これらの介入をフレーム化する統一的な視点を示す。
提案手法では,選択と効用との間に一貫したトレードオフが観測される。
論文 参考訳(メタデータ) (2026-02-02T17:04:36Z) - Mechanistic interpretability for steering vision-language-action models [0.23371356738437823]
VLA(Vision-Language-Action)モデルは、一般のエンボディエージェントを実現するための有望な道である。
本稿では,VLAを内部表現で解釈し,操作するための最初のフレームワークを紹介する。
我々は、微調整、報酬信号、環境相互作用を伴わずに、リアルタイムに行動を調整する汎用的なアクティベーションステアリング手法を提案する。
論文 参考訳(メタデータ) (2025-08-30T03:01:57Z) - Navigating Motion Agents in Dynamic and Cluttered Environments through LLM Reasoning [69.5875073447454]
本稿では,大規模言語モデル(LLM)によって強化された動作エージェントを,動的・乱雑な環境における自律的なナビゲーションに向けて前進させる。
トレーニング不要なフレームワークは、マルチエージェント調整、クローズドループ計画、動的障害物回避を、リトレーニングや微調整なしでサポートしています。
論文 参考訳(メタデータ) (2025-03-10T13:39:09Z) - LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models [16.37602070339033]
LLM(Large Language Models)は、意味的に等価なパラフレーズ入力によって、しばしば一貫性のない応答を生成する。
セマンティック不整合の原因となる潜在特徴表現を正確に識別する新しいアクティベーションステアリング手法LF-ステアリングを提案する。
本手法は, 関連トランス層の隠蔽状態をスパースオートエンコーダに基づいて, 疎活性化された高次元特徴空間にマッピングする。
論文 参考訳(メタデータ) (2025-01-19T13:06:51Z) - GEM: Group Enhanced Model for Learning Dynamical Control Systems [78.56159072162103]
サンプルベースの学習が可能な効果的なダイナミクスモデルを構築します。
リー代数ベクトル空間上のダイナミクスの学習は、直接状態遷移モデルを学ぶよりも効果的であることを示す。
この研究は、ダイナミクスの学習とリー群の性質の関連性を明らかにし、新たな研究の方向への扉を開く。
論文 参考訳(メタデータ) (2021-04-07T01:08:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。