論文の概要: Mechanistic Personality Analysis of LLMs Steering Personality via Latent Feature Interventions
- arxiv url: http://arxiv.org/abs/2606.28770v1
- Date: Sat, 27 Jun 2026 06:53:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.683292
- Title: Mechanistic Personality Analysis of LLMs Steering Personality via Latent Feature Interventions
- Title(参考訳): 潜在的特徴介入によるLLMのステアリングパーソナリティの機械的パーソナリティ解析
- Authors: David Courtis, Ting Hu,
- Abstract要約: LLM(Large Language Models)は、人のようなOCEANの性格特性を生成テキストでシミュレートする能力を実証した。
本稿では,モデルの潜在機能に直接介入する機械的解釈可能性アプローチを提案する。
提案手法は,標準的なベンチマークで高い性能を維持しつつ,機械的レベルの人格特性を制御的に操る上で有望であることを示す。
- 参考スコア(独自算出の注目度): 1.5759334013114106
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) have demonstrated the ability to simulate human-like OCEAN personality traits in generated text. Previous efforts have focused on prompt engineering or fine-tuning to shape LLM personality. In this work, we propose a mechanistic interpretability approach that directly intervenes on the model's latent features. Our method identifies latent directions in the residual stream corresponding to a target OCEAN trait using sparse autoencoders (SAEs) and contrastive activation analysis. We formalize an additive steering vector in activation space and demonstrate how applying a small additive shift to the hidden states enhances the target trait while preserving overall language modeling performance. To determine the optimal combination of feature shifts, we explore a linear weighting heuristic with grid search optimization that balances personality expression with task performance. Our approach shows promise in controllably steering personality traits at the mechanistic level while maintaining high performance on standard benchmarks.
- Abstract(参考訳): LLM(Large Language Models)は、人のようなOCEANの性格特性を生成テキストでシミュレートする能力を実証した。
これまでの努力は、LLMのパーソナリティを形作るためのエンジニアリングや微調整に重点を置いてきた。
本研究では,モデルの潜在機能に直接介入する機械的解釈可能性アプローチを提案する。
提案手法は, スパースオートエンコーダ (SAE) と対照的なアクティベーション解析を用いて, ターゲットOCEAN特性に対応する残差流の遅延方向を同定する。
アクティベーション空間における加算ステアリングベクトルを定式化し、隠れ状態に小さな加算シフトを適用することで、言語モデリング性能を保ちながら、ターゲット特性を高める方法を示す。
特徴シフトの最適組み合わせを決定するために,特徴量表現とタスク性能のバランスをとる格子探索最適化を用いた線形重み付けヒューリスティックを探索する。
提案手法は,標準的なベンチマークで高い性能を維持しつつ,機械的レベルの人格特性を制御的に操る上で有望であることを示す。
関連論文リスト
- Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models [80.45129499188461]
我々はQwenモデルファミリ上に構築されたスパースオートエンコーダ(SAE)のオープンソーススイートであるQwen-Scopeを紹介する。
SAEはポストホック解析を超越して,4方向のモデル開発のための実用的なインターフェースとして機能することを示す。
論文 参考訳(メタデータ) (2026-05-12T10:01:06Z) - PERSONA: Dynamic and Compositional Inference-Time Personality Control via Activation Vector Algebra [84.59328460968872]
大規模言語モデルにおけるパーソナリティ制御の現在の手法は、静的なプロンプトや高価な微調整に依存している。
ペルソナ(PERSONA)は、人格ベクトルを直接操作することで、微調整レベルのパフォーマンスを実現する訓練不要のフレームワークである。
PersonalityBenchでは、この手法は平均スコア9.60を達成し、教師付き微調整上界9.61とほぼ一致している。
論文 参考訳(メタデータ) (2026-02-17T15:47:58Z) - Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features [1.5874067490843806]
Control Reinforcement Learningは、各トークンでステアリングするためのSAE機能を選択するポリシーをトレーニングし、解釈可能な介入ログを生成する。
Adaptive Feature Maskingは、単一機能解釈性を維持しながら、多様な機能発見を促進する。
MMLU、BBQ、GSM8K、HarmBench、XSTestにわたるGemma 2Bでは、CRLは、トークン単位の介入ログを提供しながら改善されている。
論文 参考訳(メタデータ) (2026-02-11T02:28:49Z) - From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language Models [77.04403907729738]
このサーベイは、受動的診断基準からリアルタイムモデル動作を導くアクティブ制御信号への不確実性の進化をグラフ化する。
3つのフロンティアにまたがるアクティブ制御信号として不確実性がいかに活用されているかを示す。
この調査は、次世代のスケーラブルで信頼性があり、信頼できるAIを構築するためには、新しい不確実性のトレンドを習得することが不可欠である、と論じている。
論文 参考訳(メタデータ) (2026-01-22T06:21:31Z) - When the Coffee Feature Activates on Coffins: An Analysis of Feature Extraction and Steering for Mechanistic Interpretability [0.0]
機械的解釈可能性に関する人類学の最近の研究は、大規模言語モデルを理解し制御することを主張している。
我々は、Llama 3.1のオープンソースSAEで主要な結果を複製することで、これらの主張の最初のストレステストを行う。
機能ステアリングは, 層選択, ステアリングサイズ, コンテキストに敏感で, かなり脆弱であることがわかった。
論文 参考訳(メタデータ) (2026-01-06T14:29:51Z) - Mechanistic Knobs in LLMs: Retrieving and Steering High-Order Semantic Features via Sparse Autoencoders [8.188989044347595]
意味論的に解釈可能な内部特徴の検索とステアリングのためのスパースオートエンコーダベースのフレームワークを提案する。
本研究では,ビッグファイブの性格特性をケーススタディとして用いて,モデル行動の正確かつ双方向なステアリングを可能にすることを実証する。
論文 参考訳(メタデータ) (2026-01-06T12:40:37Z) - Activation-Space Personality Steering: Hybrid Layer Selection for Stable Trait Control in LLMs [10.99947795031516]
大きな言語モデルは、その世代において暗黙の個性を示すが、特定のニーズを満たすためにこれらの特性を確実に制御または調整することは、未解決の課題である。
本稿では,大きな5つのパーソナリティ特性を用いて,変圧器層から隠れ状態のアクティベーションを抽出するパイプラインを提案する。
本研究により, 人格特性が低ランク共有部分空間を占有し, これらの潜在構造を有効操舵機構に変換できることが判明した。
論文 参考訳(メタデータ) (2025-10-29T05:56:39Z) - The Personality Illusion: Revealing Dissociation Between Self-Reports & Behavior in LLMs [60.15472325639723]
人格特性は、人間の行動の予測因子として長い間研究されてきた。
近年のLarge Language Models (LLM) は, 人工システムに類似したパターンが出現する可能性を示唆している。
論文 参考訳(メタデータ) (2025-09-03T21:27:10Z) - IROTE: Human-like Traits Elicitation of Large Language Model via In-Context Self-Reflective Optimization [66.6349183886101]
IROTEは,安定かつ伝達可能な特性抽出のための新しいインコンテキスト手法である。
IROTEが生成する1つの自己反射は、様々な下流タスクにまたがる目標特性の安定な偽造を LLM が引き起こすことを示す。
論文 参考訳(メタデータ) (2025-08-12T08:04:28Z) - LLMvsSmall Model? Large Language Model Based Text Augmentation Enhanced
Personality Detection Model [58.887561071010985]
パーソナリティ検出は、ソーシャルメディア投稿に根ざした性格特性を検出することを目的としている。
既存のほとんどのメソッドは、事前訓練された言語モデルを微調整することで、ポスト機能を直接学習する。
本稿では,大規模言語モデル (LLM) に基づくテキスト拡張強化人格検出モデルを提案する。
論文 参考訳(メタデータ) (2024-03-12T12:10:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。