論文の概要: The Geometry of Personality: Activation Steering with Jungian Cognitive Functions
- arxiv url: http://arxiv.org/abs/2607.20803v1
- Date: Thu, 23 Jul 2026 00:18:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.251417
- Title: The Geometry of Personality: Activation Steering with Jungian Cognitive Functions
- Title(参考訳): パーソナリティの幾何学--ユング認知機能を用いたアクティベーションステアリング
- Abstract要約: ユング語評価プロトコルと2100以上の文字ナレーションのデータセットからなるフレームワークを提案する。
Llama-3.1-8Bの活性化ステアリングベクター抽出と評価実験は、8つの認知機能すべてに対して効果的な単調制御を示す。
- 参考スコア(独自算出の注目度): 8.346587569600844
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Activation steering enables control and interpretation of LLMs, yet existing work primarily models personality through static trait frameworks such as the Big Five. We investigate whether personality can instead be represented and controlled as a set of cognitive processes using the eight Jungian Cognitive Functions. To this end, we introduce a framework comprising a Jungian evaluation protocol and a dataset of over 2,100 role-playing character narrations. Activation steering vector extraction and evaluation experiments on Llama-3.1-8B demonstrate effective monotonic control over all eight cognitive functions through activation steering. Beyond controllability, our analysis reveals that: 1. personality information is concentrated in middle transformer layers; 2. steering vectors exhibit structured geometric relationships consistent with distinctions between rational and irrational functions; 3. effective multi-dimensional steering directions cannot be recovered as linear combinations of single-function directions. These findings provide new insights into the representation of personality in LLM activation space and establish a framework for studying interpretable, effective, and multi-dimensional personality control.
- Abstract(参考訳): アクティベーションステアリングはLLMの制御と解釈を可能にするが、既存の作業は主にBig Fiveのような静的な特徴フレームワークを通じてパーソナリティをモデル化する。
8つのユング的認知機能を用いた認知過程の集合としてパーソナリティを表現・制御できるかどうかを検討する。
そこで本研究では,ユング語評価プロトコルと2100以上のロールプレイング文字ナレーションのデータセットからなるフレームワークを提案する。
Llama-3.1-8Bの活性化ステアリングベクター抽出と評価実験は、活性化ステアリングによる8つの認知機能全てに対する効果的な単調制御を示す。
制御性以外にも、私たちの分析は次のように明らかにしています。
1.人格情報は中型トランス層に集中している。
2. 操舵ベクトルは、有理関数と不合理関数の区別に一致した構造的幾何学的関係を示す。
3. 実効的な多次元操舵方向は, 単機能方向の線形結合として回収できない。
これらの知見は, LLMアクティベーション空間におけるパーソナリティの表現に関する新たな洞察を与え, 解釈可能, 有効, 多次元パーソナリティ制御を研究するための枠組みを確立する。
関連論文リスト
- PERSONA: Dynamic and Compositional Inference-Time Personality Control via Activation Vector Algebra [84.59328460968872]
大規模言語モデルにおけるパーソナリティ制御の現在の手法は、静的なプロンプトや高価な微調整に依存している。
ペルソナ(PERSONA)は、人格ベクトルを直接操作することで、微調整レベルのパフォーマンスを実現する訓練不要のフレームワークである。
PersonalityBenchでは、この手法は平均スコア9.60を達成し、教師付き微調整上界9.61とほぼ一致している。
論文 参考訳(メタデータ) (2026-02-17T15:47:58Z) - Character-R1: Enhancing Role-Aware Reasoning in Role-Playing Agents via RLVR [67.66592867046229]
character-R1は効果的な役割認識推論のための検証可能な報酬信号を提供するために設計されたフレームワークである。
本フレームワークは,認知的フォーカス・リワード(Cognitive Focus Reward),参照ガイド・リワード(Reference-Guided Reward),文字指定リワード正規化( character-Conditioned Reward normalization)の3つのコア設計で構成されている。
論文 参考訳(メタデータ) (2026-01-08T05:33:37Z) - Mechanistic Knobs in LLMs: Retrieving and Steering High-Order Semantic Features via Sparse Autoencoders [8.188989044347595]
意味論的に解釈可能な内部特徴の検索とステアリングのためのスパースオートエンコーダベースのフレームワークを提案する。
本研究では,ビッグファイブの性格特性をケーススタディとして用いて,モデル行動の正確かつ双方向なステアリングを可能にすることを実証する。
論文 参考訳(メタデータ) (2026-01-06T12:40:37Z) - Linear Personality Probing and Steering in LLMs: A Big Five Study [0.7933052462113936]
本研究では,ビッグファイブの性格特性に整合した線形方向が,モデル行動の探索と操舵に有効かどうかを検討する。
その結果,特徴スコアに整合した直線方向は人格検出に有効なプローブであることが示唆された。
論文 参考訳(メタデータ) (2025-12-19T14:41:09Z) - Cognitive Mirrors: Exploring the Diverse Functional Roles of Attention Heads in LLM Reasoning [54.12174882424842]
大規模言語モデル(LLM)は、様々なタスクにおいて最先端のパフォーマンスを達成したが、内部メカニズムに関してはほとんど不透明である。
本稿では,注目者の役割と行動を体系的に分析する新しい解釈可能性フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-03T10:24:34Z) - Steering Latent Traits, Not Learned Facts: An Empirical Study of Activation Control Limits [0.0]
大規模言語モデル(LLM)は、多様なアプリケーションにまたがる安全かつ効果的なデプロイメントのために、正確な振る舞い制御を必要とする。
本研究では, ステアリングの有効性が, 異なる行動種によってどのように異なるのか, 対象行動の性質がステアリングの成功を予測することができるのか, という課題に焦点をあてる。
論文 参考訳(メタデータ) (2025-11-23T04:28:41Z) - Activation-Space Personality Steering: Hybrid Layer Selection for Stable Trait Control in LLMs [10.99947795031516]
大きな言語モデルは、その世代において暗黙の個性を示すが、特定のニーズを満たすためにこれらの特性を確実に制御または調整することは、未解決の課題である。
本稿では,大きな5つのパーソナリティ特性を用いて,変圧器層から隠れ状態のアクティベーションを抽出するパイプラインを提案する。
本研究により, 人格特性が低ランク共有部分空間を占有し, これらの潜在構造を有効操舵機構に変換できることが判明した。
論文 参考訳(メタデータ) (2025-10-29T05:56:39Z) - The Personality Illusion: Revealing Dissociation Between Self-Reports & Behavior in LLMs [60.15472325639723]
人格特性は、人間の行動の予測因子として長い間研究されてきた。
近年のLarge Language Models (LLM) は, 人工システムに類似したパターンが出現する可能性を示唆している。
論文 参考訳(メタデータ) (2025-09-03T21:27:10Z) - Emergent Active Perception and Dexterity of Simulated Humanoids from Visual Reinforcement Learning [69.71072181304066]
本稿では,擬似ヒューマノイドを用いた視覚駆動全身制御フレームワークであるPerceptive Dexterous Control (PDC)を紹介する。
PDCは、タスク仕様のためのエゴセントリックなビジョンのみを運用し、ビジュアルキューによるオブジェクト検索、ターゲット配置、スキル選択を可能にする。
強化学習によるスクラッチからのトレーニングは,能動探索などの創発的な行動を引き起こす可能性があることを示す。
論文 参考訳(メタデータ) (2025-05-18T07:33:31Z) - Neuron-based Personality Trait Induction in Large Language Models [115.08894603023712]
大規模言語モデル (LLM) は、様々な性格特性をシミュレートする能力が増している。
LLMにおけるパーソナリティ特性誘導のためのニューロンに基づくアプローチを提案する。
論文 参考訳(メタデータ) (2024-10-16T07:47:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。