論文の概要: Persona Cartography: Charting Language Model Personality Traits in Weight Space
- arxiv url: http://arxiv.org/abs/2607.07916v1
- Date: Wed, 08 Jul 2026 21:00:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.342127
- Title: Persona Cartography: Charting Language Model Personality Traits in Weight Space
- Title(参考訳): ペルソナカルトグラフィー:重み空間における言語モデルパーソナリティ特性のグラフ化
- Abstract要約: 大規模な言語モデルは、一般化と安全性を形作る反復的な行動パターン(ペルソナ)を示します。
我々は,モデルペルソナを記述するためにOCEANフレームワークを用いて,行動特性の空間におけるペルソナを位置として扱う。
低ランクのアダプタを訓練して個々の特性を増幅または抑制し、その効果を人為的なパネルに対して校正したLLM-judgeを用いて評価する。
- 参考スコア(独自算出の注目度): 2.3772203606681415
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large language models exhibit recurring behavioural patterns -- personas -- that shape generalisation and safety, but we lack reliable tools for decomposing, measuring, and controlling them. Our central insight is to treat personas as positions in a space of behavioural traits, using the OCEAN framework to describe model personas in terms of Openness, Conscientiousness, Extraversion, Agreeableness, and Neuroticism. We train low-rank adapters to amplify or suppress individual traits, and evaluate their effects using an LLM-judge calibrated against a human-validated panel, trait-specific multiple-choice benchmarks, and standard capability evaluations. Across six models from three families (4B-32B), we find that each adapter moves its target trait largely monotonically with scale, combines approximately additively with other adapters to construct mixed personas, and preserves performance on capability benchmarks at moderate scales. We further show that the induced trait axes affect safety-relevant behaviour in downstream evaluations: for example, moving along neuroticism and agreeableness axes affects frustration and sycophancy respectively. We also introduce an unsupervised psychometric pipeline that recovers four interpretable behavioural factors (tone, initiative, didacticism, epistemic caution) from model rollouts. Persona control can then be considered in terms of learning, scaling, and composing traits in weight space, providing a bridge between personality measurement, model editing, and safety.
- Abstract(参考訳): 大きな言語モデルは、一般化と安全性を形作る反復的な行動パターン(ペルソナ)を示していますが、それらを分解、測定、制御するための信頼できるツールがありません。
我々の中心的な洞察は、行動特性の空間におけるペルソナを、OCEANフレームワークを使用して、オープンネス、保守性、外転、理解性、神経主義の観点でモデルペルソナを記述することである。
低ランクのアダプタを訓練して個々の特性を増幅または抑制し、その効果を人間の評価パネルに校正したLCM-judge、特性特異的多重選択ベンチマーク、標準能力評価を用いて評価する。
3つのファミリーの6つのモデル(4B-32B)で、各アダプタはそのターゲット特性を大半が単調に移動し、ほぼ付加的に他のアダプタと組み合わせて混合ペルソナを構築し、適度なスケールで能力ベンチマークの性能を維持する。
さらに, 誘発形質軸が下流評価における安全関連行動に影響を及ぼすことを示す。例えば, 神経症と一致性軸に沿って移動すると, それぞれがフラストレーションと梅毒に影響を及ぼす。
また、モデルロールアウトから4つの解釈可能な行動因子(音素、イニシアチブ、ドクティズム、てんかん性注意)を回収する、教師なしの心理測定パイプラインも導入した。
パーソナコントロールは、ウェイトスペースにおける特性の学習、スケーリング、構成という観点で考えることができ、パーソナリティの測定、モデル編集、安全性の橋渡しを提供する。
関連論文リスト
- Apparent Psychological Profiles of Large Language Models are Largely a Measurement Artifact [1.3277433989254843]
人間のために設計された心理学機器は、大きな言語モデル(LLM)の安定した心理学的プロファイルを割り当てるのにますます使われている。
フォーマルな心理測定フレームワークを用いて、これらのプロファイルは主として測定成果物であることを示す。
論文 参考訳(メタデータ) (2026-06-18T13:18:37Z) - PERSONA: Dynamic and Compositional Inference-Time Personality Control via Activation Vector Algebra [84.59328460968872]
大規模言語モデルにおけるパーソナリティ制御の現在の手法は、静的なプロンプトや高価な微調整に依存している。
ペルソナ(PERSONA)は、人格ベクトルを直接操作することで、微調整レベルのパフォーマンスを実現する訓練不要のフレームワークである。
PersonalityBenchでは、この手法は平均スコア9.60を達成し、教師付き微調整上界9.61とほぼ一致している。
論文 参考訳(メタデータ) (2026-02-17T15:47:58Z) - Enhancing Personality Recognition by Comparing the Predictive Power of Traits, Facets, and Nuances [37.83859643892549]
パーソナリティ認識モデルは、行動データから性格特性を推定することを目的としている。
モーダル間(音響)とオブジェクト間(ダイアド・アウェア)のアテンション機構を含むトランスフォーマーベースモデルを訓練した。
その結果、ニュアンスレベルのモデルはファセットやトラストレベルのモデルよりも一貫して優れており、平均2乗誤差を最大74%削減できることがわかった。
論文 参考訳(メタデータ) (2026-02-05T13:35:04Z) - The Personality Illusion: Revealing Dissociation Between Self-Reports & Behavior in LLMs [60.15472325639723]
人格特性は、人間の行動の予測因子として長い間研究されてきた。
近年のLarge Language Models (LLM) は, 人工システムに類似したパターンが出現する可能性を示唆している。
論文 参考訳(メタデータ) (2025-09-03T21:27:10Z) - Spotting Out-of-Character Behavior: Atomic-Level Evaluation of Persona Fidelity in Open-Ended Generation [16.76995815742803]
より微細な粒度でペルソナの忠実度を定量化する原子レベル評価フレームワークを提案する。
私たちの3つの重要な測定基準は、世代間でのペルソナのアライメントと一貫性の度合いを測定します。
多様なタスクやパーソナリティの多様さからペルソナの忠実度を解析することにより,タスク構造とペルソナの嗜好性がモデル適応性にどのように影響するかを明らかにする。
論文 参考訳(メタデータ) (2025-06-24T06:33:10Z) - Evaluating Personality Traits in Large Language Models: Insights from Psychological Questionnaires [3.6001840369062386]
この研究は、多種多様なシナリオにおける大規模言語モデルに心理学的ツールを適用し、パーソナリティプロファイルを生成する。
以上の結果から, LLMは, 同一モデル群においても, 特徴, 特徴, 性格の異なる特徴を示すことが明らかとなった。
論文 参考訳(メタデータ) (2025-02-07T16:12:52Z) - ControlLM: Crafting Diverse Personalities for Language Models [32.411304295746746]
そこで本研究では,モデルの潜在空間における行動プロンプトの対比から導かれる,差動アクティベーションパターンを利用した制御LMを提案する。
まず、トレーニングなしで多様なペルソナ行動を引き出す制御LMの能力を実証する一方、精度制御により、人格特性が平均的な人格値と密に一致できることを実証する。
我々は,良心や親しみなどの有益な属性を選択的に増幅することで,推論と質問応答を改善した。
論文 参考訳(メタデータ) (2024-02-15T17:58:29Z) - Decoding Susceptibility: Modeling Misbelief to Misinformation Through a Computational Approach [61.04606493712002]
誤報に対する感受性は、観測不可能な不検証の主張に対する信念の度合いを記述している。
既存の感受性研究は、自己報告された信念に大きく依存している。
本稿では,ユーザの潜在感受性レベルをモデル化するための計算手法を提案する。
論文 参考訳(メタデータ) (2023-11-16T07:22:56Z) - Editing Personality for Large Language Models [73.59001811199823]
本稿では,Large Language Models (LLMs) の性格特性の編集に焦点をあてた革新的なタスクを紹介する。
このタスクに対処する新しいベンチマークデータセットであるPersonalityEditを構築します。
論文 参考訳(メタデータ) (2023-10-03T16:02:36Z) - AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable
Diffusion Model [69.12623428463573]
AlignDiffは、人間の好みを定量化し、抽象性をカバーし、拡散計画をガイドする新しいフレームワークである。
ユーザがカスタマイズした動作と正確に一致し、効率的に切り替えることができます。
選好マッチング,スイッチング,カバーにおいて,他のベースラインに比べて優れた性能を示す。
論文 参考訳(メタデータ) (2023-10-03T13:53:08Z) - Empirical Estimates on Hand Manipulation are Recoverable: A Step Towards
Individualized and Explainable Robotic Support in Everyday Activities [80.37857025201036]
ロボットシステムの鍵となる課題は、他のエージェントの振る舞いを理解することである。
正しい推論の処理は、(衝突)因子が実験的に制御されない場合、特に困難である。
人に関する観察研究を行うために必要なツールをロボットに装備することを提案する。
論文 参考訳(メタデータ) (2022-01-27T22:15:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。