論文の概要: What Models Express, Suppress, and Resist: Auditing Open-Weight LLMs with Persona Vectors
- arxiv url: http://arxiv.org/abs/2607.13162v1
- Date: Tue, 14 Jul 2026 18:10:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.560805
- Title: What Models Express, Suppress, and Resist: Auditing Open-Weight LLMs with Persona Vectors
- Title(参考訳): モデル「Express」と「Suppress」と「Resist」 : ペルソナベクトルを用いたオープンウェイトLCMの検証
- Abstract要約: このスケールでのペルソナベクトルの最初の体系的応用を示す。
私たちは2つのオープンウェイトモデルにおけるすべての特性を、自然(ベースラインで表現される)、ステアブル潜在性(steerable latent)、増幅性(amplable)、難易度(intractable)の2つにラベル付けします。
2つのステアブルな特性は構成を崩壊させる可能性があるが、デフォルトを含むペアは決してできない。
- 参考スコア(独自算出の注目度): 20.66154247397021
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: What a language model will and will not do is largely set during post-training, but which behaviors it expresses, hides, or resists is not revealed by prompting alone. Persona vectors, behavioral directions in activation space, can probe this organization, but prior work covers only a handful of traits. We present the first systematic application of persona vectors at this scale, compiling a 53-trait inventory across four behaviorally distinct domains and labeling every trait in two open-weight models as natural (expressed at baseline), steerable latent but amplifiable, or intractable (resistant to standard extraction). Both models default to helpful, task-oriented behavior: all nine agentic traits are natural, and their default clinician behavior matches a board-certified psychologist's independent desirability judgments on 16 of 17 traits. Steering produces its largest gains on traits these defaults exclude: hyperbole, hallucination, and sycophancy. The same asymmetry holds across all 171 generic-trait pairs: two steerable traits can collapse the composition, but pairs involving a default never do. Where standard extraction fails on a trait like "evil," a vector transferred from a fine-tuned variant still recovers it, with the residual refusals appearing inside the model's chain-of-thought. Persona vectors are most informative not as a set of controls but as a probe of behavioral organization.
- Abstract(参考訳): 言語モデルがやろうとしないことは、主にポストトレーニング中に設定されるが、それが表現、隠蔽、抵抗する振る舞いは、単独でプロンプトすることで明らかにされない。
アクティベーション空間における行動方向であるペルソナベクトルは、この組織を探索することができるが、以前の作業はわずかな特性しかカバーしていない。
このスケールでのペルソナベクトルのシステマティックな応用として,4つの異なるドメインに53ビットのインベントリをコンパイルし,2つのオープンウェイトモデルにおけるすべての特性を,自然(ベースラインで表現される)、潜在性(英語版)、増幅性(英語版)、難易度(標準抽出に耐性)としてラベル付けする。
どちらのモデルも、役に立つタスク指向の振る舞いをデフォルトとしており、9つのエージェント的特徴はすべて自然であり、そのデフォルトの臨床的行動は、17の特徴のうち16の特性に対して、ボード認定された心理学者の独立した望ましくない判断と一致する。
ステアリングは、これらのデフォルトが除外される特性(双極性、幻覚、梅毒)に最大の利益をもたらす。
2つのステアブルな形質は構成を崩壊させるが、デフォルトを含むペアは決して起こらない。
標準抽出が"evil"のような特性で失敗する場合、細調整された変種から移行したベクトルは依然としてそれを回復する。
ペルソナベクトルは、コントロールのセットとしてではなく、行動組織の調査として最も有益なものである。
関連論文リスト
- Misalignment Has a Personality: A Big Five Account of Emergent Misalignment [2.1117030125341385]
違和感は人格の変化のように振る舞う
我々は、グレード付き3段階の介入を用いて、ビッグファイブの個性ベクトルを抽出する。
校正された人格ベクトルは、不透明な安全現象を人間に適応可能な診断プロファイルに変換する。
論文 参考訳(メタデータ) (2026-07-29T01:48:03Z) - Persona Cartography: Charting Language Model Personality Traits in Weight Space [2.3772203606681415]
大規模な言語モデルは、一般化と安全性を形作る反復的な行動パターン(ペルソナ)を示します。
我々は,モデルペルソナを記述するためにOCEANフレームワークを用いて,行動特性の空間におけるペルソナを位置として扱う。
低ランクのアダプタを訓練して個々の特性を増幅または抑制し、その効果を人為的なパネルに対して校正したLLM-judgeを用いて評価する。
論文 参考訳(メタデータ) (2026-07-08T21:00:44Z) - How to Interpret Agent Behavior [56.59836196946289]
本稿では,エージェントの動作を実行時に記述・解析するための分類法であるACT*ONOMYを紹介する。
共用語彙を提供することで、ACT*ONOMYは研究者、エージェントデザイナー、エンドユーザーがエージェントの振る舞いをより一貫して解釈するのに役立つ。
論文 参考訳(メタデータ) (2026-05-13T14:52:40Z) - When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors [66.18091962164219]
既存のメトリクスは、タスクの成功に必要な義務的な振る舞いと、モデルの自律的な嗜好を反映した命令的でないパターンを区別することができない。
言語アライメントのための textbfResponse Pattern similarity (RPS) と、有向グラフとしてモデル化されたツール使用習慣のための textbfAction Graph similarity (AGS) である。
論文 参考訳(メタデータ) (2026-04-23T03:48:56Z) - MTI: A Behavior-Based Temperament Profiling System for AI Agents [4.358468367889626]
モデルテンペラメント指数(MTI)は,4軸にわたるAIエージェントのテンペラメントを測定する行動ベースのプロファイリングシステムである。
MTIは、自分たちが何を言っているのかではなく、エージェントが何をするのかを、2段階の設計で構造化された検査プロトコルを使って測定する。
論文 参考訳(メタデータ) (2026-04-02T15:15:57Z) - PERSONA: Dynamic and Compositional Inference-Time Personality Control via Activation Vector Algebra [84.59328460968872]
大規模言語モデルにおけるパーソナリティ制御の現在の手法は、静的なプロンプトや高価な微調整に依存している。
ペルソナ(PERSONA)は、人格ベクトルを直接操作することで、微調整レベルのパフォーマンスを実現する訓練不要のフレームワークである。
PersonalityBenchでは、この手法は平均スコア9.60を達成し、教師付き微調整上界9.61とほぼ一致している。
論文 参考訳(メタデータ) (2026-02-17T15:47:58Z) - Do Personality Traits Interfere? Geometric Limitations of Steering in Large Language Models [12.34382066368117]
大規模言語モデル(LLM)におけるパーソナリティステアリングは、一般に、個性特性を独立に制御できると暗黙的に仮定して、特性固有のステアリングベクターを注入することに依存する。
2つのモデルファミリー(LLaMA-3-8BとMistral-8B)から抽出されたステアリングベクトルについて検討し、非拘束方向からソフト、ハードの正則化に至るまで、幾何条件スキームを適用した。
以上の結果から, 直交重なりが明示的に除去された場合でも, 1つの特性が一貫した変化を引き起こすことが示唆された。
厳密な正則化は幾何学的独立を強制するが、横断的な行動効果を排除せず、可能である。
論文 参考訳(メタデータ) (2026-01-23T15:37:07Z) - Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents [58.00130492861884]
TraitBasisは、AIエージェントを体系的にストレステストするための軽量でモデルに依存しない方法である。
TraitBasisは、ステアブルなユーザ特性に対応するアクティベーション空間で方向を学習する。
We observed on average a 2%-30% performance degradation on $tau$-Trait across frontier model。
論文 参考訳(メタデータ) (2025-10-06T05:03:57Z) - The Personality Illusion: Revealing Dissociation Between Self-Reports & Behavior in LLMs [60.15472325639723]
人格特性は、人間の行動の予測因子として長い間研究されてきた。
近年のLarge Language Models (LLM) は, 人工システムに類似したパターンが出現する可能性を示唆している。
論文 参考訳(メタデータ) (2025-09-03T21:27:10Z) - Persona Vectors: Monitoring and Controlling Character Traits in Language Models [11.039979968884575]
大規模言語モデルは、シミュレーションされた"アシスタント"ペルソナを介してユーザと対話する。
モデルの活性化空間対人ベクトルの方向を同定する。
トレーニング中に発生する人格変化を予測・制御するためにペルソナベクトルを適用する。
論文 参考訳(メタデータ) (2025-07-29T05:20:14Z) - NaturalAdversaries: Can Naturalistic Adversaries Be as Effective as
Artificial Adversaries? [61.58261351116679]
自然言語理解タスクのための2段階の逆例生成フレームワーク(NaturalAdversaries)を提案する。
モデルパラメータへのアクセスレベルに基づいて、ブラックボックスとホワイトボックスの双方に適応可能である。
以上の結果から,これらの対立はドメイン全体にわたって一般化され,ニューラルネットワーク分類モデルの堅牢性向上に向けた今後の研究への洞察が得られた。
論文 参考訳(メタデータ) (2022-11-08T16:37:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。