論文の概要: Extracting Persona Subspaces Through Iterative Nullspace Projection For Modulation
- arxiv url: http://arxiv.org/abs/2610.04676v1
- Date: Sat, 03 Oct 2026 17:45:24 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:42:46.773795
- Title: Extracting Persona Subspaces Through Iterative Nullspace Projection For Modulation
- Title(参考訳): 反復的Nullspace射影によるペルソナ部分空間の抽出と変調
- Abstract要約: 操作中のコンテンツにペルソナコンテキストがすでに埋め込まれているような設定として変調を導入する。
我々は,MATH-500,TinyAlpaca,GSM8K,IFEvalなどの多様なタスクに対して6人のペルソナを慎重に評価した。
我々は,ペルソナ部分空間がタスク性能を犠牲にすることなく,動作を制御可能,解釈可能,一般化可能なフレームワークを提供することを示す。
- 参考スコア(独自算出の注目度): 1.0193915176785655
- License:
- Abstract: Large Language Models (LLMs) can adopt distinct personas to tune their semantics, expertise, and perspective to different users and tasks. Precise control over these traits is critical to ensure safety and reliability in model behavior. Existing methods like activation steering and prompt-based persona induction reduce a persona to a single dominant direction, missing the finer, nested traits that emerge only once that dominant signal is factored out. We introduce modulation as a setting where the persona context is already embedded in the content being manipulated, requiring control methods to amplify or suppress a trait already present rather than inject it from scratch. PaSS is an inference-time control paradigm that models personas as multi-dimensional subspaces in a model's latent space without supervised contrastive examples. The persona subspaces are extracted via iterative concept erasure and applied to modulate persona-guided generation without retraining. To extract this subspace, we use Iterative Nullspace Projections (INLP) to linearly and iteratively isolate persona-specific directions. We causally evaluate six personas against diverse tasks like MATH-500, TinyAlpaca, GSM8K, and IFEval, showing that discriminative, iterative subspace extraction captures diverse traits underlying a given persona, enabling stronger and larger modulation than single-direction additive methods, while maintaining content fidelity. We further study individual peeled directions within each subspace to uncover the distinct aspects of persona behavior they encode. Overall, we show that persona subspaces offer a controllable, interpretable, and generalizable framework for modulating LLM behavior without sacrificing task performance.
- Abstract(参考訳): 大規模言語モデル(LLM)は、それぞれの意味、専門知識、視点を異なるユーザやタスクに調整するために、個別のペルソナを採用することができる。
これらの特性の正確な制御は、モデル行動の安全性と信頼性を保証するために重要である。
アクティベーションステアリングやアクティベーションベースのペルソナ誘導のような既存の方法は、パーソナを1つの支配的な方向に還元し、支配的な信号が出力された時にのみ現れる、より微細でネストされた特性を欠いている。
我々は、操作中のコンテンツにペルソナコンテキストがすでに埋め込まれている設定として変調を導入し、スクラッチから注入するのではなく、既に存在する特性を増幅または抑制する制御方法を必要とする。
PaSSは、モデルの潜在空間における多次元部分空間としてペルソナを教師付きコントラスト例なしでモデル化する推論時制御パラダイムである。
ペルソナ部分空間は反復的概念消去により抽出され、再訓練することなくペルソナ誘導世代を変調する。
この部分空間を抽出するために、Iterative Nullspace Projections (INLP) を用いて、ペルソナ固有の方向を線形かつ反復的に分離する。
我々は,MATH-500,TinyAlpaca,GSM8K,IFEvalなどの多様なタスクに対して6人のペルソナを因果的に評価し,識別的かつ反復的なサブスペース抽出が与えられたペルソナの根底にある様々な特性を捕捉し,コンテントの忠実さを維持しつつ,単一方向付加法よりも強く大きな変調を可能にすることを示す。
さらに,各サブ空間内の個々の剥離方向を解析し,符号化したペルソナ行動の異なる側面を明らかにする。
全体として、ペルソナ部分空間は、タスク性能を犠牲にすることなく、LCMの振る舞いを制御可能、解釈可能、一般化可能なフレームワークを提供する。
関連論文リスト
- PACT: Preserving Anchored Cores in Task-vectors for Model Merging [68.52455853496585]
モデルマージは、複数のタスク固有の細調整されたモデルを単一のマルチタスクモデルに結合することを目的としている。
既存のモデルマージアプローチのほとんどは、Task Arithmeticパラダイムに従っています。
本研究では,タスクベクトル内の固定されたタスク固有コア(LBW次元)を,事前学習した重みのサブ空間と補間を整合させることにより保存するPACTを提案する。
論文 参考訳(メタデータ) (2026-06-17T02:48:35Z) - Controllable and explainable personality sliders for LLMs at inference time [1.3688381983244782]
連続多次元パーソナリティ制御のためのモジュラーフレームワークを提案する。
我々の重要な革新は、逐次適応ステアリング(SAS)である。これは、先行介入によってシフトした残流上のその後のプローブをトレーニングすることで、ステアリングベクトルを変換する手法である。
我々は,ビッグファイブの性格特性に関する枠組みを検証し,ゴール順守とコヒーレンスの両方において,ナイーブ・ベースラインを上回っていることを示す。
論文 参考訳(メタデータ) (2026-02-10T08:16:59Z) - Your Language Model Secretly Contains Personality Subnetworks [31.480534845874473]
大規模言語モデルには,すでにパラメータ空間にペルソナ特化作業が存在することを示す。
本手法は完全にトレーニング不要であり,言語モデルの既存のパラメータ空間にのみ依存する。
論文 参考訳(メタデータ) (2026-02-06T20:03:28Z) - The Geometry of Harmfulness in LLMs through Subconcept Probing [3.6335172274433414]
本稿では,言語モデルにおける有害なコンテンツの探索とステアリングのための多次元フレームワークを提案する。
55個の異なる有害な部分概念に対して、線形プローブを学習し、活性化空間において55個の解釈可能な方向を導出する。
次に、モデル内部から部分空間全体のアブレーション、および部分空間の支配的な方向におけるステアリングとアブレーションをテストする。
論文 参考訳(メタデータ) (2025-07-23T07:56:05Z) - SAE-SSV: Supervised Steering in Sparse Representation Spaces for Reliable Control of Language Models [41.553639748766784]
大規模言語モデル(LLM)は、自然言語の理解と生成において印象的な能力を示している。
本稿では,スパースで解釈可能な表現空間で動作する新しい教師付きステアリング手法を提案する。
論文 参考訳(メタデータ) (2025-05-22T03:46:57Z) - Steering Large Language Model Activations in Sparse Spaces [21.55545768931058]
AIアライメントにおける重要な課題は、テスト時に望ましい振る舞いに従うために、大きな言語モデル(LLM)を導くことである。
スパース・アクティベーション・ステアリング(SAS)はスパース・オートエンコーダ(SAE)を利用してスパース空間のステアリングを行う手法である。
論文 参考訳(メタデータ) (2025-02-28T20:43:45Z) - Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment [84.32768080422349]
人間の好みの調整は、大きな言語モデルが誤解を招くか有害なコンテンツを生成するのを防ぐ。
本研究では, 微調整後のLLMの最終性能と線形相関を示唆し, 即時多様性の新たな定式化を提案する。
論文 参考訳(メタデータ) (2024-03-17T07:08:55Z) - Unsupervised Controllable Generation with Self-Training [90.04287577605723]
GANによる制御可能な世代は依然として困難な研究課題である。
本稿では,自己学習を通じてジェネレータを制御する潜伏符号の分布を学習するための教師なしフレームワークを提案する。
我々のフレームワークは、変分オートエンコーダのような他の変種と比較して、より良い絡み合いを示す。
論文 参考訳(メタデータ) (2020-07-17T21:50:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。