論文の概要: Beyond Static Personas: Situational Personality Steering for Large Language Models
- arxiv url: http://arxiv.org/abs/2604.13846v1
- Date: Wed, 15 Apr 2026 13:17:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-16 20:38:32.550657
- Title: Beyond Static Personas: Situational Personality Steering for Large Language Models
- Title(参考訳): 静的ペルソナを超えて:大規模言語モデルのための状況的パーソナリティステアリング
- Abstract要約: IRIS(Identify-Retrieve-Steer framework for Advanced situational personality steering)を提案する。
本手法は, 状況認識型ニューロン識別, 状況認識型ニューロン検索, 類似性重み付けによるステアリングを含む。
我々は、パーソナリティベンチの枠組みと、包括的状況パーソナリティベンチマークであるSPBenchを実証的に検証した。
- 参考スコア(独自算出の注目度): 52.33369223308941
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Personalized Large Language Models (LLMs) facilitate more natural, human-like interactions in human-centric applications. However, existing personalization methods are constrained by limited controllability and high resource demands. Furthermore, their reliance on static personality modeling restricts adaptability across varying situations. To address these limitations, we first demonstrate the existence of situation-dependency and consistent situation-behavior patterns within LLM personalities through a multi-perspective analysis of persona neurons. Building on these insights, we propose IRIS, a training-free, neuron-based Identify-Retrieve-Steer framework for advanced situational personality steering. Our approach comprises situational persona neuron identification, situation-aware neuron retrieval, and similarity-weighted steering. We empirically validate our framework on PersonalityBench and our newly introduced SPBench, a comprehensive situational personality benchmark. Experimental results show that our method surpasses best-performing baselines, demonstrating IRIS's generalization and robustness to complex, unseen situations and different models architecture.
- Abstract(参考訳): パーソナライズされた大規模言語モデル(LLM)は、人間中心のアプリケーションにおいて、より自然な人間のような相互作用を促進する。
しかし、既存のパーソナライズ手法は、制限された制御性と高いリソース要求によって制約されている。
さらに、静的パーソナリティモデリングへの依存は、様々な状況における適応性を制限する。
これらの制約に対処するために、まず、ペルソナニューロンの多視点的解析を通して、LLM個人性における状況依存性と一貫した状況行動パターンの存在を実証する。
これらの知見に基づいて、我々は、高度状況人格管理のためのトレーニングフリーでニューロンベースのIdentify-Retrieve-SteerフレームワークであるIRISを提案する。
本手法は, 状況認識型ニューロン識別, 状況認識型ニューロン検索, 類似性重み付けによるステアリングを含む。
我々は、パーソナリティベンチの枠組みと、包括的状況パーソナリティベンチマークであるSPBenchを実証的に検証した。
実験の結果,本手法は,IRISの一般化と,複雑で目に見えない状況と異なるモデルアーキテクチャに対する堅牢性を実証し,最高の性能のベースラインを超えることを示した。
関連論文リスト
- Modeling Complex Behaviors: Multi-Personality Composition and Dynamic Switching in Vision-Language Models [24.456367163695962]
本稿では,マルチモーダル大言語モデル(MLLM)における明示的なパーソナリティ条件付けを提案する。
単一人格誘導、多人格誘導、個性転換を含む体系的な評価枠組みを確立する。
実験により、人格誘導はイメージキャプション性能を向上するが、正確な推論を必要とするタスクではパフォーマンスを損なう可能性があることが示された。
論文 参考訳(メタデータ) (2026-06-09T16:34:37Z) - Experiences Build Characters: The Linguistic Origins and Functional Impact of LLM Personality [10.56924140369377]
本研究は、教師なしの方法でモデルをドメイン固有のテキストに公開するために、継続事前学習を採用する。
モデル変異の性格特性を定量化し,それらの言語的スタイルと推論行動との関係を解析する。
この結果は、モデル能力がバイモーダルであり、"Expressive Generalists" と "Suppressed Specialists" がピークであることを示している。
論文 参考訳(メタデータ) (2026-03-06T09:42:41Z) - HUMANLLM: Benchmarking and Reinforcing LLM Anthropomorphism via Human Cognitive Patterns [59.17423586203706]
本稿では,心理的パターンを因果力の相互作用として扱うフレームワークであるHUMANLLMを提案する。
12,000の学術論文から244のパターンを構築し、2-5のパターンが相互に強化、衝突、変調されるシナリオ11,359を合成する。
我々の二重レベルチェックリストは、個々のパターンの忠実度と創発的なマルチパターンのダイナミクスを評価し、強い人間のアライメントを達成する。
論文 参考訳(メタデータ) (2026-01-15T08:56:53Z) - Structured Personality Control and Adaptation for LLM Agents [11.050618253938126]
大規模言語モデル(LLM)は、ますますヒトとコンピュータの相互作用(HCI)を形作っている
ユング心理学的タイプを用いたLLMパーソナリティをモデル化する枠組みを提案する。
この設計により、エージェントは対話要求に応じて動的に調整しながらニュアンス付き特性を維持することができる。
論文 参考訳(メタデータ) (2026-01-15T03:15:24Z) - PTCBENCH: Benchmarking Contextual Stability of Personality Traits in LLM Systems [30.449659477704543]
制御状況下での大規模言語モデル(LLM)の一貫性を定量化するベンチマークであるPTCBENCHを紹介する。
PTCBENCHは、様々な場所のコンテキストやライフイベントにまたがる12の異なる外部条件をモデル化し、NEO Five-Factor Inventoryを用いてその性格を厳格に評価する。
39,240人の性格特性記録について検討したところ、ある外部シナリオがLSMの顕著な性格変化を誘発し、その推論能力を変化させることが判明した。
論文 参考訳(メタデータ) (2026-01-12T18:15:50Z) - DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios [57.327907850766785]
現実的な現実のシナリオにまたがる騙しのキャラクタリゼーションは未解明のままである。
DeceptionBenchは、さまざまなドメインにまたがる認知傾向を体系的に評価する最初のベンチマークです。
本研究は,本質的な側面から,ユーザ満足度を優先する自己関心のエゴスティックな傾向を示すモデルや,サイコファンティックな行動を示すモデルについて検討する。
実世界のフィードバックダイナミクスのより現実的なシミュレーションを構築するために,持続的マルチターン相互作用ループを組み込んだ。
論文 参考訳(メタデータ) (2025-10-17T10:14:26Z) - IROTE: Human-like Traits Elicitation of Large Language Model via In-Context Self-Reflective Optimization [66.6349183886101]
IROTEは,安定かつ伝達可能な特性抽出のための新しいインコンテキスト手法である。
IROTEが生成する1つの自己反射は、様々な下流タスクにまたがる目標特性の安定な偽造を LLM が引き起こすことを示す。
論文 参考訳(メタデータ) (2025-08-12T08:04:28Z) - A Comparative Study of Large Language Models and Human Personality Traits [6.354326674890978]
言語モデル(LLM)は、言語理解と生成において人間のような能力を示す。
本研究では, LLMが人格的特徴を示すか, これらの特徴が人格とどのように比較されるかを検討する。
論文 参考訳(メタデータ) (2025-05-01T15:10:15Z) - Neuron-based Personality Trait Induction in Large Language Models [115.08894603023712]
大規模言語モデル (LLM) は、様々な性格特性をシミュレートする能力が増している。
LLMにおけるパーソナリティ特性誘導のためのニューロンに基づくアプローチを提案する。
論文 参考訳(メタデータ) (2024-10-16T07:47:45Z) - PersLLM: A Personified Training Approach for Large Language Models [66.16513246245401]
データ構築とモデルチューニングを改善するためのフレームワークPersLLMを提案する。
データ利用が不十分な場合には、Chain-of-Thoughtプロンプトやアンチインダクションといった戦略を取り入れます。
厳密な振舞いパターンを設計し,モデルの性格の特異性とダイナミズムを高めるために自動DPOを導入する。
論文 参考訳(メタデータ) (2024-07-17T08:13:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。