論文の概要: Role Steering of Language Models for Social Simulations
- arxiv url: http://arxiv.org/abs/2608.00023v2
- Date: Thu, 06 Aug 2026 06:50:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-09 10:00:34.25451
- Title: Role Steering of Language Models for Social Simulations
- Title(参考訳): 社会シミュレーションにおける言語モデルの役割
- Authors: Isaac Song, Mohammed Rehan Parwani, Glenn Matlin, Emile Anand, Akhil Theerthala, Arjun Chatterjee, Anthony Wen-Ming Zang, Maria Kostylew, Yonadav G. Shavit, Sebastien Krier, Mark Riedl,
- Abstract要約: 言語モデルエージェントから構築された社会シミュレーションは、エージェントがシミュレートされた集団に入る前にチェックできるロール条件の振る舞いを必要とする。
本稿では,ロールコンディショニングエージェントのためのアクティベーションステアリングスクリーニングワークフローを提案する。
このワークフローを、228のロールに依存しない275のインベントリ、GPT-4.1のロール参照、GPT-4.1のミニジャッジに適用する。
- 参考スコア(独自算出の注目度): 1.593682229070013
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Social simulations built from language-model agents need role-conditioned behavior that can be checked before agents are placed into a simulated population. We introduce an activation-steering screening workflow for role-conditioned agents: define a role profile, extract a role-specific direction, sweep four steering coefficients, evaluate role-profile alignment, and pass or flag each candidate configuration. On OLMo-3-7B-Instruct, we apply the workflow to a mixed 275-role inventory with 228 role-agnostic questions, GPT-4.1-mini prompted role references, and GPT-4.1-mini judges. Role-specific directions receive higher judged role-profile alignment than an assistant-axis directional control from prior persona-vector work, with mean overall scores of 63.2 versus 41.1 across the tested grid. They also preserve high lexical diversity, while the control drops sharply at larger coefficients. The role-level screen is the main practical output: most roles improve as steering increases, but 38 roles decline across all six measured dimensions, showing why simulation builders should choose coefficients per role rather than deploy a uniform high-strength setting. We make our code and evaluation artifacts available at https://anonymous.4open.science/r/anonymous-research-code-5F03/.
- Abstract(参考訳): 言語モデルエージェントから構築された社会シミュレーションは、エージェントがシミュレートされた集団に入る前にチェックできるロール条件の振る舞いを必要とする。
役割条件付きエージェントに対するアクティベーション・ステアリング・スクリーニング・ワークフローを導入し、ロールプロファイルを定義し、ロール固有の方向を抽出し、4つのステアリング係数を掃除し、ロールを目立たせるアライメントを評価し、各候補設定をパスまたはフラグする。
OLMo-3-7B-Instructでは、228のロールに依存しない質問、GPT-4.1-miniのロール参照、GPT-4.1-miniのジャッジを含む混合275ロールのインベントリにワークフローを適用する。
役割特異的な方向は、以前のペルソナ・ベクターの作業からアシスタント軸方向制御よりも高い評価を受けており、テストグリッド全体での平均スコアは63.2対41.1である。
また、高い語彙の多様性を保ち、コントロールは大きな係数で急降下する。
役割レベルの画面は、ほとんどの役割はステアリングの増加に伴って改善されるが、6つの測定次元すべてで38の役割は減少し、シミュレーションビルダーが一様高強度設定を配置するよりも、役割ごとに係数を選択するべき理由を示している。
コードと評価アーティファクトはhttps://anonymous.4open.science/r/anonymous-research-code-5F03/で公開しています。
関連論文リスト
- From Facts to Insights: A Persona-Driven Dual Memory Framework and Dataset for Role-Playing Agents [50.66268133366637]
現在のシステムはペルソナに依存しない要約に依存しており、ペルソナ固有の解釈なしで事実を記録する。
RoleMemoは4つの推論タスクを備えたデータセットで、実際の断片をペルソナを通して解釈して正しい回答を得る必要がある。
本稿では,記憶を2つのストリームに分解するDualMemを提案する。
論文 参考訳(メタデータ) (2026-05-25T10:48:24Z) - The Granularity Axis: A Micro-to-Macro Latent Direction for Social Roles in Language Models [61.32031248060941]
マイクロレベルの個人経験からマクロレベルの組織,制度的,あるいは国家的推論に至るまで,大きな言語モデルが社会的役割をコードしていることを示す。
以上の結果から,社会的役割の粒度は単にスタイリスティックな表面特徴ではなく,言語モデル行動における構造的,秩序的,因果的に操作可能な潜在方向である可能性が示唆された。
論文 参考訳(メタデータ) (2026-05-07T13:08:19Z) - When Roles Fail: Epistemic Constraints on Advocate Role Fidelity in LLM-Based Political Statement Analysis [0.0]
本稿では,モデルが割り当てられた役割を確実に維持するという仮定を,初めて体系的に実証した。
RDI(Role Drift Index)、EDD(Drift Distance)、DDI(Directional Drift Index)、ERS(Entropy-based Role stability)の4つの指標を用いて、60の政治声明における役割忠実度を測定した。
エピステミック・フロア・エフェクト(ファクト・チェックの結果は、正当性が維持できない絶対的な下位境界を作る)とロール・プライア・コンフリクト(学習時の知識が、事実的に曖昧な文に対して役割指示を上回る)の2つの障害モードを特定します。
論文 参考訳(メタデータ) (2026-04-29T21:50:28Z) - Improving LLM Reasoning through Interpretable Role-Playing Steering [33.25597755294326]
ロールプレイングは大規模言語モデル(LLM)の推論能力を高める効果的な手法として登場した。
Sparse Autoencoder Role-Playing Steering (SRPS) は、ロールプレイング行動に関連する内部モデルの特徴を特定し、操作する新しいフレームワークである。
提案手法は,ロールプレイプロンプトから潜在表現を抽出し,アクティベーションパターンに基づいて最も関連性の高い特徴を選択し,制御可能な強度でモデルの残留ストリームに注入可能なステアリングベクトルを構築する。
論文 参考訳(メタデータ) (2025-06-09T00:31:17Z) - RoleMRC: A Fine-Grained Composite Benchmark for Role-Playing and Instruction-Following [31.80357046048002]
ロールプレイングは、大規模言語モデルにとって、多様な指示に従うことが重要である。
既存のロールプレイングデータセットは、主にロールスタイルと知識境界の制御に寄与する。
本稿では,RoleMRCという詳細なロールプレイングと命令フォローのベンチマークを紹介する。
論文 参考訳(メタデータ) (2025-02-17T03:08:37Z) - Large Language Models are Superpositions of All Characters: Attaining
Arbitrary Role-play via Self-Alignment [62.898963074989766]
本稿では,ロールプレイのための自己アライメント手法であるDittoを紹介する。
この方法は4000文字からなるロールプレイトレーニングセットを生成し、現在利用可能なデータセットのスケールを10倍に超える。
本稿では,ロールプレイ領域におけるクロススーパービジョンアライメント実験について紹介する。
論文 参考訳(メタデータ) (2024-01-23T03:56:22Z) - RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models [107.00832724504752]
大規模言語モデル(LLM)におけるロールプレイング能力をベンチマークし、評価し、拡張するフレームワークであるRoleLLMを紹介する。
Context-InstructとRoleGPTによって、168,093サンプルでロールプレイする最初の体系的できめ細かい文字レベルのベンチマークデータセットであるRoleBenchを作成します。
論文 参考訳(メタデータ) (2023-10-01T17:52:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。