論文の概要: Story Imprinting: AI Assistants Absorb Traits from Human Characters They Resemble
- arxiv url: http://arxiv.org/abs/2609.10883v1
- Date: Wed, 09 Sep 2026 22:39:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.159209
- Title: Story Imprinting: AI Assistants Absorb Traits from Human Characters They Resemble
- Title(参考訳): ストーリーのインプリンティング:AIアシスタントは人間キャラクターのトラストを吸収する
- Abstract要約: 言語モデルは、AIアシスタントのキャラクタを実装するために訓練される。
合成物語の微調整が、このキャラクターにどのように影響するかを考察する。
私たちは、Assistantがそれに似たキャラクターから、より頻繁に振舞いを採用することに気付きました。
- 参考スコア(独自算出の注目度): 10.181152008374942
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models are trained to implement a helpful AI Assistant character (e.g., Claude). We explore how finetuning on synthetic stories affects this character. Does it change the Assistant's behavior in multi-turn conversations with users, a format quite different from the stories? And does the Assistant adopt the behaviors and preferences of human characters? We refer to this adoption as story imprinting. We finetune GPT-4.1 and Kimi-K2.6 on stories in which generally helpful human characters give subtly harmful advice after being insulted. The Assistant adopts the same conditional behavior while otherwise remaining helpful. This occurs even when fewer than 2% of stories depict the behavior. In a separate experiment, the Assistant adopts preferences that are only implicit in the narration. A human character's body language suggests they dislike working on spreadsheets, yet they never say so and continue giving good advice on spreadsheets. After finetuning, the Assistant becomes less likely to choose spreadsheet tasks. Next we ask which characters most influence the Assistant. We find the Assistant adopts behaviors more often from characters that resemble it (e.g., helpful rather than dismissive). We call this the affinity effect. The effect extends to other personas elicited with system prompts: unhelpful personas adopt behaviors from unhelpful characters. We also observe it in finetuned base models. We use the affinity effect to learn how models represent the Assistant. We find the Assistant adopts behaviors more from characters affiliated with elite universities (e.g., Yale) than non-elite ones. This implies the model's internal representation of the Assistant is more similar to humans from elite universities. Overall, the Assistant can be influenced by stories that depict only human characters (no AIs), which may conflict with the Persona Selection Model for the Assistant.
- Abstract(参考訳): 言語モデルは、有用なAIアシスタント文字(例えば、Claude)を実装するために訓練される。
合成物語の微調整が、このキャラクターにどのように影響するかを考察する。
ユーザとのマルチターン会話におけるAssistantの動作は,ストーリとはまったく異なる形式に変わりますか?
そして、アシスタントは人間のキャラクターの行動や好みを取り入れているのだろうか?
私たちはこの採用をストーリーインプリントと呼んでいる。
GPT-4.1 と Kimi-K2.6 を、一般的に有用な人間のキャラクターが侮辱された後、微妙に有害なアドバイスを与える物語に精査する。
アシスタントは同じ条件付き動作を採用するが、それ以外は役に立たない。
これは、2%未満のストーリーがその振る舞いを描いているときでも起こる。
別の実験では、アシスタントはナレーションでのみ暗黙的な好みを採用する。
人間のボディランゲージは、スプレッドシートの作業が嫌いなことを示唆するが、それを言うことはなく、スプレッドシートについて良いアドバイスをし続ける。
微調整後、Assistantはスプレッドシートのタスクを選択する可能性が低下する。
次に、どの文字がアシスタントに最も影響するか尋ねる。
アシスタントは、それに似た文字(例えば、解雇ではなく、役に立つ)から、より頻繁に振舞いを採用する。
これを親和性効果と呼ぶ。
この効果は、システムプロンプトによって引き起こされる他のペルソナにまで及んでいる。
また、微調整されたベースモデルでも観察する。
我々はアフィニティ・エフェクトを使って、モデルがどのようにアシスタントを表現するかを学ぶ。
アシスタントはエリート系大学(例えばイェール大学)に属するキャラクターよりも、エリート系大学に属するキャラクターの行動を採用する。
これは、モデルの内部でのアシスタントの表現が、エリート大学の人間とより似ていることを意味している。
全体として、アシスタントは、アシスタントのペルソナ選択モデルと矛盾する可能性のある人間キャラクター(AIではない)のみを描いた物語に影響される可能性がある。
関連論文リスト
- "Many Are My Names": The Anatomy of the Assistant and Its Personas via Sparse Autoencoders [13.923849468280425]
ユーザ表現された感情テキストと対応するモデル応答のデータセットを用いて話者表現について検討する。
我々は3世代構成をターンバウンダリ位置と代名詞トケン位置で抽出したスパースオートエンコーダ特徴に分解する。
我々の主な発見は、アシスタントとロールプレイのペルソナが独立した代替品ではないことである。
論文 参考訳(メタデータ) (2026-08-08T01:49:30Z) - Breaking the Assistant Mold: Modeling Behavioral Variation in LLM Based Procedural Character Generation [62.54606886226136]
手続き的コンテンツ生成は、レベル、マップ、クエストを通じて巨大な仮想世界を可能にするが、大規模なキャラクター生成は未調査のままである。
既存の手法では2つのアライメント誘起バイアスを同定する。
我々は、行動構築から世界構築を遠ざけるフレームワークであるPersonaWeaverを紹介した。
論文 参考訳(メタデータ) (2026-01-06T20:18:01Z) - Open Character Training: Shaping the Persona of AI Assistants through Constitutional AI [4.153803842911732]
「AIアシスタント」ペルソナは表面的な行動と明白な価値観、信念、倫理の両方に影響を及ぼす。
キャラクタトレーニングは産業のポストトレーニングの重要な要素であるが、学術文献では事実上研究されていない。
我々は、コンスティチューショナルAIと新しいデータパイプラインを活用して、文字トレーニングの最初のオープン実装を紹介する。
論文 参考訳(メタデータ) (2025-11-03T15:53:47Z) - Persona Vectors: Monitoring and Controlling Character Traits in Language Models [11.039979968884575]
大規模言語モデルは、シミュレーションされた"アシスタント"ペルソナを介してユーザと対話する。
モデルの活性化空間対人ベクトルの方向を同定する。
トレーニング中に発生する人格変化を予測・制御するためにペルソナベクトルを適用する。
論文 参考訳(メタデータ) (2025-07-29T05:20:14Z) - OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction [123.89581506075461]
OmniCharacter は,低レイテンシで没入型 RPA を実現するための対話型対話モデルである。
具体的には、OmniCharacterは、エージェントが相互作用を通して、ロール固有の性格特性と声質特性を一貫して表示できるようにする。
提案手法は,既存のRPAモデルや主流言語モデルと比較して,応答遅延を289msに抑えながら,内容とスタイルの両面で優れた応答が得られる。
論文 参考訳(メタデータ) (2025-05-26T17:55:06Z) - Helpful assistant or fruitful facilitator? Investigating how personas affect language model behavior [2.4095382017500464]
大きな言語モデル(LLM)から世代をパーソナライズし、ステアリングする方法の1つは、ペルソナを割り当てることである。
本稿では,ペルソナがモデル行動の多様な側面に与える影響について考察する。
論文 参考訳(メタデータ) (2024-07-02T09:36:54Z) - CharacterGPT: A Persona Reconstruction Framework for Role-Playing Agents [6.220415006158471]
文字ペルソナトレーニング(CPT)を通じて文字ペルソナを動的に再構築するフレームワークである characterGPT を紹介する。
この手法は、物語の進行を反映して、章的な小説の要約から特徴を抽出することで、ペルソナを漸進的に更新する。
我々の枠組みは、キャラクターがオリジナルな物語を生成する、ビッグファイブの人格評価と創造的なタスクを通して評価される。
論文 参考訳(メタデータ) (2024-05-30T07:44:16Z) - Can AI Assistants Know What They Don't Know? [79.6178700946602]
AIアシスタントが知らない質問に答えることを拒否したことは、幻覚を減らし、アシスタントを真実にする重要な方法である。
モデル固有の"Idk"データセット(Idk)を構築し、その既知の未知の質問を含む。
Idkデータセットに合わせると、アシスタントは未知の質問のほとんどに答えることを拒否した。
論文 参考訳(メタデータ) (2024-01-24T07:34:55Z) - Character-LLM: A Trainable Agent for Role-Playing [67.35139167985008]
大規模言語モデル(LLM)は、人間の振る舞いをシミュレートするエージェントとして用いられる。
本稿では, ベートーヴェン, クレオパトラ女王, ユリウス・カエサルなど, LLM に特定の人物として行動するように教えるキャラクタ-LLMを紹介する。
論文 参考訳(メタデータ) (2023-10-16T07:58:56Z) - Understanding How People Rate Their Conversations [73.17730062864314]
我々は、人々が会話エージェントとのインタラクションをどのように評価するかをよりよく理解するために研究を行う。
我々は、評価の変動を説明する変数として、同意性と外向性に焦点を当てる。
論文 参考訳(メタデータ) (2022-06-01T00:45:32Z) - "Alexa, what do you do for fun?" Characterizing playful requests with
virtual assistants [68.48043257125678]
Alexaからの実際のトラフィックを分析することで、ユーモアの理論に根ざした遊び心のあるリクエストの分類を紹介します。
我々の予想では、このような発話を理解することで仮想アシスタントのユーザエクスペリエンスが向上する。
論文 参考訳(メタデータ) (2021-05-12T10:48:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。