論文の概要: Investigating Assistant Bias in LLM User Simulators Using a Role Vector
- arxiv url: http://arxiv.org/abs/2609.00608v1
- Date: Tue, 01 Sep 2026 02:49:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.245982
- Title: Investigating Assistant Bias in LLM User Simulators Using a Role Vector
- Title(参考訳): ロールベクトルを用いたLCMユーザシミュレータにおけるアシスタントバイアスの調査
- Authors: Daeheon Jeong, Yoonjoo Lee, Eugene Choi, Sinie van der Ben, Juho Kim,
- Abstract要約: LLMベースのユーザシミュレータは、大規模に自律エージェントを評価するために、ますます利用されている。
モデルトレーニング中にアシスタントバイアスが焼き込まれ、ロールプレイングプロンプトがオーバーライドしない。
i) ユーザ指向はアクティベーションにおいて識別可能であり, ユーザライクな振る舞いを誘発し, アシスタント特性とは異なる特徴を捉えている。
- 参考スコア(独自算出の注目度): 21.70379807235766
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-based user simulators are increasingly used to evaluate autonomous agents at scale, in place of costly human evaluations. Despite this promise, these simulators exhibit "assistant bias," a tendency to cooperate and pursue task goals. They rarely reproduce the frustration or disengagement that real users exhibit, compromising evaluation validity. Prior work outlines that this bias is baked in during model training, which role-playing prompts fail to override. We analyze this bias from model activations, extracting a user role vector by contrasting how the model represents user versus assistant perspectives on the same dialogue. We observe two findings: (i) the user direction is identifiable in activations, elicits user-like behaviors, and captures characteristics distinct from assistant traits; and (ii) although user-role activation associates with simulation realism and steering strengthens it, it can exaggerate user behaviors and override individual user profiles. Together, our findings provide a representation-level analysis of LLM user simulators, confirming that assistant bias is structurally identifiable and that user behavior can be directionally analyzed.
- Abstract(参考訳): LLMベースのユーザシミュレータは、コストのかかる人的評価の代わりに、大規模に自律エージェントを評価するために、ますます利用されている。
この約束にもかかわらず、これらのシミュレータは「補助バイアス」を示し、協調してタスク目標を追求する傾向にある。
実際のユーザが提示するフラストレーションやデエンゲージメントを再現することは滅多になく、評価の妥当性を損なう。
以前の作業では、このバイアスはモデルトレーニング中に発生し、ロールプレイングプロンプトがオーバーライドを失敗する、と説明されていた。
このバイアスをモデルアクティベーションから分析し、モデルがユーザ対アシスタントの視点を同じ対話でどのように表現するかを対比することにより、ユーザロールベクトルを抽出する。
私たちは2つの発見を観察します。
(i)利用者の行動は、アクティベーションにおいて識別可能であり、ユーザ様の行動を誘発し、アシスタントの特徴とは異なる特徴を捉え、
(II) ユーザロールアクティベーションはシミュレーションリアリズムやステアリングと結びついているが, ユーザの振る舞いを誇張し, 個々のユーザプロファイルをオーバーライドすることができる。
そこで本研究では,LLMユーザシミュレータの表現レベル解析を行い,アシスタントバイアスが構造的に識別可能であり,ユーザ行動の方向解析が可能であることを確認した。
関連論文リスト
- Verifiable User Simulation for Search and Recommendation Systems [9.794615910946002]
大規模言語モデル(LLM)に基づくユーザシミュレーションは,検索エンジン,レコメンダシステム,検索拡張生成パイプラインの評価に採用されている。
本チュートリアルでは,ユーザシミュレータを7つの監査可能なコンポーネントからなる検証可能なエンジニアリングアーティファクトとして扱う,設計と監査のためのフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-12T14:09:56Z) - Preference-Aware Rubric Learning for Personalized Evaluation [59.539429430690156]
既存の評価手法では、長期的なインタラクション履歴に埋め込まれたユーザ固有の嗜好をキャプチャできない。
静的判断よりも学習問題としてパーソナライズされた評価を定式化するパラダイムであるパーソナライズド・アズ・ラーニングを提案する。
実験により、PARLはユーザ対応の応答を確実に識別し、ユーザ間で一般化する高忠実なルーブリックを一貫して誘導することが示された。
論文 参考訳(メタデータ) (2026-05-29T17:00:55Z) - The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study [56.649987197786096]
大規模言語モデル(LLM)は人間の行動のシミュレータとしての可能性を示している。
LLMは潜在ユーザ属性の意図しないシフトを誘発し、ユーザのドリフトを引き起こす。
ユーザのドリフトによって生じる不確実性や選択バイアスを形式化する。
論文 参考訳(メタデータ) (2026-05-20T06:09:41Z) - Measuring and Mitigating the Distributional Gap Between Real and Simulated User Behaviors [61.610957638373826]
本研究では,実際のユーザ行動とシミュレーションユーザ行動の分布ギャップを計測する手法を提案する。
実会話とシミュレーション会話のデータセットが与えられた場合,本手法は各会話からユーザ行動の表現を抽出する。
ほとんどのシミュレータも同様に振る舞うが、いくつかは独立している。
論文 参考訳(メタデータ) (2026-05-08T15:09:25Z) - Mind the Sim2Real Gap in User Simulation for Agentic Tasks [101.69142591891234]
ユーザシミュレーションにおけるSim2Realのギャップを形式化し、実際の人間に対して$$$-benchプロトコルを実行する最初の研究を示す。
LLMシミュレータは過度に協調的であり、スタイリスティックに均一であり、現実的なフラストレーションや曖昧さを欠いている。
これらの知見は, LLMベースのユーザシミュレータをエージェント開発サイクルで使用する際の人間による検証の重要性を強調した。
論文 参考訳(メタデータ) (2026-03-11T19:12:31Z) - Flipping the Dialogue: Training and Evaluating User Language Models [31.119620506835677]
汎用ユーザ言語モデル(ユーザLM)を紹介する。
ユーザLMは、マルチターン会話で人間のユーザをシミュレートする、ポストトレーニング後のモデルである。
ユーザLMが人間の行動とどのように一致しているかを示し、既存のシミュレーション手法よりも優れたシミュレーションロバスト性を実現する。
論文 参考訳(メタデータ) (2025-10-08T01:04:36Z) - Addressing Personalized Bias for Unbiased Learning to Rank [56.663619153713434]
Unbiased Learning to rank (ULTR)は、バイアスのあるユーザの行動ログからバイアスのないランキングモデルを学ぶことを目的としている。
そこで本研究では,学習からランクへの目標値を求めるために,新しいユーザ認識逆確率スコア推定器を提案する。
論文 参考訳(メタデータ) (2025-08-28T14:01:31Z) - Personas within Parameters: Fine-Tuning Small Language Models with Low-Rank Adapters to Mimic User Behaviors [1.8352113484137629]
正確なレコメンデーションモデルを開発する上での長年の課題は、主にユーザインタラクションの複雑な性質のために、ユーザの振る舞いをシミュレートすることである。
本研究では, 凍結したLarge Language Models (LLMs) を用いてロバストなユーザ表現を抽出し, 微調整小言語モデル (SLMs) を用いたコスト効率, 資源効率のよいユーザエージェントをシミュレートする手法を提案する。
提案手法の有効性を実証し,本手法を用いて開発したユーザエージェントが,オフラインメトリクスとレコメンデータシステムの実環境性能のギャップを埋める可能性を示した。
論文 参考訳(メタデータ) (2025-08-18T22:14:57Z) - User Behavior Simulation with Large Language Model based Agents [116.74368915420065]
LLMベースのエージェントフレームワークを提案し,実際のユーザ動作をシミュレートするサンドボックス環境を設計する。
実験結果から,本手法のシミュレーション行動は実人の行動に非常に近いことが判明した。
論文 参考訳(メタデータ) (2023-06-05T02:58:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。