論文の概要: Diagnosing and Repairing Persona Collapse in LLM Advice
- arxiv url: http://arxiv.org/abs/2607.08326v1
- Date: Thu, 09 Jul 2026 10:12:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.499173
- Title: Diagnosing and Repairing Persona Collapse in LLM Advice
- Title(参考訳): LLM機器におけるペルソナ崩壊の診断と修復
- Abstract要約: 我々は,ヘドニック・トーンとエージェンシー・サポートによって定義された空間において,状況条件付きペルソナ選択としてアドバイス・グルーピングを定式化する。
14の文脈にまたがる1,281件のアドバイス投稿では、5人のペルソナに対して、トップレベルの人間の反応が体系的に変化する。
盲目調査では、199人が4つの状況にまたがってアドバイス・ギバーの格付けを経験し、修理されたモデルに比較してデフォルトが崩壊することを好んだ。
- 参考スコア(独自算出の注目度): 10.962822320354094
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLMs are increasingly used for personal advice on relationships, work, moral dilemmas, and crises. Post-training selects a stable, prosocial Assistant persona, but good advice requires more than a good default character: a skilled advisor comforts someone in crisis, challenges someone in denial, and stays procedural with a logistical question. We formalize advice-giving as situation-conditioned persona selection in a space defined by hedonic tone and agency support, and call failures of this mapping "persona collapse" (the compression of diverse situations into a single default persona). Across 1,281 advice posts spanning 14 contexts, top-rated human responses shift systematically across five personas, while three frontier models collapse over 90\% of responses into a single supportive persona regardless of context. Prompting the model to first pick a fitting persona only deepens the collapse. We then ask whether the collapse can be repaired. Our method, Inverse-Process Distillation, reconstructs the situational reading that could have produced each human response and trains on the result, aiming to distill the situation-to-persona policy rather than the answers. It cuts divergence from the human persona distribution by approximately 80\%. Yet in a blinded study, 199 experienced advice-givers rating responses across four situations in sequence prefer the collapsed default over every repaired model, most strongly when the situation calls for challenge, though this preference shifts with repeated exposures.
- Abstract(参考訳): LLMは、関係性、仕事、道徳的ジレンマ、危機に関する個人的なアドバイスにますます使われています。
ポストトレーニングでは、安定的でプロソシエイトなペルソナが選択されるが、良いアドバイスには、優れたデフォルトの性格以上のものが必要だ。
ヘドニック・トーンとエージェンシー・サポートによって定義された空間における状況条件付きペルソナ選択としてのアドバイス・グルーピングを形式化し、このマッピングの失敗を「ペルソナ崩壊」(多様な状況を1つのデフォルトのペルソナに圧縮する)と呼ぶ。
14の文脈にまたがる1,281件のアドバイス投稿では、トップレベルの人間の反応が5つのペルソナに体系的にシフトし、3つのフロンティアモデルは、文脈に関係なく90%以上のレスポンスが単一の支援的ペルソナに崩壊する。
フィッティングペルソナを最初に選択するモデルを実行すると、崩壊が深まります。
そして、崩壊を修復できるかどうか尋ねる。
提案手法である逆工程蒸留(Inverse-Process Distillation, Inverse-Process Distillation)は,人間の反応を再現し,その結果を訓練し,回答ではなく対人政策を蒸留することを目的としている。
ヒトの人格分布から約80%のばらつきを減少させる。
しかし、盲目調査では、4つの状況にまたがって199人のアドバイス・ギバーのレーティングレスポンスを経験し、修復されたモデルごとにデフォルトが崩壊することを好んだ。
関連論文リスト
- Moral Advice as Interactional Negotiation: Framing, User Pressure, and Social Position in Large Language Model Responses [0.0]
我々は, LLMのモラルアドバイスを, フレーミング, 持続的ユーザプレッシャー, およびモラル対象の社会的地位によって形成される相互作用交渉として検討する。
GPT-4o-miniの場合、LLMの道徳的アドバイスは、規範的応答傾向とユーザ圧力の間の部分的に安定した交渉を通じて発展することができる。
論文 参考訳(メタデータ) (2026-09-04T16:48:33Z) - Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation [17.233278905124916]
モデルが未対応の片側アカウントを完全扱い、欠落した視点を求めることなくナレーターの解釈と整合するフェールモードを示す。
複数ターンナレーションシフトによる終状態判断は,一致した単一ターンベースラインを超える平均25ポイントの差がある。
論文 参考訳(メタデータ) (2026-09-03T06:07:00Z) - MindTailor: Personalized Emotional Support via Post History-Grounded Case Formulation and Collaborative Refinement [44.7545875422459]
MindTailorは、パーソナライズされた感情的サポート応答を生成するフレームワークである。
ReddiSuppは798のReddit投稿のデータセットで、シーカーの以前の投稿履歴と組み合わせている。
論文 参考訳(メタデータ) (2026-06-20T07:52:55Z) - Staying with the Uncertainty: Uncertainty-Scaffolding Strategies for Artificial Moral Advisors in LLM-to-LLM Simulated Conversations [14.219056094334809]
我々は3つの不確実性モード(パースペクティブ、テンション保存、プロセス反射)を提案し、それらを3つの制御条件(ベースライン、パーサッシブ、シコファンティック)と比較する。
ユーザエージェントLLMは、特定の不確実性戦略に従ってAMAと倫理ジレンマの対話を行い、事前及び後アンケートを完了する。
その結果,1つのモデルがシミュレーションされたユーザエージェントとして支配的であり,オープンモデルと人間のあいまいさが一致していることが判明した。
論文 参考訳(メタデータ) (2026-06-04T08:59:10Z) - Measuring Opinion Bias and Sycophancy via LLM-based Persuasion [8.399156116912904]
提案手法は,提案するトピックに対して,アシスタントが持つ意見を検出する方法である。
直接探索は、シミュレーションされたユーザーから圧力をエスカレートする5ターンにわたってモデルの意見を求める。
間接的調査は決して意見を求めず、議論的な議論においてモデルを関与させ、それがどのように譲歩し、抵抗し、あるいは反弁論をするかを通してバイアスを漏らす。
論文 参考訳(メタデータ) (2026-04-23T11:34:06Z) - Do LLMs Benefit From Their Own Words? [56.73014497206615]
先行するアシスタント応答の除去は,少数のターンにおいて応答品質に影響を与えないことがわかった。
アシスタント側コンテキストのオミッティングは、累積コンテキストの長さを最大10倍に減らすことができる。
本研究は, 記憶量削減を図り, アシスタント履歴を選択的に省略することで, 応答品質を向上できることを示唆する。
論文 参考訳(メタデータ) (2026-02-27T18:58:26Z) - Cold-Start Personalization via Training-Free Priors from Structured World Models [90.29121836614081]
コールドスタートのパーソナライズには、ユーザ固有の履歴データが利用できない場合、インタラクションを通じてユーザの好みを推測する必要がある。
本稿では,オフライン構造学習とオンラインベイズ推論へのコールドスタート推論の分解を提案する。
生成した応答とユーザの指定した好みの80.8%を、RLでは68.5%、インタラクションでは3.5倍に調整します。
論文 参考訳(メタデータ) (2026-02-16T18:52:13Z) - Learning Steerable Clarification Policies with Collaborative Self-play [67.67872810596839]
不明瞭なクエリを処理するために、AIアシスタントは不確実性を管理するためのポリシーが必要である。
我々は,この不確実性を管理するために,自己再生を用いて評価可能な政策を訓練することを提案する。
このことが、提供されたコストに応じて予測可能な振る舞いを変更する、評価可能なポリシーにつながることを示す。
論文 参考訳(メタデータ) (2025-12-03T18:49:54Z) - Personalized Reasoning: Just-In-Time Personalization and Why LLMs Fail At It [81.50711040539566]
現在の大規模言語モデル(LLM)開発は、タスク解決と優先順位調整を別の課題として扱う。
静的ベンチマークを対話型パーソナライズタスクに変換する評価手法であるPreFDISCOを紹介する。
我々のフレームワークは、ユーザコンテキストに応じて、同じ質問が異なる推論チェーンを必要とするシナリオを作成します。
論文 参考訳(メタデータ) (2025-09-30T18:55:28Z) - Cascaded Language Models for Cost-effective Human-AI Decision-Making [52.81324217423194]
複数の専門分野にまたがってタスクを適応的に委譲するLLM決定フレームワークを提案する。
まず、deferral Policyは、ベースモデルの回答を受け入れるか、あるいは大きなモデルでそれを再生するかを決定する。
第2に、禁忌ポリシーは、カスケードモデル応答が十分に確実であるか、または人間の介入を必要とするかを判定する。
論文 参考訳(メタデータ) (2025-06-13T15:36:22Z) - You Only Live Once: Single-Life Reinforcement Learning [124.1738675154651]
多くの現実世界の状況では、そのタスクを繰り返し実行できるポリシーを学ぶことではなく、単一のトライアルで1回だけ新しいタスクを成功させることが目的である。
エージェントが介入なしにひとつのエピソード内でタスクを完了しなければならない問題設定を形式化する。
本稿では,分散マッチング戦略を用いたQ$-weighted adversarial Learning (QWALE)を提案する。
論文 参考訳(メタデータ) (2022-10-17T09:00:11Z) - Improving Personality Consistency in Conversation by Persona Extending [22.124187337032946]
本稿では,Persona Retrieval Model(PRM)とPosterior-Scored Transformer(PS-Transformer)の2つのサブコンポーネントからなる新しい検索・予測パラダイムを提案する。
提案モデルでは,自動測定と人的評価の両面で大幅に改善されている。
論文 参考訳(メタデータ) (2022-08-23T09:00:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。