論文の概要: The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads
- arxiv url: http://arxiv.org/abs/2608.04570v1
- Date: Wed, 05 Aug 2026 08:00:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.78221
- Title: The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads
- Title(参考訳): パーソナライズミラー:LDMがユーザプロファイルをどのように作成し、なぜ自己監視ミスを発生させるのか
- Authors: Yushi Sun, Yanjie Zhang, Rui Sheng,
- Abstract要約: ステレオタイプ,反ステレオタイプ,中立プロファイル間でバランスの取れた150人の人物からなるMirrageBenchを紹介した。
オーバー推論は広範に行われており、12モデルのうち1モデルがオーバー推論の35%から49%を占めている。
MirageBenchは、信頼性の高い個人化のための信頼性の高い基盤として、モデル自己報告ではなく、外部検証を位置付けている。
- 参考スコア(独自算出の注目度): 0.9743693761871391
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Personalized LLMs with persistent memory are increasingly deployed, yet the faithfulness of their user models remains unexamined. We study over-inference (OI): the phenomenon where LLMs fabricate user attributes beyond what evidence supports. We introduce MirageBench, comprising 150 personas balanced across stereotypical, counter-stereotypical, and neutral profiles, 6 personalization tasks spanning an ``imagination gradient'', a four-way faithfulness taxonomy operationalized by an independent judge (validated against a blind human annotator on 400 claims: Cohen's kappa = 0.863 four-class, kappa = 0.900 binary), and a leaderboard of 12 models across 7 families on 143616 judged claims. We find that over-inference is pervasive: every one of the 12 models over-infers 35%--49% of its claims (cross-model mean 41.6%; claim-weighted 41.8%), with no model in this evaluation escaping it. Most strikingly, we surface a Self-Monitoring Inversion: at the model-selection level, models' self-assessed OI is negatively rank-correlated with their judge-measured OI (rho = -0.60, p = 0.044; exploratory, wide bootstrap CI [-0.90, +0.06], n = 12). The models that report the least over-inference tend to be flagged as fabricating the most, so self-reported confidence is a misleading signal for comparing models, even though within a single model self-audit still ranks that model's own claims moderately well (AUROC 0.58--0.83). We further show that OI is task-dependent (27%--59%) and that, in a multi-turn pilot, inferred attributes accumulate approximately linearly with little revision. MirageBench positions external verification, rather than model self-report, as a more reliable foundation for trustworthy personalization.
- Abstract(参考訳): パーソナライズされたパーソナライズされたLLMは、永続的なメモリを持つものが多くデプロイされるが、ユーザモデルの忠実さはいまだに検討されていない。
オーバー推論(OI: Over-inference)は,LCMがエビデンス以外のユーザ属性を生成できる現象である。
筆者らは, ステレオタイプ, 反ステレオタイプ, 中立プロファイル間でバランスのとれた150人の人物, 「想像の勾配」にまたがる6つのパーソナライゼーションタスク, 独立裁判官が運営する4方向の忠実度分類(400のクレームに対して盲人アノテータに対して無効化される: Cohen's kappa = 0.863 4-class, kappa = 0.900 binary), および143616の7つのファミリーにまたがる12のモデルからなるリーダーボードについて紹介する。
12モデルのうち1モデルが35%~49%(クロスモデルは41.6%、クレーム重みは41.8%)であり、この評価を逃れるモデルはない。
モデル選択レベルでは、モデルの自己評価されたOIは、判断されたOI(rho = -0.60, p = 0.044; 探索的で広いブートストラップCI [-0.90, +0.06], n = 12)と負のランク相関を持つ。
最も過度な推論を報告しているモデルは、最も多く作成するものとしてフラグ付けされる傾向があるため、自己報告された自信は、モデルを比較するための誤解を招く信号である。
さらに,OIはタスク依存(27%~59%)であり,マルチターンパイロットの場合,推定属性はほぼ線形に蓄積され,リビジョンはほとんどなかった。
MirageBenchは、信頼性の高いパーソナライゼーションのための信頼性の高い基盤として、モデル自己報告ではなく、外部検証を位置付けている。
関連論文リスト
- Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks [0.0]
MathCheckのパラフレーズ品質検査では, 19群で4つの意味的不正確なパラフレーズが検出された。
GPT-4oは2位から4位へと降格し、クロード・ハイクとディープ・シークV3が上昇する。
論文 参考訳(メタデータ) (2026-05-27T18:59:18Z) - Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning [56.48520300004217]
本稿では、文脈干渉を内部の訓練信号に変換するセルフプレイのRLフレームワークであるSeyrnesを紹介する。
単一のモデルでは、可視的かつ気を散らすようなコンテキストの構築と、それ自身で盲点を露呈するように訓練されている。
これらの競合する目標を互いに衝突させることで、Sailnes氏は、表面的なパターンマッチングを超えてモデルを補完する。
論文 参考訳(メタデータ) (2026-05-12T06:58:35Z) - MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models [0.0]
MIRRORは、大規模言語モデルがより優れた意思決定に自己知識を使用できるかどうかを評価するベンチマークである。
約25万の評価インスタンスに対して,8つの実験室から16のモデルを評価した。
論文 参考訳(メタデータ) (2026-04-15T08:41:12Z) - Self-Transparency Failures in Expert-Persona LLMs: A Large-Scale Behavioral Audit [0.0]
本研究では,ハイテイクドメインにおけるプロフェッショナルペルソナの割り当て時に,モデルが自己透明性を示すか否かを検討する。
ファイナンシャル・アドバイザー・ペルソナは最初のプロンプトで30.8%、ニューロサージョン・ペルソナはわずか3.5%だった。
これにより、仮説化された逆ゲルマン・アムネシア効果の前提条件が作成され、いくつかの領域における適切な開示により、ユーザーは高文脈への信頼を過度に一般化する。
論文 参考訳(メタデータ) (2025-11-26T16:41:49Z) - How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts [54.07541591018305]
提案するMAD-Benchは,既存のオブジェクト,オブジェクト数,空間関係などの5つのカテゴリに分割した1000の試験サンプルを含むベンチマークである。
我々は,GPT-4v,Reka,Gemini-Proから,LLaVA-NeXTやMiniCPM-Llama3といったオープンソースモデルに至るまで,一般的なMLLMを包括的に分析する。
GPT-4oはMAD-Bench上で82.82%の精度を達成するが、実験中の他のモデルの精度は9%から50%である。
論文 参考訳(メタデータ) (2024-02-20T18:31:27Z) - Llamas Know What GPTs Don't Show: Surrogate Models for Confidence
Estimation [70.27452774899189]
大規模言語モデル(LLM)は、ユーザを誤解させるのではなく、不正な例に対して低い信頼を示さなければならない。
2023年11月現在、最先端のLLMはこれらの確率へのアクセスを提供していない。
言語的信頼度と代理モデル確率を構成する最良の方法は、12データセットすべてに対して最先端の信頼度推定を与える。
論文 参考訳(メタデータ) (2023-11-15T11:27:44Z) - Conservative Prediction via Data-Driven Confidence Minimization [70.93946578046003]
機械学習の安全性クリティカルな応用においては、モデルが保守的であることが望ましいことが多い。
本研究では,不確実性データセットに対する信頼性を最小化するデータ駆動信頼性最小化フレームワークを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:05:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。