論文の概要: Beyond a Single Judge: Simulating Social Persona Panels for Generative UI Evaluation
- arxiv url: http://arxiv.org/abs/2607.28439v1
- Date: Thu, 30 Jul 2026 16:13:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.654277
- Title: Beyond a Single Judge: Simulating Social Persona Panels for Generative UI Evaluation
- Title(参考訳): ひとりの裁判官を超えて: 生成UI評価のためのソーシャルペルソナパネルのシミュレーション
- Authors: Zheng Wu, Yibo Luo, Pu Zhang, Cheng Yang, Zhuosheng Zhang,
- Abstract要約: GenUIは、大きな言語モデルが自然言語命令から直接、完全なレンダリング可能なインターフェースを合成することを可能にする。
LLM-as-a-judgeはスケーラブルだが、単一の暗黙の視点しか反映しない。
我々は3段階のGenUI評価手法であるEvidence-Grounded, Social-Weighted Persona Panel (ESPP)を提案する。
- 参考スコア(独自算出の注目度): 19.389121016779573
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative UI (GenUI) lets large language models synthesize a complete, renderable interface directly from a natural-language instruction, but evaluating the quality of what they generate remains an open problem. Human evaluation is costly and rater-variant, while LLM-as-a-judge is scalable but reflects only a single implicit viewpoint, unable to capture how different populations of real users actually perceive the same interface. We propose the Evidence-Grounded, Social-Weighted Persona Panel (ESPP), a three-stage GenUI evaluation method in which a panel of psychologically diverse, evidence-grounded personas independently rates a screenshot, exchanges opinions under a trait-derived, semantically-gated bounded-confidence mechanism, and is aggregated via Delphi-inspired social weighting into a single judgment. ESPP tracks human judgment substantially more closely than a naive single-pass judge, raising Pearson $r$ from $0.716$ to $0.922$, and a prompt-ensemble control recovers only about a third of this gap, isolating genuine persona and evidence grounding as the dominant source of improvement. Beyond this fidelity gain, retaining each panelist's individual rating further reveals that user subgroups agree on overall model rankings yet diverge sharply on specific rating dimensions, a structural disagreement a single homogeneous judge would systematically erase. The codes are available at https://github.com/Wuzheng02/ESPP.
- Abstract(参考訳): ジェネレーティブUI(GenUI)は、大きな言語モデルが自然言語命令から直接、完全なレンダリング可能なインターフェースを合成することを可能にするが、それらが生成するものの品質評価は未解決のままである。
LLM-as-a-judgeはスケーラブルだが、単一の暗黙の視点しか反映せず、実際のユーザの異なる集団がいかにして同じインターフェースを認識しているかを捉えることができない。
Evidence-Grounded, Social-Weighted Persona Panel (ESPP) は、3段階のGenUI評価手法であり、心理的に多様性があり、エビデンス・グラウンドド・パーソナのパネルが、スクリーンショットを独立に評価し、特性に起因した意味的な有界信頼メカニズムの下で意見を交換し、デルフィに触発された社会的重み付けを通じて一つの判断に集約するものである。
ESPPは、単純なシングルパスの裁判官よりも人間の判断をかなりよく追跡し、ピアソン$r$を0.716$から0.922$に引き上げ、プロンプトアンサンブル制御は、このギャップの約3分の1しか回復せず、真のペルソナと証拠を分離し、改善の主流の源となっている。
この不確実性の向上を超えて、各パネリストの個人格付けを維持することで、ユーザーサブグループは全体のモデル格付けに同意するが、特定の格付け次元で急激な意見の相違が示され、単一の同質な裁判官が体系的に消去される構造上の不一致が明らかになる。
コードはhttps://github.com/Wuzheng02/ESPPで入手できる。
関連論文リスト
- Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging [15.994164469249727]
EYT-Benchは、大規模な言語モデルを評価するための人間中心のベンチマークである。
人体は人体培養コーパスから採取される。
最先端のクローズドおよびオープンソースモデルは、統計的に主観的次元に近接している。
論文 参考訳(メタデータ) (2026-07-11T18:22:49Z) - PA-User: Simulating Trust and Verification under AI-Generated Content [1.1105673928718571]
3つの新しいコンポーネントを持つユーザシミュレータPA-Userを提案する。
信頼コンポーネントは、それぞれのソースクラスの事実に関する別々のベータ信念を持っています。
決定ルールは、各結果に対する受け入れ、証明、破棄を選択する。
論文 参考訳(メタデータ) (2026-06-22T00:45:06Z) - From Self to Other: Evaluating Demographic Perspective-Taking in LLM Hate Speech Annotation [5.762370982168011]
パーソナ条件付き大規模言語モデル(特定の階層的アイデンティティーを採用するよう促されるモデル)は、スケールにおける様々な視点をシミュレートする方法として提案されている。
人間の社会的判断の3つの側面として, (i) 異なる集団のペルソナが人間的な方法(グループ間不一致)に異同するか否か, (ii) コンテンツが自身のアイデンティティ(グループ内での感受性)をターゲットとした場合に, より敏感になるかどうか, (iii) 他集団の反応を正確に予測できるかどうか (viarious prediction) を評価した。
以上の結果から, モデルが3次元全てを連続的に捉えることはなく, 性能はモデル依存であり, 確実に出現しないことが明らかとなった。
論文 参考訳(メタデータ) (2026-06-04T15:09:58Z) - MLLM as a UI Judge: Benchmarking Multimodal LLMs for Predicting Human Perception of User Interfaces [97.62557395494962]
GPT-4o、Claude、Llamaを30のインターフェースでベンチマークするためにクラウドソーシングを使用します。
以上の結果から,MLLMは特定の次元において人間の嗜好を近似するが,他の次元では異なってしまうことが示唆された。
論文 参考訳(メタデータ) (2025-10-09T20:00:41Z) - PerFairX: Is There a Balance Between Fairness and Personality in Large Language Model Recommendations? [0.47745223151611654]
LLM生成レコメンデーションにおけるパーソナライズと人口統計学的株式のトレードオフを定量化するためにPerFairXを提案する。
我々は、映画(MovieLens 10M)と音楽(Last.fm 360K)のデータセットで、最先端の2つのLLMであるChatGPTとDeepSeekをベンチマークする。
DeepSeekはより強い心理的適合性を達成するが、変化を促すために高い感度を示す一方、ChatGPTは安定しているがパーソナライズされていない出力を提供する。
論文 参考訳(メタデータ) (2025-08-20T09:41:53Z) - Are Personalized Stochastic Parrots More Dangerous? Evaluating Persona
Biases in Dialogue Systems [103.416202777731]
我々は、対話モデルが採用するペルソナに付随する有害な行動の感度であると定義する「ペルソナバイアス」について検討する。
我々は,人格バイアスを有害な表現と有害な合意のバイアスに分類し,攻撃性,有害継続性,関連性,ステレオタイプ合意,および有害合意の5つの側面において,人格バイアスを測定する包括的な評価枠組みを確立する。
論文 参考訳(メタデータ) (2023-10-08T21:03:18Z) - Face Recognition: Too Bias, or Not Too Bias? [45.404162391012726]
我々は、最先端の顔認識システムにおけるバイアスの問題に対する批判的な洞察を明らかにする。
異なるサブグループにまたがる対面対の最適スコアしきい値の変動を示す。
また、人間の知覚にそのようなバイアスが存在するという仮説を支持する、人間のバイアスを測定するために、人間の評価を行う。
論文 参考訳(メタデータ) (2020-02-16T01:08:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。