論文の概要: Rating the Pitch, Not the Product: User Evaluations of LLMs Reflect Expectations More Than Performance
- arxiv url: http://arxiv.org/abs/2607.05113v1
- Date: Mon, 06 Jul 2026 14:05:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.184906
- Title: Rating the Pitch, Not the Product: User Evaluations of LLMs Reflect Expectations More Than Performance
- Title(参考訳): 製品ではなくピッチを評価する - LLMのユーザ評価は、パフォーマンスよりも期待を反映している
- Abstract要約: インタラクションが終わった後も、ユーザは製品ではなく、ピッチを評価できる。
ユーザとモデルが生成した品質は、ユーザが何を言われたかではなく、モデルの真の能力にのみ依存します。
- 参考スコア(独自算出の注目度): 24.119566959637027
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Imagine two users interact with the same LLM. One has been told it is the cutting-edge flagship model; the other, an older, weaker model. They walk away with markedly different ratings of its usefulness and intelligence, yet they used the same model. In a controlled study, 162 participants each used one of six LLMs from two families across three collaborative tasks, after first viewing a landing page that matched, overstated, or understated their model's true capability. This pre-interaction framing shifted user opinions and interaction behavior while task performance did not. Oversold users rated the model more favorably and used more directive prompting, while Undersold users wrote longer, more collaborative prompts. The quality of what users and the model produced together depended only on the model's true capability, not on what users were told. Participants' change in model impressions after use, measured across two impression measures, was not predicted by task performance ($β= -0.01$ and $0.11$, both n.s.), but by whether the model met users' expectations ($β= 0.47$ and $0.50$, both $p < .001$) and how confident they felt working with it ($β= 0.47$ and $0.36$, both $p < .001$). After interaction, users are still rating the pitch, not the product: user-elicited LLM evaluations, including the preference data driving public leaderboards, measure expectation management at least as much as the model itself.
- Abstract(参考訳): 2人のユーザが同じLDMと対話する様子を想像してください。
1つは最先端の旗艦モデル、もう1つは古い、より弱いモデルだと言われている。
彼らはその有用性や知性に関して明らかに異なる評価で立ち去るが、同じモデルを使った。
コントロールされた調査では、162人の参加者が3つの共同作業からなる2家族の6つのLSMのうちの1つを使用していた。
このインタラクション前のフレーミングは、タスクのパフォーマンスがそうでない間、ユーザの意見やインタラクションの振る舞いをシフトさせました。
オーバーソルドユーザーはモデルをより好意的に評価し、ディレクティブなプロンプトを使い、アンダーソルドユーザーはより長く協力的なプロンプトを書いた。
ユーザとモデルが共に生成した品質は、ユーザが何を言われたかではなく、モデルの真の能力にのみ依存します。
2つの印象尺度で測定されたモデル印象の変化は、タスクパフォーマンス(β=-0.01$と$0.11$)では予測されなかったが、モデルのユーザ期待(β=0.47$と$0.50$、どちらも$p < .001$)と、それで作業したと感じた自信(β=0.47$と$0.36$、どちらも$p < .001$)は一致した。
ユーザー主導のLCM評価は、公共のリーダーボードを駆動する選好データを含む、少なくともモデル自体と同じくらいの期待管理を計測する。
関連論文リスト
- BehaviorBench: Modeling Real-World User Decisions from Behavioral Traces [53.55407626944686]
textscBehaviorBenchは、実世界の行動トレースからパーソナライズされた意思決定モデリングを評価するためのベンチマークである。
textscBehaviorBenchは、公開市場とオンチェーンの記録からウォレットレベルの意思決定履歴を再構築する。
2,000以上の評価ウォレットで、ベンチマークには141,445のBeliefインスタンスと1,485,972のTradeインスタンスが含まれている。
論文 参考訳(メタデータ) (2026-06-01T19:04:36Z) - Beyond the Assistant Turn: User Turn Generation as a Probe of Interaction Awareness in Language Models [3.9351446512514947]
ユーザ・ターン・ジェネレーションはLLMの振る舞いやインタラクション・アウェアネスの次元を捉えており、現在のアシスタント・オンリー・ベンチマークでは探索されていない。
この結果から,ユーザターン生成はLLMの振る舞いやインタラクションの認識の次元を捉えていることがわかった。
論文 参考訳(メタデータ) (2026-04-02T17:57:29Z) - Users as Annotators: LLM Preference Learning from Comparison Mode [9.005226538625474]
我々は、比較モードからユーザアノテーションをペアワイズに選好するデータを収集する代替手法を検討する。
ユーザの潜在品質係数を推定する予測最大化アルゴリズムを開発した。
論文 参考訳(メタデータ) (2025-10-10T08:57:34Z) - User-Assistant Bias in LLMs [11.825607435336776]
大規模言語モデル(LLM)は、チャット履歴における自身の情報やユーザの情報への依存に偏りがあり、マルチターン会話において過度に頑固あるいは同意的な振る舞いをもたらす。
我々は,フロンティアLLMにおけるユーザ・アシスタントバイアスをベンチマークし,理解し,操作するために,8kのマルチターン会話データセットであるtextbfUserAssist$を導入している。
論文 参考訳(メタデータ) (2025-08-16T20:33:09Z) - Surface Fairness, Deep Bias: A Comparative Study of Bias in Language Models [45.41676783204022]
大規模言語モデル(LLM)におけるバイアスの様々なプロキシ尺度について検討する。
MMLU (Multi-subject benchmark) を用いた人格評価モデルでは, スコアの無作為かつ大半がランダムな差が生じることがわかった。
LLMアシスタントメモリとパーソナライゼーションの最近の傾向により、これらの問題は異なる角度から開かれている。
論文 参考訳(メタデータ) (2025-06-12T08:47:40Z) - Mind the Gap! Static and Interactive Evaluations of Large Audio Models [55.87220295533817]
大型オーディオモデル(LAM)は、音声ネイティブな体験をパワーアップするために設計されている。
本研究は,484名の参加者から,LAMを評価し,7,500名のLAMインタラクションを収集する対話的アプローチを提案する。
論文 参考訳(メタデータ) (2025-02-21T20:29:02Z) - Unbiased Learning to Rank with Query-Level Click Propensity Estimation: Beyond Pointwise Observation and Relevance [74.43264459255121]
現実のシナリオでは、ユーザーは複数の関連するオプションを調べた後、1つまたは2つの結果だけをクリックします。
本稿では,ユーザが異なる検索結果リストをクリックする確率を捉えるために,クエリレベルのクリック確率モデルを提案する。
本手法では,2次元逆重み付け機構を導入し,相対飽和度と位置偏差に対処する。
論文 参考訳(メタデータ) (2025-02-17T03:55:51Z) - Ranked from Within: Ranking Large Multimodal Models Without Labels [73.96543593298426]
ソフトマックス分布から導かれる不確実性スコアは,様々なタスクにまたがるランキングモデルに対して,ロバストな基礎となることを示す。
これにより、ラベルのないデータに対するLMMのランク付けが容易になり、手動のアノテーションを必要とせずに、多様なターゲットドメインのモデルを選択するための実践的なアプローチを提供する。
論文 参考訳(メタデータ) (2024-12-09T13:05:43Z) - WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild [57.272096543738336]
WildBenchは、大規模言語モデル(LLM)のベンチマーク用に設計された自動評価フレームワークである。
WildBenchは、100万以上の人間チャットボットの会話ログから慎重に選択された1,024のタスクで構成されている。
We have developed two metrics, WB-Reward and WB-Score which are computeable using Advanced LLMs。
論文 参考訳(メタデータ) (2024-06-07T09:15:44Z) - Aligning Language Models with Demonstrated Feedback [58.834937450242975]
Demonstration ITerated Task Optimization (DITTO)は、言語モデルの出力とユーザの実証された振る舞いを直接調整する。
我々は,DITTOがニュース記事やメール,ブログ記事などのドメイン間できめ細かいスタイルやタスクアライメントを学習する能力を評価する。
論文 参考訳(メタデータ) (2024-06-02T23:13:56Z) - Do Large Language Models have Shared Weaknesses in Medical Question Answering? [1.25828876338076]
大規模言語モデル(LLM)は、医療ベンチマークで急速に改善されているが、その信頼性の欠如は、安全な現実世界の使用において永続的な課題である。
上位のLLMをベンチマークし、モデル間の一貫性のあるパターンを特定します。
質問が正しく答えるモデル間の類似性の証拠と、人間のテストテイカーとの類似性を見出した。
論文 参考訳(メタデータ) (2023-10-11T06:26:19Z) - Latent User Intent Modeling for Sequential Recommenders [92.66888409973495]
逐次リコメンデータモデルは、プラットフォーム上での氏のインタラクション履歴に基づいて、ユーザが次に対話する可能性のあるアイテムを予測することを学習する。
しかし、ほとんどのシーケンシャルなレコメンデータは、ユーザの意図に対する高いレベルの理解を欠いている。
したがって、インテントモデリングはユーザー理解と長期ユーザーエクスペリエンスの最適化に不可欠である。
論文 参考訳(メタデータ) (2022-11-17T19:00:24Z) - User-click Modelling for Predicting Purchase Intent [0.0]
この論文は、ユーザの振る舞いをモデル化するオープンな数学的問題に対する構造化された調査に寄与する。
企業がWebサイトとのユーザインタラクションを理解することは、消費者の振る舞いに関するリッチで個人化された洞察を提供するため、価値がある。
論文 参考訳(メタデータ) (2021-12-03T16:37:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。