論文の概要: Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging
- arxiv url: http://arxiv.org/abs/2607.10428v1
- Date: Sat, 11 Jul 2026 18:22:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.428475
- Title: Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging
- Title(参考訳): Enjoy Your Talk: ユーザシミュレーション、ターゲットモデリング、判断を分離したマルチスレッド対話のための人間中心ベンチマーク
- Abstract要約: EYT-Benchは、大規模な言語モデルを評価するための人間中心のベンチマークである。
人体は人体培養コーパスから採取される。
最先端のクローズドおよびオープンソースモデルは、統計的に主観的次元に近接している。
- 参考スコア(独自算出の注目度): 15.994164469249727
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Evaluating large language models (LLMs) as multi-turn conversational partners requires probing capabilities that single-turn benchmarks miss: persona consistency, evolving intent tracking, emotional dynamics, and goal completion. We introduce EYT-Bench, a human-centered benchmark built around a three-party decoupled design: a persona-grounded user simulator, a target model that separates intent perception from response generation, and an independent third-party LLM judge with optional multi-judge ensembling. Personas are sampled from public human-curated corpora, Nemotron-Personas-USA and PersonaMem-v2, rather than synthesized, reducing LLM-induced persona bias. EYT-Bench also introduces two trajectory-level metrics: embedding-based intent drift and final-intent completion rate (FICR), inspired by tau-bench. In a 17-target x 200-dialogue evaluation, EYT-Bench reveals four findings: (i) state-of-the-art closed- and open-source models are statistically close on subjective dimensions (empathy / persona / anthropomorphism vary within <= 0.3), but differ by up to 9x on objective intent tracking; (ii) reasoning ("thinking on") sharply improves objective tracking on long-context personas (+0.47-0.50 latent-intent accuracy on Gemma-4) while leaving subjective scores nearly unchanged; (iii) persona format dominates trajectory spread, with FICR saturating above 0.95 on Nemotron-USA but spreading from 0.53 to 0.88 on PersonaMem-v2; and (iv) the warm-up effect is robust on 16/17 models (one outlier, GPT-5.5, reverses the effect), with stable rankings across alpha in [0.05, 0.15]. A cross-judge ablation using deepseek-v4-pro confirms that target rankings and final-intent satisfaction are preserved across judges.
- Abstract(参考訳): 大規模言語モデル(LLM)をマルチターンの対話パートナとして評価するには、ペルソナ一貫性、進化するインテントトラッキング、感情的ダイナミクス、目標達成といった、シングルターンベンチマークが見逃す探索機能が必要である。
EYT-Benchは、人間中心のベンチマークであり、人為的なユーザシミュレータ、応答生成から意図認識を分離するターゲットモデル、オプションのマルチジャッジアンサンブルを持つ独立したサードパーティのLCMジャッジである。
ペルソナは、LLMによって誘導されるペルソナバイアスを減少させる代わりに、人体培養コーパス、Nemotron-Personas-USAおよびPersonaMem-v2からサンプルされる。
EYT-Benchはまた、tau-benchにインスパイアされた埋め込みベースのインテントドリフトとfinal-intent completion rate (FICR)という2つのトラジェクトリレベルメトリクスも導入している。
EYT-Benchは17ターゲットx200対話評価において、以下の4つの結果を示した。
(i)最先端のクローズドソースおよびオープンソースモデルは、主観的次元に統計的に近い(共感/人格/人格同型は <=0.3)が、客観的意図追跡では最大9倍まで異なる。
(二)理性は、主観的スコアをほとんど変わらないまま、長文人格の客観的な追跡(+0.47-0.50潜入精度:Gemma-4)を著しく改善する。
三 ペルソナ形式は、Nemotron-USA で 0.95 以上飽和するが、 PersonaMem-v2 で 0.53 から 0.88 まで拡散し、軌道拡散を支配している。
(4) ウォームアップ効果は16/17モデル(1つの外れ値、GPT-5.5は効果を反転させる)で頑健であり、[0.05, 0.15] においてアルファで安定したランク付けを行う。
Deepseek-v4-proを用いたクロスジャッジアブレーションでは、審査員間で目標ランクと最終インテリジェント満足度が維持されていることを確認した。
関連論文リスト
- Creating an Atomic User Model for Personality-Aware Large Language Model Interaction [0.0]
原子ユーザモデル(アトミックユーザモデル、Atomic User Model、AUM)は、安定的なアイデンティティー核として人を組織する人間可読表現である。
タスク分類器、コンポーネント選択関数、予算付きレトリバーが生成時にフィールドの小さなペイロードを返すパイプライン。
8つのフィールドを取得することは、コンテキストの23%で完全なユーザモデルのスタイル忠実さと一致した。
論文 参考訳(メタデータ) (2026-09-10T18:11:43Z) - Cognitive World Models for Process-Level Social Influence Evaluation [12.674232662629898]
textbfCognitive textbfWorld textbfModel textbf(CogWM) - LLMベースのユーザモデル。
CogWMは、社会的影響の対話評価を端末判断からプロセス追跡に移行する。
論文 参考訳(メタデータ) (2026-06-28T16:49:43Z) - Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality? [74.69723255239663]
グラウンドド・パーソナリティ・推論は、MLLMがそれぞれのビッグファイブ・格付けを、評価、推論、根拠の連鎖を通じて観察可能な証拠に固定することを要求する。
MM-OCEANは、人間の検証によるマルチエージェントパイプラインによって生成され、タイムスタンプによる行動観察、エビデンスに基づく特性分析、およびキューグラウンドMCQの7つのカテゴリがある。
この分析では、フィールド全体にわたって、正しい評価の51%が取得された手がかりに基づかず、ホリスティック・ギャラリング・レートは0-33.5%にしか達していないという顕著な偏見のギャップが明らかになった。
論文 参考訳(メタデータ) (2026-05-21T07:42:47Z) - Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment [53.72927532626824]
わずか50個のサンプル(0.3%のデータ)のサブセットは、完全なベンチマークスコアと0.93以上のピアソン相関を達成可能であることを示す。
選好をより良く予測するために、選択したサブセットの回帰モデルを訓練し、0.98の相関を達成した。
これは回帰モデリングにおいて、よく計算されたサブセットが完全なベンチマークを予測し、量を超える品質を示すことを示している。
論文 参考訳(メタデータ) (2026-04-20T00:57:31Z) - MANTA: Multi-turn Assessment for Nonhuman Thinking & Alignment [0.1452394725421793]
MANTAは、Inspect AIプラットフォーム上に構築された動的マルチターン評価フレームワークである。
Clude-sonnet-4-20250514およびopenai/gpt-4oの評価を行った。
また, LLM-as-judge 評価において, 体系的フォーマットバイアスを示す制御された4要素法であるSTYLEJUDGEを提案する。
論文 参考訳(メタデータ) (2026-04-18T19:51:32Z) - QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs [29.26861081722613]
我々は, 標準の「LLM-as-a-Judge」プロトコルが, 上学部から初期大学院レベルの数学に適用された場合, 体系的なアライメントギャップに悩まされることを実証した。
QEDBenchは、大学レベルの数学における人間の専門家とのアライメントを測定するための、最初の大規模デュアルルーブリックアライメントベンチマークである。
我々は,Claude Opus 4.5,DeepSeek-V3,Qwen 2.5 Max,Llama 4 Maverickなどのフロンティア評価が有意な正のバイアスを示すことを明らかにした。
論文 参考訳(メタデータ) (2026-02-24T07:23:28Z) - One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework [51.50565654314582]
大規模言語モデルは、複数のトピックにまたがる対話を通して、ユーザの指示に従うことができる。
既存のベンチマークは、しばしば一定回数のターンに制限されるため、飽和の影響を受けにくく、ユーザのインタラクティブなエクスペリエンスを考慮できない。
マルチターン命令追従能力を評価するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-05T14:39:59Z) - Probabilistic Human Intent Prediction for Mobile Manipulation: An Evaluation with Human-Inspired Constraints [2.2893865000399938]
人間の意図の正確な推論は、人間とロボットの衝突を引き起こすことなく、人間とロボットの協調を可能にする。
ロボットが人間の操作者の意図を推定できる確率的フレームワークであるGUIDERを提案する。
アイザック・シムの25の試験(5人の被験者x5のタスク変種)においてGUIDERを評価し,ナビゲーション用と操作用の2つのベースラインと比較した。
論文 参考訳(メタデータ) (2025-07-14T10:21:27Z) - Mind the Gap! Static and Interactive Evaluations of Large Audio Models [55.87220295533817]
大型オーディオモデル(LAM)は、音声ネイティブな体験をパワーアップするために設計されている。
本研究は,484名の参加者から,LAMを評価し,7,500名のLAMインタラクションを収集する対話的アプローチを提案する。
論文 参考訳(メタデータ) (2025-02-21T20:29:02Z) - Aligning Large Language Models with Human Opinions through Persona Selection and Value--Belief--Norm Reasoning [67.33899440998175]
Chain-of-Opinion (COO)は、単純な4段階のソリューションモデリングであり、ペルソナによる推論方法である。
COOは明示的な人格(デモグラフィーとイデオロギー)と暗黙的な人格(歴史学的な意見)を区別する
COOは、推論コールを5回だけ促すことで、新しい最先端の意見予測を効率的に達成し、以前のテクニックを最大4%改善する。
論文 参考訳(メタデータ) (2023-11-14T18:48:27Z) - Prometheus: Inducing Fine-grained Evaluation Capability in Language
Models [66.12432440863816]
我々は,GPT-4の評価能力に匹敵する,完全にオープンソースなLarge Language Model (LLM) であるPrometheusを提案する。
プロメテウスは45種類の楽譜を用いた評価において、Pearsonの0.897の相関を人間の評価値と比較した。
Prometheusは2つの人間の選好ベンチマークで最も精度が高い。
論文 参考訳(メタデータ) (2023-10-12T16:50:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。