論文の概要: Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding
- arxiv url: http://arxiv.org/abs/2607.29196v1
- Date: Fri, 31 Jul 2026 09:15:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.672673
- Title: Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding
- Title(参考訳): Hy-MultiTurn:Deep Multi-Turnダイアログ理解のための6次元ベンチマーク
- Authors: Eileen Ye, Jiawen Tao, Yaoming Li, Chenxu Liu, Wenhan Yu, Yaxin Fan, Xiaokun Yuan, Mengzhou Wu, Yanbing Jiang, Maxm Pan,
- Abstract要約: 深層多元対話理解のための中国語ベンチマークHy-MultiTurnを評価する。
また,12~76ターンにまたがる209個の制御タスクを,対話長,無関係な話題の注意散らし,口語句のフレーズ化によりさらに困難になる。
GPT-5.5でさえ、全ての要求を41.1%のレスポンスで満たしており、どのモデルも6つのモードで最高の性能を発揮できない。
- 参考スコア(独自算出の注目度): 7.061319777900869
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-running multi-turn interactions with chatbots and agents are now common, and a correct response often depends on remembering earlier details, tracking later revisions, identifying intended objects or referents, and withholding action when required conditions are unmet. Existing multi-turn benchmarks typically cover short exchanges and do not fully evaluate these capabilities in long multi-turn interactions, particularly in Chinese, while offering limited insight into how and why models fail. To address these limitations, we analyze real chatbot failures to identify six recurring mechanisms and use them to define six controlled evaluation modes in Hy-MultiTurn, a Chinese benchmark for deep multi-turn dialogue understanding. The six modes evaluate constraint memory, precise execution, constraint synthesis, object localization, action suppression, and reference resolution. Across the six modes, we construct 209 controlled tasks spanning 12-76 turns, with dialogue length, irrelevant-topic distraction, and colloquial phrasing adding further difficulty. Evaluation of 22 frontier model configurations shows that Hy-MultiTurn is broadly challenging, as even GPT-5.5, the strongest overall configuration, satisfies all requirements in only 41.1 percent of responses and no model performs best in all six modes.
- Abstract(参考訳): チャットボットやエージェントとの長時間のマルチターンインタラクションは一般的であり、適切な応答は、以前の詳細を記憶したり、後続のリビジョンを追跡したり、意図されたオブジェクトや参照を識別したり、必要な条件が満たされていない場合のアクションを控えたりすることに依存することが多い。
既存のマルチターンベンチマークは通常、短い交換をカバーしており、特に中国語での長いマルチターンインタラクションにおいてこれらの機能を十分に評価していない。
これらの制限に対処するために、実際のチャットボットの故障を分析し、6つの繰り返しメカニズムを識別し、6つの制御された評価モードを定義する。
6つのモードは、制約メモリ、正確な実行、制約合成、オブジェクトのローカライゼーション、アクション抑制、参照解像度を評価する。
6つのモードにまたがって,12~76回転にまたがる209個の制御タスクを,対話長,無関係な話題の注意散らし,口語句の表現がさらに困難になるように構成する。
22のフロンティアモデル構成の評価によると、Hy-MultiTurnは、最も強い全体的な構成であるGPT-5.5でさえ、41.1%のレスポンスで全ての要求を満たすことができ、どのモデルも6つのモードで最高の性能を発揮できない。
関連論文リスト
- WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation [56.5415838759151]
WBenchはインタラクティブな世界モデルを評価するための総合的なベンチマークである。
ビデオの品質、セッティングアテンジェンス、インタラクションアテンデンス、一貫性、物理コンプライアンスをカバーしている。
289件のテストケースと1,058件のインタラクション・ターンが含まれており、多様なシーン、スタイル、主題、一対三の視点をカバーしている。
論文 参考訳(メタデータ) (2026-05-25T14:01:31Z) - SEQUOR: A Multi-Turn Benchmark for Realistic Constraint Following [26.137364205107005]
長時間のマルチターン会話における制約適合性を評価するための自動ベンチマークSEQUORを提案する。
その結果,1つの制約に従えば,会話が長くなるにつれて命令追従精度は一貫して低下することがわかった。
会話の任意のポイントで制約を追加したり置き換えたりするシナリオでは、モデルの精度は9%以上低下する。
論文 参考訳(メタデータ) (2026-05-07T14:33:35Z) - One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework [51.50565654314582]
大規模言語モデルは、複数のトピックにまたがる対話を通して、ユーザの指示に従うことができる。
既存のベンチマークは、しばしば一定回数のターンに制限されるため、飽和の影響を受けにくく、ユーザのインタラクティブなエクスペリエンスを考慮できない。
マルチターン命令追従能力を評価するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-05T14:39:59Z) - MultiVerse: A Multi-Turn Conversation Benchmark for Evaluating Large Vision and Language Models [25.072791108956682]
MultiVerseは、647の対話を特徴とする新しいマルチターン会話ベンチマークである。
484のタスクと484のインタラクション目標を持つMultiVerseは、事実知識や知覚から、数学やコーディングといった高度な推論タスクまで、幅広いトピックをカバーしている。
我々は、MultiVerse上で18のビジョン・アンド・ランゲージモデル(VLM)を評価し、最強モデルでさえ複雑なマルチターン会話において50%の成功率しか達成していないことを明らかにした。
論文 参考訳(メタデータ) (2025-10-18T21:00:12Z) - Test-Time Scaling Strategies for Generative Retrieval in Multimodal Conversational Recommendations [70.94563079082751]
電子商取引は、複雑なマルチターンユーザーインタラクションを管理する上で、伝統的な製品検索システムの限界を明らかにしている。
本稿では,対話型マルチモーダル製品検索にテスト時間スケーリングを導入する新しいフレームワークを提案する。
提案手法は生成型レトリバー上に構築され,さらに検索精度の向上と,対話を通してユーザ意図の進化と結果の整合性を向上するテストタイムリグレード機構が組み込まれている。
論文 参考訳(メタデータ) (2025-08-25T15:38:56Z) - ContextualLVLM-Agent: A Holistic Framework for Multi-Turn Visually-Grounded Dialogue and Complex Instruction Following [0.2999888908665658]
MMDR-Bench(Multi-Modal Dialogue Reasoning Benchmark)は,300の複雑なマルチターン対話シナリオからなる新しいデータセットである。
また,既存のLVLMを高度な推論と命令追従機能で拡張する包括的フレームワークであるCoLVLM Agent(Contextual LVLM Agent)を提案する。
MMDR-Benchを用いた実験により,CoLVLM Agentは高い性能を示し,平均評価スコアは4.03。
論文 参考訳(メタデータ) (2025-08-21T02:09:02Z) - Detect, Explain, Escalate: Low-Carbon Dialogue Breakdown Management for LLM-Powered Agents [30.13634341221476]
大規模言語モデル(LLM)は、多くのアプリケーションを変えつつありますが、会話のブレークダウンへの感受性は、ユーザ信頼を損なう重要な課題です。
本稿では,低炭素運転を重視したLDMエージェントの対話分解を管理するためのフレームワーク「Detect, Explain, Escalate」を提案する。
論文 参考訳(メタデータ) (2025-04-26T07:51:05Z) - MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World Conversation [52.35744453954844]
本稿では,MLLMの6つのコアオープンエンド能力を評価するベンチマークであるMMRCを紹介する。
MMRCにおける20個のMLLMの評価は、オープンエンド相互作用における精度低下を示している。
そこで我々は,会話から重要な情報を記録し,その応答中にモデルを思い出させる,シンプルで効果的なNOTE-TAKing戦略を提案する。
論文 参考訳(メタデータ) (2025-02-17T15:24:49Z) - MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large
Language Models [70.92847554971065]
MT-Evalは,マルチターン対話能力を評価するための総合的なベンチマークである。
人間のLLM会話を解析することにより,インタラクションパターンを,再現,拡張,洗練,フォローアップの4つのタイプに分類する。
11個の有名なLCMを評価したところ、クローズドソースモデルは一般的にオープンソースモデルを上回るが、特定のタスクにおいて特定のオープンソースモデルの方がGPT-3.5-Turboを上回っていることがわかった。
論文 参考訳(メタデータ) (2024-01-30T04:50:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。