論文の概要: One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies
- arxiv url: http://arxiv.org/abs/2607.21143v2
- Date: Fri, 24 Jul 2026 08:22:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 14:08:31.00259
- Title: One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies
- Title(参考訳): LLMのClarification PoliciesのためのRegretベースのMulti-Turnベンチマーク
- Authors: Minh Ngoc Ta, My Anh Tran Nguyen, Duong D. Nguyen, Yuxia Wang, Preslav Nakov,
- Abstract要約: 本稿では,孤立した質問品質ではなく,政策行動として明確化を評価するベンチマークであるRegretBenchを紹介する。
RegretBenchは、意図的な解決、相互作用コスト、非効率な明確化、後悔を計測する。
以上の結果から,有効な明確化には有望な質問以上のものが必要であることが示唆された。
- 参考スコア(独自算出の注目度): 49.067670811577045
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Ambiguous user requests make clarification a sequential decision problem for conversational LLM assistants: they must decide whether to ask, what to ask, when to stop, and when to answer. We introduce RegretBench, a multi-turn benchmark that evaluates clarification as policy behavior rather than isolated question quality. RegretBench provides a hidden-intent formulation of ambiguity, supports free-form interaction grounded in semantic-state tracking, and introduces a regret-based objective that measures how much value a model loses relative to a reference clarification policy. Experiments on open-domain QA and product recommendation scenarios show that final success alone is insufficient, as models with similar accuracy can differ substantially in efficiency, robustness to user behaviors, and stopping decisions. By jointly measuring intent resolution, interaction cost, ineffective clarification, and regret, RegretBench reveals whether models clarify usefully and efficiently. Our results show that effective clarification requires more than plausible questions: models must ask the right question at the right time and stop once the user's intended meaning is clear.
- Abstract(参考訳): あいまいなユーザリクエストは、会話型LLMアシスタントのシーケンシャルな決定問題である。
分離された質問品質ではなく,政策行動として明確化を評価するマルチターンベンチマークであるRegretBenchを紹介する。
RegretBenchは、曖昧さの隠された定式化を提供し、セマンティックステートトラッキングに基づく自由形式のインタラクションをサポートし、モデルが参照明確化ポリシーに対してどれだけの価値を失うかを測定する、後悔に基づく目的を導入している。
オープンドメインのQAと製品レコメンデーションのシナリオの実験は、最終的な成功だけでは不十分であることを示している。
意図の解決、相互作用コスト、非効率な明確化、後悔を共同で測定することで、RegretBenchはモデルの有用性と効率性を明らかにする。
モデルでは,ユーザの意図した意味が明確になったら,適切なタイミングで適切な質問をし,停止しなければならない。
関連論文リスト
- Clarification Is Not Enough: Post-Clarification Answering Remains the Bottleneck in Multi-Turn QA [14.475086992410276]
課題を2つの要素に分解することで,多ターン質問応答における選好誘導の問題について検討する。
PACIFICベンチマークを用いて、教師付き微調整が明確化ポリシーを急速に改善することを示したが、モデルが正しい動作を取る場合でも、最終的な解答精度は著しく低いままである。
論文 参考訳(メタデータ) (2026-05-24T18:06:09Z) - Can Revealed Preferences Clarify LLM Alignment and Steering? [23.175180848107093]
LLMの観測した選択が最適化するインプリート嗜好を推定するための経験的パイプラインを提案する。
提案手法は,モデルが一貫したゴール指向の振る舞いをするかどうかの厳密な評価を可能にすることを示す。
論文 参考訳(メタデータ) (2026-05-08T23:26:35Z) - When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification [8.391356566325054]
大きな言語モデル(LLM)は、重要な詳細を省略したり、誤解を招く情報を含まない場合にも、しばしば応答する。
タスク性能を犠牲にすることなく,LLMがいつ,何を求めるかを決定する能力の評価と改善について検討する。
AskBenchは、標準的なQAペアを明示的なチェックポイントを持つマルチターンインタラクションに変換する対話型ベンチマークである。
論文 参考訳(メタデータ) (2026-02-04T02:21:01Z) - Learning Steerable Clarification Policies with Collaborative Self-play [67.67872810596839]
不明瞭なクエリを処理するために、AIアシスタントは不確実性を管理するためのポリシーが必要である。
我々は,この不確実性を管理するために,自己再生を用いて評価可能な政策を訓練することを提案する。
このことが、提供されたコストに応じて予測可能な振る舞いを変更する、評価可能なポリシーにつながることを示す。
論文 参考訳(メタデータ) (2025-12-03T18:49:54Z) - Right Answer, Wrong Score: Uncovering the Inconsistencies of LLM Evaluation in Multiple-Choice Question Answering [78.89231943329885]
大規模言語モデル(LLM)の評価には,MCQA(Multiple-Choice Question Answering)が広く用いられている。
報告されたLCMの性能には,複数の要因が大きな影響を及ぼす可能性が示唆された。
既存の回答抽出手法が人間の判断と一致しているかどうかを解析する。
論文 参考訳(メタデータ) (2025-03-19T08:45:03Z) - Fostering Appropriate Reliance on Large Language Models: The Role of Explanations, Sources, and Inconsistencies [66.30619782227173]
大規模言語モデル(LLMs)は、流動的で説得力のある誤った応答を生成することができる。
ユーザの信頼を形作るLCM応答のいくつかの特徴を同定する。
説明は正しい応答と誤応答の両方に依存することが判明した。
情報源が提供された場合や説明が矛盾している場合の誤った応答への依存度は低い。
論文 参考訳(メタデータ) (2025-02-12T16:35:41Z) - SUGAR: Leveraging Contextual Confidence for Smarter Retrieval [28.552283701883766]
セマンティック不確実性誘導適応検索(SUGAR)について紹介する。
我々は、文脈に基づくエントロピーを利用して、検索するかどうかを積極的に決定し、シングルステップとマルチステップの検索を更に決定する。
実験の結果,意味的不確実性推定によって導かれる選択探索により,多様な質問応答タスクのパフォーマンスが向上し,より効率的な推論が達成された。
論文 参考訳(メタデータ) (2025-01-09T01:24:59Z) - Rethinking LLM Uncertainty: A Multi-Agent Approach to Estimating Black-Box Model Uncertainty [47.95943057892318]
ブラックボックスLSMの不確実性の定量化は、信頼性の高い応答とスケーラブルな監視に不可欠である。
本研究では,不確実性推定にマルチエージェント相互作用を用いた新しい理論的基礎手法であるDiverseAgentEntropyを紹介する。
論文 参考訳(メタデータ) (2024-12-12T18:52:40Z) - Clarify When Necessary: Resolving Ambiguity Through Interaction with LMs [58.620269228776294]
そこで本稿では,ユーザに対して,あいまいさを解消するためのタスク非依存のフレームワークを提案する。
我々は3つのNLPアプリケーション(質問応答、機械翻訳、自然言語推論)にまたがるシステムを評価する。
インテントシムは堅牢であり、幅広いNLPタスクやLMの改善を実証している。
論文 参考訳(メタデータ) (2023-11-16T00:18:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。