論文の概要: One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies
- arxiv url: http://arxiv.org/abs/2607.21143v1
- Date: Thu, 23 Jul 2026 10:22:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.372726
- Title: One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies
- Title(参考訳): LLMのClarification PoliciesのためのRegretベースのMulti-Turnベンチマーク
- Abstract要約: 本稿では,孤立した質問品質ではなく,政策行動として明確化を評価するベンチマークであるRegretBenchを紹介する。
RegretBenchは、意図的な解決、相互作用コスト、非効率な明確化、後悔を計測する。
以上の結果から,有効な明確化には有望な質問以上のものが必要であることが示唆された。
- 参考スコア(独自算出の注目度): 49.067670811577045
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Ambiguous user requests make clarification a sequential decision problem for conversational LLM assistants: they must decide whether to ask, what to ask, when to stop, and when to answer. We introduce RegretBench, a multi-turn benchmark that evaluates clarification as policy behavior rather than isolated question quality. RegretBench provides a hidden-intent formulation of ambiguity, supports free-form interaction grounded in semantic-state tracking, and introduces a regret-based objective that measures how much value a model loses relative to a reference clarification policy. Experiments on open-domain QA and product recommendation scenarios show that final success alone is insufficient, as models with similar accuracy can differ substantially in efficiency, robustness to user behaviors, and stopping decisions. By jointly measuring intent resolution, interaction cost, ineffective clarification, and regret, RegretBench reveals whether models clarify usefully and efficiently. Our results show that effective clarification requires more than plausible questions: models must ask the right question at the right time and stop once the user's intended meaning is clear.
- Abstract(参考訳): あいまいなユーザリクエストは、会話型LLMアシスタントのシーケンシャルな決定問題である。
分離された質問品質ではなく,政策行動として明確化を評価するマルチターンベンチマークであるRegretBenchを紹介する。
RegretBenchは、曖昧さの隠された定式化を提供し、セマンティックステートトラッキングに基づく自由形式のインタラクションをサポートし、モデルが参照明確化ポリシーに対してどれだけの価値を失うかを測定する、後悔に基づく目的を導入している。
オープンドメインのQAと製品レコメンデーションのシナリオの実験は、最終的な成功だけでは不十分であることを示している。
意図の解決、相互作用コスト、非効率な明確化、後悔を共同で測定することで、RegretBenchはモデルの有用性と効率性を明らかにする。
モデルでは,ユーザの意図した意味が明確になったら,適切なタイミングで適切な質問をし,停止しなければならない。
関連論文リスト
- RISA: Response Inspection and Selective Actions for Refusal Calibration in Large Language Models [19.938570872083652]
トレーニング時間アライメントは、モデルパラメータを安全データで更新することで、拒絶動作を改善するが、さらなる計算とトレーニングが必要である。
インフェルノ時間アライメントは、基礎となるモデルパラメータを更新することなく、推論中のLCMの振る舞いを変更することを目的としている。
本稿では、初期応答を検査し、ベースモデルを更新することなくエラーを選択的に修正する推論時フレームワークである、応答検査と選択行動(RISA)を提案する。
論文 参考訳(メタデータ) (2026-09-01T06:37:42Z) - CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement [50.91045324738942]
CLAIMは、オープンドメイン環境でのアクティブな明確化学習のための不確実性駆動フレームワークである。
本研究では,不確実性推定とセマンティッククラスタリングと推論に基づく判断を統合したエントロピー駆動型合成データ生成パイプラインを提案する。
実験の結果,手動でラベル付けしたデータに頼ることなく,CLAIMが安定かつ一般化可能な明確化戦略を学習できることが確認された。
論文 参考訳(メタデータ) (2026-08-12T04:27:45Z) - Clarification Is Not Enough: Post-Clarification Answering Remains the Bottleneck in Multi-Turn QA [14.475086992410276]
課題を2つの要素に分解することで,多ターン質問応答における選好誘導の問題について検討する。
PACIFICベンチマークを用いて、教師付き微調整が明確化ポリシーを急速に改善することを示したが、モデルが正しい動作を取る場合でも、最終的な解答精度は著しく低いままである。
論文 参考訳(メタデータ) (2026-05-24T18:06:09Z) - Can Revealed Preferences Clarify LLM Alignment and Steering? [23.175180848107093]
LLMの観測した選択が最適化するインプリート嗜好を推定するための経験的パイプラインを提案する。
提案手法は,モデルが一貫したゴール指向の振る舞いをするかどうかの厳密な評価を可能にすることを示す。
論文 参考訳(メタデータ) (2026-05-08T23:26:35Z) - When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification [8.391356566325054]
大きな言語モデル(LLM)は、重要な詳細を省略したり、誤解を招く情報を含まない場合にも、しばしば応答する。
タスク性能を犠牲にすることなく,LLMがいつ,何を求めるかを決定する能力の評価と改善について検討する。
AskBenchは、標準的なQAペアを明示的なチェックポイントを持つマルチターンインタラクションに変換する対話型ベンチマークである。
論文 参考訳(メタデータ) (2026-02-04T02:21:01Z) - Learning Steerable Clarification Policies with Collaborative Self-play [67.67872810596839]
不明瞭なクエリを処理するために、AIアシスタントは不確実性を管理するためのポリシーが必要である。
我々は,この不確実性を管理するために,自己再生を用いて評価可能な政策を訓練することを提案する。
このことが、提供されたコストに応じて予測可能な振る舞いを変更する、評価可能なポリシーにつながることを示す。
論文 参考訳(メタデータ) (2025-12-03T18:49:54Z) - Right Answer, Wrong Score: Uncovering the Inconsistencies of LLM Evaluation in Multiple-Choice Question Answering [78.89231943329885]
大規模言語モデル(LLM)の評価には,MCQA(Multiple-Choice Question Answering)が広く用いられている。
報告されたLCMの性能には,複数の要因が大きな影響を及ぼす可能性が示唆された。
既存の回答抽出手法が人間の判断と一致しているかどうかを解析する。
論文 参考訳(メタデータ) (2025-03-19T08:45:03Z) - Fostering Appropriate Reliance on Large Language Models: The Role of Explanations, Sources, and Inconsistencies [66.30619782227173]
大規模言語モデル(LLMs)は、流動的で説得力のある誤った応答を生成することができる。
ユーザの信頼を形作るLCM応答のいくつかの特徴を同定する。
説明は正しい応答と誤応答の両方に依存することが判明した。
情報源が提供された場合や説明が矛盾している場合の誤った応答への依存度は低い。
論文 参考訳(メタデータ) (2025-02-12T16:35:41Z) - SUGAR: Leveraging Contextual Confidence for Smarter Retrieval [28.552283701883766]
セマンティック不確実性誘導適応検索(SUGAR)について紹介する。
我々は、文脈に基づくエントロピーを利用して、検索するかどうかを積極的に決定し、シングルステップとマルチステップの検索を更に決定する。
実験の結果,意味的不確実性推定によって導かれる選択探索により,多様な質問応答タスクのパフォーマンスが向上し,より効率的な推論が達成された。
論文 参考訳(メタデータ) (2025-01-09T01:24:59Z) - Rethinking LLM Uncertainty: A Multi-Agent Approach to Estimating Black-Box Model Uncertainty [47.95943057892318]
ブラックボックスLSMの不確実性の定量化は、信頼性の高い応答とスケーラブルな監視に不可欠である。
本研究では,不確実性推定にマルチエージェント相互作用を用いた新しい理論的基礎手法であるDiverseAgentEntropyを紹介する。
論文 参考訳(メタデータ) (2024-12-12T18:52:40Z) - Clarify When Necessary: Resolving Ambiguity Through Interaction with LMs [58.620269228776294]
そこで本稿では,ユーザに対して,あいまいさを解消するためのタスク非依存のフレームワークを提案する。
我々は3つのNLPアプリケーション(質問応答、機械翻訳、自然言語推論)にまたがるシステムを評価する。
インテントシムは堅牢であり、幅広いNLPタスクやLMの改善を実証している。
論文 参考訳(メタデータ) (2023-11-16T00:18:50Z) - Improving the Reliability of Large Language Models by Leveraging
Uncertainty-Aware In-Context Learning [76.98542249776257]
大規模言語モデルはしばしば「ハロシン化」の課題に直面している
本研究では,不確実性に応答してモデルが出力を拡張あるいは拒否することを可能にする,不確実性を考慮したコンテキスト内学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-07T12:06:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。