論文の概要: TPBench: A Turning-Point Benchmark for Dialogue Compression
- arxiv url: http://arxiv.org/abs/2610.02736v1
- Date: Fri, 02 Oct 2026 03:08:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.177094
- Title: TPBench: A Turning-Point Benchmark for Dialogue Compression
- Title(参考訳): TPBench: 対話圧縮のためのターンポイントベンチマーク
- Abstract要約: なぜなら、そのスコアはユーザーが最初に望んだものと、今望むものとを混ぜているからだ。
TPBenchは,共用名目保持予算において3つの補完的情報目標を評価する。
- 参考スコア(独自算出の注目度): 7.339235574084628
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A compressor can keep the facts of a dialogue and still drop the turn that changed them. A user corrects a price, reverses a choice, or adds a constraint. We call this failure turning-point eviction. One overall retention score hides it, because that score mixes what the user first wanted with what the user wants now. We introduce TPBench, which evaluates three complementary information targets at shared nominal retention budgets. P1 asks for the user's initial goal. P2 asks for the current value of a slot the user revised. P3 asks for both, in dialogues with a late annotated slot update. The current-value answers come from the human dialogue-state annotations of MultiWOZ and SGD. The initial-goal answer is the first sentence of the first user turn. Neither requires new crowdsourcing. The probe-specific evaluations rank compression methods differently. On the joint probe at a retained fraction of 0.30, every tested compressed method remains below full context with the main Llama reader. Deleting the turn that carries the update sharply lowers current-value accuracy, while deleting one matched irrelevant turn leaves it unchanged. A Mistral reader repeats the P2/P3 rankings and the joint-probe gap. Current-value recovery is tested on an additional corpus, LongMemEval-KU, and on Chinese RiSAWOZ: full context has the highest accuracy, and recency has the highest compressed-method mean in both evaluations.
- Abstract(参考訳): 圧縮機は対話の事実を保存でき、変更したターンを落としてしまう。
ユーザは価格を修正したり、選択を反転させたり、制約を追加したりします。
私たちはこの失敗をターンポイントの排除と呼んでいる。
なぜなら、そのスコアはユーザーが最初に望んだものと、今望むものとを混ぜているからだ。
TPBenchは,共用名目保持予算において3つの補完的情報目標を評価する。
P1は、ユーザの最初の目標を要求します。
P2は、ユーザーが修正したスロットの現在の値を求める。
P3は、後続の注釈付きスロット更新との対話で両方を要求する。
現在の値の答えは、MultiWOZとSGDの人間の対話状態アノテーションから得られます。
最初のゴールの答えは、最初のユーザーターンの最初の文である。
新規のクラウドソーシングも必要ではない。
プローブ固有の評価はランク圧縮方法が異なる。
保持率0.30のジョイントプローブでは、試験されたすべての圧縮方法は、メインのラマリーダーと完全なコンテキスト以下である。
アップデートを運ぶターンの削除は、電流値の精度を著しく低下させ、マッチしたターンの削除は変更しない。
Mistralリーダーは、P2/P3ランキングとジョイントプローブギャップを繰り返す。
電流値の回復は、LongMemEval-KUと中国のRiSAWOZの2つのコーパスでテストされる。
関連論文リスト
- Measuring Collapse and Correction in Homogeneous-Panel LLM Debate [51.03982042769297]
マルチエージェント大言語モデル(LLM)の議論は、最終回答が改善するかどうかによってしばしば評価されるが、運動は必ずしも改善されない。
標準的な最終精度評価は、これらの反対のメカニズムを詳述する。
複数選択質問(MCQ)に関する同質な議論のための監査可能なプロトコルを導入し、各実行を、崩壊、修正、オンセット、署名された介入ユーティリティよりも、遷移台帳として記録する。
論文 参考訳(メタデータ) (2026-09-28T14:31:19Z) - Style-Debiased DPO: Updating LLM Knowledge with Factuality-Aware Synthetic Preference Data [11.157564521901634]
保管側よりも勧誘側について検討する。
我々は好みの最適化を使い、好みの(ちょうせん)と好ましくない(拒絶)応答のペアから学習する。
本稿では,各ペアの拒否応答が実際に正しいかどうかを判定し,それらのペアの嗜好を逆転させ,スタイルの違いによる学習信号が全体としてキャンセルされるように重み付けするDPO(SD-DPO)を提案する。
論文 参考訳(メタデータ) (2026-09-15T02:26:19Z) - QuantiBias: Benchmarking Quantization-Induced Bias in LLMs [8.970269049715933]
幅広い聴衆にリーチするほとんどの大きな言語モデルは定量化されています。
提案するベンチマークでは,複数言語ステレオタイププローブと,オープンエンド生成を分離する拒絶制御と多重選択制御を組み合わせている。
量子化されたビルドは、既にパスしているショートフォームのセーフガードだけでなく、オープンエンドのバイアスのために再評価されなければならない。
論文 参考訳(メタデータ) (2026-07-23T08:56:11Z) - Semantic Early-Stopping for Iterative LLM Agent Loops [0.0]
連続したドラフト埋め込みが意味を変えるのをやめたとき、ループは停止する。
各質問の完全な軌道を一度生成し、同じドラフトに対してすべての停止ポリシーを再生し、全てのLM-judgeコールをキャッシュします。
最良のラウンドを選択するオラクルは、すべての実用政策に対して+0.115インフォメーションスコアを得る。
論文 参考訳(メタデータ) (2026-06-25T13:24:21Z) - Intelligence Is Not the Bottleneck: Validating an LLM First-Pass Manuscript Score Against Peer-Review Outcomes [0.0]
大規模言語モデル(LLM)システムは、ピアレビューを支援するためにますます提案されている。
ほとんどの評価は、システムが割り当てる数値スコアの妥当性ではなく、機械生成レビューテキストの散文を判断する。
提案した原稿を読み取って5つの0-100品質ディメンションと重み付き総合スコアを出力するAIPRを検証する。
論文 参考訳(メタデータ) (2026-06-14T16:13:15Z) - OnePred: Next-Query Prediction via Recursive Intent Memory in Multi-Turn Conversations [6.89645931986174]
大規模言語モデル (LLM) 対話システムは毎日数百万のマルチターン対話を処理する。
次クエリ予測は、先行するダイアログのみに基づいて、ユーザのその後のクエリを予測する。
OnePredは、トピック、未解決のニーズ、関心の変化をまたいだユーザの進化する意図の軌跡を追跡する。
論文 参考訳(メタデータ) (2026-05-22T14:16:21Z) - RLVF: Learning from Verbal Feedback without Overgeneralization [94.19501420241188]
本稿では,このような過度な一般化を伴わずに,言語フィードバックを取り入れることの課題について検討する。
制約付き選好最適化(C3PO)を用いた新しい文脈的批評手法を開発した。
提案手法は,他の文脈に対する既存行動を維持しながら,関連するシナリオに対して効果的な言語フィードバックを適用する。
論文 参考訳(メタデータ) (2024-02-16T18:50:24Z) - Reranking Overgenerated Responses for End-to-End Task-Oriented Dialogue
Systems [71.33737787564966]
エンド・ツー・エンド(E2E)タスク指向対話システム(ToD)は、いわゆる「いいね!
本稿では,システムによって当初過剰に生成された応答リストから高品質な項目を選択する方法を提案する。
本研究では,最先端のE2E ToDシステムを2.4BLEU,3.2ROUGE,2.8 METEORで改善し,新たなピーク値を得た。
論文 参考訳(メタデータ) (2022-11-07T15:59:49Z) - Integrating Rankings into Quantized Scores in Peer Review [61.27794774537103]
ピアレビューでは、レビュアーは通常、論文のスコアを提供するように求められます。
この問題を軽減するため、カンファレンスはレビュアーにレビューした論文のランキングを付加するように求め始めている。
このランキング情報を使用するための標準的な手順はなく、エリアチェアは異なる方法でそれを使用することができる。
我々は、ランキング情報をスコアに組み込むために、原則化されたアプローチを取る。
論文 参考訳(メタデータ) (2022-04-05T19:39:13Z) - Dialogue Response Ranking Training with Large-Scale Human Feedback Data [52.12342165926226]
ソーシャルメディアのフィードバックデータを利用して、フィードバック予測のための大規模なトレーニングデータセットを構築します。
我々は,1300万対の人間のフィードバックデータに基づくGPT-2モデルであるDialogRPTを訓練した。
我々のランキングは、Redditのフィードバックを予測する上で、従来のダイアログの難易度ベースラインよりも優れています。
論文 参考訳(メタデータ) (2020-09-15T10:50:05Z) - Beyond User Self-Reported Likert Scale Ratings: A Comparison Model for
Automatic Dialog Evaluation [69.03658685761538]
オープンドメインダイアログシステム評価はダイアログ研究における最も重要な課題の1つである。
本稿では,自動評価モデルCMADEを提案する。
実験の結果,対話比較作業においてCMADEの精度は89.2%であった。
論文 参考訳(メタデータ) (2020-05-21T15:14:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。