論文の概要: Beyond Supervised Clarification: Input Rewriting with LLMs for Dialogue Discourse Parsing
- arxiv url: http://arxiv.org/abs/2607.01964v1
- Date: Thu, 02 Jul 2026 09:57:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.780252
- Title: Beyond Supervised Clarification: Input Rewriting with LLMs for Dialogue Discourse Parsing
- Title(参考訳): 改善された明確化を超えて:対話談話構文解析のための LLM を用いた入力書き換え
- Abstract要約: フリーズダウンストリームモデルを改善するために入力を書き換えることは、現代のNLPパイプラインにおいて一般的な戦略となっている。
本研究では,この考え方を現実的な展開条件下で再検討する。
最高の8個の書き直し分析では、実際の天井が示され、多くのエラーは入力だけでは修復できない。
- 参考スコア(独自算出の注目度): 16.51635619165348
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Rewriting inputs to improve frozen downstream models has become a common strategy in modern NLP pipelines. Prior work on incremental dialogue discourse parsing (DDP) shows that supervised clarification models can rewrite fragmentary or underspecified utterances, such as resolving ellipsis or references, to improve parsing accuracy. In this work, we revisit this idea under realistic deployment conditions, where no clarification supervision is available and the clarifier must rely on zero-shot prompting or feedback from a frozen parser. Across three Segmented Discourse Representation Theory (SDRT) datasets and multiple parsers, we find that last-utterance clarification is far less reliable than suggested by supervised settings. Parser-agnostic rewriting often introduces more regressions than repairs, as edits that enable fixes also disrupt discourse cues relied upon by the parser. A best-of-8 rewriting analysis further reveals a practical ceiling: a large fraction of errors are not repairable through input rewriting alone. A parser-aware clarifier trained with GRPO reduces regressions by up to 37% by learning conservative abstention, yet still fails to produce selectivity-aware clarifications that consistently improve parsing. Together, these findings recast clarification as a selective intervention problem. We identify rewritability prediction, deciding whether an utterance is repairable before intervention, as the key missing capability for input-side optimization of frozen discourse parsers, and a critical direction for improving agentic pipelines more broadly.
- Abstract(参考訳): フリーズダウンストリームモデルを改善するために入力を書き換えることは、現代のNLPパイプラインにおいて一般的な戦略となっている。
インクリメンタル対話談話解析(DDP)の先行研究は、教師付き明確化モデルが、楕円や参照の解法などの断片的または不特定な発話を書き換えて、解析精度を向上させることができることを示している。
本研究では,この概念を現実的な展開条件下で再検討し,明確化の監督が得られず,凍結解析器からのゼロショットプロンプトやフィードバックに頼る必要がある。
3つのSegmented Discourse Representation Theory(SDRT)データセットと複数のパーサをまたいだ結果、最終発話の明確化は教師付き設定によって提案されるよりもはるかに信頼性が低いことがわかった。
パーサに依存しない書き換えは、修正を可能にする編集がパーサが依存する談話の手がかりを妨害するので、修理よりもレグレッションを多く導入することが多い。
最高の8個の書き直し解析により、実際的な天井が明らかにされる: 入力書き直しだけでは、多くのエラーは修復できない。
GRPOで訓練されたパーサ認識クラリファイアは、保守的な棄権を学ぶことによって、最大37%の回帰を減少させるが、解析を継続的に改善する選択性認識クラリファイアを生成できない。
これらの知見は, 選択的介入問題として, 明確化を再考するものである。
我々は,発話が介入前に修復可能かどうかを判断し,フリーズド・ディスコース・パーサの入力側最適化の鍵を欠いた機能であり,エージェント・パイプラインをより広範囲に改善するための重要な方向である,リライト可能性予測を同定する。
関連論文リスト
- RetroThinker: Enabling Retrospective Thinking in Speech LLMs [42.95471264630473]
音声大言語モデル(SpeechLLMs)は複雑な推論タスクにおいてテキストのみのLLMに遅れる。
提案するRetroThinkerは,Moshiモデルを用いて,推論中のCoTステップの自己検証と前方補正を行う多段階後トレーニングフレームワークである。
RetroThinkerは、非レトロスペクティブベースラインに対する精度-レイテンシトレードオフを大幅に改善し、11%の絶対精度を同等のレイテンシで達成する。
論文 参考訳(メタデータ) (2026-09-10T17:41:53Z) - InsightSeg: Reusing Correction Insights for Guideline-Consistent Segmentation [4.501547677532766]
本稿では,修正エピソードを再利用可能な視覚的根拠に変換するエピソード記憶機構であるInsightSegを紹介する。
InsightSegは、AcrossとCityscapesで、最初のパスと最後のガイドライン一貫性セグメンテーションのパフォーマンスを改善し、改善ステップを少なくする。
論文 参考訳(メタデータ) (2026-09-02T02:22:35Z) - Structuring Semantic Embeddings for Principle Evaluation: A Prototype-Guided Contrastive Learning Approach [58.15427952222424]
汎用的なテキスト埋め込みはそのようなタスクに広くデプロイされているが、意味的類似性は意味的に似ているがタスク固有の例を示すことができる。
本稿では,凍結したテキスト埋め込み上に構築された幾何正規化モジュールであるPGCL(Prototype-Guided Contrastive Learning)を紹介する。
論文 参考訳(メタデータ) (2026-08-15T13:19:25Z) - Reflective Prompt Tuning through Language Model Function-Calling [16.552558967042312]
Reflective Prompt Tuning (RPT)は、人間のプロンプトエンジニアの反復的なワークフローをシミュレートするフレームワークである。
RPTは、最初のプロンプトを最大12.9ポイント改善し、最先端技術と競争し続け、信頼性の校正を改善している。
解析の結果,RTPはマルチホップや数学的推論に特に有効であることがわかった。
論文 参考訳(メタデータ) (2026-05-20T22:21:29Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - Defend: Automated Rebuttals for Peer Review with Minimal Author Guidance [4.655159257282135]
大規模言語モデル (LLM) は、しばしば、反響生成に直接使用されるとき、目標とする反響を実行し、正確な事実的根拠を維持するのに苦労する。
本稿では,自動再帰生成の基本的な推論プロセスを明示的に実行するためのLDMベースのツールであるDEFENDを紹介する。
反論をスクラッチから書くのとは対照的に、著者は最小限の介入で推論プロセスのみを実行する必要がある。
論文 参考訳(メタデータ) (2026-03-28T18:12:31Z) - Not All Queries Need Rewriting: When Prompt-Only LLM Refinement Helps and Hurts Dense Retrieval [0.11280931253550518]
最適化された垂直領域では,プロンプトのみの書き換えが有害であることを示す。
我々は一貫したメカニズムを同定する: 語彙のアライメントを減らした項を共起的に書き換える。
ドメイン適応的なポストトレーニングは、監督や暗黙のフィードバックが利用可能であれば、より安全な戦略であると提案する。
論文 参考訳(メタデータ) (2026-03-02T10:40:10Z) - Balancing Faithfulness and Performance in Reasoning via Multi-Listener Soft Execution [79.98699884805636]
Reasoning Execution by Multiple Listeners (REMUL) は多人数の強化学習手法である。
REMULは、推論が他の当事者に従えるかがより忠実になるという仮説に基づいている。
スピーカーは、リスナーにとって明らかな推論を生み出すことで報われます。
論文 参考訳(メタデータ) (2026-02-18T02:55:55Z) - Constraint-Rectified Training for Efficient Chain-of-Thought [60.52883907721588]
CoT (Chain-of-Thought) は,Large Language Models (LLMs) の推論能力を大幅に向上させた。
より長い推論トレースは、自己訂正のような回答の品質とアンロック能力を改善することができるが、高い推論コストを発生させ、過度に考えることとして知られる冗長なステップをしばしば導入する。
近年の研究は、推論の長さと精度のバランスをとる効率的な推論戦略の開発を目指している。
論文 参考訳(メタデータ) (2026-02-13T02:13:45Z) - DRES: Benchmarking LLMs for Disfluency Removal [27.083825614818135]
um"、"uh"、インタージェクション、括弧、編集されたステートメントなどの分散は、音声駆動システムにおいて永続的な課題である。
制御されたテキストレベルのベンチマークである拡散除去評価スイートは、このタスクに対して再現可能なセマンティックアッパーバウンドを確立する。
DRESは、人間の注釈付きSwitchboard transcriptの上に構築され、ASRエラーからの拡散除去と音響的変動を分離する。
論文 参考訳(メタデータ) (2025-09-24T17:08:12Z) - Gumbel Reranking: Differentiable End-to-End Reranker Optimization [61.16471123356738]
RAGシステムは関連する文書を識別するためにリランカーに依存している。
注釈付きクエリ-ドキュメントペアが不足しているため、これらのモデルの微調整は依然として難しい。
我々は,トレーニングと推論のギャップを最小限に抑えることを目的とした,リランカーのためのエンドツーエンドのトレーニングフレームワークであるGumbel Re rankを提案する。
論文 参考訳(メタデータ) (2025-02-16T13:23:39Z) - HyPoradise: An Open Baseline for Generative Speech Recognition with
Large Language Models [81.56455625624041]
ASRの誤り訂正に外部の大規模言語モデル(LLM)を利用する最初のオープンソースベンチマークを導入する。
提案したベンチマークには、334,000組以上のN-best仮説を含む新しいデータセットHyPoradise (HP)が含まれている。
合理的なプロンプトと生成能力を持つLLMは、N-bestリストに欠けているトークンを修正できる。
論文 参考訳(メタデータ) (2023-09-27T14:44:10Z) - REFINER: Reasoning Feedback on Intermediate Representations [47.36251998678097]
中間推論を生成するための言語モデルを微調整するフレームワークであるREFINERを紹介する。
REFINERは、推論に対する自動フィードバックを提供する批評家モデルと対話することで機能する。
経験的評価は、同等のスケールのベースラインLMよりも大幅に改善された。
論文 参考訳(メタデータ) (2023-04-04T15:57:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。