論文の概要: PragAlign: Feedback-Guided Pragmatic Alignment for Controlled Synthetic Dialogue Generation
- arxiv url: http://arxiv.org/abs/2609.02480v1
- Date: Wed, 02 Sep 2026 11:49:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.26796
- Title: PragAlign: Feedback-Guided Pragmatic Alignment for Controlled Synthetic Dialogue Generation
- Title(参考訳): PragAlign: 制御された合成対話生成のためのフィードバックガイド付きプラグマチックアライメント
- Authors: Smitha Muthya Sudheendra, Jaideep Srivastava,
- Abstract要約: PragAlignは、制御された合成対話生成のためのフィードバック誘導フレームワークである。
800の一致した対話仕様では、PragAlignは99.50%の評価者定義の受け入れを達成している。
1200個のダイアログを別々に評価すると,アノテータに対して意図表現と対話フローが高度に認識可能であることが分かる。
- 参考スコア(独自算出の注目度): 2.5819252531158683
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Synthetic dialogue generation can support research in privacy-restricted service settings, but generated conversations must preserve communicative intent, affective meaning, and natural dialogue flow. We introduce PragAlign, a feedback-guided framework for controlled synthetic dialogue generation conditioned on service context, target intent, and target emotion, with auxiliary trait-style controls. PragAlign uses a generate--evaluate--revise loop in which an LLM-based evaluator scores intent alignment, emotion alignment, coherence, fluency, and aggregate quality, then provides criterion-specific feedback for up to three refinement rounds. On 800 matched dialogue specifications, PragAlign achieves 99.50\% evaluator-defined acceptance, compared with 72.25\% for one-shot generation and 95.88\% for repeated generation without structured feedback. This indicates that repeated attempts account for much of the gain over one-shot generation, while structured feedback primarily improves last-mile multi-constraint satisfaction rather than broad average quality. Refinement gains are concentrated in emotion alignment, which is also the dominant failure mode in ablations. A separate human evaluation of 1,200 generated dialogues shows that intent expression and dialogue flow are highly recognizable to annotators, while emotion appropriateness is less stable and more subjective. These results support PragAlign as a quality-control framework for improving evaluator-defined communicative constraint satisfaction, while showing that affective realization and independent human-perceived quality remain open challenges.
- Abstract(参考訳): 合成対話生成は、プライバシに制限されたサービス設定の研究を支援することができるが、生成された会話は、コミュニケーション意図、感情的意味、自然な対話の流れを保たなければならない。
PragAlignは、サービスコンテキスト、ターゲット意図、ターゲット感情に条件付けされた合成対話生成を制御するための、フィードバック誘導型フレームワークである。
PragAlignは、LLMベースの評価器がインテントアライメント、感情アライメント、コヒーレンス、フルーエンス、アグリゲーションクオリティをスコア付けし、最大3回のリファインメントラウンドに対して基準固有のフィードバックを提供する、ジェネレーション-評価-修正ループを使用する。
800 の一致した対話仕様では、PragAlign は 99.50 % の評価器定義の受け入れを達成し、1 ショット生成では 72.25 % 、構造化されたフィードバックなしで繰り返し生成すると 95.88 % となる。
これは、繰り返し試みが1ショット生成よりも多くの利益をもたらすことを示しているが、構造化されたフィードバックは主に、幅広い平均品質よりも、ラストマイルのマルチ制約満足度を改善する。
リファインメントゲインは感情のアライメントに集中しており、これはアブレーションにおける主要な障害モードでもある。
1200個のダイアログを別々に評価したところ、意図表現と対話フローはアノテータに対して高い認識力を持つ一方で、感情の適切さはより安定し、より主観的であることが示された。
これらの結果は、評価者によるコミュニケーション制約満足度を向上させるための品質制御フレームワークとしてPragAlignをサポートし、感情的実現と独立した人間知覚品質がオープンな課題であることを示す。
関連論文リスト
- Context Does Matter: Implications for Crowdsourced Evaluation Labels in Task-Oriented Dialogue Systems [57.16442740983528]
クラウドソースラベルは、タスク指向の対話システムを評価する上で重要な役割を果たす。
従来の研究では、アノテーションプロセスで対話コンテキストの一部だけを使用することが提案されている。
本研究では,対話文脈がアノテーション品質に及ぼす影響について検討する。
論文 参考訳(メタデータ) (2024-04-15T17:56:39Z) - Toward More Accurate and Generalizable Evaluation Metrics for
Task-Oriented Dialogs [19.43845920149182]
ダイアログ品質と呼ばれる新しいダイアログレベルのアノテーションワークフローを導入する。
DQAの専門家アノテータは、ダイアログ全体の品質を評価し、ゴール完了やユーザ感情などの属性に対するラベルダイアログも評価する。
我々は,大規模音声アシスタントプラットフォームにおける対話品質を評価する上で,高品質なヒューマンアノテートデータを持つことが重要であると論じている。
論文 参考訳(メタデータ) (2023-06-06T19:43:29Z) - Controllable Mixed-Initiative Dialogue Generation through Prompting [50.03458333265885]
混合開始対話タスクには、情報の繰り返し交換と会話制御が含まれる。
エージェントは、ポリシープランナーが定める特定の対話意図や戦略に従う応答を生成することにより、コントロールを得る。
標準的なアプローチは、これらの意図に基づいて生成条件を実行するために、訓練済みの言語モデルを微調整している。
代わりに、条件生成の微調整に代えて、大きな言語モデルをドロップインで置き換えるように促します。
論文 参考訳(メタデータ) (2023-05-06T23:11:25Z) - DynaEval: Unifying Turn and Dialogue Level Evaluation [60.66883575106898]
統合された自動評価フレームワークDynaEvalを提案する。
ターンレベルの評価を行うことができるが、対話全体の品質を公平に考慮することもできる。
実験の結果,DynaEvalは最先端の対話コヒーレンスモデルよりも優れていた。
論文 参考訳(メタデータ) (2021-06-02T12:23:18Z) - Will I Sound Like Me? Improving Persona Consistency in Dialogues through
Pragmatic Self-Consciousness [62.55060760615656]
一貫性に対処する最近のモデルは、しばしば追加の自然言語推論(NLI)ラベルでトレーニングするか、あるいは一貫性を維持するためにトレーニングされた追加モジュールを生成エージェントにアタッチする。
社会的認知と実用性に触発されて、私たちは既存の対話エージェントに、想像上のリスナーを通して、公的な自己意識を持たせました。
我々のアプローチは、Rational Speech Actsフレームワークに基づいて、会話エージェントに矛盾の発声を控えるように強制することができる。
論文 参考訳(メタデータ) (2020-04-13T08:16:16Z) - You Impress Me: Dialogue Generation via Mutual Persona Perception [62.89449096369027]
認知科学の研究は、理解が高品質なチャット会話に不可欠なシグナルであることを示唆している。
そこで我々は,P2 Botを提案する。このP2 Botは,理解を明示的にモデル化することを目的とした送信機受信者ベースのフレームワークである。
論文 参考訳(メタデータ) (2020-04-11T12:51:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。