論文の概要: DiPS: Dialogue Policy Selection for High-Stakes Persuasion Agents
- arxiv url: http://arxiv.org/abs/2607.01557v1
- Date: Thu, 02 Jul 2026 00:24:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.622372
- Title: DiPS: Dialogue Policy Selection for High-Stakes Persuasion Agents
- Title(参考訳): DiPS:高用量説得剤の対話政策選択
- Authors: Tianyi Zhang, Mousumi Das, Abrar Anwar, Jesse Thomason, David Traum,
- Abstract要約: 進化する会話コンテキストに適応した説得戦略を動的に選択するQラーニングフレームワークを提案する。
具体的には、避難の成功率を最大化するために訓練された批評家を訓練し、住民の最近の発話に基づいて各ターンで説得方針を選択する。
その結果,DiPS はゼロショット LLM や汎用RAG 拡張アプローチよりも高い退避率を達成できることがわかった。
- 参考スコア(独自算出の注目度): 12.513847531430924
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) often struggle with persuasion in high-stakes scenarios. People's individual personalities and concerns require tailored strategies rather than a one-size-fits-all approach. To address this challenge, we focus on a fire-rescue scenario in which an operator must persuade a resident to evacuate as a high-stakes persuasion domain and propose Dialogue Policy Selection (DiPS), a Q-learning framework to dynamically select persuasion strategies adapted to the evolving conversational context. Specifically, we train a critic, trained to maximize the chance of evacuation success, to select a persuasion policy at each turn based on the resident's recent utterances.We then evaluate DiPS against multiple baselines in both simulated and real human interactions. We find that DiPS achieves higher evacuation success than a zero-shot LLM and generic RAG-augmented approach.
- Abstract(参考訳): 大規模言語モデル(LLM)は、しばしば高いシナリオで説得に苦しむ。
個人の個性や関心事には、一大のアプローチではなく、適切な戦略が必要である。
この課題に対処するために、我々は、住民に高い説得領域として避難するよう説得し、対話政策選択(DiPS)を提案し、進化する会話コンテキストに適応した説得戦略を動的に選択するQラーニングフレームワークを提案する、消防救助シナリオに焦点を当てた。
具体的には、避難の成功率を最大化するために訓練された批評家を訓練し、住民の最近の発話に基づいて各ターンで説得方針を選択し、シミュレーションと実の両方において複数のベースラインに対してDiPSを評価する。
その結果,DiPS はゼロショット LLM や汎用RAG 拡張アプローチよりも高い退避率を達成できることがわかった。
関連論文リスト
- Spontaneous Persuasion: An Audit of Model Persuasiveness in Everyday Conversations [0.2621730497733947]
大規模言語モデル(LLM)は、頭と頭の比較において人間を上回る強い説得力を持つ。
事前の作業は、最も効果的な議論や説得力のある声明を生み出す意図的な試みとして説得を測る。
我々は,必ずしも説得が保証されない日常のシナリオにおいて,説得戦略の過激な使用を特徴付ける「自発的説得」を紹介した。
論文 参考訳(メタデータ) (2026-04-23T23:01:38Z) - GameTalk: Training LLMs for Strategic Conversation [51.29670609281524]
マルチターンインタラクションによる戦略的意思決定のために,LLMをトレーニングするフレームワークであるtextbfGameTalkを紹介した。
シングルターンの目的や静的アクション予測に焦点を当てた以前の作業とは異なり、私たちはLLMをトレーニングして、全会話にわたってグローバルな目的を最適化します。
本手法は, 推論, コーディネート, 対戦型モデリングの異なる側面を強調するために設計された, ますます複雑なゲーム群に対して評価する。
論文 参考訳(メタデータ) (2026-01-22T19:18:39Z) - UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning [32.51053667574764]
推論機能を備えた新しいユーザ言語モデルであるUserLM-R1を提案する。
まず,静的な役割と,多様なシナリオに適応するための動的シナリオ特異的な目標を兼ね備えた包括的ユーザプロファイルを構築した。
そこで我々は,応答を生成する前に,高品質な合理性を生成するためのゴール駆動意思決定政策を提案する。
論文 参考訳(メタデータ) (2026-01-14T06:42:01Z) - Leading the Follower: Learning Persuasive Agents in Social Deduction Games [41.77995385351868]
大規模言語モデル(LLM)エージェントは、社会的推論ゲームにおいて顕著な進歩を見せている。
エージェントに説得力のある影響に対する発話を最適化するよう訓練する強化学習フレームワークを提案する。
この研究は、戦略的社会的影響力を持つAIエージェントを開発するための重要なステップである。
論文 参考訳(メタデータ) (2025-10-10T07:33:30Z) - On the Adaptive Psychological Persuasion of Large Language Models [37.18479986426215]
我々は,Large Language Models (LLMs) が自律的に説得し,説得に抵抗できることを示した。
総合的な心理的説得戦略を11つ導入する。
最適戦略を自律的に選択するようにLLMを訓練する適応型フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-07T13:52:50Z) - Toward Optimal LLM Alignments Using Two-Player Games [86.39338084862324]
本稿では,対戦相手と防御エージェントの反復的相互作用を含む2エージェントゲームのレンズによるアライメントについて検討する。
この反復的強化学習最適化がエージェントによって誘導されるゲームに対するナッシュ平衡に収束することを理論的に実証する。
安全シナリオにおける実験結果から、このような競争環境下での学習は、完全に訓練するエージェントだけでなく、敵エージェントと防御エージェントの両方に対する一般化能力の向上したポリシーにつながることが示されている。
論文 参考訳(メタデータ) (2024-06-16T15:24:50Z) - Plug-and-Play Policy Planner for Large Language Model Powered Dialogue
Agents [121.46051697742608]
そこで本稿では,PDPPという言語モデルプラグインを用いて対話問題を整理するための新たな対話ポリシー計画パラダイムを提案する。
具体的には、利用可能な人間の注釈付きデータに対する教師付き微調整を容易にするための新しいトレーニングフレームワークを開発する。
PPDPPは3つの異なるプロアクティブな対話アプリケーションにおいて、既存のアプローチを一貫して、実質的に上回っている。
論文 参考訳(メタデータ) (2023-11-01T03:20:16Z) - JoTR: A Joint Transformer and Reinforcement Learning Framework for
Dialog Policy Learning [53.83063435640911]
対話政策学習(DPL)は対話モデリングの重要な構成要素である。
フレキシブルな対話行動を生成するための新しいフレームワークであるJoTRを導入する。
従来の方法とは異なり、JoTRはよりダイナミックで適応可能な対話アクション生成を可能にするワードレベルのポリシーを定式化している。
論文 参考訳(メタデータ) (2023-09-01T03:19:53Z) - Learning Goal-oriented Dialogue Policy with Opposite Agent Awareness [116.804536884437]
本稿では,目標指向対話における政策学習のための逆行動認識フレームワークを提案する。
我々は、その行動から相手エージェントの方針を推定し、この推定を用いてターゲットエージェントを対象ポリシーの一部として関連づけて改善する。
論文 参考訳(メタデータ) (2020-04-21T03:13:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。