DeepSAGE: Stage-Aware Reinforcement Learning for Structured CBT Counseling Dialogue
Abstractの概要
DeepSAGEは、CBT(認知行動療法)の初回カウンセリングセッションを、治療目標と自動完了基準を持つ11の明示的な段階のシーケンスとして実施するためのLLMとDRLのハイブリッドフレームワークです。外部コントローラーが意味的類似性とNLIに基づく目標達成度を用いて段階の完了を判断し、強化学習ポリシーがLLMの応答を導く治療的意図を選択します。不安症および大うつ病性障害の病態を表す模擬クライアントを用い、検索、プロンプト、段階、ポリシーに基づく6つのベースラインと比較評価が行われました。これらのシミュレーション全体で、DeepSAGEはより強いエンゲージメントと段階目標達成および対話効率の良好なバランスを報告していますが、この結果は臨床的有効性ではなく対話制御性能の比較を反映したものであると強調されています。
新規性
本論文の主な新規性は、CBTの初回セッション対話全体を、明示的な治療目標、自動遷移基準、DRLに基づく治療的意図選択を備えた11段階の制御問題として定式化した点にあります。これにより、単一ターン、プロンプトのみによるCBTガイダンス、非構造化な支持的対話に焦点を当てていた従来のLLMカウンセリング研究と差別化されます。
成果
不安症とうつ病の模擬セッションにおいて、DeepSAGEは比較対象システムの中で最も高いユーザー発話長と自己開示を達成し、うつ病条件での苦痛軽減においても競争力を維持しつつ、不安条件で最大の感情強度低下をもたらしました。段階構造化されたシステム群の中で、Stage-PromptやDeepSAGE_Rよりも少ないカウンセラー発話数で最も高いセッション成功率を達成し、目標完了と効率性の優れたトレードオフを示しました。さらに専門家による評価では、生成された対話が概ね妥当な感情の推移と認識可能なCBTプロセスを示していることが示されました。
論文の注目点
- DeepSAGEは、11段階のCBTセッション構造内で、外部ステージコントローラーと、LLM応答生成のための治療的意図を選択するPPO訓練済みポリシーを組み合わせています。
- 段階遷移は、プロンプトや固定対話フローのみに依存するのではなく、意味的類似性とNLI含意を組み合わせた明示的な目標達成スコアリングによって判定されます。
- 実証された利点は模擬的なエンゲージメント、自己開示、プロトコル完了効率に現れていますが、著者らは臨床的有効性を明示的に主張しておらず、高リスク事例における安全性の限界を強調しています。