論文の概要: Where do LLMs Fall Short in CBT-Guided Affective Reasoning?
- arxiv url: http://arxiv.org/abs/2607.02885v1
- Date: Fri, 03 Jul 2026 02:34:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.443892
- Title: Where do LLMs Fall Short in CBT-Guided Affective Reasoning?
- Title(参考訳): CBT誘導アフェクティブ推論においてLLMはどこで不足するのか?
- Abstract要約: 認知行動療法(CBT)は、認知的要因と行動的要因の相互作用を調べることによって、ユーザの精神状態を理解するための構造化された枠組みを提供する。
しかし、アウト・オブ・ザ・ボックスのLDMは、ユーザが実際に何を必要としているかに関わらず、流動的で共感的に応答するが、検証とリフレクションに崩壊する。
我々は、CBT対話を制御された感情的推論として扱う知識誘導フレームワークを用いて、このギャップを探求する。
- 参考スコア(独自算出の注目度): 7.155385243581969
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cognitive Behavioral Therapy (CBT) provides a structured framework for understanding a user's mental state by examining the interaction between cognitive and behavioral factors. However, out-of-the-box LLMs respond fluently and empathetically, yet collapse into validation & reflection, regardless of what the user actually needs. They know theoretical CBT (scoring up to 96% accuracy on licensing exam questions) but fail to apply it effectively. We explore this gap with a knowledge-guided framework that treats CBT dialogue as controlled affective reasoning: user narratives are decomposed into Beck's Cognitive Conceptualization structure, grounded in clinical SNOMED CT concepts validated via Natural Language Inference, and a Multiple Chain-of-Thought (MCoT) strategy selection between Validation & Reflection, Socratic Questioning, or Alternative Perspectives. To measure whether such guidance actually changes behavior, we introduce the Protocol Leverage Force (F), a behavior-level metric that captures how far an intervention shifts a model away from its default response. Across three open-weight LLMs and 14 RealCBT-derived case studies, evaluated with human experts, valence-arousal trajectories, and linguistic entrainment, F shows that simply introducing protocol definitions via single chain-of-thought prompting fails to change LLM behavior, while MCoT on these definitions guides strategy selection better. Still, the effect stays within 1% (approx. 1.2-1.3%), and all models remain biased toward Validation & Reflection. These results show CBT knowledge alone does not ensure effective application, giving the affective-computing community instrumentation to measure where LLMs fall short.
- Abstract(参考訳): 認知行動療法(CBT)は、認知的要因と行動的要因の相互作用を調べることによって、ユーザの精神状態を理解するための構造化された枠組みを提供する。
しかし、アウト・オブ・ザ・ボックスのLDMは、ユーザが実際に何を必要としているかに関わらず、流動的で共感的に応答するが、検証とリフレクションに崩壊する。
彼らは理論的なCBT(免許試験の正確性96%)を知っているが、効果的に適用できない。
我々は,CBT対話をコントロールされた感情的推論として扱う知識誘導型フレームワークを用いて,このギャップを考察する: ユーザ物語は,自然言語推論による臨床SNOMED CT概念を基盤としたBeckの認知概念化構造と,検証と考察,ソクラティック質問,あるいは代替的視点によるMCoT戦略の選択である。
このようなガイダンスが実際に振る舞いを変えるかどうかを測定するために、デフォルトの応答からモデルがどれくらい離れるかを計測する行動レベルの指標であるProtocol Leverage Force (F)を導入します。
3つのオープンウェイトLLMと14のRealCBT由来のケーススタディにおいて、人間の専門家、有能な覚醒的軌跡、言語的訓練によって評価され、Fは、単一のチェーン・オブ・シークレット・プロンプトによるプロトコル定義の導入がLLMの振る舞いを変えるのに失敗することを示し、MCoTは戦略選択をより良く導く。
それでも効果は1%(約1.2-1.3%)に留まり、全てのモデルは検証と反射に偏っている。
これらの結果から,CBTの知識だけでは有効な応用が得られず,LLMが不足している場所を測定するための感情計算型コミュニティインスツルメンテーションが提供される。
関連論文リスト
- Cognivia: A Cognitive Behavioral Therapy Copilot for Evidence-Based Mental Healthcare [15.515996576316342]
認知的歪曲は否定的な感情を増幅し、精神的な健康障害に寄与する。
本稿では,認知歪みの自動識別と合理的応答生成を統合したエビデンスベースの人工知能セラピストであるCogniviaを提案する。
コグニビアは、語彙メトリクス、LLMに基づく2つの相補的な基準を持つ裁判官、行動科学の専門家10人による人的評価を用いて評価される。
論文 参考訳(メタデータ) (2026-07-28T12:56:06Z) - Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs [60.80435138270317]
本稿では,メタ認知的フィードバックによる強化学習を忠実な校正問題に適用する。
実験により、RLMFは様々なタスクにおいて汎用的で最先端のFCを実現することが示された。
RLMFは標準のRLを最大63%上回り、モデルの性能限界を評価し表現する能力を高めている。
論文 参考訳(メタデータ) (2026-06-30T17:56:01Z) - Agentic Cognitive Profiling: Realigning Automated Alzheimer's Disease Detection with Clinical Construct Validity [66.94391219005291]
本稿では,臨床プロトコルロジックによる自動スクリーニングを実現するエージェント認知プロファイリング(ACP)を提案する。
我々の設計の中心は、すべての定量化を決定論的関数呼び出しに委譲することで、測定から意味的理解を分離することである。
ACPは、タスク試験で90.5%のスコアマッチ率、AD予測で85.3%の精度を達成し、一般的な基準を上回っている。
論文 参考訳(メタデータ) (2026-03-18T06:15:35Z) - Assessing the Effectiveness of LLMs in Delivering Cognitive Behavioral Therapy [4.551587749019292]
認知行動療法(CBT)を実践するプロセラピストをエミュレートする言語モデルの評価
以上の結果から,LCMはCBTのような対話を生成できるが,共感の伝達や一貫性の維持には限界があることがわかった。
論文 参考訳(メタデータ) (2026-03-04T09:15:14Z) - Are We Evaluating the Edit Locality of LLM Model Editing Properly? [68.441768731381]
この目的のために既存の特異性評価プロトコルは不十分であることがわかった。
既存の特異度指標は特異度正規化器の強度と弱い相関関係にある。
また、現在のメトリクスには十分な感度が欠けており、異なるメソッドの特異性性能の区別に効果がないこともわかりました。
論文 参考訳(メタデータ) (2026-01-24T07:07:21Z) - ICLShield: Exploring and Mitigating In-Context Learning Backdoor Attacks [61.06621533874629]
In-context Learning (ICL)は、大規模言語モデル(LLM)において顕著な成功を収めた。
本稿では,LLMがタスク関連潜伏概念とバックドア関連潜伏概念の両方を同時に学習する,という二重学習仮説を初めて提案する。
そこで本研究では,概念選好比を動的に調整する防衛機構であるICLShieldを提案する。
論文 参考訳(メタデータ) (2025-07-02T03:09:20Z) - An Empirical Study of the Anchoring Effect in LLMs: Existence, Mechanism, and Potential Mitigations [12.481311145515706]
本研究は、心が第一の情報に大きく依存する認知バイアスであるアンカー効果を考察し、影響のある判断を下す。
アンカー効果の大規模研究を容易にするため,新しいデータセットであるSynAnchorsを導入する。
以上の結果から, LLMのアンカリングバイアスは一般に浅層作用とともに存在し, 従来の手法では排除されないことが示唆された。
論文 参考訳(メタデータ) (2025-05-21T11:33:54Z) - CBT-Bench: Evaluating Large Language Models on Assisting Cognitive Behavior Therapy [67.23830698947637]
認知行動療法(CBT)支援の体系的評価のための新しいベンチマークであるCBT-BENCHを提案する。
我々は, CBT-BENCHにおける3段階の課題を含む: I: 基本的CBT知識獲得, 複数選択質問のタスク; II: 認知的モデル理解, 認知的歪み分類, 主根的信念分類, きめ細かい中核信念分類のタスク; III: 治療的応答生成, CBTセラピーセッションにおける患者音声に対する応答生成のタスク。
実験結果から,LLMはCBT知識のリサイティングに優れるが,複雑な実世界のシナリオでは不十分であることが示唆された。
論文 参考訳(メタデータ) (2024-10-17T04:52:57Z) - Are Large Language Models Possible to Conduct Cognitive Behavioral Therapy? [13.0263170692984]
大規模言語モデル(LLM)が検証され、心理的補助療法の新たな可能性を提供する。
精神保健の専門家は、LSMを治療に使用することについて多くの懸念を抱いている。
自然言語処理性能に優れた4つのLLM変種を評価した。
論文 参考訳(メタデータ) (2024-07-25T03:01:47Z) - Towards Effective Evaluations and Comparisons for LLM Unlearning Methods [97.2995389188179]
本稿では,大規模言語モデルにおける機械学習評価の精度向上を図る。
評価指標の堅牢性と、競合する目標間のトレードオフという、2つの重要な課題に対処します。
論文 参考訳(メタデータ) (2024-06-13T14:41:00Z) - MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation [60.65820977963331]
大規模言語モデル(LLM)のための新しい評価パラダイムを導入する。
このパラダイムは、しばしば推論プロセスを無視する結果指向の評価から、より包括的な評価へと重点を移す。
GSM8Kデータセットにこのパラダイムを適用し,MR-GSM8Kベンチマークを開発した。
論文 参考訳(メタデータ) (2023-12-28T15:49:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。