論文の概要: MIThinker: A Plug-and-Play Policy-Optimized Thinker For Motivational Interviewing Counseling
- arxiv url: http://arxiv.org/abs/2606.29265v1
- Date: Sun, 28 Jun 2026 08:27:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.861911
- Title: MIThinker: A Plug-and-Play Policy-Optimized Thinker For Motivational Interviewing Counseling
- Title(参考訳): MIThinker: モチベーションと面接のカウンセリングのための、プラグ&プレイのポリシー最適化思想家
- Authors: Yizhe Yang, Palakorn Achananuparp, Heyan Huang, Jing Jiang, Ee-Peng Lim,
- Abstract要約: モチベーション・インタビュー(MI)カウンセリング・エージェントは、思考とカウンセリング・テクニックを明確に整合させることなく、応答を生成する。
我々は、MIカウンセリングエージェントを戦略選択と応答生成に導くために、治療的思考を生成する軽量な思考モデルであるMIThinkerを提案する。
自動パイプラインであるAugR1-MIは、観察された応答からのリバースエンジニアリングカウンセラーの考えである。
- 参考スコア(独自算出の注目度): 51.961625498227654
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reasoning large language models (LLMs) have recently made much progress in complex problem-solving, leveraging internal reasoning (or thought) to guide their solution generation. However, existing LLM-based counseling agents, including those using Motivational Interviewing (MI), generate responses without explicitly aligning thoughts with counseling techniques, limiting their effectiveness. We propose MIThinker, a lightweight thinking model that generates therapeutic thoughts to guide MI counseling agents in strategy selection and response generation. To overcome the lack of annotated thought data, we introduce AugR1-MI, an automated pipeline that reverse-engineers counselor's thoughts from observed responses. Through two-stage training combining supervised fine-tuning and reinforcement learning, MIThinker demonstrates improved theory-of-mind assessment and strategy alignment. Comprehensive evaluations show that MindfulMI, our agent leveraging MIThinker, achieves MI competency comparable to state-of-the-art systems with an order of magnitude less computation.
- Abstract(参考訳): 大規模言語モデル(LLM)の推論は、最近、複雑な問題解決に大きく進歩し、内部推論(あるいは思考)を利用してソリューション生成を導く。
しかし、既存のLCMベースのカウンセリングエージェントは、モチベーション・インタビューティング(MI)を用いて、カウンセリング技術と明確に一致しない応答を生成し、その効果を制限している。
我々は、MIカウンセリングエージェントを戦略選択と応答生成に導くために、治療的思考を生成する軽量な思考モデルであるMIThinkerを提案する。
注釈付き思考データの欠如を克服するために、観察された反応からカウンセラーの思考をリバースエンジニアリングする自動化パイプラインであるAugR1-MIを導入する。
教師付き微調整と強化学習を組み合わせた2段階のトレーニングを通じて、MIThinker氏は、理論と戦略の整合性を改善した。
総合評価の結果,MIThinkerを利用するエージェントであるMindfulMIは,従来のシステムに匹敵するMI能力を実現している。
関連論文リスト
- ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning [53.817538122688944]
Reinforced Meta-thinking Agents (ReMA) を導入し,Large Language Models (LLMs) の推論からメタ思考行動を求める。
ReMAは、推論プロセスを2つの階層的なエージェントに分解する。戦略上の監視と計画を生成するハイレベルなメタ思考エージェントと、詳細な実行のための低レベルな推論エージェントである。
単ターン実験による実験結果から、ReMAは複雑な推論タスクにおいて単エージェントRLベースラインよりも優れることが示された。
論文 参考訳(メタデータ) (2025-03-12T16:05:31Z) - MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning [3.651416979200174]
MMCTAgentは、複雑な視覚的推論タスクにおける現在のMLLM固有の制限に対処するために設計された、新しい批判的思考エージェントフレームワークである。
人間の認知プロセスや批判的思考にインスパイアされたMCCTAgentは、複数のモーダル情報を反復的に分析し、クエリを分解し、戦略を計画し、その推論を動的に進化させる。
論文 参考訳(メタデータ) (2024-05-28T16:55:41Z) - Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate [85.3444184685235]
複数のエージェントが"tit for tat"の状態で議論を表現するマルチエージェント議論(MAD)フレームワークを提案し、審査員が議論プロセスを管理して最終解を得る。
我々のフレームワークは、深い熟考を必要とするタスクに役立ちそうなLSMにおける散発的思考を奨励する。
論文 参考訳(メタデータ) (2023-05-30T15:25:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。