論文の概要: Mind2Dialogue: Training Human-Aware Language Models by Simulating User Mental States
- arxiv url: http://arxiv.org/abs/2609.15972v1
- Date: Mon, 14 Sep 2026 17:55:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.546386
- Title: Mind2Dialogue: Training Human-Aware Language Models by Simulating User Mental States
- Title(参考訳): Mind2Dialogue:ユーザ精神状態のシミュレーションによるヒューマン・アウェア言語モデルのトレーニング
- Abstract要約: Mind2Dialogueは、ユーザのメンタルステートをシミュレートし、それらを人間に意識したトレーニングのための特権的な監視に変換するためのフレームワークである。
まず,精神状態の更新とコヒーレントな会話の生成を両立させる心理誘導シミュレータを提案する。
私たちの特権的な蒸留は、デプロイ時にメンタルステートに直接アクセスすることなく、ユーザを支援するために、Oracleの優れたインフォームドレスポンスのモデルをトレーニングします。
- 参考スコア(独自算出の注目度): 72.77158276658636
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As language models become more capable, long-term collaboration in learning, reasoning, and decision-making calls for a deeper understanding of the people they serve. Yet training such human-aware language models faces a fundamental supervision gap because current datasets for LLM assistant training contain few if any well-informed responses explicitly grounded in users' unspoken beliefs and goals. Scaling such supervision is inherently constrained, as users' underlying states are not directly observable. We thus propose the Mind2Dialogue framework to mitigate this gap by simulating users' mental states and turning them into privileged supervision for human-aware training. Specifically, we first propose a psychology-guided simulator that preserves personal characteristics while updating mental states through interaction to generate coherent conversations. The key idea is to enforce a shared evolving mental state that drives user behavior and guides an Oracle assistant's responses. Our privileged distillation then trains models on the Oracle's well-informed responses to assist users without direct access to their mental states at deployment. Moreover, we propose to evaluate human-aware learning by combining personalization and theory of mind, examining how models understand people and act on that understanding. Training on the full Mind2Dialogue corpus improves every reported personalization metric over the corresponding Qwen, Llama, and OLMo instruction-tuned baselines, including gains of 26.6 to 40.9 percentage points in preference-following generation. The gains extend to belief and action reasoning on Qwen and Llama, beyond personalized assistance. Looking forward, Mind2Dialogue makes user simulation a foundation for genuine AI collaborators that understand beliefs and intentions behind people's words and support their long-term goals across education, work, and everyday life.
- Abstract(参考訳): 言語モデルがより有能になるにつれて、学習、推論、意思決定における長期的なコラボレーションは、彼らが奉仕する人々の深い理解を求める。
しかし、LLMアシスタントトレーニングの現在のデータセットには、ユーザの無意味な信念や目標に明確に根ざした、十分に表現された応答がほとんど含まれていないため、そのようなヒューマン・アウェア言語モデルのトレーニングは、基本的な監督のギャップに直面している。
このような監視のスケーリングは、ユーザの基本的な状態が直接監視できないため、本質的に制限されている。
そこで我々は、ユーザの精神状態をシミュレートし、それを人間意識訓練のための特権的な監督にすることで、このギャップを軽減するためのMind2Dialogueフレームワークを提案する。
具体的には、まず、対話を通じて精神状態を更新し、コヒーレントな会話を発生させながら、個人の特性を保った心理誘導シミュレータを提案する。
鍵となる考え方は、ユーザの振る舞いを駆動し、Oracleアシスタントのレスポンスをガイドする、共有進化するメンタルステートを強制することである。
私たちの特権的な蒸留は、デプロイ時にメンタルステートに直接アクセスすることなく、ユーザを支援するために、Oracleの優れたインフォームドレスポンスのモデルをトレーニングします。
さらに,モデルが人を理解し,その理解にどう作用するかを考察し,パーソナライズと心の理論を組み合わせることで,人間意識学習を評価することを提案する。
完全なMind2Dialogueコーパスのトレーニングは、Qwen、Llama、OLMoの命令調整ベースラインに対する報告されたパーソナライズ基準を改善し、優先フォロー生成の26.6から40.9ポイントのゲインを含む。
利益は、パーソナライズされた援助を超えて、QwenとLlamaに対する信念と行動推論にまで及んでいる。
今後、Mind2Dialogueはユーザーシミュレーションを、人々の言葉の背後にある信念や意図を理解し、教育、仕事、日々の生活における長期的な目標をサポートする、真のAI協力者の基盤にする。
関連論文リスト
- Measuring User's Mental Models of Speech Translation in Human-AI Collaboration [23.64422798744437]
本稿では,言語間質問応答に基づく新しい枠組みを用いて,ユーザの音声翻訳システムのメンタルモデルについて検討する。
翻訳品質の異なるユーザ行動と精度傾向を解析することにより,システムがどこが間違っているかを予測することができるかを検討する。
論文 参考訳(メタデータ) (2026-06-23T14:40:36Z) - Resonant Minds: Closed-Loop Social Avatars with Theory of Mind [16.880605576970538]
本稿では,認識,社会的推論,表現を連続的な相互作用サイクルに統合した閉ループ二重エージェントフレームワークを提案する。
知覚モジュールは、パートナーのマルチモーダルな振る舞いをビデオから分析し、社会的推論モジュールは、心の理論を通して隠れた精神状態を予測する。
その後、表情モジュールは、リスナーの反応行動とともに、話者音声と表現の両方の感情制御可能なデュアルエージェントビデオを生成する。
論文 参考訳(メタデータ) (2026-06-04T09:03:43Z) - ThoughtTrace: Understanding User Thoughts in Real-World LLM Interactions [31.70995208851302]
ThoughtTraceは、現実世界のマルチターンヒューマン-AI会話とユーザの自己報告された思考を組み合わせた最初の大規模データセットである。
ThoughtTraceには1,058のユーザ、2,155の会話、17,058のターン、10,174の思考アノテーションが20の言語モデルで収集されている。
論文 参考訳(メタデータ) (2026-05-19T16:42:06Z) - HumanLLM: Towards Personalized Understanding and Simulation of Human Nature [72.55730315685837]
HumanLLMは個人のパーソナライズされた理解とシミュレーションのために設計された基礎モデルである。
私たちはまず、Reddit、Twitter、Blogger、Amazonといったプラットフォーム上で、現実世界のユーザデータをキュレートした大規模なコーパスであるCognitive Genomeを構築しました。
次に、多様な学習タスクを定式化し、教師付き微調整を行い、モデルの幅広い個人化された人間の行動、思考、経験を予測する。
論文 参考訳(メタデータ) (2026-01-22T09:27:27Z) - Because we have LLMs, we Can and Should Pursue Agentic Interpretability [22.10895793309226]
大規模言語モデル(LLM)は、ユーザのメンタルモデルの開発と活用によって、人間の理解を積極的に支援する。
エージェント的解釈性は、特に評価において、私たちが「ループの絡み合い」と呼ぶ性質のために、課題をもたらす。
エージェントの解釈可能性の約束は、人間がLLMの潜在的な欺く概念を学ぶのを助けることである。
論文 参考訳(メタデータ) (2025-06-13T18:13:58Z) - Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning [31.196865401472664]
自然言語の環境に関する生産的な議論を人間による実演なしで行うように、言語モデルを訓練する。
我々はエージェントの目標を利用して、コミュニケーションを誘導する高密度報酬信号として、世界の有用な情報を予測する。
我々は、容疑者の告発や証拠提供など、我々の技術による創発的行動を分析し、強力な議論を可能にすることを発見した。
論文 参考訳(メタデータ) (2025-02-09T22:44:45Z) - Interactive Dialogue Agents via Reinforcement Learning on Hindsight Regenerations [58.65755268815283]
多くの実際の対話は対話的であり、つまりエージェントの発話が会話の相手に影響を与えるか、情報を引き出すか、意見を変えるかである。
この事実を利用して、既存の最適データを書き直し、拡張し、オフライン強化学習(RL)を介してトレーニングする。
実際の人間によるユーザ調査の結果、我々のアプローチは既存の最先端の対話エージェントを大きく上回っていることがわかった。
論文 参考訳(メタデータ) (2024-11-07T21:37:51Z) - Real-time Addressee Estimation: Deployment of a Deep-Learning Model on
the iCub Robot [52.277579221741746]
住所推定は、社会ロボットが人間とスムーズに対話するために必要なスキルである。
人間の知覚スキルにインスパイアされたディープラーニングモデルは、iCubロボットに設計、訓練、デプロイされる。
本研究では,人間-ロボットのリアルタイムインタラクションにおいて,そのような実装の手順とモデルの性能について述べる。
論文 参考訳(メタデータ) (2023-11-09T13:01:21Z) - AGENT: A Benchmark for Core Psychological Reasoning [60.35621718321559]
直観心理学は、観察可能な行動を駆動する隠された精神変数を推論する能力です。
他のエージェントを推論する機械エージェントに対する近年の関心にもかかわらず、そのようなエージェントが人間の推論を駆動するコア心理学の原則を学ぶか保持するかは明らかではない。
本稿では,プロシージャが生成する3dアニメーション,エージェントを4つのシナリオで構成したベンチマークを提案する。
論文 参考訳(メタデータ) (2021-02-24T14:58:23Z) - A Neural Topical Expansion Framework for Unstructured Persona-oriented
Dialogue Generation [52.743311026230714]
Persona Exploration and Exploitation (PEE)は、事前に定義されたユーザペルソナ記述を意味論的に相関したコンテンツで拡張することができる。
PEEはペルソナ探索とペルソナ搾取という2つの主要なモジュールで構成されている。
提案手法は, 自動評価と人的評価の両面で, 最先端のベースラインを上回っている。
論文 参考訳(メタデータ) (2020-02-06T08:24:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。