論文の概要: Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.20975v1
- Date: Fri, 21 Aug 2026 10:55:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.513736
- Title: Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models
- Title(参考訳): 行動のない信念:視覚・言語モデルにおける心の理論の協調行動への翻訳の測定
- Authors: Tonglin Yan, Gregoire Sergeant-Perthuis, David Rudrauf,
- Abstract要約: 効果的な社会的相互作用は、エージェントが精神状態の推論を言語と非言語チャネルをまたいで協調した行動信号に同時に翻訳する必要がある。
2つのエンボディエージェントが協調的および競争的シナリオ間で相互作用するベンチマークであるMOSAICを紹介する。
我々は、VLMがToM順序制約の下で期待された結果と一致しない動作を生成し、明示的なToM順序制約を課すことで、指定された推論レベルに整合した信頼性のある動作変化が得られないことを発見した。
- 参考スコア(独自算出の注目度): 0.509780930114934
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Effective social interaction requires agents to translate mental state inferences into coordinated behavioral signals across verbal and nonverbal channels simultaneously. Yet existing benchmarks evaluate theory of mind (ToM) reasoning and embodied behavior in isolation, leaving unmeasured the gap between social inference and social action. We introduce MOSAIC (Multimodal Orchestration of Social Action, Inference, and Communication), a controlled benchmark in which two embodied agents interact across cooperative and competitive scenarios requiring integration of verbal statements, spatial trajectories, gaze direction, and facial expression under systematically varied ToM constraints. Evaluating 13 models, including 11 VLMs, across 200 trials per model, we find that VLMs fail to produce behaviors consistent with the expected outcomes under ToM-order constraints, and that imposing explicit ToM-order constraints produces no reliable behavioral change aligned with the specified reasoning level. Signal-level analysis reveals two sequential bottlenecks: most models cannot produce directionally coherent nonverbal signals, and even when signals are present, VLM agents fail to interpret others behaviors and react to them. PCM-LLM, included as a structured architectural reference point with an explicit ToM module, succeeds across all conditions, suggesting that explicit belief-action coupling is a sufficient ingredient for this class of tasks.
- Abstract(参考訳): 効果的な社会的相互作用は、エージェントが精神状態の推論を言語と非言語チャネルをまたいで協調した行動信号に同時に翻訳する必要がある。
しかし、既存のベンチマークでは、社会的推論と社会的行動のギャップを未測定のままにして、心の理論(ToM)の推論と分離行動の具体化を評価している。
言語文,空間的軌跡,視線方向,表情を体系的に変化したToM制約の下で統合する必要のある,協調的・競争的なシナリオにおいて,2つの具体的エージェントが相互作用する制御ベンチマークであるMOSAIC(Multimodal Orchestration of Social Action, Inference, and Communication)を紹介する。
11のVLMを含む13のモデルを評価すると、VLMはToM-order制約の下で期待される結果と一致しない動作を生成できず、明示的なToM-order制約を課すことで、特定の推論レベルに整合した信頼性のある動作変化が得られないことが分かる。
信号レベル解析は2つのシーケンシャルなボトルネックを明らかにしている。ほとんどのモデルでは、方向整合性のない非言語信号は生成できない。
PCM-LLMは、明示的なToMモジュールを持つ構造的アーキテクチャ参照ポイントとして含まれており、全ての条件で成功し、明示的な信念-行動結合がこの種のタスクに十分な要素であることを示唆している。
関連論文リスト
- MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings [11.551333946022053]
自然主義的多人数会議における複雑な社会的行動推論のためのベンチマークである MeetingToM を紹介する。
ベンチマークは階層的に組織され、ToMを社会的粒度の増加レベルで評価する。
本研究は,マルチモーダルモデルにおけるミーティンググラウンドToMを進展させるテストベッドとして,ミーティングToMを確立させる上で重要な課題を浮き彫りにした。
論文 参考訳(メタデータ) (2026-07-21T16:05:49Z) - SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models [86.19617358080016]
Social Omniは、3つのコア次元にわたる対話性の評価を運用するベンチマークである。
Social Omniは2000の知覚サンプルと209の相互作用生成インスタンスの品質管理された診断セットを備えている。
本分析により,モデルの知覚的精度と,文脈的に適切な割り込みを生成する能力との間に顕著な疎結合が明らかとなった。
論文 参考訳(メタデータ) (2026-03-17T17:58:44Z) - GPT-4o Lacks Core Features of Theory of Mind [0.09320657506524145]
ToMの認知的な定義を用いて、新しい評価フレームワークを開発し、テストする。
LLMは単純なToMパラダイムで人間の判断を近似することに成功したが、論理的に等価なタスクでは失敗する。
論文 参考訳(メタデータ) (2026-02-12T16:33:58Z) - On the Paradoxical Interference between Instruction-Following and Task Solving [50.75960598434753]
次の命令は、大規模言語モデル(LLM)を、タスクの実行方法に関する明示的な制約を指定することで、人間の意図と整合させることを目的としている。
我々は,LLMのタスク解決能力にパラドックス的に干渉する命令に従うという,直感に反する現象を明らかにした。
本稿では,タスク解決に追従する命令の干渉を定量化する指標として,SUSTAINSCOREを提案する。
論文 参考訳(メタデータ) (2026-01-29T17:48:56Z) - M3-BENCH: Process-Aware Evaluation of LLM Agents Social Behaviors in Mixed-Motive Games [4.88323005571385]
M3-Benchは、M3-Benchのマルチステージベンチマークである。
我々は、多次元の証拠を解釈可能な社会行動像に集約するために、ビッグファイブパーソナリティモデルと社会交換理論を統合する。
論文 参考訳(メタデータ) (2026-01-13T11:38:51Z) - Doing Things with Words: Rethinking Theory of Mind Simulation in Large Language Models [48.815314312823006]
本研究では,GABM(Generative Agent-Based Model)コンコーディアが実世界のシミュレーション環境において,効果的に心の理論(ToM)をモデル化できるかどうかを考察する。
我々は,このフレームワークがToM能力のシミュレートに成功しているかどうか,ソーシャルコンテキストから真の推論を行うことで,GPT-4がタスクを遂行できるかどうかを評価する。
論文 参考訳(メタデータ) (2025-10-15T10:48:31Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - Large Language Models as Theory of Mind Aware Generative Agents with Counterfactual Reflection [31.38516078163367]
ToM-agentは、オープンドメインの会話相互作用において、LLMベースの生成エージェントがToMをシミュレートできるように設計されている。
ToM-Adntは、精神状態に対するエージェントの認識のエミュレーションを促進するため、精神状態からの信頼を解き放つ。
以上の結果から,ToM-agentは,意味的情緒的支援や意思決定に限らず,相手の行動の根底にある要因を把握できることが示唆された。
論文 参考訳(メタデータ) (2025-01-26T00:32:38Z) - MARS: Benchmarking the Metaphysical Reasoning Abilities of Language Models with a Multi-task Evaluation Dataset [50.36095192314595]
大きな言語モデル(LLM)は、一般化可能な推論能力を持つ意識的なエージェントとして機能する。
この能力は、イベントにおける無限の可能な変更をモデル化する複雑さのために、まだ探索されていない。
我々は,各ステップに対応する3つのタスクからなる最初のベンチマークMARSを紹介する。
論文 参考訳(メタデータ) (2024-06-04T08:35:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。