論文の概要: Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?
- arxiv url: http://arxiv.org/abs/2605.22109v1
- Date: Thu, 21 May 2026 07:42:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.14563
- Title: Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?
- Title(参考訳): 知覚と偏見:MLLMはパーソナリティの第一印象を超えることができるか?
- Authors: Caixin Kang, Tianyu Yan, Sitong Gong, Mingfang Zhang, Liangyang Ouyang, Ruicong Liu, Bo Zheng, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang,
- Abstract要約: グラウンドド・パーソナリティ・推論は、MLLMがそれぞれのビッグファイブ・格付けを、評価、推論、根拠の連鎖を通じて観察可能な証拠に固定することを要求する。
MM-OCEANは、人間の検証によるマルチエージェントパイプラインによって生成され、タイムスタンプによる行動観察、エビデンスに基づく特性分析、およびキューグラウンドMCQの7つのカテゴリがある。
この分析では、フィールド全体にわたって、正しい評価の51%が取得された手がかりに基づかず、ホリスティック・ギャラリング・レートは0-33.5%にしか達していないという顕著な偏見のギャップが明らかになった。
- 参考スコア(独自算出の注目度): 74.69723255239663
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) are increasingly deployed in human-facing roles where personality perception is critical, yet existing benchmarks evaluate this capability solely on numerical Big Five score prediction, leaving open whether models truly perceive personality through behavioral understanding or merely prejudge through superficial pattern matching. We address this gap with three contributions. (i) A new task: we formalize Grounded Personality Reasoning (GPR), which requires MLLMs to anchor each Big Five rating in observable evidence through a chain of rating, reasoning, and grounding. (ii) A new dataset: we release MM-OCEAN (1,104 videos, 5,320 MCQs), produced by a multi-agent pipeline with human verification, with timestamped behavioral observations, evidence-grounded trait analyses, and seven categories of cue-grounding MCQs. (iii) Benchmark and analysis: we design a three-tier evaluation (rating, reasoning, grounding) plus four sample-level failure-mode metrics: Prejudice Rate (PR), Confabulation Rate (CR), Integration-failure Rate (IR), and Holistic-grounding Rate (HR), and benchmark 27 MLLMs (13 closed, 14 open). The analysis uncovers a striking Prejudice Gap: across the field, 51% of correct ratings are not grounded in retrieved cues, and the Holistic-Grounding Rate spans only 0-33.5%. These findings expose a disconnect between getting the right score and reasoning for the right reason, charting a roadmap for grounded social cognition in MLLMs.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、個性知覚が重要視される人間の面にますます展開されているが、既存のベンチマークでは、数値的なビッグファイブスコアの予測にのみこの能力を評価しており、モデルが行動的理解を通じて真にパーソナリティを知覚しているか、あるいは表面的パターンマッチングによる単なる偏見かのどちらかである。
このギャップに3つのコントリビューションで対処します。
(i)新たな課題:グラウンドド・パーソナリティ・推論(GPR)を定式化する。これはMLLMが各ビッグファイブ・レーティングを、評価、推論、根拠の連鎖を通じて観察可能な証拠に固定することを要求するものである。
(II)MM-OCEAN(動画1,104本,5,320本)を人間による検証によるマルチエージェントパイプラインで作成し,タイムスタンプによる行動観察,エビデンス・グラウンドト特性解析,クエグラウンド型MCQの7つのカテゴリを作成した。
3) ベンチマークと分析: 偏見率 (PR), 衝突率 (CR), 統合不良率 (IR), ホロスティックグラウンドレート (HR), ベンチマーク27 MLLM (13クロード,14オープン) という,3段階の評価(レーティング,推論,グラウンドニング)と4段階の障害モードのメトリクスを設計する。
この分析では、フィールド全体にわたって、正しい評価の51%が取得された手がかりに基づかず、ホロスティック・ギャラリング・レートは0-33.5%にしか達していないという、顕著な偏見のギャップが明らかになった。
これらの結果は、正しいスコアと正しい理由の推論との間に不一致を生じさせ、MLLMにおける社会的認知の基盤となるロードマップをグラフ化した。
関連論文リスト
- MEDLEY-BENCH: Scale Buys Evaluation but Not Control in AI Metacognition [37.95586695802894]
メタ認知(メタ認知)は、自分自身の推論を監視し、規制する能力であり、AIベンチマークでは未評価のままである。
我々は,行動メタ認知のベンチマークであるMEDLEY-BENCHを紹介した。
論文 参考訳(メタデータ) (2026-04-17T12:32:50Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - Evaluating LLM Alignment on Personality Inference from Real-World Interview Data [7.061237517845673]
大規模言語モデル(LLM)は、複雑な心理的理解を必要とする役割にますます配備されている。
このような応用の重要な側面である人間の性格特性を解釈する能力は、まだ解明されていない。
本研究では, 半構造化された面接書と, 検証された5つの特徴スコアを組み合わせた新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-09-16T16:54:35Z) - HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding [120.84817886550765]
MLLM(Multimodal Large Language Models)は、画像とビデオの両方を含む視覚的理解タスクにおいて、大きな進歩を見せている。
既存の人間中心のベンチマークは、主にビデオ生成の品質と行動認識を強調し、人間中心のシナリオに必要な知覚と認知の能力を見落としている。
我々は,人間中心のビデオ理解におけるMLLMのより総合的な評価を提供するために,厳格にキュレートされたベンチマークを提案する。
論文 参考訳(メタデータ) (2025-07-07T11:52:24Z) - VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models [121.03333569013148]
VisuLogicは、6つのカテゴリにまたがる1,000の人間認証された問題のベンチマークです。
これらの質問は、複数の視点からMLLMの視覚的推論能力を評価するために評価することができる。
ほとんどのモデルは精度が30%以下で、25%のランダムベースラインよりわずかに高く、人間によって達成された51.4%よりはるかに低い。
論文 参考訳(メタデータ) (2025-04-21T17:59:53Z) - CLASH: Evaluating Language Models on Judging High-Stakes Dilemmas from Multiple Perspectives [3.7931130268412194]
CLASHは345個のハイインパクトジレンマと3,795個の異なる値の個々の視点からなるデータセットである。
CLASHは、価値に基づく意思決定プロセスの批判的かつ未調査な側面の研究を可能にする。
GPT-5やClaude-4-Sonnetのような強力なプロプライエタリモデルでさえ、曖昧な決定に苦戦している。
論文 参考訳(メタデータ) (2025-04-15T02:54:16Z) - Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs [65.93003087656754]
VisFactorは、よく確立された認知心理学評価から20の視覚中心のサブテストをデジタル化するベンチマークである。
GPT、Gemini、Claude、LLaMA、Qwen、SEEDファミリーから20のフロンティアマルチモーダル言語モデル(MLLM)を評価する。
最高のパフォーマンスモデルは100点中25.19点のスコアしか得られず、精神的な回転、空間的関係推論、図形の識別といったタスクに一貫して失敗する。
論文 参考訳(メタデータ) (2025-02-23T04:21:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。