論文の概要: Human-Like Attention? A Psychophysical Comparison of Visual Search in Humans and MLLMs
- arxiv url: http://arxiv.org/abs/2610.05463v1
- Date: Sun, 04 Oct 2026 19:11:35 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:44:28.48544
- Title: Human-Like Attention? A Psychophysical Comparison of Visual Search in Humans and MLLMs
- Title(参考訳): 人間のような注意? 人間とMLLMにおける視覚検索の心理学的比較
- Abstract要約: 本研究では,マルチモーダル大規模言語モデル (MLLM) が視覚検索タスクにおいて人間のような難易度を示すかどうかを検討する。
同一の2次元刺激と3次元刺激を異なる大きさで比較した。
- 参考スコア(独自算出の注目度): 0.5872014229110213
- License:
- Abstract: Visual search is a fundamental cognitive ability. This study investigates whether Multimodal Large Language Models (MLLMs) exhibit human-like difficulty signatures in visual search tasks. We compared search performance of humans (n = 1,250) and MLLMs using identical 2D and 3D stimuli across different set sizes. Both groups showed efficient performance in feature searches, most clearly when the target had a unique color, but performance degradation in conjunction searches as set sizes increased. Additionally, we found strong correlations between human and MLLM error rates ($ρ= 0.82$), which suggests that MLLMs are sensitive to similar objective complexities, such as stimulus heterogeneity. However, differences were found as well: whereas humans invested extra search time to respond accurately on target-absent trials, MLLMs exhibited extreme present/absent response biases in complex searches. We conclude that MLLMs replicate high-level human performance signatures, yet their underlying computations differ significantly.
- Abstract(参考訳): 視覚検索は基本的な認知能力である。
本研究では,マルチモーダル大規模言語モデル (MLLM) が視覚検索タスクにおいて人間のような難易度を示すかどうかを検討する。
同一の2次元刺激と3次元刺激を異なるサイズで比較し, 人間の探索性能(n = 1,250)とMLLMの比較を行った。
両群とも特徴探索において高い性能を示し, ターゲットが特異な色を持つ場合が最も顕著であったが, セットサイズが大きくなるにつれて, 協調探索における性能劣化が増大した。
さらに,ヒトとMLLMの誤差率(ρ=0.82$)には強い相関関係がみられた。
MLLMは、複雑な検索において、ターゲット・アビデント・トライアルに正確に反応するために余分な検索時間を投資する一方で、極端な現在/アビデント・レスポンスバイアスを示した。
MLLMはハイレベルな人間のパフォーマンスシグネチャを再現するが、その基礎となる計算は著しく異なる。
関連論文リスト
- Matched Outcomes, Divergent Gaze: How Foveated MLLMs Search Compared to Humans [50.71222402701153]
目標指向検索(COCO-Search18)における3つの汎用大言語モデル(MLLM)と人間の眼球運動スキャンパスを比較した。
いずれも低エントロピー、大振幅、自己整合性のスキャンパスであり、2人の人間が互いに同意するよりもはるかに近い。
このギャップは、回答アライメントとサリエンシのメトリクスが測定できないプロセス軸の上に置かれている。それらが見逃しているため、そのような指標は人間のようなビジョンを証明できない。ゼロショットモデルは結果と空間的疑問に適合するが、時間的、プロセスレベルではない。
論文 参考訳(メタデータ) (2026-08-17T12:54:39Z) - I Spy With My Model's Eye: Visual Search as a Behavioural Test for MLLMs [3.5266549480163047]
マルチモーダル大規模言語モデル(MLLM)は視覚言語タスクにおいて高い性能を達成するが、その視覚処理は不透明である。
従来の視覚探索のパラダイムを応用して,MLLMの視覚的特徴が乱れのセットサイズとは無関係に検出されるような,ポップアウト効果を示すかどうかを検証した。
高度なMLLMは、色や大きさに基づく解離性(単一特徴)探索や、接続性(複数特徴)探索の容量制限において人間的なポップアウト効果を示す。
論文 参考訳(メタデータ) (2025-10-22T15:24:07Z) - Evaluating Graphical Perception with Multimodal LLMs [2.090547583226381]
マルチモーダル大言語モデル(MLLM)は画像の解析と理解において著しく進歩している。
可視化のために、MLLMはグラフィカルな知覚タスクに適用した場合、どのように機能するか?
本研究は主に、微調整および事前訓練されたモデルとゼロショットを用いて、人間の視覚的知覚と密に一致しているかどうかを判断する。
論文 参考訳(メタデータ) (2025-04-05T16:14:08Z) - Do LLMs exhibit human-like response biases? A case study in survey
design [66.1850490474361]
大規模言語モデル(LLM)が人間の反応バイアスをどの程度反映しているかについて検討する。
アンケート調査では, LLMが人間のような応答バイアスを示すかどうかを評価するためのデータセットとフレームワークを設計した。
9つのモデルに対する総合的な評価は、一般のオープンかつ商用のLCMは、一般的に人間のような振る舞いを反映しないことを示している。
論文 参考訳(メタデータ) (2023-11-07T15:40:43Z) - Human Behavioral Benchmarking: Numeric Magnitude Comparison Effects in
Large Language Models [4.412336603162406]
大規模言語モデル(LLM)は、テキストで広まる数値を差分表現しない。
本研究では,LLMが行動レンズからどれだけの数の数値を捉えているかを検討する。
論文 参考訳(メタデータ) (2023-05-18T07:50:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。