論文の概要: Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models
- arxiv url: http://arxiv.org/abs/2607.09654v1
- Date: Fri, 10 Jul 2026 17:53:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.918876
- Title: Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models
- Title(参考訳): 視覚言語AIモデルにおける精度と視覚認知誤差の進化
- Abstract要約: 複雑な社会的相互作用・行動を示す100の画像を含む複合社会行動データセットについて紹介する。
視覚言語モデルの10~2025年におけるシーン記述の進展を分析した。
MLLMはより単純なMS-COCOシーンと複雑な振る舞いを描写したシーン間のシーン記述精度のギャップをなくしたことを示す。
- 参考スコア(独自算出の注目度): 3.1217191045756603
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision language models (VLMs) have made remarkable progress in visual reasoning during the last decade. Most evaluations have used simple scenes (MS-COCO) that do not showcase complex human interactions or behaviors, only a handful of non-curated human descriptions as a benchmark, and have not focused on understanding the model's error types. Here, we introduce the Complex Social Behavior (CSB) dataset, containing 100 images depicting complex social interactions/behaviors. We analyze the progression of scene descriptions over a decade (2017-2025) of VLMs (four pre-Multimodal Large Language Models, MLLMs, and five MLLMs). We evaluate the accuracy of the models and 20 human descriptions relative to a gold standard on the CSB dataset and on a sample from MS-COCO. We analyzed five visual-cognitive error types: object detection, recognition, hallucination, scene understanding, and spatial dependence. The CSB dataset showed a more pronounced improvement than MS-COCO in scene description accuracy, with pre-MLLMs achieving much lower accuracy than the bottom-ranked human descriptions and MLLMs attaining accuracies similar to the top-ranked human descriptions. We show that MLLMs have eliminated the gap in scene description accuracy between simpler MS-COCO scenes and scenes depicting complex behaviors (CSB). MLLMs have almost eliminated all error types in our tested datasets, except for occasionally relying on different image regions for scene descriptions than humans do (spatial dependence error). We also show that detection, recognition, and hallucination errors have the highest impact on scene description accuracy. Together, our findings provide a more thorough evaluation of how visual language models have advanced over the last decade.
- Abstract(参考訳): 視覚言語モデル(VLM)は、過去10年間、視覚的推論において顕著な進歩を遂げてきた。
ほとんどの評価では、複雑なヒューマンインタラクションや振る舞いを示しない単純なシーン(MS-COCO)を使用しており、ベンチマークとして修正されていない人間の記述はごくわずかであり、モデルのエラータイプを理解することに重点を置いていない。
本稿では,複合社会行動(CSB)データセットについて紹介する。
我々は、VLM(Multimodal Large Language Models, MLLMs, 5 MLLMs)の10年間にわたるシーン記述の進捗状況を分析した。
CSBデータセットとMS-COCOのサンプルを用いて、モデルと20人の記述の精度を評価した。
物体検出,認識,幻覚,シーン理解,空間依存の5種類の視覚的認知的誤りを解析した。
CSBデータセットは、シーン記述精度においてMS-COCOよりも顕著な改善を示し、前MLLMは下位ランクの人間記述よりもはるかに低い精度で、MLLMは上位ランクの人間記述と同様の精度を達成した。
MLLMはより単純なMS-COCOシーンと複雑な振る舞いを描写するシーン(CSB)とのシーン記述精度のギャップをなくしたことを示す。
MLLMはテストデータセットのすべてのエラータイプをほぼ排除していますが、時折、人間よりもシーン記述のために異なる画像領域に依存しています(空間依存エラー)。
また,検出,認識,幻覚の誤りがシーン記述精度に最も影響を与えることを示す。
私たちの研究結果は、過去10年間にビジュアル言語モデルがどのように進歩してきたかについて、より徹底的な評価を与えてくれます。
関連論文リスト
- Visual Room 2.0: Seeing is Not Understanding for MLLMs [9.870930749379932]
MLLMの知覚認識アライメントを評価するための階層的ベンチマークであるtextitVisual Room 2.0 を紹介する。
人間の知覚と認知のプロセスは、低、中、高の3段階にわたってモデル化され、17の代表的なタスクをカバーしています。
データセットには350のマルチモーダルサンプルが含まれており、それぞれ6つのプログレッシブな質問(合計2,100件)が認識から認知に分散している。
論文 参考訳(メタデータ) (2025-11-17T03:34:52Z) - ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs [98.27348724529257]
ViCrit (Visual Caption Hallucination Critic) は、VLMを訓練し、人間の手書き画像キャプションの段落に挿入された微妙で合成的な視覚幻覚をローカライズするRLプロキシタスクである。
ViCrit Taskでトレーニングされたモデルは、さまざまなビジョン言語モデルベンチマークで大幅に向上している。
論文 参考訳(メタデータ) (2025-06-11T19:16:54Z) - Do You See Me : A Multidimensional Benchmark for Evaluating Visual Perception in Multimodal LLMs [9.951669153984708]
Do You See Me"は,1,758のイメージと2,612の質問を備えた,スケーラブルなベンチマークである。
人間は96.49%の精度を達成し、トップMLLMは50%以下である。
これは、真に堅牢な視覚知覚を持つMLLMに対して、緊急の必要性を浮き彫りにしている。
論文 参考訳(メタデータ) (2025-05-28T13:31:32Z) - Evaluating Graphical Perception with Multimodal LLMs [2.090547583226381]
マルチモーダル大言語モデル(MLLM)は画像の解析と理解において著しく進歩している。
可視化のために、MLLMはグラフィカルな知覚タスクに適用した場合、どのように機能するか?
本研究は主に、微調整および事前訓練されたモデルとゼロショットを用いて、人間の視覚的知覚と密に一致しているかどうかを判断する。
論文 参考訳(メタデータ) (2025-04-05T16:14:08Z) - Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs [65.93003087656754]
VisFactorは、よく確立された認知心理学評価から20の視覚中心のサブテストをデジタル化するベンチマークである。
GPT、Gemini、Claude、LLaMA、Qwen、SEEDファミリーから20のフロンティアマルチモーダル言語モデル(MLLM)を評価する。
最高のパフォーマンスモデルは100点中25.19点のスコアしか得られず、精神的な回転、空間的関係推論、図形の識別といったタスクに一貫して失敗する。
論文 参考訳(メタデータ) (2025-02-23T04:21:32Z) - Explore the Hallucination on Low-level Perception for MLLMs [83.12180878559295]
低レベルの視覚知覚と理解タスクにおけるMLLMの自己認識性を定義し,評価することを目的としている。
低レベルの視覚に対する人間の反応をシミュレートするベンチマーク設定であるQL-Benchを提案する。
いくつかのモデルでは、ロバストな低レベル視覚能力を示すが、その自己認識性は比較的未発達である。
論文 参考訳(メタデータ) (2024-09-15T14:38:29Z) - What is the Visual Cognition Gap between Humans and Multimodal LLMs? [63.81347276258992]
MLLM(Multimodal Large Language Models)の視覚認知能力を評価し,その性能を人間の視覚認知研究と比較した。
我々の比較実験では、MLLMと人間の知能のギャップが明らかになっている。
我々は,MaRs-VQAとQwen2-VCogベースラインモデルの公開が,人間の視覚認知能力を持つ次世代MLLMに向けて進展をもたらすと考えている。
論文 参考訳(メタデータ) (2024-06-14T22:02:21Z) - OSCaR: Object State Captioning and State Change Representation [52.13461424520107]
本稿では,OSCaR(Object State Captioning and State Change Representation)データセットとベンチマークを紹介する。
OSCaRは14,084の注釈付きビデオセグメントで構成され、様々なエゴセントリックなビデオコレクションから1,000近いユニークなオブジェクトが集められている。
マルチモーダル大言語モデル(MLLM)を評価するための新しいテストベッドを設定する。
論文 参考訳(メタデータ) (2024-02-27T01:48:19Z) - Q-Bench+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs [71.07108539262721]
低レベルの視覚に関連する人間の言語応答をエミュレートするためのベンチマーク設定を設計する。
我々は,MLLMの低レベルの認識関連質問応答と記述評価を,単一画像から画像ペアへ拡張する。
複数のMLLMが単一の画像に対して十分な低レベルの視覚能力を持つことを示したが、GPT-4Vのみが人間よりも高い精度で比較できる。
論文 参考訳(メタデータ) (2024-02-11T06:44:11Z) - Detecting and Preventing Hallucinations in Large Vision Language Models [4.7264116948935975]
M-HalDetectは、詳細な画像記述のための最初のマルチモーダル幻覚検出データセットである。
InstructBLIPから細粒度マルチモーダル報酬モデルを訓練し,その有効性を評価する。
LLaVAとmPLUG-OWLの幻覚をそれぞれ15%と57%低減する。
論文 参考訳(メタデータ) (2023-08-11T21:35:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。