Fugu-MT 論文翻訳(概要): Large-scale Generative AI Models Lack Visual Number Sense

論文の概要: Large-scale Generative AI Models Lack Visual Number Sense

arxiv url: http://arxiv.org/abs/2402.03328v1
Date: Tue, 9 Jan 2024 18:18:32 GMT
ステータス: 翻訳完了
システム内更新日: 2024-02-11 15:54:39.966807
Title: Large-scale Generative AI Models Lack Visual Number Sense
Title（参考訳）: ビジュアルナンバーセンスを欠く大規模生成AIモデル
Authors: Alberto Testolin, Kuinan Hou, Marco Zorzi
Abstract要約: 人間は、数えなくても、視覚的なシーンの物体の数を簡単に判断できる。生成型人工知能(AI)モデルでは、単純な視覚刺激で物体の数を確実に指定できるかどうかを検討した。
参考スコア（独自算出の注目度）: 0.09208007322096533
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Humans can readily judge the number of objects in a visual scene, even without counting, and such a skill has been documented in a variety of animal species and in babies prior to language development and formal schooling. Numerical judgments are error-free for small sets, while for larger collections responses become approximate, with variability increasing proportionally to the target number. This response pattern is observed for items of all kinds, despite variation in object features (such as color or shape), suggesting that our visual number sense relies on abstract representations of numerosity. Here, we investigated whether generative Artificial Intelligence (AI) models based on large-scale transformer architectures can reliably name the number of objects in simple visual stimuli or generate images containing a target number of items in the 1-10 range. Surprisingly, none of the foundation models considered performed in a human-like way: They all made striking errors even with small numbers, the response variability often did not increase in a systematic way, and the pattern of errors varied with object category. Our findings demonstrate that advanced AI systems still lack a basic ability that supports an intuitive understanding of numbers, which in humans is foundational for numeracy and mathematical development.
Abstract（参考訳）: 人間は、数えることなく、視覚シーンの物体の数を容易に判断することができ、そのようなスキルは、言語発達や正式な教育に先立って、様々な動物種や赤ちゃんに記録されている。数値的な判断は小さな集合では誤りのないが、より大きな集合では応答が近似され、変数はターゲット数に比例して増加する。この応答パターンは、オブジェクトの特徴(色や形状など)のばらつきにもかかわらず、あらゆる種類のアイテムで観察され、我々の視覚的な数字感覚は、数字の抽象的な表現に依存していることを示唆している。本稿では,大規模トランスフォーマーアーキテクチャに基づく生成型人工知能(ai)モデルが,単純な視覚刺激でオブジェクト数を確実に命名できるか,あるいは1～10の範囲のターゲット数を含む画像を生成するかを検討した。意外なことに、人間のような方法で実行されたと見なされる基礎モデルは、どれも小さな数であっても衝撃的なエラーを犯し、応答のばらつきはしばしば体系的な方法で増加せず、エラーのパターンはオブジェクトカテゴリによって異なる。我々の研究結果は、高度なAIシステムには数値の直感的な理解を支える基本的な能力がないことを示している。

関連論文リスト

ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs [98.27348724529257]
ViCrit (Visual Caption Hallucination Critic) は、VLMを訓練し、人間の手書き画像キャプションの段落に挿入された微妙で合成的な視覚幻覚をローカライズするRLプロキシタスクである。 ViCrit Taskでトレーニングされたモデルは、さまざまなビジョン言語モデルベンチマークで大幅に向上している。
論文参考訳（メタデータ） (2025-06-11T19:16:54Z)
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models [51.900488744931785]
視覚抽象化のためのAIシステムの能力を評価し改善するためのビジュアルグラフアリーナ(VGA)を導入する。人間はタスク間でほぼ完璧な精度を達成し、モデルは同型検出で完全に失敗し、パス/サイクルタスクにおいて限られた成功を示した。表現不変推論の課題を分離することにより、VGAは、AIビジュアルモデルにおける人間のような概念化に向けた前進を促進するためのフレームワークを提供する。
論文参考訳（メタデータ） (2025-06-06T17:06:25Z)
BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models [2.526146573337397]
眼科診断に触発された新しい評価手法を提案する。合成画像のプロシージャ生成を用いて視覚特性の制御を行う。この診断は、系統的なストレステストときめ細かい故障解析を可能にする。
論文参考訳（メタデータ） (2025-06-05T12:43:10Z)
Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations [61.235500325327585]
既存のAIベンチマークは、主に言語推論を評価し、非言語的で多段階の視覚シミュレーションの複雑さを無視している。 STAREは,マルチモーダルな大規模言語モデルを視覚シミュレーションによりよりよく解いたタスクで厳格に評価するためのベンチマークである。評価の結果,より単純な2次元変換よりもモデルの方が優れているが,より複雑なタスクにおいてランダムに近い確率で実行可能であることがわかった。
論文参考訳（メタデータ） (2025-06-05T05:09:46Z)
Mitigating Low-Level Visual Hallucinations Requires Self-Awareness: Database, Model and Training Strategy [53.07517728420411]
低レベル視覚タスクにおける幻覚に焦点を当てた最初のインストラクションデータベースを提案する。低レベル視覚タスクにおけるモデルの知覚と理解能力を向上させるための自己認識障害除去(SAFEQA)モデルを提案する。低レベルの視覚課題に対する総合的な実験を行い、提案手法がこれらの課題におけるモデルの自己認識を著しく向上し、幻覚を低減させることを示す。
論文参考訳（メタデータ） (2025-03-26T16:05:01Z)
Towards Understanding Graphical Perception in Large Multimodal Models [80.44471730672801]
我々は,グラフにおけるLMMの知覚能力のギャップを分析するための評価フレームワークを開発するために,グラフィカル知覚の理論を利用する。我々は3つのレベル(チャート、ビジュアル要素、ピクセル)における最先端LMMの知覚能力の評価と診断にフレームワークを適用した。
論文参考訳（メタデータ） (2025-03-13T20:13:39Z)
LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models [5.892066196730199]
大規模視覚言語モデル(LVLM)は、タスクの数え上げに苦慮していることが知られている。多数のオブジェクトに対するLVLMのカウント能力を向上する,シンプルで効果的なベースライン手法を提案する。このアプローチの有効性を,さまざまなデータセットやベンチマークで実証する。
論文参考訳（メタデータ） (2024-12-01T05:50:22Z)
Help Me Identify: Is an LLM+VQA System All We Need to Identify Visual Concepts? [62.984473889987605]
本稿では,大規模言語モデルとVQA(Visual Question Answering)システムを活用した,視覚概念学習のためのゼロショットフレームワークを提案する。 VQAシステムに問い合わせ画像とともにこれらの質問を行い、回答を集約し、テスト画像中のオブジェクトの有無を判定する。実験では,既存のゼロショット視覚分類法や少数ショット概念学習手法と同等の性能を示した。
論文参考訳（メタデータ） (2024-10-17T15:16:10Z)
HumanEval-V: Benchmarking High-Level Visual Reasoning with Complex Diagrams in Coding Tasks [25.959032350818795]
人間のアノテーションによるコーディングタスクのベンチマークであるHumanEval-Vを提案する。各タスクは、関数シグネチャとテストケースを組み合わせた、慎重に構築されたダイアグラムを備えている。トップパフォーマンスモデルでさえ、控えめな成功率を実現しています。
論文参考訳（メタデータ） (2024-10-16T09:04:57Z)
Estimating the distribution of numerosity and non-numerical visual magnitudes in natural scenes using computer vision [0.08192907805418582]
自然の視覚的な場面では、異なる数列の出現頻度は、電力法分布に従うことを示す。本研究では, 連続度と数値の相関構造が, データセット, シーンタイプ間で安定であることを示す。
論文参考訳（メタデータ） (2024-09-17T09:49:29Z)
A Sanity Check for AI-generated Image Detection [49.08585395873425]
我々はAI生成画像を検出するAI生成画像検出装置(AI生成画像検出装置)を提案する。 AIDEは最先端の手法を+3.5%、+4.6%改善した。
論文参考訳（メタデータ） (2024-06-27T17:59:49Z)
Evaluating Numerical Reasoning in Text-to-Image Models [16.034479049513582]
難易度が異なる数値推論課題におけるテキスト・ツー・イメージ・モデルの評価を行った。もっとも先進的なモデルでさえ、初歩的な数値スキルしか持たないことを示す。数値推論評価のための新しいベンチマークであるGeckoNumにプロンプト、生成された画像、人間のアノテーションをバンドルする。
論文参考訳（メタデータ） (2024-06-20T22:56:31Z)
Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models [57.42800112251644]
本研究では,画像中の特定の物体の数を誤って識別するモデルを参照しながら,特定の種類の幻覚数幻覚に焦点を当てた。そこで,本研究では,数幻覚を減らすための一貫性向上を目的としたトレーニング手法を考案し,直接微調整法よりも8%の性能向上を図った。
論文参考訳（メタデータ） (2024-03-03T02:31:11Z)
WinoViz: Probing Visual Properties of Objects Under Different States [39.92628807477848]
本稿では,異なる文脈や状態下でのオブジェクトの異種視覚特性に関する言語モデルの推論能力を探索する,1,380の例からなるテキストのみの評価データセットを提案する。我々の課題は、現実的な推論(意図した意味を表現)と視覚的知識推論を必要とするため、難しい。また、タスクを解決するには、複数のステップの推論チェーンを必要とする、より難しいバージョンのマルチホップデータも提示します。
論文参考訳（メタデータ） (2024-02-21T07:31:47Z)
Bongard-HOI: Benchmarking Few-Shot Visual Reasoning for Human-Object Interactions [138.49522643425334]
Bongard-HOIは、自然画像からの人間と物体の相互作用の合成学習に焦点を当てた、新しい視覚的推論ベンチマークである。古典的ボナード問題(BP)の2つの望ましい特徴に着想を得たものである。 Bongard-HOIは、今日の視覚認識モデルに重大な課題を提示している。
論文参考訳（メタデータ） (2022-05-27T07:36:29Z)
NumGLUE: A Suite of Fundamental yet Challenging Mathematical Reasoning Tasks [37.730939229638224]
8つのタスクでAIシステムの性能を評価するベンチマークであるNumGLUEを提案する。このベンチマークは、最先端の大規模言語モデルを含むニューラルモデルで解決されるには程遠い。我々はNumGLUEが言語内で堅牢で一般的な算術推論を行うシステムを促進することを願っている。
論文参考訳（メタデータ） (2022-04-12T09:36:10Z)
Object-Centric Diagnosis of Visual Reasoning [118.36750454795428]
本稿では,地平とロバスト性に基づく視覚的推論の体系的対象中心の診断について述べる。我々は,グラフ推論機械という診断モデルを開発した。本モデルは、純粋に象徴的な視覚的表現を確率的シーングラフに置き換え、教師の強制訓練をビジュアル推論モジュールに適用する。
論文参考訳（メタデータ） (2020-12-21T18:59:28Z)
A Number Sense as an Emergent Property of the Manipulating Brain [16.186932790845937]
本研究では,人間が数量や量を操作する能力を習得し,発達させるメカニズムについて考察する。我々のモデルは、シーン内のオブジェクトの数を推定する能力を得る。我々は,簡単な事前学習作業から,数と量を持つ施設の重要側面を指導して学ぶことができると結論付けた。
論文参考訳（メタデータ） (2020-12-08T00:37:35Z)
A robot that counts like a child: a developmental model of counting and pointing [69.26619423111092]
実物を数えることができる新しい神経ロボティクスモデルを導入する。このモデルにより,エンボディメントと数値認識の相互作用を調べることができる。トレーニングされたモデルは、アイテムのセットをカウントすることができ、同時にそれらを指し示します。
論文参考訳（メタデータ） (2020-08-05T21:06:27Z)
Machine Number Sense: A Dataset of Visual Arithmetic Problems for Abstract and Relational Reasoning [95.18337034090648]
文法モデルを用いて自動生成される視覚的算術問題からなるデータセット、MNS(Machine Number Sense)を提案する。これらの視覚的算術問題は幾何学的フィギュアの形をしている。我々は、この視覚的推論タスクのベースラインとして、4つの主要なニューラルネットワークモデルを用いて、MNSデータセットをベンチマークする。
論文参考訳（メタデータ） (2020-04-25T17:14:58Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。