論文の概要: Large-scale Generative AI Models Lack Visual Number Sense
- arxiv url: http://arxiv.org/abs/2402.03328v1
- Date: Tue, 9 Jan 2024 18:18:32 GMT
- ステータス: 処理完了
- システム内更新日: 2024-02-11 15:54:39.966807
- Title: Large-scale Generative AI Models Lack Visual Number Sense
- Title(参考訳): ビジュアルナンバーセンスを欠く大規模生成AIモデル
- Authors: Alberto Testolin, Kuinan Hou, Marco Zorzi
- Abstract要約: 人間は、数えなくても、視覚的なシーンの物体の数を簡単に判断できる。
生成型人工知能(AI)モデルでは、単純な視覚刺激で物体の数を確実に指定できるかどうかを検討した。
- 参考スコア(独自算出の注目度): 0.09208007322096533
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Humans can readily judge the number of objects in a visual scene, even
without counting, and such a skill has been documented in a variety of animal
species and in babies prior to language development and formal schooling.
Numerical judgments are error-free for small sets, while for larger collections
responses become approximate, with variability increasing proportionally to the
target number. This response pattern is observed for items of all kinds,
despite variation in object features (such as color or shape), suggesting that
our visual number sense relies on abstract representations of numerosity. Here,
we investigated whether generative Artificial Intelligence (AI) models based on
large-scale transformer architectures can reliably name the number of objects
in simple visual stimuli or generate images containing a target number of items
in the 1-10 range. Surprisingly, none of the foundation models considered
performed in a human-like way: They all made striking errors even with small
numbers, the response variability often did not increase in a systematic way,
and the pattern of errors varied with object category. Our findings demonstrate
that advanced AI systems still lack a basic ability that supports an intuitive
understanding of numbers, which in humans is foundational for numeracy and
mathematical development.
- Abstract(参考訳): 人間は、数えることなく、視覚シーンの物体の数を容易に判断することができ、そのようなスキルは、言語発達や正式な教育に先立って、様々な動物種や赤ちゃんに記録されている。
数値的な判断は小さな集合では誤りのないが、より大きな集合では応答が近似され、変数はターゲット数に比例して増加する。
この応答パターンは、オブジェクトの特徴(色や形状など)のばらつきにもかかわらず、あらゆる種類のアイテムで観察され、我々の視覚的な数字感覚は、数字の抽象的な表現に依存していることを示唆している。
本稿では,大規模トランスフォーマーアーキテクチャに基づく生成型人工知能(ai)モデルが,単純な視覚刺激でオブジェクト数を確実に命名できるか,あるいは1~10の範囲のターゲット数を含む画像を生成するかを検討した。
意外なことに、人間のような方法で実行されたと見なされる基礎モデルは、どれも小さな数であっても衝撃的なエラーを犯し、応答のばらつきはしばしば体系的な方法で増加せず、エラーのパターンはオブジェクトカテゴリによって異なる。
我々の研究結果は、高度なAIシステムには数値の直感的な理解を支える基本的な能力がないことを示している。
関連論文リスト
- Help Me Identify: Is an LLM+VQA System All We Need to Identify Visual Concepts? [62.984473889987605]
本稿では,大規模言語モデルとVQA(Visual Question Answering)システムを活用した,視覚概念学習のためのゼロショットフレームワークを提案する。
VQAシステムに問い合わせ画像とともにこれらの質問を行い、回答を集約し、テスト画像中のオブジェクトの有無を判定する。
実験では,既存のゼロショット視覚分類法や少数ショット概念学習手法と同等の性能を示した。
論文 参考訳(メタデータ) (2024-10-17T15:16:10Z) - Estimating the distribution of numerosity and non-numerical visual magnitudes in natural scenes using computer vision [0.08192907805418582]
自然の視覚的な場面では、異なる数列の出現頻度は、電力法分布に従うことを示す。
本研究では, 連続度と数値の相関構造が, データセット, シーンタイプ間で安定であることを示す。
論文 参考訳(メタデータ) (2024-09-17T09:49:29Z) - Evaluating Numerical Reasoning in Text-to-Image Models [16.034479049513582]
難易度が異なる数値推論課題におけるテキスト・ツー・イメージ・モデルの評価を行った。
もっとも先進的なモデルでさえ、初歩的な数値スキルしか持たないことを示す。
数値推論評価のための新しいベンチマークであるGeckoNumにプロンプト、生成された画像、人間のアノテーションをバンドルする。
論文 参考訳(メタデータ) (2024-06-20T22:56:31Z) - Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models [57.42800112251644]
本研究では,画像中の特定の物体の数を誤って識別するモデルを参照しながら,特定の種類の幻覚数幻覚に焦点を当てた。
そこで,本研究では,数幻覚を減らすための一貫性向上を目的としたトレーニング手法を考案し,直接微調整法よりも8%の性能向上を図った。
論文 参考訳(メタデータ) (2024-03-03T02:31:11Z) - WinoViz: Probing Visual Properties of Objects Under Different States [39.92628807477848]
本稿では,異なる文脈や状態下でのオブジェクトの異種視覚特性に関する言語モデルの推論能力を探索する,1,380の例からなるテキストのみの評価データセットを提案する。
我々の課題は、現実的な推論(意図した意味を表現)と視覚的知識推論を必要とするため、難しい。
また、タスクを解決するには、複数のステップの推論チェーンを必要とする、より難しいバージョンのマルチホップデータも提示します。
論文 参考訳(メタデータ) (2024-02-21T07:31:47Z) - Bongard-HOI: Benchmarking Few-Shot Visual Reasoning for Human-Object
Interactions [138.49522643425334]
Bongard-HOIは、自然画像からの人間と物体の相互作用の合成学習に焦点を当てた、新しい視覚的推論ベンチマークである。
古典的ボナード問題(BP)の2つの望ましい特徴に着想を得たものである。
Bongard-HOIは、今日の視覚認識モデルに重大な課題を提示している。
論文 参考訳(メタデータ) (2022-05-27T07:36:29Z) - Object-Centric Diagnosis of Visual Reasoning [118.36750454795428]
本稿では,地平とロバスト性に基づく視覚的推論の体系的対象中心の診断について述べる。
我々は,グラフ推論機械という診断モデルを開発した。
本モデルは、純粋に象徴的な視覚的表現を確率的シーングラフに置き換え、教師の強制訓練をビジュアル推論モジュールに適用する。
論文 参考訳(メタデータ) (2020-12-21T18:59:28Z) - A Number Sense as an Emergent Property of the Manipulating Brain [16.186932790845937]
本研究では,人間が数量や量を操作する能力を習得し,発達させるメカニズムについて考察する。
我々のモデルは、シーン内のオブジェクトの数を推定する能力を得る。
我々は,簡単な事前学習作業から,数と量を持つ施設の重要側面を指導して学ぶことができると結論付けた。
論文 参考訳(メタデータ) (2020-12-08T00:37:35Z) - A robot that counts like a child: a developmental model of counting and
pointing [69.26619423111092]
実物を数えることができる新しい神経ロボティクスモデルを導入する。
このモデルにより,エンボディメントと数値認識の相互作用を調べることができる。
トレーニングされたモデルは、アイテムのセットをカウントすることができ、同時にそれらを指し示します。
論文 参考訳(メタデータ) (2020-08-05T21:06:27Z) - Machine Number Sense: A Dataset of Visual Arithmetic Problems for
Abstract and Relational Reasoning [95.18337034090648]
文法モデルを用いて自動生成される視覚的算術問題からなるデータセット、MNS(Machine Number Sense)を提案する。
これらの視覚的算術問題は幾何学的フィギュアの形をしている。
我々は、この視覚的推論タスクのベースラインとして、4つの主要なニューラルネットワークモデルを用いて、MNSデータセットをベンチマークする。
論文 参考訳(メタデータ) (2020-04-25T17:14:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。