論文の概要: Bringing Back Rule Induction to Fluid Intelligence Research? An Initial Validation of the ARC-AGI Benchmark in Humans
- arxiv url: http://arxiv.org/abs/2607.11263v2
- Date: Tue, 14 Jul 2026 17:47:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 14:59:31.862118
- Title: Bringing Back Rule Induction to Fluid Intelligence Research? An Initial Validation of the ARC-AGI Benchmark in Humans
- Title(参考訳): 流体インテリジェンス研究にルール誘導をもたらすか? : ARC-AGIベンチマークの初期検証
- Abstract要約: 流体インテリジェンス(gf)対策に関する2つの競合する見解は、動作記憶能力または新しい関係を誘導する能力によって性能が制約されることを示唆している。
ARC-AGIベンチマークは主にルール誘導を必要とし、人間と人工両方のgfの尺度として提案された。
ARC-AGIの心理的特徴とノモロジカルネットワークについて,100名を対象に検討した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Two competing perspectives on fluid intelligence (gf) measures propose that performance is primarily constrained either by working memory capacity or by the ability to induce novel relations. The first perspective is currently dominant in measurement, as evident from the use of a limited set of recurring rules, whereas the second perspective is reflected in many definitions but rarely present in measurement. The ARC-AGI benchmark predominantly requires rule induction and was proposed as a measure of gf for both humans and artificial systems. However, its psychometric properties have not yet been examined in human samples. We therefore investigated the psychometric characteristics and nomological network of ARC-AGI in a first study with 100 participants. A compilation of ARC-AGI items showed good psychometric properties and correlated substantially with figural fluid intelligence as measured by a figural reasoning test (ρ= .63). Associations with figural originality were weak. These findings provide initial support for the validity of ARC-AGI as a measure of human fluid intelligence. Future research should include more rule induction tasks as well as additional multivariate covariates. This study is unusual by studying a task in humans that was initially designed for machines. We suggest systematically embedding AI benchmarks into the nomological network of human cognitive abilities to enable more systematic evaluation and interdisciplinary cooperation.
- Abstract(参考訳): 流体インテリジェンス(gf)対策に関する2つの競合する見解は、性能が主に作業記憶能力または新しい関係を誘導する能力によって制約されていることを示唆している。
第1の視点は現在測定において支配的であり、制限された反復規則の使用から明らかであるが、第2の視点は多くの定義で反映されているが、測定にはほとんど存在しない。
ARC-AGIベンチマークは主にルール誘導を必要とし、人間と人工両方のgfの尺度として提案された。
しかし、その心理測定特性はまだヒトのサンプルでは研究されていない。
そこで,100名を対象に,ARC-AGIの心理的特徴とノモロジカルネットワークについて検討した。
ARC-AGI項目のコンパイルは、優れた心理測定特性を示し、フィギュア推論テスト(ρ=.63)によって測定されたフィギュア流体インテリジェンスと大きく相関した。
フィギュアの独創性との関係は弱かった。
これらの知見は,人間の流体知能の指標としてARC-AGIの有効性を最初に支持するものである。
今後の研究には、より多くのルール誘導タスクと追加の多変量共変量を含むべきである。
この研究は、当初機械用に設計された人間のタスクを研究することで珍しい。
我々は、より体系的な評価と学際的な協力を可能にするために、AIベンチマークを人間の認知能力のノモロジーネットワークに体系的に組み込むことを提案する。
関連論文リスト
- Uneven Evolution of Cognition Across Generations of Generative AI Models [13.772329509422201]
人工知能の追求には、狭いタスク性能を超えるモデルの認知能力を評価するための堅牢な手法が必要である。
本稿では、生成AIの認知的プロファイルを評価し、それらを人間の規範と比較し、世代間での進化を追跡するための心理測定フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-07T18:16:49Z) - Probing the "Psyche'' of Large Reasoning Models: Understanding Through a Human Lens [28.277723085755806]
大規模推論モデル(LRM)は、複雑なタスクに対処する際、例外的な能力のため、研究者から大きな注目を集めている。
本稿では、原子推論のステップを特徴付け、LEM知能の「精神」を調査するための包括的分類法を提案する。
人間の精神過程から派生した5つのグループと17のカテゴリから構成されており、学際的な観点からのLRMの理解の基礎となっている。
論文 参考訳(メタデータ) (2025-11-30T04:49:44Z) - A Definition of AGI [208.25193480759026]
人工知能の具体的な定義の欠如は、今日の専門的なAIと人間レベルの認知のギャップを曖昧にしている。
そこで本研究では,AGIを認知的多目的性と熟達度に適合するものとして,これに対応するための定量的枠組みを提案する。
論文 参考訳(メタデータ) (2025-10-21T01:28:35Z) - The next question after Turing's question: Introducing the Grow-AI test [51.56484100374058]
本研究は,GROW-AIと呼ばれる人工知能評価の枠組みを拡張することを目的としている。
GROW-AIは、チューリングテストの自然な後継者である"Can Machine grow up?
この作品の独創性は、人間の世界から人工知能への「成長」過程の概念的な変換にある。
論文 参考訳(メタデータ) (2025-08-22T10:19:42Z) - Stop Evaluating AI with Human Tests, Develop Principled, AI-specific Tests instead [2.809966405091883]
我々は、ベンチマークのパフォーマンスを人間のような特性の測定として解釈することは、十分な理論的、実証的な正当化を欠いていると論じる。
私たちは、AIシステムに適した、原則化されたAI固有の評価フレームワークの開発を呼びかけます。
論文 参考訳(メタデータ) (2025-07-30T18:14:35Z) - ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems [0.03431023404301193]
ARC-AGI-2は、前者の入出力ペアタスクフォーマットを保持し、研究者の連続性を保証する。
それは、抽象的推論と問題解決能力を評価するために特別に設計された、新しくキュレーションされ拡張された一連のタスクを含んでいる。
ARC-AGI-2は、より汎用的で人間らしいAI能力への進歩を厳格に測定するための次世代ツールとして機能することを目指している。
論文 参考訳(メタデータ) (2025-05-17T04:34:48Z) - Evaluating General-Purpose AI with Psychometrics [43.85432514910491]
本稿では,大規模言語モデルなどの汎用AIシステムの包括的かつ正確な評価の必要性について論じる。
現在の評価手法は、主に特定のタスクのベンチマークに基づいており、これらの汎用AIシステムを適切に評価するには不十分である。
これらの課題に対処するため,タスク指向評価から構成指向評価への移行を提案する。
論文 参考訳(メタデータ) (2023-10-25T05:38:38Z) - Self-Emotion-Mediated Exploration in Artificial Intelligence Mirrors: Findings from Cognitive Psychology [0.08739101659113153]
本研究は,本質的な探索駆動を実現するための,人工エージェントの学習フレームワークを提案する。
データ分析は、人間の心理学的な研究に従って、プライドまたはサプライズを規定する。
結果: 国家と探検の因果関係はエージェントの大多数によって実証される。
論文 参考訳(メタデータ) (2023-02-13T18:20:44Z) - ACP++: Action Co-occurrence Priors for Human-Object Interaction
Detection [102.9428507180728]
ヒューマン・オブジェクト・インタラクション(HOI)検出のタスクにおける一般的な問題は、多数のHOIクラスが少数のラベル付き例しか持たないことである。
我々は、人間と物体の相互作用の間に自然の相関関係と反相関が存在することを観察した。
我々は、これらの先行知識を学習し、特に稀なクラスにおいて、より効果的な訓練に活用する手法を提案する。
論文 参考訳(メタデータ) (2021-09-09T06:02:50Z) - ACRE: Abstract Causal REasoning Beyond Covariation [90.99059920286484]
因果誘導における現在の視覚システムの系統的評価のための抽象因果分析データセットについて紹介する。
Blicket実験における因果発見の研究の流れに触発され、独立シナリオと介入シナリオのいずれにおいても、以下の4種類の質問で視覚的推論システムに問い合わせる。
純粋なニューラルモデルは確率レベルのパフォーマンスの下で連想戦略に向かう傾向があるのに対し、ニューロシンボリックな組み合わせは後方ブロッキングの推論に苦しむ。
論文 参考訳(メタデータ) (2021-03-26T02:42:38Z) - Detecting Human-Object Interactions with Action Co-occurrence Priors [108.31956827512376]
人-物間相互作用(HOI)検出タスクにおける一般的な問題は、多数のHOIクラスが少数のラベル付き例しか持たないことである。
我々は、人間と物体の相互作用の間に自然の相関と反相関が存在することを観察した。
我々はこれらの先行知識を学習し、特に稀なクラスにおいてより効果的な訓練に活用する手法を提案する。
論文 参考訳(メタデータ) (2020-07-17T02:47:45Z) - Machine Common Sense [77.34726150561087]
機械の常識は、人工知能(AI)において広範で潜在的に無拘束な問題のままである
本稿では、対人インタラクションのようなドメインに焦点を当てたコモンセンス推論のモデル化の側面について論じる。
論文 参考訳(メタデータ) (2020-06-15T13:59:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。