論文の概要: Multi-Dimensional Assessment for AI Cognition (MAAC): A Theoretical Framework for Process-Oriented Cognitive Evaluation of Text-Based AI Systems
- arxiv url: http://arxiv.org/abs/2608.00680v1
- Date: Sat, 01 Aug 2026 14:01:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.864412
- Title: Multi-Dimensional Assessment for AI Cognition (MAAC): A Theoretical Framework for Process-Oriented Cognitive Evaluation of Text-Based AI Systems
- Title(参考訳): AI認知のための多次元アセスメント : テキストベースAIシステムのプロセス指向認知評価のための理論的枠組み
- Abstract要約: 本稿では,テキストベースのAIシステムが生み出すものから,その考え方に移行するためのフレームワークである,多次元AI認知のためのアセスメント(MAAC)を紹介する。
MAACは認知負荷、ツール実行、コンテンツ品質、メモリ統合、複雑性ハンドリング、幻覚制御、知識伝達、処理効率、プロセスアウトカムアライメントの9つの認知的動機付けディメンションを定義している。
5つの理論的分析は、フレームワークのコヒーレンスと経験的テスト容易性の最初のサポートを提供する。
- 参考スコア(独自算出の注目度): 1.8262547855491456
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Evaluating artificial intelligence systems has historically relied on outcome-based benchmarks that measure task accuracy, robustness, or fairness. While indispensable, these benchmarks provide limited diagnostic insight into the underlying cognitive processes that generate performance-leaving critical questions unanswered about how AI systems reason, integrate memory, manage complexity, or avoid generating false information. This paper introduces the Multi-Dimensional Assessment for AI Cognition (MAAC), a theoretically grounded framework for shifting evaluation from what text-based AI systems produce to how they think. MAAC defines nine cognitively motivated dimensions: Cognitive Load, Tool Execution, Content Quality, Memory Integration, Complexity Handling, Hallucination Control, Knowledge Transfer, Processing Efficiency, and Process-Outcome Alignment. Each dimension is grounded in established cognitive science theory-drawing on Marr's tri-level hypothesis, Baddeley's working memory model, Sweller's cognitive load theory, and unified theories of cognition. Five theoretical analyses provide initial support for the framework's coherence and empirical testability: dimension-to-theory mapping; a coverage matrix assessing breadth and non-redundancy; a formal gap analysis relative to current evaluation practice; a worked diagnostic illustration; and a set of a priori interdependency predictions for future empirical testing. MAAC provides a theoretical and operational framework for principled process-level cognitive assessment of text-based AI systems, complementing existing outcome-based benchmarks with cognitively grounded, multi-dimensional evaluation.
- Abstract(参考訳): 人工知能システムの評価は歴史的に、タスクの正確性、堅牢性、公正性を測定する結果ベースのベンチマークに依存してきた。
これらのベンチマークは必須だが、AIシステムがどのように推論するか、メモリの統合、複雑さの管理、偽情報の生成を回避しているか、といった、パフォーマンスを犠牲にする重要な疑問を生じさせる、基礎となる認知プロセスに関する限られた診断洞察を提供する。
本稿では,テキストベースのAIシステムが生み出すものから,その考え方に移行するための理論的基盤となる,AI認知のための多次元アセスメント(MAAC)について紹介する。
MAACは認知負荷、ツール実行、コンテンツ品質、メモリ統合、複雑性ハンドリング、幻覚制御、知識伝達、処理効率、プロセスアウトカムアライメントの9つの認知的動機付けディメンションを定義している。
各次元は、マーの三レベル仮説、バドレーのワーキングメモリモデル、スワラーの認知負荷理論、認知の統一理論に基づいて確立された認知科学理論に基礎を置いている。
5つの理論的分析は、フレームワークのコヒーレンスと経験的テスト容易性に対する初期サポートを提供する:次元から理論へのマッピング、幅と非冗長性を評価するカバレッジマトリックス、現在の評価プラクティスに対する形式的ギャップ分析、機能的な診断図、将来の経験的テストのための優先順位相互依存性予測のセットである。
MAACは、テキストベースのAIシステムの原則化されたプロセスレベルの認知評価のための理論的かつ運用的なフレームワークを提供する。
関連論文リスト
- Beyond ID Embeddings: Process-Grounded Language Modeling for Cognitive Diagnosis [77.02066500576528]
プロセス認識言語認知診断(PLCD)フレームワークは、言語から派生した構造を認知の先行点として使用し、学生の後方状態を校正するための応答記録を使用する。
PLCDは、学生のパフォーマンス予測において従来のベースラインを上回るだけでなく、認知伝達能力も高い。
論文 参考訳(メタデータ) (2026-09-11T03:51:20Z) - A Survey of Reasoning in Autonomous Driving Systems: Open Challenges and Emerging Paradigms [49.66022971508878]
私たちは、推論はモジュラーコンポーネントからシステムの認知コアに高めるべきだと論じています。
応答性推論のトレードオフやソーシャルゲーム推論など,7つの中核的推論課題を導出し,体系化する。
我々は,LLMに基づく推論と,ミリ秒スケールで安全クリティカルな車両制御の要求との間の,高レイテンシ,熟考的特性の根本的かつ未解決な緊張関係を同定する。
論文 参考訳(メタデータ) (2026-03-11T07:40:53Z) - Measuring What AI Systems Might Do: Towards A Measurement Science in AI [19.687397197326817]
能力、妥当性、スキル、価値、能力は、常に相互に使用され、観測可能なパフォーマンスと混同されます。
我々は、能力と妥当性は、反事実関係によって特徴づけられるシステムの安定した特徴である配置特性であると主張する。
論文 参考訳(メタデータ) (2026-02-10T12:59:41Z) - Theory Trace Card: Theory-Driven Socio-Cognitive Evaluation of LLMs [2.98033672654447]
多くの社会的認知的評価は、目標能力の明確な理論的な仕様なしで進行していると論じる。
この理論的な根拠がなければ、能力の狭い部分集合のみを行使するベンチマークは、広範能力の証拠として日常的に誤解される。
本稿では,社会認知評価に付随する軽量なドキュメントアーティファクトであるTrace Cardを紹介する。
論文 参考訳(メタデータ) (2026-01-05T08:06:50Z) - The Vibe-Check Protocol: Quantifying Cognitive Offloading in AI Programming [5.584060970507507]
Vibe Coding'は、開発者が自然言語を通じてハイレベルな意図を明確に表現し、AIエージェントに実装を委譲するパラダイムである。
本稿では,ソフトウェア工学の学習方法としてテキストIs Vibe Codingが優れているか,という研究課題を解明するための理論的枠組みを提案する。
論文 参考訳(メタデータ) (2026-01-02T06:13:41Z) - The Artificial Intelligence Cognitive Examination: A Survey on the Evolution of Multimodal Evaluation from Recognition to Reasoning [0.0]
この分野は、単純な認識タスクから複雑な推論ベンチマークに移行する、パラダイムシフトが進行中である、と我々は主張する。
ImageNet時代の基礎的な"知識テスト"から、"応用ロジックと理解"テストまでの道程をグラフ化します。
我々は、抽象的、創造的、社会的知性を評価するために、未知の領域を探索する。
論文 参考訳(メタデータ) (2025-10-05T10:41:22Z) - The next question after Turing's question: Introducing the Grow-AI test [51.56484100374058]
本研究は,GROW-AIと呼ばれる人工知能評価の枠組みを拡張することを目的としている。
GROW-AIは、チューリングテストの自然な後継者である"Can Machine grow up?
この作品の独創性は、人間の世界から人工知能への「成長」過程の概念的な変換にある。
論文 参考訳(メタデータ) (2025-08-22T10:19:42Z) - Machine vs Machine: Using AI to Tackle Generative AI Threats in Assessment [0.0]
本稿では、高等教育評価において、生成人工知能(AI)がもたらす課題に対処するための理論的枠組みを提案する。
GPT-4、Claude、Llamaのような大規模な言語モデルは、洗練された学術コンテンツを作成する能力をますます示している。
調査によると、学生の74-92%が学術目的でこれらのツールを実験している。
論文 参考訳(メタデータ) (2025-05-31T22:29:43Z) - Two Experts Are All You Need for Steering Thinking: Reinforcing Cognitive Effort in MoE Reasoning Models Without Additional Training [86.70255651945602]
我々はReinforcecing Cognitive Experts(RICE)と呼ばれる新しい推論時ステアリング手法を導入する。
RICEは、追加のトレーニングや複雑化なしに推論のパフォーマンスを改善することを目的としている。
先行する MoE ベースの LRM を用いた経験的評価は、推論精度、認知効率、ドメイン間の一般化において顕著で一貫した改善を示す。
論文 参考訳(メタデータ) (2025-05-20T17:59:16Z) - How Metacognitive Architectures Remember Their Own Thoughts: A Systematic Review [16.35521789216079]
メタ認知は、人工エージェントの自律性と適応性を高める可能性に大きな注目を集めている。
既存の概要は、基礎となるアルゴリズム、表現、そしてそれぞれの成功に気付かない概念レベルに留まっている。
論文 参考訳(メタデータ) (2025-02-28T08:48:41Z) - A Unified Framework for Evaluating the Effectiveness and Enhancing the Transparency of Explainable AI Methods in Real-World Applications [2.0681376988193843]
本研究では,XAIの単一評価フレームワークについて紹介する。
数字とユーザフィードバックの両方を使って、説明が正しいか、理解しやすく、公平で、完全で、信頼できるかをチェックする。
我々は、医療、金融、農業、自動運転システムにおけるケーススタディを通じて、この枠組みの価値を示す。
論文 参考訳(メタデータ) (2024-12-05T05:30:10Z) - Neural Causal Models for Counterfactual Identification and Estimation [62.30444687707919]
本稿では,ニューラルモデルによる反事実文の評価について検討する。
まず、神経因果モデル(NCM)が十分に表現可能であることを示す。
第2に,反事実分布の同時同定と推定を行うアルゴリズムを開発する。
論文 参考訳(メタデータ) (2022-09-30T18:29:09Z) - Neuro-symbolic Architectures for Context Understanding [59.899606495602406]
本稿では,データ駆動型アプローチと知識駆動型アプローチの強みを組み合わせたフレームワークとして,ハイブリッドAI手法を提案する。
具体的には、知識ベースを用いて深層ニューラルネットワークの学習過程を導く方法として、ニューロシンボリズムの概念を継承する。
論文 参考訳(メタデータ) (2020-03-09T15:04:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。