論文の概要: Psychological Competence as a Missing Dimension in AI Evaluation
- arxiv url: http://arxiv.org/abs/2607.08285v1
- Date: Thu, 09 Jul 2026 09:29:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.491008
- Title: Psychological Competence as a Missing Dimension in AI Evaluation
- Title(参考訳): AI評価におけるミス・ディメンジョンとしての心理学的能力
- Abstract要約: 本稿では,AI評価における心理学的能力の欠如について紹介する。
心理学的能力とその中核領域の概念的枠組みを概説する。
我々は、心理的能力がモデル提供者、組織、研究者、規制機関にとって中核となるべきだと論じている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current AI evaluation frameworks focus primarily on technical performance, including accuracy, robustness, reasoning ability, and policy compliance. These measures remain essential, but they are not sufficient for systems that interact directly with users through natural language. Human-facing AI systems are increasingly used as advisors, coaches, tutors, and companions. In these roles, their responses can shape how users reason, interpret emotions, form beliefs, calibrate trust, and make decisions. The relevant unit of evaluation is therefore not only the model, but the human-AI interaction. This paper introduces psychological competence as a missing dimension in AI evaluation. We define psychological competence as the capacity of a human-facing AI system to support user cognition, emotional interpretation, and behavioral decision-making in ways that are appropriate to the user, context, and purpose of the interaction. This includes interaction properties such as framing, tone, perceived authority, responsiveness, uncertainty handling, and conversational guidance. Existing evaluation approaches capture parts of this problem but rarely assess these psychological effects directly. Drawing on behavioral science and human-AI interaction research, we outline a conceptual framework for psychological competence and its core domains. Rather than proposing a specific benchmark, we define the construct, clarify its boundaries, and describe how it may be assessed through scenario-based probes, structured human evaluation, and model-assisted evaluation methods. We argue that psychological competence should become a core consideration for model providers, deploying organizations, researchers, and regulators concerned with the real-world effects of human-facing AI systems.
- Abstract(参考訳): 現在のAI評価フレームワークは主に、正確性、堅牢性、推論能力、ポリシーコンプライアンスなど、技術的パフォーマンスに重点を置いている。
これらの措置は依然として不可欠であるが、自然言語を介してユーザーと直接対話するシステムには不十分である。
人間向けAIシステムは、アドバイザー、コーチ、家庭教師、コンパニオンとしてますます利用されている。
これらの役割において、彼らの反応は、ユーザーの理性、感情の解釈、信念の形成、信頼の校正、意思決定の仕方を形成することができる。
したがって、関連する評価単位はモデルだけでなく、人間とAIの相互作用である。
本稿では,AI評価における心理学的能力の欠如について紹介する。
心理能力は,ユーザ認知,情緒的解釈,行動決定を支援する,人間の対面AIシステムの能力として定義する。
これには、フレーミング、トーン、認識された権威、応答性、不確実性処理、会話指導などの相互作用特性が含まれる。
既存の評価手法はこの問題の一部を捉えているが、これらの心理的影響を直接的に評価することは滅多にない。
行動科学と人間-AIインタラクション研究に基づいて,心理学的能力とその中核領域の概念的枠組みを概説する。
特定のベンチマークを提案するのではなく、構成を定義し、その境界を明確にし、シナリオベースのプローブ、構造化された人的評価、モデル支援評価方法を通じてどのように評価されるかを記述する。
心理学的能力は、モデル提供者、組織、研究者、規制機関を配置し、人間が直面するAIシステムの現実的な影響に関する中核的な考慮となるべきだ、と我々は主張する。
関連論文リスト
- AI Should Not Only Be Helpful. It Should Be Contingent. Artificial Intimacy, Sycophancy, and the Future of Social Learning [0.3906427348768226]
我々は、AIシステムはユーザーの満足度だけでなく、人間の社会的学習への影響によって評価されるべきであると主張している。
我々は、軌道に基づく評価や社会的帰結予測のモデルを含む、随伴AIのためのフレームワークの概要を述べる。
論文 参考訳(メタデータ) (2026-08-31T18:23:14Z) - Measuring What AI Systems Might Do: Towards A Measurement Science in AI [19.687397197326817]
能力、妥当性、スキル、価値、能力は、常に相互に使用され、観測可能なパフォーマンスと混同されます。
我々は、能力と妥当性は、反事実関係によって特徴づけられるシステムの安定した特徴である配置特性であると主張する。
論文 参考訳(メタデータ) (2026-02-10T12:59:41Z) - Responsible Evaluation of AI for Mental Health [72.85175110624736]
メンタルヘルスケアにおけるAIツールの評価に対する現在のアプローチは、断片化されており、臨床実践、社会的コンテキスト、ファーストハンドのユーザエクスペリエンスと不整合である。
本稿では,臨床の健全性,社会的文脈,公平性を統合した学際的枠組みを導入することにより,責任ある評価を再考する。
論文 参考訳(メタデータ) (2026-01-20T12:55:10Z) - Human-centred test and evaluation of military AI [0.0]
REAIM 2024 Blueprint for Actionは、軍事領域におけるAIアプリケーションは倫理的かつ人間中心であるべきだと述べている。
AIシステムの開発と展開におけるTEVVは、ライフサイクルを通して人間のユーザを巻き込む必要がある。
従来の人間中心のテストと評価方法は、デプロイされたAIシステムに適応する必要がある。
論文 参考訳(メタデータ) (2024-12-02T21:14:55Z) - Aligning Generalisation Between Humans and Machines [74.120848518198]
AI技術は、科学的発見と意思決定において人間を支援することができるが、民主主義と個人を妨害することもある。
AIの責任ある使用と人間-AIチームへの参加は、AIアライメントの必要性をますます示している。
これらの相互作用の重要かつしばしば見落とされがちな側面は、人間と機械が一般化する異なる方法である。
論文 参考訳(メタデータ) (2024-11-23T18:36:07Z) - How Performance Pressure Influences AI-Assisted Decision Making [52.997197698288936]
我々は、プレッシャーと説明可能なAI(XAI)技術がAIアドバイステイク行動とどのように相互作用するかを示す。
我々の結果は、圧力とXAIの異なる組み合わせで複雑な相互作用効果を示し、AIアドバイスの行動を改善するか、悪化させるかのどちらかを示す。
論文 参考訳(メタデータ) (2024-10-21T22:39:52Z) - Combining AI Control Systems and Human Decision Support via Robustness and Criticality [53.10194953873209]
我々は、逆説(AE)の方法論を最先端の強化学習フレームワークに拡張する。
学習したAI制御システムは、敵のタンパリングに対する堅牢性を示す。
トレーニング/学習フレームワークでは、この技術は人間のインタラクションを通じてAIの決定と説明の両方を改善することができる。
論文 参考訳(メタデータ) (2024-07-03T15:38:57Z) - ConSiDERS-The-Human Evaluation Framework: Rethinking Human Evaluation for Generative Large Language Models [53.00812898384698]
生成型大規模言語モデル(LLM)の人間による評価は多分野にわたる作業であるべきだと論じる。
認知バイアスが、流動的な情報や真理をいかに説明するか、そして、認識の不確実性が、Likertのような評価スコアの信頼性にどのように影響するかを強調します。
本稿では,ConSiDERS-The-Human評価フレームワークを提案する。一貫性,スコーリング基準,差別化,ユーザエクスペリエンス,責任,スケーラビリティの6つの柱からなる。
論文 参考訳(メタデータ) (2024-05-28T22:45:28Z) - Towards interactive evaluations for interaction harms in human-AI systems [8.989911701384788]
我々は,テキストインタラクションの害に着目したテキストインタラクション倫理に基づく評価へのシフトを提案する。
まず,(1)静的,(2)普遍的なユーザエクスペリエンスを仮定し,(3)構成妥当性を限定した現状評価手法の限界について議論する。
インタラクティブな評価を設計するための実践的原則として, 生態学的に有効な相互作用シナリオ, ヒューマンインパクトメトリクス, 多様な人間参加アプローチなどがあげられる。
論文 参考訳(メタデータ) (2024-05-17T08:49:34Z) - AGENT: A Benchmark for Core Psychological Reasoning [60.35621718321559]
直観心理学は、観察可能な行動を駆動する隠された精神変数を推論する能力です。
他のエージェントを推論する機械エージェントに対する近年の関心にもかかわらず、そのようなエージェントが人間の推論を駆動するコア心理学の原則を学ぶか保持するかは明らかではない。
本稿では,プロシージャが生成する3dアニメーション,エージェントを4つのシナリオで構成したベンチマークを提案する。
論文 参考訳(メタデータ) (2021-02-24T14:58:23Z) - How to Answer Why -- Evaluating the Explanations of AI Through Mental
Model Analysis [0.0]
人間中心のAI研究の鍵となる疑問は、ユーザーのメンタルモデルをどのように有効に調査するかである。
実験的な研究手法としてメンタルモデルが適切かどうかを評価する。
本稿では、人間中心の方法で説明可能なAIアプローチを評価するための模範的手法を提案する。
論文 参考訳(メタデータ) (2020-01-11T17:15:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。