論文の概要: Ontology-Based Contextual AI Evaluations (OB-CAIE) Methodology
- arxiv url: http://arxiv.org/abs/2610.00529v1
- Date: Wed, 30 Sep 2026 18:15:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.690804
- Title: Ontology-Based Contextual AI Evaluations (OB-CAIE) Methodology
- Title(参考訳): オントロジーに基づく文脈AI評価(OB-CAIE)手法
- Abstract要約: OB-CAIEは、テスト対象を明確に定義することで、科学手法の最初のステップに取り組むことで、AI評価の現在の状態を強化する。
OB-CAIE問題空間は1つまたは複数のAI評価に使用できる。
OB-CAIE方法論の重要な利点は、標準的なOB-CAIE方法論の問題空間内で障害点を追跡、視覚化、分析できることである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: The ontology-based contextual AI evaluation (OB-CAIE) methodology was developed to address a lack of scientific rigor that arises from unclear testing coverage, to balance human expertise and automations, and to address a lack of reproducibility of AI evaluation testing environments. OB-CAIE strengthens the current state of AI evaluations by addressing the first step in the scientific method by clearly defining what will be tested. Two ontologies represent the tractable problem space in the OB-CAIE methodology: the Domain-Specific Ontology (DSO) and the Evaluation Process Ontology (EPO). The DSO is the what; the EPO is the how. An OB-CAIE problem space can be used for one or multiple AI evaluations. The OB-CAIE methodology allows for human judgment at specific points, in scientifically grounded ways, and in complex subject areas where human feedback is genuinely irreducible or machine irreplaceable. A key advantage of the OB-CAIE methodology is that failure points can be traced, visualized and analyzed within the canonical OB-CAIE methodology problem space.
- Abstract(参考訳): オントロジーに基づく文脈AI評価(OB-CAIE)方法論は、不明瞭なテストカバレッジから生じる科学的厳密さの欠如、人間の専門知識と自動化のバランス、そしてAI評価テスト環境の再現性の欠如に対処するために開発された。
OB-CAIEは、テスト対象を明確に定義することで、科学手法の最初のステップに取り組むことで、AI評価の現在の状態を強化する。
2つのオントロジーは、OB-CAIE(Domain-Specific Ontology、ドメイン特化オントロジー、Domain-Specific Ontology、Domain-Specific Ontology、DSO)と評価プロセスオントロジー(EPO)である。
DSOとは何か; EPOは方法です。
OB-CAIE問題空間は、1つまたは複数のAI評価に使用できる。
OB-CAIE法は、科学的根拠のある特定の点で、そして人間のフィードバックが真に不可能または機械が不可能な複雑な主題領域において、人間の判断を可能にする。
OB-CAIE方法論の重要な利点は、標準的なOB-CAIE方法論の問題空間内で障害点を追跡、視覚化、分析できることである。
関連論文リスト
- Multi-Dimensional Assessment for AI Cognition (MAAC): A Theoretical Framework for Process-Oriented Cognitive Evaluation of Text-Based AI Systems [1.8262547855491456]
本稿では,テキストベースのAIシステムが生み出すものから,その考え方に移行するためのフレームワークである,多次元AI認知のためのアセスメント(MAAC)を紹介する。
MAACは認知負荷、ツール実行、コンテンツ品質、メモリ統合、複雑性ハンドリング、幻覚制御、知識伝達、処理効率、プロセスアウトカムアライメントの9つの認知的動機付けディメンションを定義している。
5つの理論的分析は、フレームワークのコヒーレンスと経験的テスト容易性の最初のサポートを提供する。
論文 参考訳(メタデータ) (2026-08-01T14:01:17Z) - Position: Explainability Research Must Prioritize Foundations over Ad-hoc Methods [56.14010017381489]
本稿では,機械学習コミュニティが,基礎的・構造的課題に対処するために,アドホックなXAI手法から転換する必要があることを論じる。
我々は、XAIをより人間中心のアクション指向のパラダイムに移行するために設計された実践的なチェックリストを概説する。
論文 参考訳(メタデータ) (2026-06-18T21:46:20Z) - Position: Science of AI Evaluation Requires Item-level Benchmark Data [42.82377343454172]
我々は、AI評価の厳密な科学を確立するためには、アイテムレベルのAIベンチマークデータが不可欠であると主張している。
コミュニティ全体の採用を促進するため、アイテムレベルのベンチマークデータの増大するレポジトリであるOpenEvalを紹介します。
論文 参考訳(メタデータ) (2026-02-27T04:31:30Z) - STRICTA: Structured Reasoning in Critical Text Assessment for Peer Review and Beyond [68.47402386668846]
本研究では,テキストアセスメントをステップワイド推論プロセスとしてモデル化するために,Structured Reasoning In Critical Text Assessment (STRICTA)を導入する。
STRICTAは、因果性理論に基づく相互接続推論ステップのグラフに評価を分解する。
約40人のバイオメディカル専門家が20以上の論文について4000以上の推論ステップのデータセットにSTRICTAを適用した。
論文 参考訳(メタデータ) (2024-09-09T06:55:37Z) - An evidence-based methodology for human rights impact assessment (HRIA) in the development of AI data-intensive systems [49.1574468325115]
我々は、すでに人権がデータ利用の分野で決定を下していることを示している。
本研究は人権影響評価(HRIA)の方法論とモデルである。
提案手法は,具体的ケーススタディで検証し,その有効性と有効性を示す。
論文 参考訳(メタデータ) (2024-07-30T16:27:52Z) - Towards interactive evaluations for interaction harms in human-AI systems [8.989911701384788]
我々は,テキストインタラクションの害に着目したテキストインタラクション倫理に基づく評価へのシフトを提案する。
まず,(1)静的,(2)普遍的なユーザエクスペリエンスを仮定し,(3)構成妥当性を限定した現状評価手法の限界について議論する。
インタラクティブな評価を設計するための実践的原則として, 生態学的に有効な相互作用シナリオ, ヒューマンインパクトメトリクス, 多様な人間参加アプローチなどがあげられる。
論文 参考訳(メタデータ) (2024-05-17T08:49:34Z) - Towards a Comprehensive Human-Centred Evaluation Framework for
Explainable AI [1.7222662622390634]
本稿では,レコメンデータシステムに使用されるユーザ中心評価フレームワークを適用することを提案する。
我々は、説明的側面、説明的特性を要約し、それらの関係を示し、これらの特性を測定する分類指標を統合する。
論文 参考訳(メタデータ) (2023-07-31T09:20:16Z) - Position: AI Evaluation Should Learn from How We Test Humans [65.36614996495983]
人間の評価のための20世紀起源の理論である心理測定は、今日のAI評価における課題に対する強力な解決策になり得る、と我々は主張する。
論文 参考訳(メタデータ) (2023-06-18T09:54:33Z) - The Role of AI in Drug Discovery: Challenges, Opportunities, and
Strategies [97.5153823429076]
この分野でのAIのメリット、課題、欠点についてレビューする。
データ拡張、説明可能なAIの使用、従来の実験手法とAIの統合についても論じている。
論文 参考訳(メタデータ) (2022-12-08T23:23:39Z) - A Human-Centric Assessment Framework for AI [11.065260433086024]
説明可能なAIシステムをどのように評価すべきかに関して合意された基準はない。
チューリングテストに触発されて,人間中心のアセスメントフレームワークを導入する。
このセットアップは、広範囲の人間中心のAIシステムアセスメントのためのフレームワークとして機能する。
論文 参考訳(メタデータ) (2022-05-25T12:59:13Z) - Towards Automatic Evaluation of Dialog Systems: A Model-Free Off-Policy
Evaluation Approach [84.02388020258141]
強化学習におけるオフポリシ評価に基づく人間評価スコア推定のための新しいフレームワークであるENIGMAを提案する。
ENIGMAはいくつかの事前収集された経験データしか必要としないため、評価中にターゲットポリシーとのヒューマンインタラクションは不要である。
実験の結果,ENIGMAは人間の評価スコアと相関して既存手法よりも有意に優れていた。
論文 参考訳(メタデータ) (2021-02-20T03:29:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。