論文の概要: Quality Action Assurance: Multimodal Verification of Examiner Claims in VR OSCEs
- arxiv url: http://arxiv.org/abs/2607.19063v2
- Date: Mon, 27 Jul 2026 13:38:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 14:56:47.027835
- Title: Quality Action Assurance: Multimodal Verification of Examiner Claims in VR OSCEs
- Title(参考訳): 品質行動保証:VR OSCEにおけるエキシマクレームのマルチモーダル検証
- Abstract要約: 本稿では,VR(Virtual Reality)小児OSCEにおける検査者の主張を検証するフレームワークであるQuality Action Assurance(QAA)を紹介する。
QAAは、ビデオ、VRログ、アクターデータから構築されたイベントの真のシーケンスに対して、検査官が主張するアクションを比較する。
全体として、QAAは69.9%の精度と76.7%のリコールで検査者の誤りを検出し、事実の正しさを39.2%から79.2%に改善した。
- 参考スコア(独自算出の注目度): 0.13054218846965873
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Objective Structured Clinical Examinations (OSCEs) are the gold standard for assessing clinical competence, yet scoring remains vulnerable to examiner subjectivity, fatigue, and cognitive bias. Standard examiner validation via inter-rater statistics lacks explanatory power regarding the source of errors, as it neither analyzes examiner reasoning nor verifies examiner claims against actual events. Thus, we introduce Quality Action Assurance (QAA), a multimodal framework that verifies examiner claims in Virtual Reality (VR) pediatric OSCEs by comparing actions claimed by examiners against the true sequence of events, constructed from video, VR logs, and actor data. QAA combines a constrained temporal action alignment model, which performs action localization and actor source attribution, with a large language model that extracts examiner claims and checks them against the record. Across a 5-fold cross-validation, QAA achieves 99.2% $\pm$ 0.7% Actor F1 and 93.4% $\pm$ 1.9% W@16 for temporal alignment. Overall, QAA detects examiner errors with 69.9% precision and 76.7% recall, improving factual correctness from 39.2% to 79.2%, enabling fairer OSCE assessment.
- Abstract(参考訳): 客観的構造的臨床検査(英: Objective Structured Clinical Examinations、OSCE)は、臨床能力を評価するための金の基準である。
検視官の標準検証は、検視官の推論を分析したり、実際の事象に対する検視官の主張を検証したりするため、検視官間統計による検証ではエラーの原因に関する説明力に欠ける。
そこで本研究では,ビデオ,VRログ,アクターデータから構築されたイベントの真のシーケンスに対して,検査者が主張するアクションを比較することで,VR(Virtual Reality) pediatric OSCEにおける検査者の主張を検証するマルチモーダルフレームワークであるQuality Action Assurance(QAA)を紹介する。
QAAは、アクションローカライゼーションとアクターソース属性を実行する制約付き時間的行動アライメントモデルと、検査者のクレームを抽出し、レコードに対してチェックする大きな言語モデルを組み合わせる。
5倍のクロスバリデーションで、QAAは99.2%の$\pm$ 0.7%のアクターF1、93.4%の$\pm$ 1.9%のW@16を達成する。
全体として、QAAは69.9%の精度と76.7%のリコールで検査者エラーを検出し、事実の正しさを39.2%から79.2%に改善し、OSCEの公平な評価を可能にした。
関連論文リスト
- NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI [6.058290832294911]
エージェントベンチマークは、リポジトリの編集、Web研究、端末の使用、長期のインタラクションをますます評価している。
最近の報奨ベンチマークとシステムレポートは、エージェントが代わりに公開ソリューションを回復し、評価成果物を読み、ジェネレータ構造を推論し、フィードバックを操作し、不正なスコアリングパスの恩恵を受けることができることを示している。
我々は、プロトコルの有効性を定式化し、露出を特定し、エージェントがどのように使用したかを決定し、その結果のスコアが誤解を招くかどうかを評価するポストホック監査であるHackDetectを導入する。
論文 参考訳(メタデータ) (2026-07-24T14:55:19Z) - Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation [3.079997053226693]
本報告では,4つの主要なツールコール・ベンチマーク・ファミリーの体系的妥当性と評価について述べる。
496人の専門家がレビューしたベンチマークタスクのうち、92人の評価者と人間の意見の不一致が18.5%のミスアライメントレートに対応している。
ツールコール評価失敗、トレースレベルの監査成果物、修正された評価項目の統一分類を導入し、ツールの実行、タスク完了、結果検証を別々に計測する指標について議論する。
論文 参考訳(メタデータ) (2026-06-30T21:10:42Z) - A Multi-Domain Red Teaming Framework for Safety, Robustness, and Fairness Evaluation of Medical Large Language Models [34.38896321208398]
大規模言語モデル(LLM)は、ますます医療全体に展開されているが、既存のベンチマークでは、敵対的あるいは倫理的に複雑な条件下でのモデルの振る舞いを捉えていない。
我々は690の臨床的根拠のあるシナリオにまたがる11の現代LPMを評価する多ドメインレッド・チームリング・フレームワークを開発した。
その結果, 平均スコアは0.791~0.984。
論文 参考訳(メタデータ) (2026-04-15T14:57:55Z) - A Scoping Review of LLM-as-a-Judge in Healthcare and the MedJUDGE Framework [11.502207790112344]
LLM-as-a-Judge (LaaJ) は大規模言語モデルを用いてモデル出力を評価する。
採用が増えたにもかかわらず、バリデーションの厳格さは限られていた。
偏見検査のリスクは36の研究 (73.5%) で欠落しており、人口統計学的公正性はわずか1 (2.0%) であり、時間的安定性や患者の状況は評価されなかった。
臨床リスク層にまたがる妥当性,安全性,説明責任を重視したリスク階層化3ピラーフレームワークであるMedJUDGEを提案する。
論文 参考訳(メタデータ) (2026-04-03T14:50:01Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification [60.18369393468405]
既存の検証器は通常、ドメイン知識の欠如と限られた校正のために性能が劣る。
GLEANは専門家によって計算されたプロトコルをトラジェクトリインフォームされ、よく校正された正当性信号にコンパイルする。
我々は,MIMIC-IVデータセットから得られた3つの疾患の薬物的臨床診断でGLEANを実証的に検証した。
論文 参考訳(メタデータ) (2026-03-03T09:36:43Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - SPECA: Specification-to-Checklist Agentic Auditing for Multi-Implementation Systems -- A Case Study on Ethereum Clients [1.711666249985278]
SPECAは、標準要件をチェックリストに変換する仕様からChecklistフレームワークである。
SPECAは,11社を対象とし,フサカアップグレードのセキュリティ監査コンテストの会場内でインスタンス化を行う。
我々の改善されたエージェントは、競争監査の基礎的真実に対して評価され、高影響の脆弱性について27.3%の厳格なリコールを達成した。
論文 参考訳(メタデータ) (2026-02-07T12:19:00Z) - Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models [87.66870367661342]
大規模言語モデル(LLM)は、医療におけるAIアプリケーションで使用される。
LLMを継続的にストレステストするレッドチームフレームワークは、4つのセーフティクリティカルなドメインで重大な弱点を明らかにすることができる。
敵エージェントのスイートは、自律的に変化するテストケースに適用され、安全でないトリガー戦略を特定し、評価する。
私たちのフレームワークは、進化可能でスケーラブルで信頼性の高い、次世代の医療AIのセーフガードを提供します。
論文 参考訳(メタデータ) (2025-07-30T08:44:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。