論文の概要: Multimodal examination answer data with expert-designed Outcome-Based Education rubrics for criterion-level assessment
- arxiv url: http://arxiv.org/abs/2608.22346v1
- Date: Sun, 23 Aug 2026 10:25:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.725416
- Title: Multimodal examination answer data with expert-designed Outcome-Based Education rubrics for criterion-level assessment
- Title(参考訳): 基準レベル評価のための専門家が設計したアウトカム・ベース・エデュケーション・ルーリックを用いたマルチモーダル試験回答データ
- Abstract要約: データ記事では、専門家が設計した Outcome-Based Education (OBE) グレーディングメタデータと組み合わせた、スキャンされた検査回答のマルチモーダルコレクションについて説明する。
このコレクションには、4つの学術機関の415人の学生からの回答が485件含まれている。
データはロバストネス対応の自動評価、文書理解、基準レベルのフィードバック、スコア予測、プライバシ対応評価研究をサポートする。
- 参考スコア(独自算出の注目度): 0.30880364712525776
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This data article describes a multimodal collection of scanned examination answers paired with expert-designed Outcome-Based Education (OBE) grading metadata. The collection contains 485 answer submissions from 415 consenting students at four academic institutions. Eight faculty contributors supplied examination materials covering nine subjects and 12 distinct question templates. Each answer-level item links a scanned PDF to a randomized identifier, subject label, question, model answer, criterion definitions, performance-level descriptions, criterion marks, and a total mark. The 12 rubrics contain 47 criteria in total. The scans retain realistic academic content, including handwriting, printed text, equations, tables, code, figures, sketches, and diagrams. CamScanner, Adobe Scan, and conventional scanners contributed variation in illumination, contrast, orientation, compression, and resolution. Diverse handwriting, crossed-out work, revised calculations, and inserted corrections add further visual variability for robustness and generalization studies. Preparation involved heterogeneous-source consolidation, label and text standardization, score validation, identifier randomization, filename randomization, and JSON-to-PDF integrity checks. An answer-level audit confirmed 485 unique identifiers, 485 unique PDF filenames, agreement between each total mark and its criterion-mark sum, and scores within the applicable rubric maximum. The data can support rubric-aware automated evaluation, multimodal document understanding, criterion-level feedback, score prediction, and privacy-aware OBE assessment research. Access is restricted to research use and is available from the corresponding author upon reasonable request.
- Abstract(参考訳): 本稿では、専門家が設計した Outcome-Based Education (OBE) グレーディングメタデータと組み合わせた、スキャンされた検査回答のマルチモーダルコレクションについて述べる。
このコレクションには、4つの学術機関の学生415人の回答が485件含まれている。
8人の教員が9つの被験者と12の異なる質問テンプレートを含む検査資料を提供した。
各回答レベル項目は、スキャンされたPDFをランダム化された識別子、主題ラベル、質問、モデル回答、基準定義、パフォーマンスレベル記述、基準マーク、合計マークにリンクする。
12のルーブには合計47の基準がある。
スキャンは、手書き、印刷されたテキスト、方程式、表、コード、図形、スケッチ、図表など、現実的な学術的内容を保持する。
CamScanner、Adobe Scan、および従来のスキャナーは照明、コントラスト、方向、圧縮、解像度のバリエーションに貢献している。
様々な手書き、クロスアウト作業、修正された計算、挿入された修正により、ロバスト性や一般化研究のさらなる視覚的多様性がもたらされる。
準備には、異種ソースの統合、ラベルとテキストの標準化、スコア検証、識別子のランダム化、ファイル名のランダム化、JSON-to-PDF整合性チェックが含まれていた。
回答レベル監査では、485のユニークな識別子、485のユニークなPDFファイル名、各マークと基準マークの合計との一致、および適用可能なルーリック最大値内のスコアが確認された。
データはルーブリック対応の自動評価、マルチモーダル文書理解、基準レベルのフィードバック、スコア予測、プライバシ対応OBEアセスメントリサーチをサポートする。
アクセスは研究用に限られており、適切な要求に応じて対応する著者から利用できる。
関連論文リスト
- SciDocBench: A Workflow-Centered Benchmark and Data Pipeline for Scientific Document Understanding [51.537009919690696]
我々は、科学文書理解のためのワークフロー中心のベンチマークであるSciDocBenchを紹介する。
7つの研究支援グループと5つの科学領域にまたがる19のサブタスクで構成されている。
最も評価の高いシステムは62.6/100であり、文書認識、証拠根拠、検証、文書横断推論の弱点が顕著である。
SciDocIR上に構築したSciDocDatasetは、約15Kの微調整サンプルと、14の検証可能なサブタスクにわたる8Kの強化学習サンプルから構成される。
論文 参考訳(メタデータ) (2026-09-04T13:39:48Z) - OmniHandwritingOCR: A Diagnostic Benchmark for Evaluating Multimodal LLMs in Handwritten OCR Scenarios [15.793450444852455]
OmniHandwriting OCRは手書きOCR上でMLLMとOCRシステムを評価するための診断ベンチマークである。
6つのサブタスクと12のサブセットにまたがる手書きのテキスト認識と手書きの数学的表現認識をカバーし、合計77.57Kのラベル付き画像である。
我々は,統一プロトコルの下で5つの相補的なメトリクスを持つ13のオープンソースおよびクローズドソースシステムを評価する。
論文 参考訳(メタデータ) (2026-08-19T06:27:05Z) - Deep Academic Survey: Stateful Agentic Closed-Loop Paradigm for Academic Survey Automation [60.151050016855834]
DASは出版指向の学術調査を作成するためのステートフルなエージェント・フレームワークである。
その鍵となる考え方は、再利用可能な紙分析とトピック固有の原稿構築を分離することである。
DASは4つの次元で最高点に達し、総合スコアは4.34であり、最強の競争相手は4.03である。
論文 参考訳(メタデータ) (2026-08-18T17:29:00Z) - ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence [57.37494162084001]
チェーン・オブ・エビデンス(Chain-of-Evidence, CoE)は、すべてのクレームがエビデンス・ソースにトレース可能であることを要求する検証可能なフレームワークである。
CoE Auditはポストホック監査であり、スコア検証、仕様違反、参照検証、メソッドコードアライメントという4つの整合性チェックが全システムに均一に適用される。
論文 参考訳(メタデータ) (2026-05-25T21:30:27Z) - RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension [65.81339691942757]
RPC-Bench(RPC-Bench)は、高品質なコンピュータサイエンス論文のレビュー・リビューの交換から構築された大規模質問応答ベンチマークである。
我々は、科学研究の流れに沿ったきめ細かい分類を設計し、モデルがなぜ、何、どのように学術的な文脈で質問するかを理解し、答える能力を評価する。
論文 参考訳(メタデータ) (2026-01-14T11:37:00Z) - Stylometry Analysis of Human and Machine Text for Academic Integrity [0.6558127228160233]
この研究は、盗作、創作、教育コンテンツの著者の検証など、学術的完全性への挑戦に対処する。
著者の帰属とスタイル変化の検出を通じて,学生のコンテンツを認証するための自然言語処理(NLP)ベースのフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-03T16:13:38Z) - Grading Handwritten Engineering Exams with Multimodal Large Language Models [0.0]
手書きのSTEM試験は、オープンエンドの推論と図をキャプチャするが、手動のグラデーションは遅く、スケールが難しい。
マルチモーダル大言語モデル(LLM)を用いた手書き手書き工学クイズを段階的に学習するためのエンドツーエンドワークフローを提案する。
講師は手書きの参照ソリューション(100%)と短時間のグルーピングルールのみを提供し、基準スキャンを露出することなく、条件がグルーピングされるテキストのみの要約に変換する。
論文 参考訳(メタデータ) (2026-01-02T16:10:08Z) - SurveyBench: Can LLM(-Agents) Write Academic Surveys that Align with Reader Needs? [37.28508850738341]
調査書は労働集約的で知的に要求されるタスクである。
一般的なDeepResearchエージェントやサーベイ特殊化手法のような最近のアプローチは、自動的にサーベイを生成することができる。
しかし、そのアウトプットは人間の基準に欠けることが多く、厳格で読者対応のベンチマークが欠けている。
本稿では,詳細なクイズ駆動評価フレームワークであるSurveyBenchを提案する。
論文 参考訳(メタデータ) (2025-10-03T15:49:09Z) - MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query [91.01970848241075]
MERITは、インターリーブされたマルチ条件セマンティック検索のための最初の多言語データセットである。
本稿では,多条件セマンティック検索のための最初の多言語データセットであるMERITを紹介する。
論文 参考訳(メタデータ) (2025-06-03T17:59:14Z) - Contra4: Evaluating Contrastive Cross-Modal Reasoning in Audio, Video, Image, and 3D [97.08549913899247]
Contra4は、画像、オーディオ、ビデオ、および3Dの4つのモードにまたがる、対照的な相互モーダル推論のためのデータセットである。
それぞれの例は、複数の候補モダリティのインスタンスと並んで自然言語の質問を示し、モデルがプロンプトと意味的に一致するものを選択する必要がある。
コントラ4は、人間の注釈付きキャプションとモデルの混在するラウンドトリップ一貫性フィルタを組み合わせることで、高品質な監視を確実にし、174kのトレーニング例と2.3kのサンプルを手作業で検証する。
論文 参考訳(メタデータ) (2025-06-02T03:12:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。