論文の概要: Automated Textbook Auditing with Multi-Agent LLM Systems
- arxiv url: http://arxiv.org/abs/2607.11276v1
- Date: Mon, 13 Jul 2026 08:58:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.404868
- Title: Automated Textbook Auditing with Multi-Agent LLM Systems
- Title(参考訳): マルチエージェントLLMシステムによるテキスト自動監査
- Abstract要約: textbfAI Textbook Auditorは、教育材料の品質保証を自動化するモジュール型マルチエージェントパイプラインである。
このシステムは教科書PDFを受信し、2つの分析トラックを通して構造化された人間閲覧可能なレポートを生成する。
textbfJudge Agentは、人間のレビュアーに発見を提示する前に、ドメイン固有のルールを使用して偽陽性をフィルタリングする。
- 参考スコア(独自算出の注目度): 0.13999481573773073
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Ensuring the quality of educational materials requires more than standard proofreading: textbooks must be audited for factual accuracy, domain-specific technical correctness, and linguistic quality simultaneously -- a task that general-purpose grammar checkers cannot address. We present \textbf{AI Textbook Auditor}, a modular multi-agent pipeline for automated quality assurance of educational materials across subject domains. The system accepts a textbook PDF and produces a structured, human-reviewable report via two analysis tracks: a \textbf{Factual and Technical Track} in which an ensemble of specialized LLM agents detects factual inaccuracies, code errors, incorrect definitions, and conceptual inconsistencies, augmented with web search for humanities domains; and a \textbf{Grammar Track} operating PDF-natively to preserve diacritical encoding. A \textbf{Judge Agent} filters false positives using domain-specific rules before presenting findings to a human reviewer. The pipeline supports two ingestion modes -- vision-native page rendering and PyMuPDF text extraction -- and is domain-adaptable via custom prompts encoding subject-specific error taxonomies. We demonstrate the system on two Romanian upper-secondary textbooks: a CS textbook (56 technical findings across seven categories, with an expert-validated precision of 62.5\%) and a history and social sciences textbook (72 findings spanning factual errors, ideological bias, and grammar). The system is designed as a triage tool that reduces the manual effort of locating candidate issues, with human expert validation required before any editorial action.
- Abstract(参考訳): 教科書は、事実の正確性、ドメイン固有の技術的正確性、言語的品質を同時に監査する必要がある。
本稿では,対象領域にわたる教材の自動品質保証のためのモジュール型マルチエージェントパイプラインである「textbf{AI Textbook Auditor}」を紹介する。
このシステムは、教科書PDFを受理し、2つの分析トラックを通して構造化された人間レビュー可能なレポートを生成する: 特殊なLLMエージェントのアンサンブルが事実の不正確さ、コードエラー、不正確な定義、概念上の不整合を検出し、人文科学領域のウェブ検索で強化し、PDFをネイティブに操作してダイアクリティカルエンコーディングを保存する。
textbf{Judge Agent}は、人間のレビュアーに発見を提示する前に、ドメイン固有のルールを使用して偽陽性をフィルタリングする。
パイプラインは、視覚ネイティブなページレンダリングとPyMuPDFテキスト抽出という2つの取り込みモードをサポートし、主題固有のエラー分類をエンコードするカスタムプロンプトを介してドメイン適応可能である。
ルーマニアの2つの上中等教科書について,CS教科書(6つのカテゴリにわたる56の技術的発見,専門家検証精度62.5\%)と歴史・社会科学教科書(72の事実誤り,イデオロギーバイアス,文法)を実証した。
このシステムは、候補問題を特定するための手作業を減らすためのトリアージツールとして設計されており、人間の専門家による検証は編集作業の前に必要である。
関連論文リスト
- Code as Representation: A Compilable Parsing Paradigm for Academic Documents [50.40789738182074]
Compilable Academic Document Parsing (CADP)は、コンテキストラプラス実行可能なPythonとして全ページを再構築するパラダイムである。
テキストと複数のSAEタイプを含む全学術ページのエキスパート検証ベンチマークであるCADP-Benchを紹介する。
その結果、フロンティアモデルでさえも、高忠実度で実行可能な再構築を行うのに苦戦していることがわかった。
論文 参考訳(メタデータ) (2026-08-18T09:10:43Z) - Automated Semantic Fault Localization in SysML v2: A Human-in-the-Loop Framework Using Knowledge-Graph Augmented LLMs [0.11744028458220425]
本稿では,意味的誤りを自動的に識別し,修復するためのヒューマン・イン・ザ・ループ・フレームワークを提案する。
微調整された小言語モデル(SLM)と、システム要素間の物理的互換性ルールをコードするドメイン知識グラフを組み合わせる。
本稿では,車載システム領域を用いて,機械的,電気的,流体的,信号的インターフェース間の関係を把握した知識グラフを示す。
論文 参考訳(メタデータ) (2026-06-22T14:20:11Z) - Automated Grading of Handwritten Mathematics Using Vision-Capable LLMs [2.727845763576068]
視覚対応の大型言語モデル(LLM)は新しい機会を提供する。
インストラクター定義ルーブリックを用いた手書き数学書記作業のためのLLM-based graderの実証評価を行った。
論文 参考訳(メタデータ) (2026-05-18T19:06:15Z) - RoLegalGEC: Legal Domain Grammatical Error Detection and Correction Dataset for Romanian [2.859324824091086]
我々の知る限り、法域における文法的誤りの検出と修正のための最初のルーマニア語並列データセットRoLegalGECを紹介する。
我々は、データセットを、文法的誤りの検出と修正の両方に有用なツールに変換する、いくつかのニューラルネットワークモデルを評価する。
論文 参考訳(メタデータ) (2026-04-21T15:43:33Z) - Can MLLMs Read Students' Minds? Unpacking Multimodal Error Analysis in Handwritten Math [55.83696908107408]
スクラッチマス(ScratchMath)は,手書き数学のスクラッチワークにおける誤りの説明と分類のための新しいベンチマークである。
本データセットは,中国初等・中等生の1,720個の数学サンプルからなる。
我々は,ScratchMath上での16のMLLMを系統的に評価し,人的専門家に対する顕著な性能差を明らかにした。
論文 参考訳(メタデータ) (2026-03-26T02:57:20Z) - Stylometry Analysis of Human and Machine Text for Academic Integrity [0.6558127228160233]
この研究は、盗作、創作、教育コンテンツの著者の検証など、学術的完全性への挑戦に対処する。
著者の帰属とスタイル変化の検出を通じて,学生のコンテンツを認証するための自然言語処理(NLP)ベースのフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-03T16:13:38Z) - MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks [56.350173737493215]
環境・社会・ガバナンス(ESG)報告は、持続可能性の実践の評価、規制コンプライアンスの確保、財務透明性の促進に不可欠である。
MMESGBenchは、マルチモーダル理解と複雑な推論を、構造的に多種多様なマルチソースESG文書間で評価するための、最初のベンチマークデータセットである。
MMESGBenchは、45のESG文書から得られた933の検証済みQAペアで構成され、7つの異なるドキュメントタイプと3つの主要なESGソースカテゴリにまたがる。
論文 参考訳(メタデータ) (2025-07-25T03:58:07Z) - FacTool: Factuality Detection in Generative AI -- A Tool Augmented
Framework for Multi-Task and Multi-Domain Scenarios [87.12753459582116]
より広い範囲のタスクは、生成モデルによって処理されると、事実エラーを含むリスクが増大する。
大規模言語モデルにより生成されたテキストの事実誤りを検出するためのタスクおよびドメインに依存しないフレームワークであるFacToolを提案する。
論文 参考訳(メタデータ) (2023-07-25T14:20:51Z) - Unsupervised Sentiment Analysis of Plastic Surgery Social Media Posts [91.3755431537592]
ソーシャルメディアプラットフォームにまたがる膨大なユーザー投稿は、主に人工知能(AI)のユースケースに使われていない。
自然言語処理(NLP)は、コーパス(corpora)として知られるドキュメントの体系を利用して、人間のような言語理解でコンピュータを訓練するAIのサブフィールドである。
本研究は, 教師なし解析の応用により, コンピュータがプラスティック手術に対する否定的, 肯定的, 中立的なユーザ感情を予測できることを示した。
論文 参考訳(メタデータ) (2023-07-05T20:16:20Z) - MURMUR: Modular Multi-Step Reasoning for Semi-Structured Data-to-Text
Generation [102.20036684996248]
多段階推論を用いた半構造化データからテキストを生成するための,ニューロシンボリックなモジュラーアプローチであるMURMURを提案する。
WebNLG や LogicNLG のような2つのデータ・テキスト生成タスクについて実験を行った。
論文 参考訳(メタデータ) (2022-12-16T17:36:23Z) - Towards Automated Document Revision: Grammatical Error Correction,
Fluency Edits, and Beyond [46.130399041820716]
ACLアンソロジーから採取した学術論文をプロの編集者が改訂する文書改訂コーパスTETRAを導入する。
TETRAの独特性を既存の文書修正コーパスと比較し、微妙な違いであっても、修正後の文書の品質を識別できることを実証する。
論文 参考訳(メタデータ) (2022-05-23T17:37:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。