論文の概要: CALLIOPE: A Source-Grounded Oral Assessment System and Synthetic Readiness Evaluation
- arxiv url: http://arxiv.org/abs/2610.00290v1
- Date: Fri, 25 Sep 2026 12:01:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.594993
- Title: CALLIOPE: A Source-Grounded Oral Assessment System and Synthetic Readiness Evaluation
- Title(参考訳): CALLIOPE: ソース・グラウンドド・オーラルアセスメントシステムと合成準備性評価
- Abstract要約: CALLIOPEは、バージョン付き指導資料、学習者のターン記録と書き起こし、適応的質問、二者評価、教育者レビュー、輸出可能な証拠を統合する、ソース・グラウンドド・オーラルアセスメントシステムである。
本技術報告では,CALLIOPEについて述べる。CALLIOPEは,バージョン付き指導資料,学習者ターン記録と転写,適応的質問,2段階のスコアリング,教育者レビュー,輸出可能なエビデンスを統合した,ソースグラウンドによる口頭評価システムである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Oral assessment with generative AI requires more than a conversational interface: educators must connect a spoken response to its source material, scoring criteria, model outputs and subsequent human judgement. This technical report presents CALLIOPE, a source-grounded oral assessment system integrating versioned instructional material, learner-turn recording and transcription, adaptive questioning, two-provider rubric scoring, educator review and exportable evidence. We examine implementation and retained synthetic verification records from 25 September 2026. Three spoken fixtures and a silence control were exercised across two release runs. In the final release rehearsal, the spoken fixtures received aggregate AI scores of 100, 62 and 8 out of 100; two elicited provider-disagreement flags. All eight retrieved audio files across the two runs were byte-identical to their inputs. These observations establish operation of specific exercised paths, not scoring validity or learning gains. A later zero-traffic candidate added version-bound consent checks, insert-only first-pass rating receipts and separately authorised coded exports, supported by local regression tests but not a new full live research workflow evaluation. We distinguish deployed functionality, candidate safeguards and remaining recovery, concurrency and study-operation requirements. The contribution is an inspectable response-to-review workflow and a release-specific account of what its engineering evidence does, and does not, establish. No human-participant outcomes are reported. OpenAI Codex assisted with technical verification, evidence synthesis and manuscript preparation.
- Abstract(参考訳): 教育者は、その原材料、評価基準、モデル出力、その後の人間の判断に音声応答を接続しなければならない。
本技術報告では,CALLIOPEについて述べる。CALLIOPEは,バージョン付き指導資料,学習者ターン記録と転写,適応的質問,2プロジェクタルーリックスコア,教育者レビュー,輸出可能なエビデンスを統合した,ソースグラウンドによる口頭アセスメントシステムである。
我々は,2026年9月25日からの総合的検証記録の実施と維持について検討した。
3つの音声器具とサイレントコントロールが2つのリリースランで実行された。
最終リリースのリハーサルでは、音声フィクスチャは100点、62点、100点中8点のAIスコアを受け取った。
検索された8つのオーディオファイルはすべて、入力に対してバイト単位のものだった。
これらの観察により、特定の運動経路の操作が確立され、有効性や学習利得は評価されない。
その後のゼロトレーフ候補は、バージョンバウンドの同意チェック、挿入専用ファーストパスレーティングレセプション、およびローカル回帰テストでサポートされた個別のコード付きエクスポートを追加したが、新しい完全な研究ワークフロー評価は行わなかった。
デプロイされた機能、候補のセーフガード、残りのリカバリ、並行性、研究-オペレーティング要件を区別します。
このコントリビューションは、インスペクタブルなレスポンス・トゥ・リビューのワークフローであり、そのエンジニアリングエビデンスが何を行い、何が確立されていないかをリリース固有の説明である。
人的参加の成果は報告されていない。
OpenAIコーデックスは、技術検証、証拠合成、原稿作成を支援した。
関連論文リスト
- Human-AI Collaboration for Multi-Line Task Adjustment Using Local Large Language Models and a Digital Twin [0.0]
本研究では,局所的な大規模言語モデル,デジタルツイン,人的意思決定を統合したマルチラインタスク調整システムを提案する。
Propose-Verify-Decideワークフローオペレータの意図は、構造化された要件に変換し、一連の候補戦略を生成し、セマンティクス、シミュレーション実行、運用上の制約をチェックする。
この結果は、トレーサブルな戦略レビューワークフローを示しているが、全体的な信頼性や長期的な安定性は確立していない。
論文 参考訳(メタデータ) (2026-09-24T05:48:53Z) - PaperDoctor: Evidence-Grounded and Actionable Feedback for Scientific Papers in Progress [130.58520199343707]
PaperDoctorは,3つの重要なイノベーションを備えた,サブミッション前のフィードバックのためのエージェントフレームワークである。
まず、全体論的階層的なフレームワークは、書き込み、レイアウト、参照、コード、理論、先行作業、実験を評価します。
第二に、各発見には、観察、文、方程式、コードラインなどの特定の証拠へのポインタ、修正提案が含まれる。
第3に、PaperDoctorはクレームの重要性と計算予算に基づいて実験を選択的に再構築し、再実行する。
論文 参考訳(メタデータ) (2026-09-15T11:08:11Z) - Neyshekar: An Open Persian Read-Speech Corpus for Automatic Speech Recognition [0.0]
ネイシェカール (Neyshekar) は、公式言語と非公式言語の両方をカバーするために設計されたペルシア語読み上げコーパスである。
バージョン6では、190人のコントリビュータから合計99.02時間、34,541人の異なるプロンプトが提供されている。
論文 参考訳(メタデータ) (2026-09-13T14:30:43Z) - From Matching Models to Recruiting Agents: A Systematized Narrative Review of AI Recruitment Systems, Evaluation, and Governance [1.436449142247059]
このレビューは、ニューラル・パーソナリティ・マッチングによる双方向の検索と行動ランキングから発展を辿る。
類似性から相互適合性、モデルから複合ワークフロー、オフライン予測からエビデンスと生産性に整合した評価という3つの組み合わせの遷移を分析した。
評価証拠から最強の証明可能なクレームへのステージマッピングと,相互性,エビデンス,時間的制御,選択的,監査可能なシステムに関するアジェンダを導入する。
論文 参考訳(メタデータ) (2026-09-03T08:46:03Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - From Transcripts to AI Agents: Knowledge Extraction, RAG Integration, and Robust Evaluation of Conversational AI Assistants [0.0]
顧客向け産業向けの信頼できる会話AIアシスタントの構築は、ノイズの多い会話データ、断片化された知識、正確なヒューマンハンドオフの必要性により、依然として困難である。
本稿では,履歴書から直接対話型AIアシスタントを構築し,評価するためのエンドツーエンドフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-26T07:44:47Z) - Beyond Static Scoring: Enhancing Assessment Validity via AI-Generated Interactive Verification [0.4260312058817663]
大規模言語モデル(LLM)は、著者の行を曖昧にすることで、従来のオープンエンドアセスメントの妥当性に挑戦する。
本稿では,ルーリックに基づく自動スコアリングとAIが生成し,対象とするフォローアップ質問を組み合わせることで,評価の整合性を高める新しいHuman-AIコラボレーションフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-14T08:13:53Z) - Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models [44.31597857713689]
最初の段階でActive Indexingを導入し、一般化可能なソースアンコールバインディングを作成します。
Qwen-2.5-7B&3Bの実験は、アクティブインデックスがパッシブインデックスのベースラインを一貫して上回っていることを示している。
内部の引用は、モデルを検索ノイズに対してより堅牢にすることで、外部の引用を補完する。
論文 参考訳(メタデータ) (2025-06-21T04:48:05Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z) - Unsupervised Opinion Summarization with Noising and Denoising [85.49169453434554]
ユーザレビューのコーパスから合成データセットを作成し、レビューをサンプリングし、要約のふりをして、ノイズのあるバージョンを生成します。
テスト時に、モデルは本物のレビューを受け入れ、健全な意見を含む要約を生成し、合意に達しないものをノイズとして扱います。
論文 参考訳(メタデータ) (2020-04-21T16:54:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。