論文の概要: The Theoretical Foundation of Socratic Tests: Dynamic, Multimodal, Conversational Examinations
- arxiv url: http://arxiv.org/abs/2607.29624v1
- Date: Fri, 31 Jul 2026 16:57:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.819255
- Title: The Theoretical Foundation of Socratic Tests: Dynamic, Multimodal, Conversational Examinations
- Title(参考訳): ソクラテステストの理論基礎--動的・マルチモーダル・会話的検証
- Abstract要約: ソクラティックテスト(Socratic Test)は、コンピュータによる自動会話アセスメントである。
本論文は, 近位発達ゾーン(ZPD)の定量化のための段階的足場の利用を形式化する。
詳しくは、ペナルティと人間とAIのアライメントよりも熟達を優先する、非補償的で付加的なグレーディングアーキテクチャについて説明する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Traditional static assessments rely on a subtractive, deficit-based grading model that often penalizes ambition and obscures diagnostic feedback. Conversely, traditional face-to-face oral examinations introduce severe construct-irrelevant variance by exacerbating performative anxiety and the sociological power imbalances inherent to academic hierarchies. This paper presents the theoretical foundation for the "Socratic Test," an automated, computer-mediated conversational assessment. By integrating Dynamic Assessment principles, multimodal workspaces, Bloom's Taxonomy for real-time proctoring, and the SOLO Taxonomy for structural evaluation, the Socratic Test actively maps a student's cognitive boundaries. This paper formalizes the use of graduated scaffolding to quantify the Zone of Proximal Development (ZPD) and details a non-compensatory, additive grading architecture that prioritizes mastery over penalty and human-AI alignment to ensure unprecedented measurement reliability.
- Abstract(参考訳): 従来の静的アセスメントは、しばしば野心を罰し、診断のフィードバックを曖昧にする減算的欠陥ベースのグレーディングモデルに依存している。
逆に、従来の対面口腔検査では、パフォーマンス的不安を悪化させ、学術的階層に固有の社会的な力の不均衡を生じさせることにより、構成的無関係なばらつきが生じている。
本稿では,自動対話型評価システム「ソクラティック・テスト」の理論的基礎について述べる。
動的アセスメントの原則、マルチモーダルワークスペース、リアルタイムプロクターのためのブルームの分類、構造評価のためのSOLO分類を統合することで、ソクラティックテストは学生の認知境界を積極的にマッピングする。
本稿では,段階的足場を用いたZPD(Zone of Proximal Development)の定量化を形式化し,前例のない測定信頼性を確保するために,ペナルティと人間-AIアライメントよりも熟達を優先する非補償的付加的なグレーディングアーキテクチャを詳述する。
関連論文リスト
- INSPIRE: An Internalize-Then-Improve Approach for Example-Driven Mathematical Reasoning [61.60016491769943]
人間の数学教育において、定理境界をテストするために反例を構築するような例に基づく推論は、深い概念的理解を反映している。
本稿では,RGSI(Reference-Guided Students Internalization)と段階的選好学習戦略を組み合わせた内在化・内在化アプローチであるINSPIREを提案する。
複数のモデルスケールとファミリーにわたる実験は、大規模なオープンソースモデルを超えながら、一貫した改善を示している。
論文 参考訳(メタデータ) (2026-08-27T03:24:03Z) - Multi-Dimensional Assessment for AI Cognition (MAAC): A Theoretical Framework for Process-Oriented Cognitive Evaluation of Text-Based AI Systems [1.8262547855491456]
本稿では,テキストベースのAIシステムが生み出すものから,その考え方に移行するためのフレームワークである,多次元AI認知のためのアセスメント(MAAC)を紹介する。
MAACは認知負荷、ツール実行、コンテンツ品質、メモリ統合、複雑性ハンドリング、幻覚制御、知識伝達、処理効率、プロセスアウトカムアライメントの9つの認知的動機付けディメンションを定義している。
5つの理論的分析は、フレームワークのコヒーレンスと経験的テスト容易性の最初のサポートを提供する。
論文 参考訳(メタデータ) (2026-08-01T14:01:17Z) - Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models [52.18157855348584]
エントロピー最小化(EM)によるテスト時間適応(TTA)は分類作業に有効であることが証明されているが、その応用は理論的に断片化されている。
本研究では,自己回帰モデルに適した厳密なEMの定式化を導出する。
本研究の目的は,トークンレベルの政策勾配損失とトークンレベルのエントロピー損失に自然に分解されることを示し,従来の手法を統一された定式化の部分的実現として再解釈する。
テストベッドとしてWhisper ASRを用いることで、音響ノイズ、アクセント、多言語設定を含む20以上の異なる領域のパフォーマンスを継続的に向上することを示す。
論文 参考訳(メタデータ) (2026-05-05T12:00:06Z) - General Machine Learning: Theory for Learning Under Variable Regimes [2.538209532048866]
本研究では,学習者,記憶状態,評価条件が時間とともに変化しうる状況下での学習について検討する。
本稿では, 許容輸送, 保護コア保存, 評価者対応学習の進化を主眼とした, 体制的変化の枠組みを開発する。
論文 参考訳(メタデータ) (2026-03-24T13:58:31Z) - InnoEval: On Research Idea Evaluation as a Knowledge-Grounded, Multi-Perspective Reasoning Problem [87.30601926271864]
InnoEvalは、人間レベルのアイデアアセスメントをエミュレートするために設計された、深いイノベーション評価フレームワークである。
我々は,多様なオンライン情報源から動的証拠を検索し,根拠とする異種深層知識検索エンジンを適用した。
InnoEvalをベンチマークするために、権威あるピアレビューされた提案から派生した包括的なデータセットを構築します。
論文 参考訳(メタデータ) (2026-02-16T00:40:31Z) - PRISM-Physics: Causal DAG-Based Process Evaluation for Physics Reasoning [57.868248683256574]
PRISM-Physicsはプロセスレベルの評価フレームワークであり、複雑な物理推論問題のベンチマークである。
解は公式の有向非巡回グラフ(DAG)として表される。
その結果,評価フレームワークは人的専門家のスコアと一致していることがわかった。
論文 参考訳(メタデータ) (2025-10-03T17:09:03Z) - Machine vs Machine: Using AI to Tackle Generative AI Threats in Assessment [0.0]
本稿では、高等教育評価において、生成人工知能(AI)がもたらす課題に対処するための理論的枠組みを提案する。
GPT-4、Claude、Llamaのような大規模な言語モデルは、洗練された学術コンテンツを作成する能力をますます示している。
調査によると、学生の74-92%が学術目的でこれらのツールを実験している。
論文 参考訳(メタデータ) (2025-05-31T22:29:43Z) - Causality can systematically address the monsters under the bench(marks) [64.36592889550431]
ベンチマークはさまざまなバイアス、アーティファクト、リークに悩まされている。
モデルは、調査の不十分な障害モードのため、信頼できない振る舞いをする可能性がある。
因果関係はこれらの課題を体系的に解決するための 理想的な枠組みを提供します
論文 参考訳(メタデータ) (2025-02-07T17:01:37Z) - Position: AI Evaluation Should Learn from How We Test Humans [65.36614996495983]
人間の評価のための20世紀起源の理論である心理測定は、今日のAI評価における課題に対する強力な解決策になり得る、と我々は主張する。
論文 参考訳(メタデータ) (2023-06-18T09:54:33Z) - Independent Ethical Assessment of Text Classification Models: A Hate
Speech Detection Case Study [0.5541644538483947]
人工知能システムの独立した倫理的評価は、倫理的価値に合わせてシステムの発達、展開、使用を公平に検証するものである。
本研究は、このギャップを埋め、ヘイトスピーチ検出の課題に特化して、テキスト分類モデルの総合的な独立した倫理的評価プロセスを設計する。
論文 参考訳(メタデータ) (2021-07-19T23:03:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。