Fugu-MT 論文翻訳(概要): ArguAgent: AI-Supported Real-Time Grouping for Productive Argumentation in STEM Classrooms

論文の概要: ArguAgent: AI-Supported Real-Time Grouping for Productive Argumentation in STEM Classrooms

arxiv url: http://arxiv.org/abs/2604.23449v1
Date: Sat, 25 Apr 2026 21:38:31 GMT
ステータス: 翻訳完了
システム内更新日: 2026-04-28 17:12:07.353717
Title: ArguAgent: AI-Supported Real-Time Grouping for Productive Argumentation in STEM Classrooms
Title（参考訳）: ArguAgent: STEM教室における生産性向上のためのAI対応リアルタイムグルーピング
Authors: Jennifer Kleiman, Yizhu Gao, Xin Xia, Zhaoji Wang, Zipei Zhu, Jongchan Park, Xiaoming Zhai,
Abstract要約: アルグアジェント(ArguAgent)は、学生の姿勢と議論スキルに基づいたグループを作成するAIシステムである。検証された学習過程において、議論品質の違いを+/-1レベルに制限する。両方の設計基準を満たすグループの95.4%を達成しており、ランダムな割り当てよりも3.2倍改善されている。
参考スコア（独自算出の注目度）: 5.090665056048702
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Argumentation is a core practice in STEM education, but its productivity depends on who participates and how they interact. Higher-achieving students often dominate the talk and decision-making, while lower-achieving peers may disengage, defer, or comply without contributing substantive reasoning. Forming groups strategically based on students' stances and argumentation skills could help foster inclusive, evidence-based discourse. In practice, however, teachers are constrained in implementing this grouping strategy because it requires real-time insight into students' positions and the quality of their argumentation, information that is difficult to assess reliably and at scale during instruction. We present a generative AI-powered system, ArguAgent, that creates groups optimizing for stance heterogeneity while constraining argumentation quality differences to +/-1 level on a validated learning progression. ArguAgent uses a two-component assessment pipeline: first scoring student arguments on a 0-4 rubric, then clustering positions via semantic analysis. We validated the scoring component against human expert consensus (Krippendorff's ααα = 0.817) using 200 expert-generated scores. Testing three OpenAI models (GPT-4o-mini, GPT-5.1, GPT-5.2) with identical calibrated prompts, we found that systematic prompt engineering informed by human disagreement analysis contributed 89% of scoring improvement (QWK: 0.531 to 0.686), while model upgrades contributed an additional 11% (QWK: 0.686 to 0.708). Simulation testing across 100 classes demonstrated that the grouping algorithm achieves 95.4% of groups that meet both design criteria, a 3.2x improvement over random assignment. These results suggest ArguAgent can enable real-time, theoretically grounded grouping that promotes productive STEM argumentation in classrooms.
Abstract（参考訳）: 議論はSTEM教育の中核的な実践であるが、その生産性は誰が参加し、どのように相互作用するかに依存する。高い成績の学生が講演や意思決定を支配し、低い成績の学生は実質的な推論に貢献することなく解禁、延期、あるいは遵守することがある。学生の姿勢と議論スキルに基づいて戦略的にグループを形成することは、包括的でエビデンスに基づく談話を促進するのに役立つ。しかし、実際には、教師は、学生の位置や議論の質をリアルタイムに把握する必要があるため、授業中、確実かつ大規模に評価することが難しいため、このグループ化戦略の実施に制約が課されている。本稿では,AIを用いた生成システムArguAgentを提案する。このシステムでは,評価学習の進行に対して,議論品質の違いを+/-1レベルに制限しながら,不均一性を最適化するグループを生成する。 ArguAgentは2成分アセスメントパイプラインを使用しており、まずは0-4ルーブリック上で学生引数をスコアし、その後セマンティック分析によって位置をクラスタリングする。我々は,200個の専門家スコアを用いて,人間の専門家コンセンサス(クリッペンドルフのαα = 0.817)に対して評価を行った。 3つのOpenAIモデル(GPT-4o-mini, GPT-5.1, GPT-5.2)を同一の校正プロンプトで試験したところ, 人体不一致解析によるシステム的インシデントエンジニアリングが89%のスコア改善(QWK:0.531から0.686)に寄与し, モデルアップグレードは11%(QWK:0.686から0.708)に増加した。 100クラスにわたるシミュレーションテストでは、グループ化アルゴリズムは、両方の設計基準を満たすグループの95.4%を達成し、ランダムな割り当てよりも3.2倍改善した。これらの結果から、ArguAgentは、教室における生産的STEM議論を促進するリアルタイム、理論的に根拠付けられたグループ化を可能にすることが示唆された。

関連論文リスト

Task Complexity Matters: An Empirical Study of Reasoning in LLMs for Sentiment Analysis [2.1036545320600095]
推論能力を持つ大規模言語モデル(LLM)は、推論が言語タスク全体のパフォーマンスを普遍的に改善する、という魅力的な物語を生み出している。 7つのモデルファミリーにまたがる504構成を包括的に評価することで,この主張を検証した。その結果, 推論の有効性は, タスク依存的であり, 課題の多い仮定であることが明らかとなった。
論文参考訳（メタデータ） (2026-02-27T14:49:05Z)
A comprehensive study of LLM-based argument classification: from Llama through DeepSeek to GPT-5.2 [0.0]
本研究では,いくつかの最先端の大規模言語モデル (LLM) の包括的評価を行う。この評価には、チェーン・オブ・ソート・プロンプト、即興の言い直し、投票、確実性に基づく分類など、先進的なプロンプト戦略が組み込まれている。最適性能モデル(GPT-5.2)は78.0%(UKP)と91.9%(Args.me)の分類精度を達成する。
論文参考訳（メタデータ） (2026-02-25T11:17:24Z)
Can Consumer Chatbots Reason? A Student-Led Field Experiment Embedded in an "AI-for-All" Undergraduate Course [0.7515394929245942]
本稿では,ジョージ・メイソン大学のUNIV 182(AI4All)の中間プロジェクトとして,学生主導のフィールド実験を行った。学生は、独自の推論タスクを設計し、現在使われている消費者チャットボット上で実行し、(i)回答の正しさと(ii)推論の有効性を評価した。 OpenAI GPT-5 と Claude 4.5 は最高平均解答精度 (86.2% と 83.8%) を獲得し、Grok 4 (82.5%) と Perplexity (73.1%) が続いた。
論文参考訳（メタデータ） (2025-12-28T22:51:25Z)
Hierarchical Pedagogical Oversight: A Multi-Agent Adversarial Framework for Reliable AI Tutoring [0.0]
本稿では,構造化された対人合成を教育評価に適用する枠組みである階層的教育監督(HPO)を紹介する。表面的なコンセンサスに向かって漂う協調的なマルチエージェントシステムとは異なり、HPOは関心事の弁証的分離を強制する。 1,214の中学校数学対話のMRBenchデータセットを用いて,この枠組みを評価する。
論文参考訳（メタデータ） (2025-12-27T06:42:07Z)
From Harm to Help: Turning Reasoning In-Context Demos into Assets for Reasoning LMs [58.02809208460186]
デモとしてDeepSeek-R1の高品質なトレースを使って、このパラドックスを再検討する。デモが最適であっても、より多くの例を加えることで、常に精度が低下することがわかった。デモを明示的で再利用可能な洞察に変換するシーケンシャルなテストタイム手順であるInsight-to-solve(I2S)を紹介します。
論文参考訳（メタデータ） (2025-09-27T08:59:31Z)
Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。 Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。 SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文参考訳（メタデータ） (2025-09-25T14:05:55Z)
The Surprising Effectiveness of Test-Time Training for Few-Shot Learning [59.309477460893916]
言語モデル(LM)は、トレーニングディストリビューション内のタスクにおいて印象的なパフォーマンスを示しているが、しばしば構造的に新しいタスクで苦労している。 LMの推論と少数ショット学習能力を改善するメカニズムとして,テストタイムトレーニング(TTT)の有効性を検討する。本研究は,新しいタスクにおける文脈内学習の限界を強調し,言語モデルの適応性を高めるためのテストタイムトレーニングの可能性を示した。
論文参考訳（メタデータ） (2024-11-11T18:59:45Z)
Applying Large Language Models and Chain-of-Thought for Automatic Scoring [23.076596289069506]
本研究では,大規模言語モデル(LLM)の学生による科学評価に対する応答の自動評価への適用について検討した。我々は、これまで人工知能ベースの自動スコアリングツールの使用を制限していたアクセシビリティ、技術的複雑さ、説明可能性の欠如といった課題を克服することに注力した。
論文参考訳（メタデータ） (2023-11-30T21:22:43Z)
Evaluating Language Models for Mathematics through Interactions [116.67206980096513]
大型言語モデル(LLM)と対話し,評価するためのプロトタイププラットフォームであるCheckMateを紹介した。我々はCheckMateと共同で3つの言語モデル(InstructGPT, ChatGPT, GPT-4)を、学部レベルの数学の証明支援として評価する研究を行った。我々は、人間の行動の分類を導き、概して肯定的な相関にもかかわらず、正しさと知覚的有用性の間に顕著な相違点があることを明らかにする。
論文参考訳（メタデータ） (2023-06-02T17:12:25Z)
Measuring Equality in Machine Learning Security Defenses: A Case Study in Speech Recognition [56.69875958980474]
この研究は、学習したシステムを守るためのアプローチと、異なるサブ人口間でのセキュリティ防衛がパフォーマンス上の不平等をもたらす方法を検討する。提案された多くの手法は、虚偽の拒絶やロバストネストレーニングの不平等といった直接的な害を引き起こす可能性がある。本稿では, ランダム化スムースメントとニューラルリジェクションの2つの防御法の比較を行い, マイノリティ集団のサンプリング機構により, ランダム化スムースメントがより公平であることを見出した。
論文参考訳（メタデータ） (2023-02-17T16:19:26Z)
Robustness Gym: Unifying the NLP Evaluation Landscape [91.80175115162218]
ディープニューラルネットワークは、現実のシステムにデプロイすると脆くなることが多い。最近の研究は、そのようなモデルの堅牢性をテストすることに重点を置いている。単純かつ評価可能なツールキットであるRobustness Gymの形で解を提案する。
論文参考訳（メタデータ） (2021-01-13T02:37:54Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。