論文の概要: SpecialEduBench: Benchmarking Vision-Language Models on Knowledge, Skill, and Attitude in Language Intervention for Autistic Children
- arxiv url: http://arxiv.org/abs/2609.26090v1
- Date: Tue, 04 Aug 2026 06:53:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.872012
- Title: SpecialEduBench: Benchmarking Vision-Language Models on Knowledge, Skill, and Attitude in Language Intervention for Autistic Children
- Title(参考訳): SpecialEduBench:自閉症児の言語介入における知識,スキル,態度に関するビジョンランゲージモデルのベンチマーク
- Abstract要約: 言語は自閉症児の最も初期の介入の標的である。
特別教育に到達したベンチマークは、モデルが子供の前で何をするかではなく、何を知っているかを尋ねる。
Emph SpecialEduBenchを導入し、知識、技能、態度に沿って教育能力を測定する。
- 参考スコア(独自算出の注目度): 2.6438280473793987
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Language is the target of most early intervention for autistic children. Because the goal and the method change from child to child, the work falls to a teacher who takes one child at a time and judges each scene as it unfolds. Artificial intelligence is now being brought to that work, yet the benchmarks that reach special education ask what a model knows rather than what it does in front of a child. Building one is not straightforward, since whether a response is good teaching depends on what the child has just done, so no answer key applies. The evidence that settles it is visual as much as verbal, since the length of a wait, a shift of gaze, and the child's uptake leave no trace in a transcript. We introduce \emph{SpecialEduBench}, which measures pedagogical competence along knowledge, skill, and attitude, with 4,537 knowledge items and with 200 skill items and 68 attitude items built on recorded intervention, the attitude items crossing pressure with monitoring into 192 response cells. Seven special-education experts wrote, scored, and reviewed the items, and we revised the judge model's instruction against the reference scores they set. Across eight frontier vision-language models no axis is saturated, since the strongest still fails about a tenth of the honesty cells. The models converge where the knowledge is factual and separate where the task is situated, and the failures gather where pressure is applied. We intend the benchmark as an audit to run before deployment and as a starting point for models built for this domain.
- Abstract(参考訳): 言語は自閉症児の最も初期の介入の標的である。
目的と方法が子供から子供へと変わるため、仕事は一度に1人の子供を連れて行く教師に委ねられ、各場面が展開するにつれて判断される。
人工知能(AI)は、今その仕事に持ち込まれていますが、特別な教育を受けるためのベンチマークでは、子どもの前で何をするかではなく、モデルが何を知っているのかを尋ねています。
なぜなら、反応が良い教育であるかどうかは、子供がやったことに依存するため、答えキーは適用されないからである。
それは、待ち時間の長さ、視線の変化、そして子供の取り込みが書き起こしに痕跡を残していないためである。
我々は,知識,技能,態度の教育的能力を測定する「emph{ SpecialEduBench}」を紹介し,4,537個の知識項目,記録介入に基づく200個のスキル項目と68個の態度項目,192個の応答セルへのモニタリングによる姿勢項目の交差圧について紹介した。
7名の特別教育専門家が項目を作成,採点,レビューし,基準点に対する審査モデルの指導を改訂した。
8つのフロンティア・ヴィジュアル言語モデルでは、最も強いものは正直な細胞の約10分の1に失敗するため、軸が飽和していない。
モデルは知識が事実である場所に収束し、タスクがどこにあるのかを分離し、失敗は圧力が適用される場所に集結する。
このベンチマークは、デプロイ前に実施する監査と、このドメインで構築されたモデルの出発点として意図しています。
関連論文リスト
- OptoAgent: A Trustworthy Multi-Agent Framework for Opportunistic Vision Micro-Screening in Classroom Environments [1.6791044863781395]
私たちはSightSentinelを紹介します。これは、子供がすでに読んでいる壁のディスプレイを、繰り返し表示されるスクリーニングサイトに変えるアーキテクチャです。
本報告では, 定式化, アーキテクチャ, 臨床基準に対する4段階の検証プロトコル, アプローチを拒否すべき条件について述べる。
論文 参考訳(メタデータ) (2026-09-13T13:38:10Z) - KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old? [79.27736230305516]
人間の視覚発達理論に基づく新しいベンチマークであるKidVisを紹介する。
人間の生理的ベースラインに対する20の最先端MLLMを評価すると、パフォーマンスの相違が明らかになる。
この研究は、現在のMLLMは、彼らの推論能力にもかかわらず、一般化された視覚知能に必要な生理的知覚的プリミティブが欠如していることを確認する。
論文 参考訳(メタデータ) (2026-01-13T07:32:50Z) - Assessing the alignment between infants' visual and linguistic experience using multimodal language models [2.275358921334511]
日常学習における子どもの視覚的・言語的経験と時間的整合性について
学習のための理想化された整列モーメントは、現代の機械学習データセットと比較して、子供の日常体験において比較的稀であることを示す。
これらの結果から, 単語学習を記述したモデルでは, 頻繁なアライメントが制約であることが示唆された。
論文 参考訳(メタデータ) (2025-11-24T06:58:16Z) - Employing self-supervised learning models for cross-linguistic child speech maturity classification [38.411292716220174]
子どもの発声を識別するために,新しいデータセットであるSpeechMaturityを最先端のトランスフォーマーモデルに適用する。
データセットには242,004のラベル付き発声が含まれている。
データセットでトレーニングされたモデルは、以前のデータセットでトレーニングされた最先端モデルを上回っ、人間に匹敵する分類精度を達成し、農村部や都市部で堅牢であった。
論文 参考訳(メタデータ) (2025-06-10T17:20:02Z) - Self-Supervised Models for Phoneme Recognition: Applications in Children's Speech for Reading Learning [9.670752318129326]
まず, フランス語音声における音素認識に適応したwav2vec 2.0, HuBERT, WavLMモデルを比較した。
次に,子音の微調整中に変圧器ブロックを解凍することで適応する。
We show that WavLM base+ is more robust to various reading task and noise levels。
論文 参考訳(メタデータ) (2025-03-06T18:57:16Z) - Evaluating Large Vision-and-Language Models on Children's Mathematical Olympiads [74.54183505245553]
ジョイントビジョンとテキスト推論のためのAI能力の体系的分析は、現在の科学文献に欠けている。
我々は,子どものオリンピアードからのビジュオ言語問題を用いて,その数学的およびアルゴリズム的推論能力に基づいて,最先端のLVLMを評価した。
以上の結果から,近代のLVLMは,高学年の問題解決において,より強力な推論能力を示す一方で,幼児向けの問題に正しく答える基盤が欠如していることが示唆された。
論文 参考訳(メタデータ) (2024-06-22T05:04:39Z) - Instruction-following Evaluation through Verbalizer Manipulation [64.73188776428799]
本稿では,動詞操作と呼ばれる新しい指示追従評価プロトコルを提案する。
モデルにタスクラベルを、異なる範囲のモデル先行と整合した単語で言語化するように指示する。
異なる家族や規模にわたるモデルの指示追従能力は、より自然な話し手の性能によって著しく異なることが観察された。
論文 参考訳(メタデータ) (2023-07-20T03:54:24Z) - Computational Language Acquisition with Theory of Mind [84.2267302901888]
我々は、心の理論(ToM)を備えた言語学習エージェントを構築し、その学習過程への影響を測定する。
重み付けされたToMリスナーコンポーネントを用いた学習話者は,画像参照ゲームの設定において,性能向上につながることがわかった。
論文 参考訳(メタデータ) (2023-03-02T18:59:46Z) - Improving Children's Speech Recognition by Fine-tuning Self-supervised
Adult Speech Representations [2.2191297646252646]
幼児の音声認識は、包括的音声認識技術を構築する際には不可欠だが、ほとんど見過ごされる領域である。
近年の自己教師型学習の進歩は、このデータ不足の問題を克服する新たな機会を生み出している。
子どもの音声認識のためのモデルを構築するために,自己指導型成人音声表現を活用し,よく知られた幼児音声コーパスを3つ利用した。
論文 参考訳(メタデータ) (2022-11-14T22:03:36Z) - Fantastic Questions and Where to Find Them: FairytaleQA -- An Authentic
Dataset for Narrative Comprehension [136.82507046638784]
幼稚園児の物語理解に焦点を当てたデータセットであるFairytaleQAを8年生に紹介する。
FairytaleQAは10,580の明示的で暗黙的な質問で構成されており、278の子供フレンドリーな物語から導かれる。
論文 参考訳(メタデータ) (2022-03-26T00:20:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。