論文の概要: Fairness-Aware Multimodal Transformer Modeling for Real-Time Student Attention Estimation
- arxiv url: http://arxiv.org/abs/2609.02232v1
- Date: Wed, 02 Sep 2026 07:42:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.138309
- Title: Fairness-Aware Multimodal Transformer Modeling for Real-Time Student Attention Estimation
- Title(参考訳): 実時間学生意識推定のための公平性を考慮したマルチモーダル変圧器モデリング
- Authors: Christoforos Fragkiadakis, Seyed Sahand Mohammadi Ziabari, Ali Mohammed Mansoor Alsahag,
- Abstract要約: DIPSER上での公平性を考慮したマルチモーダル時間モデルの評価を行った。
DIPSERは、顔画像、ウェアラブルセンサーの測定、アテンションアノテーション、自動推論された人口統計メタデータを組み合わせた、自然主義的な教室データセットである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automated student-attention estimation can support learning analytics, but aggregate predictive metrics can conceal demographic disparities. This study evaluates fairness-aware multimodal temporal models on DIPSER, a naturalistic classroom dataset combining facial images, wearable-sensor measurements, attention annotations, and automatically inferred demographic metadata. Three baselines are compared across 10 training seeds: a Visual GRU, a Sensor GRU, and a Residual Fusion Transformer. The multimodal model achieves the best mean test performance (MAE 0.283, RMSE 0.363) and the lowest worst-group error among the evaluated baselines, although its gain over the Visual GRU is modest. Gender- and age-targeted MAE-gap regularization reduces disparities on validation data, but these gains do not consistently transfer to held-out subjects or repeated subject-level splits. On an NVIDIA A100-SXM4-40GB GPU, the warm end-to-end pipeline averages 50.65 ms per prediction window at a one-second stride, while the temporal model itself requires 1.02 ms. The findings show that multimodal fusion can modestly improve prediction and worst-group performance, but validation-level fairness gains should not be assumed to generalize. Robust fairness assessment therefore requires subgroup-aware evaluation, repeated subject-level validation, and larger, better balanced demographic samples.
- Abstract(参考訳): 学生意識の自動推定は、学習分析をサポートすることができるが、集計された予測指標は、人口統計上の格差を隠蔽することができる。
本研究は,顔画像,ウェアラブルセンサ計測,アテンションアノテーション,自動推論された人口統計メタデータを組み合わせた自然主義教室データセットであるDIPSER上での公平性を考慮したマルチモーダル時間モデルを評価する。
3つのベースラインは、Visual GRU、Sensor GRU、Residual Fusion Transformerの10のトレーニングシードで比較される。
マルチモーダルモデルでは,最大平均テスト性能(MAE 0.283,RMSE 0.363)と評価ベースラインの中で最悪のグループ誤差を達成できる。
性別と年齢を目標としたMAEギャップ正規化は、検証データの格差を減少させるが、これらの利得は、保持対象または繰り返し対象レベルの分割に一貫して移行しない。
NVIDIA A100-SXM4-40GB GPUでは、温かいエンドツーエンドパイプラインは1秒間の予測ウィンドウで平均50.65ms、時間モデル自体は1.02msである。この結果は、マルチモーダル融合が予測と最悪のグループパフォーマンスを適度に改善できることを示しているが、検証レベルの公正性の向上は、一般化するべきではない。
したがって、ロバスト公正性評価には、サブグループ意識の評価、繰り返しの主観レベルの検証、より大きなバランスの取れた人口統計サンプルが必要である。
関連論文リスト
- Bias-Aware Machine Unlearning: Towards Fairer Vision Models via Controllable Forgetting [3.1959623025848405]
ディープニューラルネットワークはトレーニングデータに急激な相関関係に依存することが多く、医療や自動運転といった安全クリティカルな領域ではバイアスや不公平な予測が生じる。
機械学習の最近の進歩は、ポストホックモデルの修正に有望な代替手段を提供する。
論文 参考訳(メタデータ) (2025-09-09T07:25:51Z) - Test-Time Consistency in Vision Language Models [26.475993408532304]
VLM(Vision-Language Models)は、様々なマルチモーダルタスクにおいて優れたパフォーマンスを実現している。
MM-R3のような最近のベンチマークでは、最先端のVLMでさえ意味論的に等価な入力にまたがって分岐予測をもたらすことが強調されている。
教師付き再学習なしにセマンティックな一貫性を高める,シンプルで効果的なテスト時間一貫性フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-27T17:09:44Z) - Performance of Machine Learning Classifiers for Anomaly Detection in Cyber Security Applications [0.1601392577755919]
この研究は、2つの不均衡なパブリックデータセット上の機械学習モデルを実証的に評価する。
テスト対象はeXtreme Gradient Boosting (XGB) と Multi Layer Perceptron (MLP) である。
IterativeImputerの結果は平均値と中央値に匹敵するが、複雑性と実行時間の増加のために大規模なデータセットには推奨されない。
論文 参考訳(メタデータ) (2025-04-26T02:43:27Z) - No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance [68.18779562801762]
マルチモーダルモデルは、下流の"ゼロショット"のパフォーマンスを線形改善するために、指数関数的に多くのデータを必要とする。
本研究は,大規模な訓練パラダイムの下での「ゼロショット」一般化能力の鍵となる訓練データに対する指数関数的要求を明らかにする。
論文 参考訳(メタデータ) (2024-04-04T17:58:02Z) - Bias Amplification Enhances Minority Group Performance [10.380812738348899]
本稿では,新しい2段階学習アルゴリズムであるBAMを提案する。
第1段階では、各トレーニングサンプルに対して学習可能な補助変数を導入することにより、バイアス増幅方式を用いてモデルを訓練する。
第2段階では、バイアス増幅モデルが誤分類したサンプルを重み付けし、その後、再重み付けされたデータセット上で同じモデルをトレーニングし続けます。
論文 参考訳(メタデータ) (2023-09-13T04:40:08Z) - GREAT Score: Global Robustness Evaluation of Adversarial Perturbation using Generative Models [60.48306899271866]
GREATスコア(GREAT Score)と呼ばれる新しいフレームワークを提案する。
我々は,ロバストベンチにおける攻撃ベースモデルと比較し,高い相関性を示し,GREATスコアのコストを大幅に削減した。
GREAT Scoreは、プライバシーに敏感なブラックボックスモデルのリモート監査に使用することができる。
論文 参考訳(メタデータ) (2023-04-19T14:58:27Z) - Local Clustering with Mean Teacher for Semi-supervised Learning [8.54739245813914]
Tarvainen と Valpola の Mean Teacher (MT) モデルは、いくつかの半教師付きベンチマークデータセットで好成績を示した。
そこで本研究では,局所クラスタリング(LC)と呼ばれる簡易で効果的な手法を提案する。
論文 参考訳(メタデータ) (2020-04-20T22:31:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。