論文の概要: FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2608.08736v1
- Date: Sun, 09 Aug 2026 14:28:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.937043
- Title: FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models
- Title(参考訳): FitAQA:マルチモーダル大言語モデルの適合度行動品質評価ベンチマーク
- Abstract要約: 本稿では、フィットネスAQAにおけるマルチモーダル言語モデル(MLLM)の評価のための体系的なベンチマークであるFitAQAを紹介する。
6つの相補的な品質次元内で38の繰り返しフォームエラーを定義する統一型形式誤り分類法を開発した。
FitAQAはさらに、関連する視覚的証拠を認識するための認識、その証拠をドメイン知識と組み合わせて実行の正確さを評価する判断、時間とともにフォームエラーをローカライズするための時間的根拠の3つの評価タスクを定式化している。
- 参考スコア(独自算出の注目度): 12.824373478041737
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fitness Action Quality Assessment (AQA) is important for intelligent sports training, yet the capabilities of Multimodal Large Language Models (MLLMs) in this setting remain underexplored. Existing benchmarks rely on action-specific annotation schemes and focus primarily on final assessment outputs, offering limited insight into how models assess exercise quality. We introduce FitAQA, a systematic benchmark for evaluating MLLMs in fitness AQA, containing 2,219 videos and 5,512 QA instances across 30 bodyweight exercises. In collaboration with experts in sports science, we develop a unified form error taxonomy that defines 38 recurring form errors within six complementary quality dimensions: alignment, symmetry, stability, coordination, tempo, and completeness. This taxonomy provides a shared assessment framework across different exercises. FitAQA further formulates three evaluation tasks: perception for recognizing relevant visual evidence, judgement for combining that evidence with domain knowledge to assess execution correctness, and temporal grounding for localizing form errors over time. Extensive evaluation shows that current MLLMs still struggle to assess exercise quality comprehensively and localize form errors precisely. Controlled experiments further indicate that visual perception is a key bottleneck, as judgement performance improves substantially when ground-truth perceptual evidence is provided. The dataset and evaluation code will be made publicly available.
- Abstract(参考訳): AQA(Fitness Action Quality Assessment)は、知的スポーツトレーニングにおいて重要であるが、この設定におけるMLLM(Multimodal Large Language Models)の機能はまだ未定である。
既存のベンチマークはアクション固有のアノテーションスキームに依存しており、最終的な評価結果に重点を置いており、モデルがエクササイズ品質を評価する方法に関する限られた洞察を提供している。
本研究では、フィットネスAQAのMLLMを評価するための体系的ベンチマークであるFitAQAを紹介し、30回の体重運動で2,219の動画と5,512のQAインスタンスを含む。
スポーツ科学の専門家と共同で、アライメント、対称性、安定性、コーディネーション、テンポ、完全性の6つの相補的な品質次元において38の繰り返しフォームエラーを定義する統一型エラー分類を開発する。
この分類は、異なるエクササイズをまたいだ共有アセスメントフレームワークを提供する。
FitAQAはさらに、関連する視覚的証拠を認識するための認識、その証拠をドメイン知識と組み合わせて実行の正確さを評価する判断、時間とともにフォームエラーをローカライズするための時間的根拠の3つの評価タスクを定式化している。
大規模な評価では、現在のMLLMは、運動品質を包括的に評価し、フォームエラーを正確にローカライズするのに依然として苦労している。
制御された実験は、地味な知覚的証拠が提供されると判断性能が大幅に向上するので、視覚知覚が重要なボトルネックであることを示している。
データセットと評価コードは公開されます。
関連論文リスト
- PointQ-Bench: Benchmarking Diagnostic and Interpretable Point Cloud Quality Assessment [28.88904276309088]
ポイントクラウドの品質は、3D取得、再構築、レンダリング、知覚において重要な役割を果たす。
本稿では,PCQAをスカラースコアから包括的品質理解へ拡張するベンチマークであるPointQ-Benchを紹介する。
PointQ-Benchは,3,083のポイントクラウドで構成されている。
論文 参考訳(メタデータ) (2026-05-27T09:56:36Z) - ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning [59.558706734431276]
空間知能の現在の評価は、現代の視覚言語モデル(VLM)設定下で体系的に無効にすることができる。
本稿では,各QAペアが実際の入力の下で応答可能で正しいことを保証するためのベンチマークとプロトコルであるReVSIを紹介する。
論文 参考訳(メタデータ) (2026-04-27T10:45:51Z) - Can Vision Language Models Judge Action Quality? An Empirical Evaluation [5.688409551177917]
アクション・クオリティ・アセスメント(AQA)は、理学療法、スポーツコーチング、競争力判定に広く応用されている。
Vision Language Models (VLM) は AQA に対してかなりの保証を持っているが、この領域における実際のパフォーマンスは、ほとんど役に立たないままである。
本稿では,活動領域(例えば,フィットネス,フィギュアスケート,ダイビング,タスク,表現,促進戦略)における最先端VLMの総合評価について述べる。
論文 参考訳(メタデータ) (2026-04-09T14:29:19Z) - Decoupling Perception and Calibration: Label-Efficient Image Quality Assessment Framework [78.58395822978271]
LEAFはラベル効率の良い画像品質評価フレームワークである。
MLLM教師の知覚的品質の先行を軽量な学生回帰器に蒸留する。
提案手法は,強いMOS対応相関を維持しつつ,人間のアノテーションの必要性を著しく低減する。
論文 参考訳(メタデータ) (2026-01-28T15:15:17Z) - Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents [52.14392337070763]
CFG-Benchは、きめ細かな動作インテリジェンスを体系的に評価する新しいベンチマークである。
CFG-Benchは、1,368のキュレートされたビデオと19,562の3つのモダリティからなる質問応答ペアからなる。
CFG-Benchに関する包括的評価から,MLLMの先導者は,物理的相互作用の詳細な指示を生成するのに苦慮していることが明らかとなった。
論文 参考訳(メタデータ) (2025-11-24T02:02:29Z) - Continual Action Quality Assessment via Adaptive Manifold-Aligned Graph Regularization [53.82400605816587]
アクション品質アセスメント(AQA)は、ビデオにおける人間の行動を定量化し、スポーツスコアリング、リハビリテーション、スキル評価の応用を支援する。
大きな課題は、現実世界のシナリオにおける品質分布の非定常的な性質にある。
本稿では,進化する分布を扱うための連続学習機能を備えた連続AQA(Continuous AQA)を紹介する。
論文 参考訳(メタデータ) (2025-10-08T10:09:47Z) - Evaluating Variance in Visual Question Answering Benchmarks [0.9065034043031668]
視覚的質問応答(VQA)のための強力なツールとしてマルチモーダル大言語モデル(MLLM)が登場している。
それらの進歩にもかかわらず、VQAベンチマークにおけるMLLMの評価は、しばしば点推定に依存する。
本稿では、14の広く使用されているVQAベンチマークを分析し、これらの問題を批判的に検証する。
論文 参考訳(メタデータ) (2025-08-04T17:37:13Z) - Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens [30.083110119139793]
textbfAbilityLensはMLLMを6つの重要な知覚能力で評価する統合ベンチマークである。
我々は、現在のメインストリームMLLMの長所と短所を特定し、安定性パターンを強調し、最先端のオープンソースモデルとクローズドソースモデルの顕著なパフォーマンスギャップを明らかにする。
論文 参考訳(メタデータ) (2024-11-22T04:41:20Z) - Evaluating Generative Language Models in Information Extraction as Subjective Question Correction [49.729908337372436]
本稿では,新しい評価手法SQC-Scoreを提案する。
主観的質問訂正の原則に着想を得て,新しい評価手法SQC-Scoreを提案する。
3つの情報抽出タスクの結果から,SQC-Scoreは基準値よりもアノテータの方が好ましいことが示された。
論文 参考訳(メタデータ) (2024-04-04T15:36:53Z) - Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined
Levels [95.44077384918725]
スコアの代わりにテキスト定義のレーティングレベルを持つ大規模マルチモーダリティモデル(LMM)を提案する。
提案したQ-Alignは、画像品質評価(IQA)、画像美学評価(IAA)、映像品質評価(VQA)タスクにおける最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-12-28T16:10:25Z) - Uncertainty-Driven Action Quality Assessment [11.958132175629368]
本稿では,複数の判定スコアの多様性を捉えるために,不確実性駆動型AQA (UD-AQA) という新しい確率モデルを提案する。
我々は,AQA回帰損失の再重み付けに使用される各予測の不確かさを推定する。
提案手法は,オリンピックイベントMTL-AQAとFineDivingの3つのベンチマークと,手術スキルJIGSAWSデータセットの3つのベンチマークで比較結果を得た。
論文 参考訳(メタデータ) (2022-07-29T07:21:15Z) - Evaluation Gaps in Machine Learning Practice [13.963766987258161]
実際に、機械学習モデルの評価は、しばしば、非文脈化された予測行動の狭い範囲に焦点を当てる。
評価対象の理想化された幅と実際の評価対象の狭い焦点との間の評価ギャップについて検討した。
これらの特性を研究することで、規範的な影響を持つコミットメントの範囲について、機械学習分野の暗黙の仮定を実証する。
論文 参考訳(メタデータ) (2022-05-11T04:00:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。