論文の概要: Single-agent vs. Multi-agents for Automated Video Analysis of On-Screen Collaborative Learning Behaviors
- arxiv url: http://arxiv.org/abs/2604.03631v1
- Date: Sat, 04 Apr 2026 08:01:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.683993
- Title: Single-agent vs. Multi-agents for Automated Video Analysis of On-Screen Collaborative Learning Behaviors
- Title(参考訳): シングルエージェント対マルチエージェントによるオンライン協調学習行動の自動ビデオ解析
- Authors: Likai Peng, Shihui Feng,
- Abstract要約: スクリーン上の学習行動は、学生が学習中にどのように情報を求め、利用し、生成するかについての貴重な洞察を提供する。
近年の視覚言語モデル(VLM)は、労働集約型手動コーディングを自動化する新しい機会を提供する。
本研究では,ビデオ解析におけるVLMベースのマルチエージェントシステムの有効性を実証し,マルチモーダルデータ解析のためのスケーラブルなフレームワークを提供する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-screen learning behavior provides valuable insights into how students seek, use, and create information during learning. Analyzing on-screen behavioral engagement is essential for capturing students' cognitive and collaborative processes. The recent development of Vision Language Models (VLMs) offers new opportunities to automate the labor-intensive manual coding often required for multimodal video data analysis. In this study, we compared the performance of both leading closed-source VLMs (Claude-3.7-Sonnet, GPT-4.1) and open-source VLM (Qwen2.5-VL-72B) in single- and multi-agent settings for automated coding of screen recordings in collaborative learning contexts based on the ICAP framework. In particular, we proposed and compared two multi-agent frameworks: 1) a three-agent workflow multi-agent system (MAS) that segments screen videos by scene and detects on-screen behaviors using cursor-informed VLM prompting with evidence-based verification; 2) an autonomous-decision MAS inspired by ReAct that iteratively interleaves reasoning, tool-like operations (segmentation/ classification/ validation), and observation-driven self-correction to produce interpretable on-screen behavior labels. Experimental results demonstrated that the two proposed MAS frameworks achieved viable performance, outperforming the single VLMs in scene and action detection tasks. It is worth noting that the workflow-based agent achieved best on scene detection, and the autonomous-decision MAS achieved best on action detection. This study demonstrates the effectiveness of VLM-based Multi-agent System for video analysis and contributes a scalable framework for multimodal data analytics.
- Abstract(参考訳): スクリーン上の学習行動は、学生が学習中にどのように情報を求め、利用し、生成するかについての貴重な洞察を提供する。
スクリーン上での行動エンゲージメントの分析は、学生の認知的・協調的プロセスを捉える上で不可欠である。
近年のVLM(Vision Language Models)は、マルチモーダルビデオデータ分析にしばしば必要とされる労働集約型手動コーディングを自動化する新たな機会を提供する。
本研究では,ICAPフレームワークを用いた協調学習環境下での画面記録の自動符号化のための単一および複数エージェント設定において,主要なクローズドソースVLM(Claude-3.7-Sonnet, GPT-4.1)とオープンソースVLM(Qwen2.5-VL-72B)の性能を比較した。
特に2つのマルチエージェントフレームワークを提案し比較した。
1)カーソルインフォームドVLMを用いて映像をシーンごとに分割し,画面上での動作を検出する3エージェントワークフローマルチエージェントシステム(MAS)
2)ReActにインスパイアされた自律意思決定MASは、推論、ツールライクな操作(分類・分類・検証)、観察駆動の自己補正を反復的にインターリーブし、スクリーン上で解釈可能な行動ラベルを生成する。
実験の結果,2つのMASフレームワークは,シーンおよびアクション検出タスクにおいて,単一のVLMよりも優れた性能を示した。
ワークフローベースのエージェントはシーン検出において最善を尽くし、自律決定MASはアクション検出において最善を尽くした点に注意が必要である。
本研究では,ビデオ解析におけるVLMベースのマルチエージェントシステムの有効性を実証し,マルチモーダルデータ解析のためのスケーラブルなフレームワークを提供する。
関連論文リスト
- MVR: Multi-view Video Reward Shaping for Reinforcement Learning [17.20077949643041]
MVR(Multi-View Video Reward Shaping)は、複数の視点から撮影したビデオを用いて、対象タスクに関する状態の関連性をモデル化するフレームワークである。
MVRは、画像ベースの手法に固有の特定の静的ポーズに対するバイアスを軽減する状態関連関数を学習する。
タスク固有の報酬とVLMに基づくガイダンスを統合した状態依存報酬形成形式を導入する。
論文 参考訳(メタデータ) (2026-03-02T10:24:04Z) - Training Multi-Image Vision Agents via End2End Reinforcement Learning [51.81337984526068]
我々は、エンドツーエンドの強化学習によって訓練されたオープンソースの視覚エージェントであるIMAgentを提案する。
マルチエージェントシステムを利用することで、困難かつ視覚的にリッチなマルチイメージQAペアを生成する。
我々は、視覚的反射と確認のための2つの特別なツールを開発し、モデルが積極的に画像コンテンツに注意を向けることを可能にする。
論文 参考訳(メタデータ) (2025-12-05T10:02:38Z) - Learning from Online Videos at Inference Time for Computer-Use Agents [41.90425060535666]
我々は,コンピュータ利用エージェントがオンラインビデオから推論時に効果的に学習できるようにする方法について研究する。
本稿では,チュートリアルビデオの検索とフィルタリングを行い,それらを構造化されたデモトラジェクトリに変換し,動的にトラジェクトリをコンテキスト内ガイダンスとして選択するフレームワークを提案する。
私たちのフレームワークは、テキストのチュートリアルや書き起こしのみを使用する強力なベースエージェントや変種を一貫して上回ります。
論文 参考訳(メタデータ) (2025-11-06T07:29:02Z) - Dual Learning with Dynamic Knowledge Distillation and Soft Alignment for Partially Relevant Video Retrieval [53.54695034420311]
実際には、ビデオは通常、より複雑な背景コンテンツによって、長い時間で切り離される。
本稿では,大規模視覚言語事前学習モデルから一般化知識を抽出する新しい枠組みを提案する。
実験により,本モデルがTVR,ActivityNet,Charades-STAデータセット上での最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2025-10-14T08:38:20Z) - VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents [105.43882565434444]
VLM2Vec-V2は、様々な視覚形態にまたがる埋め込みを学習するための統一的なフレームワークである。
まず、MMEBを5つの新しいタスクタイプで拡張する包括的なベンチマークであるMMEB-V2を紹介する。
次に、テキスト、画像、ビデオ、ビジュアルドキュメント入力をサポートする汎用埋め込みモデルであるVLM2Vec-V2を訓練する。
論文 参考訳(メタデータ) (2025-07-07T00:51:57Z) - CML-MOTS: Collaborative Multi-task Learning for Multi-Object Tracking
and Segmentation [31.167405688707575]
ビデオフレーム上でのインスタンスレベルの視覚分析のためのフレームワークを提案する。
オブジェクト検出、インスタンスセグメンテーション、マルチオブジェクトトラッキングを同時に行うことができる。
提案手法は, KITTI MOTS と MOTS Challenge のデータセットを用いて広範に評価する。
論文 参考訳(メタデータ) (2023-11-02T04:32:24Z) - Adapting Pre-trained Language Models to Vision-Language Tasks via
Dynamic Visual Prompting [83.21164539349273]
事前学習型言語モデル (PLM) はマルチメディア研究においてその役割を担っている。
本稿では,視覚言語推論タスクのスタンドアロンモデルとしてのPLMの探索に焦点をあてる。
ダイナミックビジュアル・プロンプティング(DVP)と呼ばれるPLMのための新しいトランスファー学習手法を提案する。
論文 参考訳(メタデータ) (2023-06-01T07:19:28Z) - MIST: Multiple Instance Self-Training Framework for Video Anomaly
Detection [76.80153360498797]
タスク固有の識別表現を効率的に洗練するためのマルチインスタンス自己学習フレームワーク(MIST)を開発した。
mistは1)スパース連続サンプリング戦略を適用し,より信頼性の高いクリップレベル擬似ラベルを生成するマルチインスタンス擬似ラベル生成器,2)自己誘導型注意強調特徴エンコーダで構成される。
本手法は,上海技術におけるフレームレベルのAUC 94.83%の取得において,既存の教師付きおよび弱教師付き手法と同等あるいはそれ以上に機能する。
論文 参考訳(メタデータ) (2021-04-04T15:47:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。