論文の概要: ChildGaze: A Benchmark Dataset for Collaborative Behavior Understanding in Children
- arxiv url: http://arxiv.org/abs/2609.06353v1
- Date: Sun, 06 Sep 2026 03:07:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 05:55:55.064027
- Title: ChildGaze: A Benchmark Dataset for Collaborative Behavior Understanding in Children
- Title(参考訳): ChildGaze: 子どもの協調行動理解のためのベンチマークデータセット
- Abstract要約: ChildGazeは子中心の行動アノテーションデータセットで、ChildPlayビデオコレクション上に構築されている。
ChildGazeは、自然主義的な子育てとピアインタラクションにおける協調行動を研究するための信頼性の高いベンチマークを提供する。
- 参考スコア(独自算出の注目度): 3.2769173057785212
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding collaborative behavior in children is important for analyzing social participation, peer interaction, shared attention, and engagement during play and learning activities. Reliable recognition of these cues can support research in child development, educational analysis, and human-centered computer vision. However, estimating where a child is looking does not necessarily reveal whether the child is actively participating in a shared activity. To support this higher-level analysis, we introduce ChildGaze, a child-centered behavioral annotation dataset built on the ChildPlay video collection [1]. ChildGaze introduces two behavioral labels, collaborative and non-collaborative, assigned independently to each child within a frame. The dataset provides face, left-hand, and right-hand bounding boxes for children and adults and organizes the annotations at the row, person, and frame levels. The current release contains 27 annotated video files, 10,641 frames, and 73,268 body-part annotation rows. Annotation reliability was evaluated on 1,187 frames using independent annotations from two annotators. The collaboration labels achieved 93.16% raw agreement and a Cohen's kappa of 0.8631, while bounding-box annotations achieved an overall mean IoU of 0.808. Baseline experiments with pretrained ViT and Swin Transformer models achieved up to 97.44% child-person-level accuracy and 96.80% frame-level accuracy, respectively. These results show that ChildGaze provides a reliable benchmark for studying collaborative behavior in naturalistic child-adult and peer interactions.
- Abstract(参考訳): 子どもの協調行動を理解することは、遊びや学習活動における社会的参加、相互交流、共有された注意、エンゲージメントを分析する上で重要である。
これらのキューの信頼性の高い認識は、児童発達、教育分析、人間中心のコンピュータビジョンの研究を支援することができる。
しかし、子供が見ている場所を推定することは、子供が共有活動に参加しているかどうかを必ずしも明らかにしない。
この高レベルな分析をサポートするために、子中心の振る舞いアノテーションデータセットであるChildGazeを紹介します。
ChildGazeは、コラボレーティブと非コラボレーティブという2つの行動ラベルを導入し、フレーム内の各子供に独立して割り当てる。
データセットは、子供や大人のための顔、左利き、右利きのバウンディングボックスを提供し、行、人、フレームレベルでアノテーションを整理する。
現在のリリースには、27の注釈付きビデオファイル、10,641フレーム、73,268のボディ部分アノテーション行が含まれている。
アノテーションの信頼性を2つのアノテーションからの独立アノテーションを用いて1,187フレームで評価した。
コラボレーションラベルは93.16%の生契約、コーエンのカッパは0.8631、バウンディングボックスアノテーションは0.808の全体的な平均IoUを達成した。
事前訓練されたViTモデルとSwin Transformerモデルによるベースライン実験は、それぞれ97.44%の児童レベルの精度と96.80%のフレームレベルの精度を達成した。
これらの結果から,ChildGazeは自然主義的児童・親子間相互作用における協調行動を研究するための信頼性の高いベンチマークを提供することが示された。
関連論文リスト
- CoMind: Understanding Collaborative Human Activity from Multiple Minds and Views [82.15362247351763]
調理シナリオにおける現実のコラボレーションをキャプチャする,エゴセントリックでエクソセントリックなビデオデータセットを新たに導入する。
このデータセットは、マルチパースペクティブなビデオ、高品質なオーディオ、視線追跡、および3Dシーンとオブジェクトスキャンを統合する。
我々は,共同注意推定,社会的条件付きオブジェクトインタラクション予測,協調的ハンドオーバ予測のベンチマークを構築した。
論文 参考訳(メタデータ) (2026-07-07T18:08:45Z) - Learning Human-Object Interaction as Groups [52.28258599873394]
GroupHOIは、幾何学的近接性および意味的類似性の観点から文脈情報を伝播するフレームワークである。
これは、より困難な非言語間相互作用検出タスクにおいて、主要なパフォーマンスを示す。
論文 参考訳(メタデータ) (2025-10-21T07:25:10Z) - ChildPlay-Hand: A Dataset of Hand Manipulations in the Wild [11.306212771477645]
ChildPlay-Handは、人とオブジェクトのバウンディングボックスと操作アクションを含む、新しいデータセットである。
操作アクションは、把握、保持、操作、および異なるタイプのリリースなど、HOIサイクルのメインステージをカバーする。
我々は,様々な時間的・分節ネットワークをベンチマークし,身体と手領域の情報を探索し,ポーズとRGBのモダリティを比較した。
論文 参考訳(メタデータ) (2024-09-14T05:35:46Z) - UpStory: the Uppsala Storytelling dataset [2.7895834501191823]
UpStoryは、小学生間の自然主義的なダイアド相互作用のデータセットである。
データセットには35対のデータが含まれており、合計で3時間40mのオーディオとビデオが記録される。
データセットの匿名化バージョンが公開されており、フレーム単位のヘッドポーズ、ボディポーズ、顔の特徴が含まれている。
論文 参考訳(メタデータ) (2024-07-05T08:46:16Z) - ChildPlay: A New Benchmark for Understanding Children's Gaze Behaviour [18.885623017619988]
本研究は、子どもの視線目標と相互作用する大人の視線目標を予測するための最初の研究である。
コントロールされていない環境で大人と遊んだり、交流したりした子どもたちを対象とする、短いビデオクリップのキュレートされたコレクションであるChildPlayデータセットを紹介した。
本研究では,3次元視野におけるシーン部分を明確に識別することで,幾何学的にグラウンド化された視線目標予測のための新しいモデルを提案する。
論文 参考訳(メタデータ) (2023-07-04T10:26:53Z) - Multi-View Correlation Consistency for Semi-Supervised Semantic
Segmentation [59.34619548026885]
半教師付きセマンティックセグメンテーションは、ラベルなしデータのリッチで堅牢な監視を必要とする。
本稿では,異なるビュー間の画素・画素対応を保証するビューコヒーレントなデータ拡張戦略を提案する。
2つのデータセットの半教師付き設定では、最先端の手法と比較して、競争の正確さが報告される。
論文 参考訳(メタデータ) (2022-08-17T17:59:11Z) - ChildCI Framework: Analysis of Motor and Cognitive Development in Children-Computer Interaction for Age Detection [4.442846744776511]
本稿では、最近のChildCIフレームワークで提案されている異なるテストの包括的な分析について述べる。
本稿では,子どもがモバイルデバイスと対話する際の運動・認知的側面に関連する,100以上のグローバルな特徴について述べる。
93%以上の精度は、公開されているChildCIdb_v1データベースを使って達成される。
論文 参考訳(メタデータ) (2022-04-08T18:03:39Z) - Kinship Verification Based on Cross-Generation Feature Interaction
Learning [53.62256887837659]
顔画像からの血縁検証は、コンピュータビジョンの応用において、新しいが挑戦的な技術として認識されている。
本稿では,頑健な親族関係検証のためのクロスジェネレーション・インタラクション・ラーニング(CFIL)フレームワークを提案する。
論文 参考訳(メタデータ) (2021-09-07T01:50:50Z) - Analyzing and Mitigating Interference in Neural Architecture Search [96.60805562853153]
本研究では、異なる子モデルをサンプリングし、共有演算子の勾配類似度を計算することで干渉問題を解明する。
これら2つの観測から着想を得て、干渉を緩和するための2つのアプローチを提案する。
検索したアーキテクチャは、RoBERTa$_rmbase$が1.1、0.6、ELECTRA$_rmbase$が1.6、テストセットであるGLUEベンチマークで1.1より優れています。
論文 参考訳(メタデータ) (2021-08-29T11:07:46Z) - Learning task-agnostic representation via toddler-inspired learning [19.478820330574628]
我々は,幼児の行動を通じて,高度に意図的な学習システムからインスピレーションを得た。
幼児の学習手順に触発されて,タスクに依存しない視覚表現を学習し,記憶できる対話型エージェントを設計する。
実験の結果,これらの表現は様々な視覚タスクに拡張可能であることがわかった。
論文 参考訳(メタデータ) (2021-01-27T06:26:56Z) - ConsNet: Learning Consistency Graph for Zero-Shot Human-Object
Interaction Detection [101.56529337489417]
画像中のHuman, Action, Object>の形のHOIインスタンスを検出・認識することを目的としたHuman-Object Interaction (HOI) Detectionの問題点を考察する。
我々は、オブジェクト、アクション、インタラクション間の多レベルコンパレンシーは、稀な、あるいは以前には見られなかったHOIのセマンティック表現を生成するための強力な手がかりであると主張している。
提案モデルでは,人-対象のペアの視覚的特徴とHOIラベルの単語埋め込みを入力とし,それらを視覚-意味的関節埋め込み空間にマッピングし,類似度を計測して検出結果を得る。
論文 参考訳(メタデータ) (2020-08-14T09:11:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。