論文の概要: Robust and Efficient Motion Reasoning for Privacy-Aware Classroom Incident Recognition
- arxiv url: http://arxiv.org/abs/2608.05115v1
- Date: Wed, 05 Aug 2026 17:46:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.066179
- Title: Robust and Efficient Motion Reasoning for Privacy-Aware Classroom Incident Recognition
- Title(参考訳): プライバシーに配慮したクラスルームインシデント認識のためのロバストかつ効率的な動作推論
- Authors: Paritosh Parmar, Landy Lan, Hong Yang, Chen Yi, Chiat Pin Tay,
- Abstract要約: 本稿では,CCTVスタイルのビデオと実世界の教室のポーズデータを組み合わせた新しいベンチマークを提案する。
動作方向, 速度, 加速度, 強度において, 単独の動作よりも多くの事象が異なるという観察に動機づけられた, 軽量だが頑健な動き推論フレームワークを提案する。
我々のモデルは計算コストの10分の1以下でかなり大きなベースラインを上回ります。
- 参考スコア(独自算出の注目度): 7.461472623142273
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Can computer vision help make classrooms safer? In this pilot study, we investigate privacy-aware and computationally efficient classroom incident recognition from CCTV-style observations. This setting remains underexplored, with limited benchmarks and few methods designed for the privacy, efficiency, and generalization demands of real-world deployment. We introduce a novel hybrid benchmark combining generative CCTV-style videos with real-world classroom pose data, and propose a lightweight, but robust motion-reasoning framework motivated by the observation that many incidents differ more in motion direction, speed, acceleration, and intensity than in pose alone. To that end, our method first constructs hierarchical kinematic representations of human actions. Our method then distills hierarchical, multi-order kinematic reasoning from a large teacher into a much smaller single-order student, enabling efficient per-person inference while preserving expressive motion understanding. Experiments show that our model outperforms substantially larger baselines at less than one-tenth of their computational cost, while also demonstrating stronger out-of-domain motion reasoning and zero-shot synthetic-to-real generalization. We will publicly release the benchmark, codebase, and supporting tools to facilitate further research in privacy-aware classroom safety.
- Abstract(参考訳): コンピュータービジョンは教室をより安全にするのに役立つのか?
本研究では,CCTV方式の観測結果から,プライバシ意識と計算効率のよい教室インシデント認識について検討する。
この設定は、限られたベンチマークと、現実のデプロイメントにおけるプライバシ、効率、一般化の要求のために設計されたいくつかのメソッドで、未調査のままである。
本稿では,CCTV形式の映像と実世界の教室のポーズデータを組み合わせた新しいハイブリッド・ベンチマークを提案する。また,動作方向,速度,加速度,強度において,単独よりも多くの事象が異なるという観察を動機とした,軽量だが頑健な動き推論フレームワークを提案する。
そこで本手法はまず,人間の行動の階層的キネマティック表現を構築する。
提案手法は,大規模教師の階層的・多階キネマティック推論をより小さい一階の学生に蒸留し,表現的動作理解を保ちながら効率よく個人ごとの推論を可能にする。
実験により,我々のモデルは計算コストの10分の1以下でかなり大きなベースラインを上回り,さらにドメイン外運動推論とゼロショット合成-実一般化を実証した。
私たちは、プライバシーに配慮した教室の安全性に関するさらなる研究を促進するために、ベンチマーク、コードベース、サポートツールを公開します。
関連論文リスト
- KAI: A Kinematic-Aware Interface for Data-Efficient Articulated Object Manipulation [63.408378267309786]
人工物体の操作には、ロボットのデモンストレーションだけでは学べない運動構造を理解する必要がある。
本稿では,音節オブジェクトの運動構造をキャプチャする中間表現であるKAI(Kinematic-Aware Articulation Interface)を紹介する。
解釈可能な幾何学的および運動論的事前を政策学習に組み込むことで、KAIは調音運動の基盤構造に沿った強い帰納的バイアスを与える。
論文 参考訳(メタデータ) (2026-07-27T14:29:47Z) - Multi-Camera View Scaling for Data-Efficient Robot Imitation Learning [57.88781687419521]
複数の同期カメラパースペクティブを使用して、各専門家軌跡から擬似演示を生成する。
シミュレーションと実世界の操作タスクの実験は、データ効率と一般化の著しい向上を示している。
以上の結果から,カメラビューのスケーリングは,模倣学習のための実用的でスケーラブルなソリューションであることが示唆された。
論文 参考訳(メタデータ) (2026-04-01T07:00:44Z) - InterReal: A Unified Physics-Based Imitation Framework for Learning Human-Object Interaction Skills [16.31202379413011]
我々は,現実世界の人間-物体間相互作用(HOI)制御のための統合物理学に基づく模倣学習フレームワークを開発した。
InterRealは、人間型ロボットがHOI参照動作をトラッキングし、きめ細かい対話的スキルの学習を容易にする。
クリティカルトラッキングエラーメトリクスによって導かれるメタ政治は、低レベルの強化学習目標に対して報酬信号を探索し、割り当てる。
論文 参考訳(メタデータ) (2026-03-08T07:44:35Z) - ConLA: Contrastive Latent Action Learning from Human Videos for Robotic Manipulation [27.54751123419347]
人間のビデオからロボットポリシーを学習するための教師なし事前学習フレームワークであるConLAを提案する。
人間のビデオのみに事前学習を行うことで、実際のロボット軌道事前学習で得られた性能を初めて上回ります。
論文 参考訳(メタデータ) (2026-01-31T06:40:57Z) - Generalizable Geometric Prior and Recurrent Spiking Feature Learning for Humanoid Robot Manipulation [90.90219129619344]
本稿では,スパイキング機能を備えたR-prior-S, Recurrent Geometric-priormodal Policyを提案する。
物理的現実の高レベル推論を基礎として、軽量な2次元幾何学的帰納バイアスを利用する。
ロボット行動生成におけるデータ効率問題に対して,再帰的適応スパイクネットワークを導入する。
論文 参考訳(メタデータ) (2026-01-13T23:36:30Z) - Self-Augmented Robot Trajectory: Efficient Imitation Learning via Safe Self-augmentation with Demonstrator-annotated Precision [2.3548641190233264]
自己拡張型ロボット軌道(Self-Augmented Robot Trajectory, SART)は、一つの人間のデモンストレーションからポリシー学習を可能にするフレームワークである。
SARTは、人間による実証にのみ訓練されたポリシーよりも、はるかに高い成功率を達成する。
論文 参考訳(メタデータ) (2025-09-11T23:10:56Z) - Reinforcement Learning for Decision-Level Interception Prioritization in Drone Swarm Defense [51.736723807086385]
本稿では,この課題に対処する上で,強化学習の実践的メリットを示すケーススタディを提案する。
本研究では,現実的な運用制約を捉えた高忠実度シミュレーション環境を提案する。
エージェントは最適なインターセプション優先順位付けのために複数のエフェクターを調整することを学ぶ。
我々は、何百ものシミュレートされた攻撃シナリオにおいて、手作りルールベースのベースラインに対する学習ポリシーを評価する。
論文 参考訳(メタデータ) (2025-08-01T13:55:39Z) - CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning [47.195002937893115]
CoMoは、多様なインターネットスケールのビデオから、より情報に富んだ連続的な動きの表現を学ぶことを目指している。
動作評価と学習指導のための2つの新しい指標を提案する。
CoMoは強力なゼロショットの一般化を示しており、以前は目に見えないビデオドメインに対して連続的な擬似アクションを生成することができる。
論文 参考訳(メタデータ) (2025-05-22T17:58:27Z) - Efficient Object-centric Representation Learning with Pre-trained Geometric Prior [1.9685736810241874]
本稿では、幾何学的理解を重視し、事前学習された視覚モデルを利用して物体発見を促進する弱教師付きフレームワークを提案する。
本手法では,オブジェクト中心学習に特化して設計された効率的なスロットデコーダを導入し,露骨な深度情報を必要としない多目的シーンの効率的な表現を可能にする。
論文 参考訳(メタデータ) (2024-12-16T20:01:35Z) - Stochastic Coherence Over Attention Trajectory For Continuous Learning
In Video Streams [64.82800502603138]
本稿では,映像ストリーム中のピクセルワイズ表現を段階的かつ自律的に開発するための,ニューラルネットワークに基づく新しいアプローチを提案する。
提案手法は, 参加者の入場地を観察することで, エージェントが学習できる, 人間の様の注意機構に基づく。
実験では,3次元仮想環境を利用して,映像ストリームを観察することで,エージェントが物体の識別を学べることを示す。
論文 参考訳(メタデータ) (2022-04-26T09:52:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。