論文の概要: RoboVAD: A Large Cross-Domain Evaluation Benchmark for Anomaly Detection in Robotic Arm Manipulation Videos
- arxiv url: http://arxiv.org/abs/2609.17843v1
- Date: Tue, 15 Sep 2026 21:02:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.544378
- Title: RoboVAD: A Large Cross-Domain Evaluation Benchmark for Anomaly Detection in Robotic Arm Manipulation Videos
- Title(参考訳): RoboVAD:ロボットアーム操作ビデオにおける異常検出のための大規模クロスドメイン評価ベンチマーク
- Abstract要約: ビデオ異常検出(VAD)は、公共の監視や道路交通安全といった典型的なシナリオに広く応用される、活発に研究されている課題である。
本稿ではロボットアーム操作ビデオにおけるビデオ異常検出のための大規模ベンチマークであるRoboVADを紹介する。
我々は、ロボットアーム操作に特化して適応した新しい手法を含む、最先端のVAD手法を訓練し、評価する。
- 参考スコア(独自算出の注目度): 60.00002556483565
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Video anomaly detection (VAD) is an actively studied task, having wide applications in typical scenarios such as public surveillance and road traffic safety. The task is also relevant for robotic arm interactions, where it has several downstream applications, including learning better interaction and manipulation abilities, triggering recovery procedures when anomalies occur, etc. Despite its relevance, the exploration of anomaly detection in robotic arm manipulation videos is limited by the low number of available resources. To this end, we introduce RoboVAD, a large-scale benchmark for video anomaly detection that comprises challenging cross-domain evaluation scenarios, where certain actions (tasks executed by a robotic arm) and anomaly types (mistakes that occur while performing certain tasks) remain unseen during training. RoboVAD is designed to benchmark VAD methods in realistic scenarios, where robotic arms can perform unforeseen tasks, and thereby encounter new anomaly types. We train and evaluate several state-of-the-art VAD methods, including a novel method specifically adapted for robotic arm manipulation. While the proposed method outperforms many state-of-the-art competitors, all methods remain below a micro-averaged frame-level AUC threshold of 70% in the most challenging evaluation setup, confirming the difficulty of the proposed benchmark. We publicly release our dataset and code at https://zenodo.org/records/22754659.
- Abstract(参考訳): ビデオ異常検出(VAD)は、公共の監視や道路交通安全といった典型的なシナリオに広く応用される、活発に研究されている課題である。
このタスクは、ロボットアームのインタラクションにも関係しており、より優れたインタラクションと操作能力の学習、異常が発生した時の回復手順のトリガーなど、いくつかの下流アプリケーションを備えている。
その関連性にもかかわらず、ロボットアーム操作ビデオにおける異常検出の探索は、利用可能なリソースの少なさによって制限されている。
この目的のために,ビデオ異常検出のための大規模ベンチマークであるRoboVADを導入する。これは,特定の動作(ロボットアームによって実行されるタスク)と異常タイプ(タスクの実行中に発生するミス)がトレーニング中に見つからないような,クロスドメイン評価シナリオに挑戦するものだ。
RoboVADは、ロボットアームが予期せぬタスクを実行し、新たな異常タイプに遭遇する、現実的なシナリオでVADメソッドのベンチマークを行うように設計されている。
我々は、ロボットアーム操作に特化して適応した新しい手法を含む、最先端のVAD手法を訓練し、評価する。
提案手法は、多くの最先端の競合より優れているが、提案手法は、最も困難な評価設定において、平均フレームレベルのAUC閾値を70%以下に抑え、提案したベンチマークの難しさを確認する。
データセットとコードはhttps://zenodo.org/records/22754659で公開しています。
関連論文リスト
- Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents [58.49879338545782]
ロングホライゾンタスクは、現実のロボット展開では一般的なものだが、そのようなタスクの障害検出は未調査のままである。
動作条件付き世界モデルからの潜在表現を用いて、操作軌跡をモニタする故障検出フレームワークであるForesightを提案する。
この結果から, 動作条件付きワールドモデル埋め込みは, 長距離操作における信頼性のある故障監視のためのスケーラブルな表現を提供する可能性が示唆された。
論文 参考訳(メタデータ) (2026-06-22T09:32:28Z) - Fail-RAG : A Retrieval Augmented Generation Informed Framework for Robot Failure Identification [8.8407924555623]
Fail-RAGはRetrieval Augmented Generation (RAG)ベースの障害検出フレームワークである。
Fail-RAGは5種類のロボットで平均25パーセント高い障害検出精度を達成した。
論文 参考訳(メタデータ) (2026-06-17T21:02:47Z) - Guardian: Detecting Robotic Planning and Execution Errors with Vision-Language Models [53.20969621498248]
本稿では,多種多様な計画および実行障害を生成するために,軌道を手続き的に乱す自動ロボット故障合成手法を提案する。
RLBench-Fail, BridgeDataV2-Fail, UR5-Failの3つの新しい故障検出ベンチマークを構築した。
次に、詳細な障害推論と検出のためのマルチビューイメージを備えたVLMであるGuardianをトレーニングします。
論文 参考訳(メタデータ) (2025-12-01T17:57:27Z) - ORV: 4D Occupancy-centric Robot Video Generation [33.360345403049685]
遠隔操作を通じて現実世界のロボットシミュレーションデータを取得することは、時間と労力のかかることで有名だ。
ORVは,4次元のセマンティック・コンカレンシー・シーケンスをきめ細かな表現として利用した,作業中心のロボットビデオ生成フレームワークである。
ORVは、占有率に基づく表現を活用することにより、時間的一貫性と正確な制御性を確保しつつ、シミュレーションデータをフォトリアリスティックなロボットビデオにシームレスに変換することができる。
論文 参考訳(メタデータ) (2025-06-03T17:00:32Z) - ILeSiA: Interactive Learning of Robot Situational Awareness from Camera Input [13.374743857520487]
本稿では,カメラ入力とラベリングフレームを安全あるいは危険として利用することで,ロボットの状況認識を教えることに焦点を当てる。
提案手法は,新しい断層の1つの例のみを用いて,既知の断層と新しい断層の両方を確実に検出することができる。
本手法により,次世代のコボットを,容易にセットアップ可能な視覚的リスクアセスメントで迅速に展開することが可能となる。
論文 参考訳(メタデータ) (2024-09-30T10:31:27Z) - Distributional Instance Segmentation: Modeling Uncertainty and High
Confidence Predictions with Latent-MaskRCNN [77.0623472106488]
本稿では,潜在符号を用いた分散インスタンス分割モデルのクラスについて検討する。
ロボットピッキングへの応用として,高い精度を実現するための信頼性マスク手法を提案する。
本手法は,新たにリリースした曖昧なシーンのデータセットを含め,ロボットシステムにおける致命的なエラーを著しく低減できることを示す。
論文 参考訳(メタデータ) (2023-05-03T05:57:29Z) - An Outlier Exposure Approach to Improve Visual Anomaly Detection
Performance for Mobile Robots [76.36017224414523]
移動ロボットの視覚異常検出システム構築の問題点を考察する。
標準異常検出モデルは、非異常データのみからなる大規模なデータセットを用いて訓練される。
本研究では,これらのデータを利用してリアルNVP異常検出モデルの性能向上を図る。
論文 参考訳(メタデータ) (2022-09-20T15:18:13Z) - Improving Variational Autoencoder based Out-of-Distribution Detection
for Embedded Real-time Applications [2.9327503320877457]
アウト・オブ・ディストリビューション(OD)検出は、リアルタイムにアウト・オブ・ディストリビューションを検出するという課題に対処する新しいアプローチである。
本稿では,自律走行エージェントの周囲の有害な動きを頑健に検出する方法について述べる。
提案手法は,OoD因子の検出能力を一意に改善し,最先端手法よりも42%向上した。
また,本モデルでは,実験した実世界およびシミュレーション駆動データに対して,最先端技術よりも97%の精度でほぼ完璧に一般化した。
論文 参考訳(メタデータ) (2021-07-25T07:52:53Z) - Robust Unsupervised Video Anomaly Detection by Multi-Path Frame
Prediction [61.17654438176999]
本稿では,フレーム予測と適切な設計による新規で頑健な非教師付きビデオ異常検出手法を提案する。
提案手法は,CUHK Avenueデータセット上で88.3%のフレームレベルAUROCスコアを得る。
論文 参考訳(メタデータ) (2020-11-05T11:34:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。