論文の概要: MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection
- arxiv url: http://arxiv.org/abs/2608.00975v1
- Date: Sun, 02 Aug 2026 03:58:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.041186
- Title: MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection
- Title(参考訳): MonitorVLM-v2: リアルタイム安全違反検出のためのデプロイ型ビジョンランゲージフレームワーク
- Abstract要約: MonitorVLM-v2は、VLMに基づく安全評価を、有限の規制決定空間に対する確率的推論として再放送する。
推論速度は19.45倍に向上し、サイトの通常の手動検査ワークフローの2.78倍の違反が確認された。
- 参考スコア(独自算出の注目度): 13.557979876968675
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large vision--language models (VLMs) can reason step by step about complex visual scenes, but this open-ended, autoregressive chain-of-thought (CoT) approach is poorly suited to safety-critical, rule-governed settings such as industrial surveillance, where decisions must be bounded, deterministic, and low-latency. Because CoT inference cost scales jointly with reasoning length and the number of concurrent streams, it creates a throughput bottleneck that precludes the real-time, multistream monitoring required for industrial accountability. Here we present MonitorVLM-v2, a deployment-oriented framework that recasts VLM-based safety assessment as probabilistic inference over a finite regulatory decision space, compressing multimodal reasoning into single-step rule-ID predictions and reducing decoding from a variable-length sequence to a single token. We introduce symbolic policy optimization (SymPO), a novel contrastive policy optimization algorithm that sharpens decision boundaries within this finite symbolic space, together with an entropy-driven triage mechanism that routes uncertain predictions to human reviewers for expert confirmation. In a four-month prospective deployment across 10 concurrent camera feeds in an operational underground mining facility, MonitorVLM-v2 achieved a 19.45-fold increase in inference speed and identified 2.78 times as many confirmed violations as the site's routine manual inspection workflow, demonstrating the practical value of compressed symbolic decision-making for real-time, auditable industrial monitoring.
- Abstract(参考訳): 大規模な視覚言語モデル(VLM)は、複雑な視覚シーンを段階的に考えることができるが、このオープンエンドで自己回帰的なチェーン・オブ・シント(CoT)アプローチは、産業監視のような安全クリティカルでルールに守られた設定には適していない。
CoT推論コストは推論の長さと並行ストリーム数と共同でスケールするため、産業的説明責任に必要なリアルタイムなマルチストリーム監視を阻害するスループットボトルネックが生じる。
ここでは,VLMに基づく安全性評価を有限の規制決定空間上の確率的推論として再評価し,マルチモーダル推論を単一ステップのルールID予測に圧縮し,可変長シーケンスから単一トークンへの復号を削減したデプロイメント指向フレームワークである MonitorVLM-v2 を提案する。
我々は,この有限なシンボル空間における決定境界を鋭くする新しいコントラストポリシー最適化アルゴリズムであるシンボリックポリシー最適化(SymPO)と,不確実な予測を専門家の確認のために導出するエントロピー駆動トリアージ機構を導入する。
運用中の地下鉱業施設で10台の同時カメラ・フィードを横断する4ヶ月の展開で、MonitorVLM-v2は19.45倍の推論速度の向上を達成し、現場の定期的な手動検査ワークフローの2.78倍の違反が確認され、リアルタイムで監査可能な産業監視のための圧縮された象徴的意思決定の実用的価値を実証した。
関連論文リスト
- IPM-FM: A Foundation Model with Consensus Feature Selection for Industrial Process Monitoring [59.59850511287819]
産業プロセス監視基盤モデル(IPM-FM)を提案する。
まず、自己教師付き事前学習を通じて、ラベルのない産業プロセスデータから汎用的な表現を学習する。
少数のタスクラベル付きデータを使用して特定の監視タスクに適応し、最終的に校正された予測を生成する。
論文 参考訳(メタデータ) (2026-09-08T07:43:04Z) - FoodMonitor: Benchmarking MLLMs for Explainable Compliance Analysis [29.80090524705393]
FoodMonitorは、商用キッチン監視における説明可能なコンプライアンス分析のベンチマークである。
最高の性能モデルは0.360ドルC_textscore$でしか得られず、空間的局所化と細かいルール理解が主要なボトルネックとして現れる。
論文 参考訳(メタデータ) (2026-05-23T10:19:41Z) - Federated Stream-Processing and Latency-Gated Response for Cross-Sector Threat Detection and Collaborative Containment [0.0]
重要なインフラ防衛は、高度なサプライチェーンの妥協と盗まれた管理資格によって、予防的制御がしばしば回避されるという運用上の現実によってボトルネックになっている。
本稿では,協調したクロスセクタ脅威を検知し,機械の速度で封じ込めを編成する,新しい高スループットストリーム処理および相関フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-17T08:32:08Z) - Probabilistic Concept-Aware Steering for Trustworthy LLM Inference [14.752999429320226]
本稿では,大規模言語モデル(LLM)推論のための確率論的概念認識ステアリング(PCS)フレームワークを提案する。
PCSは、コンセプト駆動のステアリングベクター検索と確率的強度校正により、制御可能な安全指向のセマンティックバイアスを提供しながら、元のタスク能力を維持している。
論文 参考訳(メタデータ) (2026-05-15T15:34:48Z) - Monitoring Data-aware Temporal Properties (Extended Version) [56.386411908764494]
有限トレース上の任意のSMT理論に富む線形時間特性の予測モニタリングについて考察する。
この設定での予測モニタリングは非常に困難であり、監視状態はこれまでのトレースプレフィックスと可能な有限継続の両方に依存している。
本研究は,表現的フラグメントオフMTにおける特性モニタリングのための新しい基礎的枠組みの正しさを提示し,正式に証明するものである。
論文 参考訳(メタデータ) (2026-05-14T10:23:11Z) - Causal Bootstrapped Alignment for Unsupervised Video-Based Visible-Infrared Person Re-Identification [52.784239635604735]
VVI-ReIDは、静止画像以外にも時間情報が付加的な手がかりを提供する、全日監視のための重要な技術である。
既存のアプローチは、高価なクロスモダリティアノテーションによる完全な教師付き学習に大きく依存しており、スケーラビリティが制限されています。
そこで,本研究では,ビデオの先行を明示的に活用するCausal Bootstrapped Alignmentフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-17T02:15:59Z) - Adaptive t Design Dummy-Gate Obfuscation for Cryogenic Scale Enforcement [0.0]
クラウド量子サービスは、スケジューラメタデータ、レイテンシパターン、共テナント干渉を通じて、回路構造とタイミングを明らかにすることができる。
我々は,ゲートモデルワークロードの運用上のプライバシを強制するスケジューリングおよび難読化スタックであるNADGOを紹介する。
低温CMOS制御による4キュービット超伝導タイルの試作を行い,深度可変ローカルランダム回路と小型QAOAインスタンスの両特性について検討した。
論文 参考訳(メタデータ) (2025-08-31T12:12:48Z) - Advancing Neural Network Verification through Hierarchical Safety Abstract Interpretation [52.626086874715284]
我々は、安全でない出力の階層構造を検証する抽象的DNN検証と呼ばれる新しい問題定式化を導入する。
出力到達可能な集合に関する抽象的解釈と推論を活用することにより,形式的検証プロセスにおいて,複数の安全性レベルを評価することができる。
我々の貢献には、新しい抽象的安全性の定式化と既存のアプローチとの関係を理論的に探求することが含まれる。
論文 参考訳(メタデータ) (2025-05-08T13:29:46Z) - Data-Driven Calibration of Prediction Sets in Large Vision-Language Models Based on Inductive Conformal Prediction [0.0]
動的しきい値キャリブレーションとクロスモーダル整合性検証を統合したモデル非依存不確実性定量化法を提案する。
このフレームワークは、様々なキャリブレーションとテストの分割比で安定したパフォーマンスを実現し、医療、自律システム、その他の安全に敏感な領域における現実的な展開の堅牢性を強調している。
この研究は、マルチモーダルAIシステムにおける理論的信頼性と実用性の間のギャップを埋め、幻覚検出と不確実性を考慮した意思決定のためのスケーラブルなソリューションを提供する。
論文 参考訳(メタデータ) (2025-04-24T15:39:46Z) - Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection [56.66677293607114]
オープンセットのリアクティブかつアクティブな障害検出のためのCode-as-Monitor(CaM)を提案する。
モニタリングの精度と効率を高めるために,制約関連エンティティを抽象化する制約要素を導入する。
実験により、CaMは28.7%高い成功率を達成し、厳しい乱れの下で実行時間を31.8%短縮することが示された。
論文 参考訳(メタデータ) (2024-12-05T18:58:27Z) - Weakly-Supervised Spatio-Temporal Anomaly Detection in Surveillance
Video [128.41392860714635]
Weakly-Supervised Snoma-Temporally Detection (WSSTAD) を監視ビデオに導入する。
WSSTADは異常事象を封止する時空間管(すなわち連続する境界ボックスのシーケンス)をローカライズすることを目的としている。
本稿では,空間的・時間的領域に複数粒度を持つ入力提案を行うデュアルブランチネットワークを提案する。
論文 参考訳(メタデータ) (2021-08-09T06:11:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。