論文の概要: Federated Binary Gating with Server-Side Vision-Language Inference for Surveillance Anomaly Classification
- arxiv url: http://arxiv.org/abs/2609.07403v1
- Date: Mon, 07 Sep 2026 12:14:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.420934
- Title: Federated Binary Gating with Server-Side Vision-Language Inference for Surveillance Anomaly Classification
- Title(参考訳): サーベイランス異常分類のためのサーバサイドビジョンランゲージ推論を用いたフェデレーションバイナリゲーティング
- Abstract要約: サーバ側ゼロショットVLM推論とCNNゲートを組み合わせたハイブリッド2段アーキテクチャを提案する。
我々は,UCF-Crimeを5つの粗いメタクラスに分類し,実際の3ノードヘテロジニアス展開においてフェデレーションステージを実装した。
- 参考スコア(独自算出の注目度): 0.24629531282150874
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Privacy-sensitive surveillance systems could benefit from large vision-language models (VLMs), but such models typically require centralized access to raw video. In federated learning settings, this challenge is amplified by non-independent and identically distributed (non-IID) client data, which can make direct multiclass anomaly classification unstable, especially for rare categories. We propose a hybrid two-stage architecture that combines a federated binary convolutional neural network (CNN) gate with server-side zero-shot VLM inference. The lightweight LiteCNN3D gate performs local anomaly screening and forwards only flagged videos to Qwen3-VL-8B, which assigns them to four anomaly metaclasses. We evaluate this design on UCF-Crime grouped into five coarse metaclasses and implement the federated stage in a real three-node heterogeneous deployment. In the studied setting, direct federated multiclass training collapses, whereas the proposed decomposition yields a better trade-off between classification quality and raw-video transmission. With fixed-threshold routing, the federated hybrid pipeline preserves nearly the same macro-averaged F1 score (F1-macro) as its centralized CNN+VLM counterpart while reducing the fraction of transmitted videos to 51.4%, although with a lower proxy macro receiver operating characteristic area under the curve (ROC AUC) than the centralized hybrid system. A complementary sensitivity-oriented routing operating point increases macro ROC AUC from 0.673 to 0.692 and reduces the false negative rate from 29.3% to 22.9%, but decreases F1-macro from 0.503 to 0.485 while increasing transmission from 51.4% to 57.9%. These results suggest that federation is better suited to coarse local screening, while routing rules can be adjusted to trade server-side VLM usage for higher anomaly sensitivity.
- Abstract(参考訳): プライバシーに敏感な監視システムは、大きな視覚言語モデル(VLM)の恩恵を受けるが、そのようなモデルは通常、生のビデオに一元的にアクセスする必要がある。
連合学習環境では、この課題は非独立かつ同一に分散された(非IID)クライアントデータによって増幅され、特に稀なカテゴリにおいて、直接多クラス異常分類を不安定にすることができる。
本稿では,フェデレートされたバイナリ畳み込みニューラルネットワーク(CNN)ゲートとサーバ側のゼロショットVLM推論を組み合わせたハイブリッド2段階アーキテクチャを提案する。
軽量な LiteCNN3D ゲートは局所異常スクリーニングを行い、フラグ付きビデオのみを Qwen3-VL-8B に転送し、4つの異常メタクラスに割り当てる。
我々は,UCF-Crimeを5つの粗いメタクラスに分類し,実際の3ノードヘテロジニアス展開においてフェデレーションステージを実装した。
実験では, 直接フェデレートしたマルチクラストレーニングが崩壊するのに対して, 提案した分解は, 分類品質と生ビデオ伝送とのトレードオフが良好である。
固定閾値ルーティングでは、フェデレートされたハイブリッドパイプラインは、中央のCNN+VLMとほぼ同じマクロ平均F1スコア(F1-macro)を維持しながら、送信されたビデオの割合を51.4%に削減する。
相補的な感度指向ルーティング操作点はマクロROC AUCを0.673から0.692に増加させ、偽陰率を29.3%から22.9%に下げるが、F1マクロを0.503から0.485に減少させ、送信を51.4%から57.9%に増加させる。
これらの結果から,フェデレーションは局所的なスクリーニングに適しており,ルーティングルールはサーバ側のVLM使用量を高い異常感度で交換するために調整可能であることが示唆された。
関連論文リスト
- Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - Sensitivity Analysis of GRU, LSTM and Transformer Encoder in Classification of Automated Driving Systems [0.5156484100374058]
安全監視, 規制コンプライアンス, 保険評価, 異常検出において, どの自動運転システムがアクティブかを独立に検証するモニタリングシステムは重要である。
まず、GRU(Gated Recurrent Units)、LSTM(Long Short-Term Memory)、Transformer encoder(Transformer encoder)の3つのシーケンスベース分類モデルの有効性を評価する。
3モデルとも、クリーンなデータでトレーニングすると、マクロF1スコアが0.92(GRU)、LSTMが0.90(Transformer encoder model)、そして0.93(Transformer encoder model)となる。
論文 参考訳(メタデータ) (2026-07-25T01:31:37Z) - Edges Before Embeddings: A Confidence-Aware Blur Gate for Vision-Language Pipelines [0.0]
MagikaDocumentFromPixelは、1つのイメージを1つのCPUコアで約7ミリ秒でシャープ、ぼやけた、あるいは不確実なものとして分類する。
ラプラシア語で書かれた補助的な入力チャネルは、古典的なぼけが依存しているスペクトル証拠に直接アクセスする。
最後のレシピであるMobileNetV3-Large with the EPM with 384x384 at paired GoPro Large frames, evaluate with 5-scale test-time augmentation with F1 = 0.9803 (AUC 0.9989) with a 17 MB ONNX artifact。
論文 参考訳(メタデータ) (2026-06-24T13:51:42Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - OmniISR: A Unified Framework for Centralized and Federated Learning via Intermediate Supervision and Regularization [58.03221830946145]
我々は、純粋なCL、純粋なFL、ハイブリッドCL-FLトレーニングモードを融合する統合フレームワークであるOmniISRを提案する。
我々は,OmniISRが集中型パラダイムとフェデレーション型パラダイムの両方において,モデル性能を一貫して改善していることを示す。
論文 参考訳(メタデータ) (2026-05-19T04:13:27Z) - When Does Multimodal AI Help? Diagnostic Complementarity of Vision-Language Models and CNNs for Spectrum Management in Satellite-Terrestrial Networks [1.0152838128195467]
無線ネットワーク管理のための視覚言語モデル(VLM)は、スペクトル関連タスクのための軽量畳み込みニューラルネットワーク(CNN)よりも優れていることを示す。
本稿では,4段階の粒度分類(L1),空間的局所化(L2),意味的推論(L4)からなる108Kの視覚的問合せ対からなるベンチマークであるSpectrumQAを紹介する。
論文 参考訳(メタデータ) (2026-04-04T15:53:49Z) - D3R-Net: Dual-Domain Denoising Reconstruction Network for Robust Industrial Anomaly Detection [0.0]
非教師付き異常検出(UAD)は、現代の製造において、自動視覚検査の鍵となる要素である。
本稿では、D3R-Netについて紹介する。D3R-Netは、自己教師型「癒し」タスクと周波数認識正規化を結合したデュアルドメイン・デノベーション・コンストラクションフレームワークである。
空間平均二乗誤差に加えて、周波数領域の整合性を促進するFast Fourier Transform (FFT) 等級損失を用いる。
論文 参考訳(メタデータ) (2026-01-27T23:21:59Z) - Accelerating Heterogeneous Federated Learning with Closed-form Classifiers [23.133964735844007]
フェデレートラーニング(FL)手法は、しばしば非常に統計的に異質な設定で苦労する。
Fed3R(Federated Recursive Ridge Regression)を紹介する。
Fed3Rは統計的不均一性に免疫を持ち、クライアントのサンプリング順序に不変である。
論文 参考訳(メタデータ) (2024-06-03T08:52:06Z) - Adaptive Split-Fusion Transformer [90.04885335911729]
本稿では,適応重みによる畳み込みと注目の分岐を異なる方法で扱うための適応分割変換器(ASF-former)を提案する。
ImageNet-1Kのような標準ベンチマークの実験では、我々のASFフォーマーはCNN、トランスフォーマー、ハイブリッドパイロットを精度で上回っている。
論文 参考訳(メタデータ) (2022-04-26T10:00:28Z) - Uniformer: Unified Transformer for Efficient Spatiotemporal
Representation Learning [68.55487598401788]
この研究の最近の進歩は、主に3D畳み込みニューラルネットワークと視覚変換器によって推進されている。
本稿では3次元畳み込み自己注意の利点を簡潔なトランスフォーマー形式にシームレスに統合する新しいUnified TransFormer(UniFormer)を提案する。
我々は、Kineetics-400、Kineetics-600、Something V1&V2といった人気ビデオベンチマークで広範な実験を行っている。
我々の UniFormer は Kinetics-400/Kinetics-600 で 8/84.8% のトップ-1 の精度を実現している。
論文 参考訳(メタデータ) (2022-01-12T20:02:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。