論文の概要: Latent Clarity: Bridging World-Model Kinematics to Semantic Manifolds for Video Anomaly Anticipation
- arxiv url: http://arxiv.org/abs/2607.03558v1
- Date: Fri, 03 Jul 2026 18:47:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.648413
- Title: Latent Clarity: Bridging World-Model Kinematics to Semantic Manifolds for Video Anomaly Anticipation
- Title(参考訳): 潜在的明瞭さ:ビデオ異常予測のための世界モデルキネマティクスをセマンティックマニフォールドにブリッジする
- Authors: Abu Anas Ibn Samad,
- Abstract要約: 継続的ビデオ検出は、リアクティブなMIL(Multiple Instance Learning)によって支配され、機能がスコアに分解される。
本稿では,連続的な意味的世界モデルパイプラインであるPULS(Predictive Unified Latent Space)を紹介する。
この翻訳だけで、UCF-Crime のチャンクレベル AUROC は 0.8994 であり、MIL や階層融合のない分布外異常は 0.8162 である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Continuous video anomaly detection is dominated by reactive Multiple Instance Learning (MIL) that collapses spatiotemporal features into scalar scores. We introduce PULS (Predictive Unified Latent Space), a continuous semantic world-model pipeline comprising two modules: a 490M-parameter KSD Bridge (Kinematic-to-Semantic Distillation) and a 16.8M-parameter Anticipatory State Predictor (ASP). The KSD Bridge maps V-JEPA 2 physical tensors into the 2048-d Qwen3-VL-Embedding-2B text-aligned hypersphere, trained on a subset of UCF-Crime. This translation alone yields a chunk-level AUROC of 0.8994 for UCF-Crime and 0.8162 for out-of-distribution XD-Violence without MIL or hierarchical fusion. We introduce and validate the Latent Clarity Hypothesis: because JEPA's temporal predictor discards aleatoric pixel noise while preserving kinematics, anticipated future representations are more semantically separable than observed presents. The ASP sharpens these anticipated future latents, achieving 44.5% mean 14-way zero-shot VQA accuracy (exceeding observation baseline by +9.6 pp). Applying the ASP to Observation Tensors collapses accuracy to 7.3% (random chance), proving Anticipation and Observation occupy distinct sub-manifolds. A Triple-Track Lead-Time protocol with an L1-surprise gate yields a peak +8.9 pp anticipatory advantage at T-0.5s (p < 0.001, N = 1,000 permutation), separating physical anticipation from static scene priors. Zero-shot transfer to XD-Violence confirms that Newtonian-invariant kinematic representations generalize out-of-distribution.
- Abstract(参考訳): 連続ビデオ異常検出は、時空間的特徴をスカラースコアに分解するリアクティブ多重インスタンス学習(MIL)によって支配される。
PULS(Predictive Unified Latent Space)は、490MのKSDブリッジ(Kinematic-to-Semantic Distillation)と16.8Mの予測状態予測器(ASP.8Mの予測状態予測器)の2つのモジュールからなる連続的な意味的世界モデルパイプラインである。
KSDブリッジは、V-JEPA 2物理テンソルを2048-d Qwen3-VL-Embedding-2Bテキスト整列超球にマッピングし、UCF-Crimeのサブセットで訓練した。
この変換だけで、UCF-CrimeのチャンクレベルAUROCは0.8994、分布外XD-Violenceは0.8162となる。
本稿では,JEPAの時間予測器がキネマティクスを保ちながらアレータリックピクセルノイズを排除しているため,将来の表現は観測対象よりも意味的に分離可能であることを示す。
ASPはこれらの予測された将来の潜伏者を鋭くし、44.5%は14ウェイゼロショットVQAの精度を達成している(観測基準は+9.6 pp)。
ASPを観測テンソルに適用すると精度が7.3%(ランダムな確率)に低下し、予測と観測が異なるサブ多様体を占有する。
L1サプライズゲートを持つトリプルトラックリードタイムプロトコルは、T-0.5s(p < 0.001, N = 1,000 置換)でピーク +8.9 pp の予測アドバンテージを得る。
XD-ビオレンスへのゼロショット移動はニュートン不変キネマティック表現が分布外分布を一般化することを確認する。
関連論文リスト
- ESPO: Early-Stopping Proximal Policy Optimization [78.79610718910628]
ESPO(Early-Stopping Proximal Policy Optimization)は、軌道上の障害を検出し、ロールアウトを早期に終了する。
DeepSeek-R1-Distill-Qwen-7Bでは、ESPOはAIME2024(46.28%対45.25%)、AMC2023(85.83%対82.94%)、MATH-500(87.42%対85.43%)でPPOを上回っている。
論文 参考訳(メタデータ) (2026-05-28T12:40:22Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Predicting Upcoming Stuttering Events from Three-Second Audio: Stratified Evaluation Reveals Severity-Selective Precursors, and the Model Deploys Fully On-Device [0.0]
我々は,SEP-28k(Apple,20,131本の3秒クリップ)でCNNをトレーニングし,次の連続クリップに障害があるかどうかを予測する。
集合目的は、重大事象が韻律前駆体を持つため、重大選択予測器に収束する。
相互人口移動: 微調整無しで、同じチェックポイントが1024名の小児Who-Stutter発話に適用され、AUC 0.674 の検出と 0.655 の予測が達成される。
論文 参考訳(メタデータ) (2026-04-30T00:30:28Z) - Sparse Autoencoder Decomposition of Clinical Sequence Model Representations: Feature Complexity, Task Specialisation, and Mortality Prediction [1.7865154997539017]
スパースオートエンコーダ(SAE)は、大きな言語モデルやタンパク質言語モデルに適用されているが、電子健康記録(EHR)基礎モデルには体系的に適用されていない。
InSPECT(外来)とMIMIC-IV(ICU)の残留ストリーム抽出点10点すべてにおいて、14.5万パラメータ自己回帰性臨床シーケンスモデルであるFlatASCEND上でTopK SAEを訓練する。
SAE分解は、トランスフォーマーの深さをまたいだプログレッシブな抽象化を明らかにする:層0の特徴は、ほぼ完全なトークン検出器(45.7%シングルトン)であり、層6の特徴は、複数の臨床カテゴリ(0.5%シングルトン)にまたがる約30のトークンタイプにまたがっている。
論文 参考訳(メタデータ) (2026-04-13T12:08:32Z) - Bayesian Transformer for Probabilistic Load Forecasting in Smart Grids [0.0]
本研究では,3つの相補的不確実性機構をPatchTSTバックボーンに統合したベイズ変圧器フレームワークを提案する。
7段階のマルチクエンタリーピンボールロス予測ヘッドと、訓練後の等音波回帰キャリブレーションにより、鋭く、ほぼ一意にカバーされた予測間隔が生成される。
主要なベンチマーク(PJM, H=24h)では、BTは0.0289のCRPSを達成し、Deep Ensemblesより7.4%、決定論的LSTMより29.9%改善した。
論文 参考訳(メタデータ) (2026-03-09T02:39:51Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - From Observations to States: Latent Time Series Forecasting [65.98504021691666]
本稿では,TSFを観測回帰から潜時予測に移行する新しいパラダイムであるLatent Time Series Forecasting(LatentTSF)を提案する。
具体的には、LatentTSFはAutoEncoderを使用して、各段階での観測結果を高次元の潜在状態空間に投影する。
提案する潜伏目標は,予測潜伏状態と地道状態と観測値との相互情報を暗黙的に最大化する。
論文 参考訳(メタデータ) (2026-01-30T20:39:44Z) - Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning [70.56067503630486]
第6世代(6G)インテリジェンスは、流動的なトークン予測ではなく、想像と選択の能力を校正している、と我々は主張する。
We showed that WM-MS3M cuts mean absolute error (MAE) by 1.69% vs MS3M with 32% less parameters and similar latency, and achieve a 35-80% lower root mean squared error (RMSE) than attention/hybrid baselines with 2.3-4.1x faster inference。
論文 参考訳(メタデータ) (2025-11-04T17:22:22Z) - Group Evidence Matters: Tiling-based Semantic Gating for Dense Object Detection [0.0]
本稿では,重畳誘起冗長性をグループエビデンスに変換する検出器非依存のポストプロセッシングフレームワークを提案する。
このフレームワークは再訓練を必要とせず、現代の検出器と統合する。
論文 参考訳(メタデータ) (2025-09-13T01:55:08Z) - CLIPure: Purification in Latent Space via CLIP for Adversarially Robust Zero-Shot Classification [65.46685389276443]
画像とテキストプロンプトをマッチングすることでゼロショット分類を行うことができる、視覚言語で事前訓練されたエンコーダモデルであるCLIPについて検討する。
次に, 共分散精製プロセス間のKL分散として精製リスクを定式化する。
画像の潜伏ベクトルの確率をモデル化するCLI-Diffと、画像の埋め込みとaの写真とのコサイン類似度をモデル化するCLI-Cosの2つのバリエーションを提案する。
論文 参考訳(メタデータ) (2025-02-25T13:09:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。