論文の概要: DensFiLM: Density-Conditioned Video Saliency for Crowd Scenes
- arxiv url: http://arxiv.org/abs/2607.25465v1
- Date: Tue, 28 Jul 2026 08:57:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.780267
- Title: DensFiLM: Density-Conditioned Video Saliency for Crowd Scenes
- Title(参考訳): DensFiLM: 群衆シーンのための密度調整ビデオ・サイレンシー
- Authors: Anis Ur Rahman,
- Abstract要約: 我々は,ビデオスウィン変換器のボトルネックに軽量な線形変調層を挿入する密度条件付きビデオサリエンシモデルであるDensFiLMを紹介する。
学習された密度埋め込みはチャネルワイズスケールとシフトパラメータを生成し、デコーダは各密度構造で選択された特徴からサリエンシを再構築することができる。
CrowdFixでは、DensFiLMは4つの種に対してNAS 1.434とCC 0.517を平均して達成し、それぞれACLNetを14.7%、ACCNetを14.9%改善した。
- 参考スコア(独自算出の注目度): 0.7106986689736828
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Video saliency models typically apply a single fixation strategy across crowd scenes, despite systematic changes in attention with crowd density. Sparse scenes encourage tracking individuals, whereas dense scenes shift attention toward collective motion and scene-level landmarks. We introduce DensFiLM, a density-conditioned video saliency model that inserts a lightweight Feature-wise Linear Modulation layer at the bottleneck of a Video Swin Transformer. A learned density embedding produces channel-wise scale and shift parameters, allowing the decoder to reconstruct saliency from features selected for each density regime. The module adds only ~100K parameters and can use either CrowdFix density labels or the model's own density prediction. On CrowdFix, DensFiLM achieves mean NSS 1.434 and CC 0.517 over four seeds, improving over ACLNet by 14.7% and 14.9%, respectively, while predicted-density conditioning matches oracle-label performance. Ablations show that explicit RAFT optical flow and larger temporal and social-force extensions provide no further improvement in this setting. In a centre-prior-subtraction diagnostic, density conditioning yields an NSS gain of 0.462 over the unconditioned backbone, compared with 0.124 under standard evaluation. These results show that lightweight bottleneck conditioning provides a more effective inductive bias than increasing model capacity for crowd-video saliency. Our code is available at https://github.com/aniskhan25/crowdfix-saliency.
- Abstract(参考訳): ビデオ・サリエンシ・モデルは通常、群衆密度の体系的な変化にもかかわらず、群衆のシーン全体に単一の固定戦略を適用する。
スパースシーンは個人を追跡するのを奨励する一方、密集したシーンは集団の動きやシーンレベルのランドマークに注意を向ける。
我々は,ビデオスウィン変換器のボトルネックに,軽量な特徴量線形変調層を挿入する密度条件付きビデオサリエンシモデルであるDensFiLMを紹介する。
学習された密度埋め込みはチャネルワイズスケールとシフトパラメータを生成し、デコーダは各密度構造で選択された特徴からサリエンシを再構築することができる。
モジュールは100Kのパラメータのみを追加し、CrowdFixの密度ラベルまたはモデル独自の密度予測を使用することができる。
CrowdFix では、DensFiLM は 4つの種に対して NSS 1.434 と CC 0.517 を平均して達成し、それぞれ ACLNet を 14.7% と 14.9% で改善し、予測密度条件付けはオラクルラベルのパフォーマンスと一致した。
アブレーションは、RAFT光流と時間的および社会的力の増大が、この設定に更なる改善をもたらすことを示している。
中心部分抽出診断において、密度条件付けは無条件の背骨に対して0.462のNASゲインを得るが、標準評価では0.124である。
これらの結果から, 軽量なボトルネック条件付けは, クラウドビデオ・サリエンシのモデル容量を増加させるよりも, より効果的な帰納バイアスを与えることが示された。
私たちのコードはhttps://github.com/aniskhan25/crowdfix-saliency.comで利用可能です。
関連論文リスト
- Density-Guided Robust Counterfactual Explanations on Tabular Data under Model Multiplicity [20.899371081590342]
対実的説明(CE)は行動可能な会話には不可欠であるが、その信頼性は低密度領域でしばしば損なわれる。
我々は、高信頼データ多様体に固執することにより、堅牢なCEを構築する生成フレームワークであるtextitDensityFlowを提案する。
論文 参考訳(メタデータ) (2026-05-29T06:36:33Z) - Vision Transformers Need Better Token Interaction [0.0]
ビジョントランスフォーマー(ViT)は、画像レベルの強い表現を学習できるが、パッチ表現は、長期トレーニング中の密集予測にはあまり効果がない。
我々は,グローバルな意味情報がパッチトークンを通じて局所的に正当化されるものを超えて拡散する最適化ショートカットを特徴付ける。
論文 参考訳(メタデータ) (2026-05-22T17:25:16Z) - Motion-Adaptive Temporal Attention for Lightweight Video Generation with Stable Diffusion [1.9349092719498848]
凍結安定拡散モデルに基づくパラメータ効率の高いビデオ生成のための動き適応型時間的注意機構を提案する。
カスケード戦略により、UNetトランスフォーマーブロックに軽量な時間的アテンションモジュールを注入する。
我々のアブレーション研究は、ノイズ相関と運動振幅との明確なトレードオフを明らかにし、多様な生成行動に対する実用的な推論時間制御を提供する。
論文 参考訳(メタデータ) (2026-03-18T06:20:57Z) - Video Individual Counting and Tracking from Moving Drones: A Benchmark and Methods [51.91154554622608]
moveDroneCrowd++は、移動中のドローンが捉えた、密集した群衆のカウントと追跡のための、最大のビデオレベルのデータセットである。
また,GD3Aを提案する。GD3Aは,特定位置化を回避する密度マップに基づくビデオ個人カウント手法である。
実験結果から,本手法は群集や複雑な運動下での既存手法よりも有意に優れていた。
論文 参考訳(メタデータ) (2026-01-18T17:17:31Z) - TCFormer: A 5M-Parameter Transformer with Density-Guided Aggregation for Weakly-Supervised Crowd Counting [13.816243638358408]
TC TCTCerは、小型で超軽量で、トランスフォーマーをベースとしたクラウドカウントフレームワークで、500万のパラメータしか持たず、競争的なパフォーマンスを実現している。
空間的監督の欠如を補うため,Learningable Density-Weighted Averaging Moduleと呼ばれる機能集約機構を設計した。
本稿では,集団密度を異なるグレードに識別する密度レベル分類損失を提案する。
論文 参考訳(メタデータ) (2025-12-21T10:37:00Z) - Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation [69.57572900337176]
本稿では,効率的なストリーミングビデオ生成のための新しいフレームワークであるReward Forcingを紹介する。
EMA-Sinkトークンは、長期コンテキストと最近のダイナミクスの両方をキャプチャし、初期フレームコピーを防ぐ。
Re-DMDは、視覚言語モデルにより評価されたより大きなダイナミックスを持つサンプルを優先順位付けすることで、モデル出力分布を高逆領域にバイアスする。
論文 参考訳(メタデータ) (2025-12-04T11:12:13Z) - Adaptive Begin-of-Video Tokens for Autoregressive Video Diffusion Models [11.913945404405865]
ほとんどのビデオ拡散モデル(VDM)は自己回帰的な方法でビデオを生成し、それに続く繰り返しフレームを生成する。
本稿では,自動回帰VDMのためのAdaptive Begin-of-Video Tokens(ada-BOV)を提案する。
論文 参考訳(メタデータ) (2025-11-15T08:29:14Z) - An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes [85.00111442236499]
本稿では,非時間密度の動画をGumbel Softmax を用いて様々な立方体に分割する新しい知覚パラダイムを持つ LMM である textbfQuicksviewer を提案する。
言語バックボーンから3段階のプログレッシブステージを通じてモデルをトレーニングし、それぞれが知覚効率によって平均420s/1fpsの長大なビデオを組み込む。
トレーニング用ビデオテキストサンプルは0.8Mに過ぎず, 精度が最大8.72倍に向上した。
論文 参考訳(メタデータ) (2025-04-21T17:57:21Z) - Video Individual Counting for Moving Drones [51.429771128144964]
ビデオ・パーソナライズ・カウンティング(VIC)は、インテリジェント・ビデオ監視の重要性から注目を集めている。
以前のデータセットは、比較的まばらな個人で固定または稀に動くカメラでキャプチャされ、混雑したシーンでの高度に異なるビューと時間の評価を制限する。
これらの問題に対処するために、私たちはMovingDroneCrowdデータセットを導入しました。
論文 参考訳(メタデータ) (2025-03-12T07:09:33Z) - Convex Hull Prediction for Adaptive Video Streaming by Recurrent Learning [38.574550778712236]
本稿では,コンテンツ認識凸船体予測の深層学習に基づく手法を提案する。
再帰的畳み込みネットワーク(RCN)を用いて,映像の複雑さを暗黙的に解析し,その凸殻を予測する。
提案するモデルでは, 最適凸殻の近似精度が向上し, 既存の手法と比較して, 競争時間の節約が期待できる。
論文 参考訳(メタデータ) (2022-06-10T05:11:02Z) - MANet: Improving Video Denoising with a Multi-Alignment Network [72.93429911044903]
本稿では,複数フローの提案とアテンションに基づく平均化を行うマルチアライメントネットワークを提案する。
大規模ビデオデータセットを用いた実験により,本手法は調音ベースラインモデルを0.2dBで改善することを示した。
論文 参考訳(メタデータ) (2022-02-20T00:52:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。