論文の概要: HAJJv2-CrowdCount: Zero-Shot Benchmark for Dense Crowd Counting
- arxiv url: http://arxiv.org/abs/2607.07322v1
- Date: Wed, 08 Jul 2026 12:11:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.366833
- Title: HAJJv2-CrowdCount: Zero-Shot Benchmark for Dense Crowd Counting
- Title(参考訳): HAJJv2-CrowdCount: クラウドカウントのゼロショットベンチマーク
- Abstract要約: HAJJv2データセットを再検討し、HAJJv2-CrowdCount: 1秒あたりの人称アノテート回数をテストビデオに含めます。
オープンボキャブラリ検出器(YOLO-World)、ポイントベースカウンタ(APGCC)、即時セグメンテーションベースのカウンタ(SAM3Count)の3つの最近のゼロショットカウントパラダイムをベンチマークする。
SAM3Count は YOLO-World (92.0) と APGCC (152.9) に先立って、最も低い総合平均誤差 (MAE 70.4, 95% CI 56.0-86.1) を達成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automated crowd counting in Hajj video is difficult not because current models lack capacity, but because the footage violates the assumptions those models were built on: cameras observe the crowd from steep, near-vertical angles, individuals occlude one another extensively, and a single frame can contain well over a thousand people. Benchmarks that test crowd counting in such an environment are either private or not detailed per second. We revisit the HAJJv2 dataset and contribute HAJJv2-CrowdCount: per-second human-annotated crowd counts for its testing videos. Using these annotations, we benchmark three recent zero-shot counting paradigms: an open-vocabulary detector (YOLO-World), a point-based counter (APGCC), and a promptable segmentation-based counter (SAM3Count). SAM3Count attains the lowest overall mean absolute error (MAE 70.4, 95% CI 56.0-86.1), ahead of YOLO-World (92.0) and APGCC (152.9). This ordering reverses, however, in the regime most relevant to deployment: on the densest frames, the detection- and segmentation-based counters both degrade sharply (MAE exceeding 300), while the point-based counter degrades far more gracefully (MAE 114.9). This inversion is decision-relevant for Hajj crowd management, where reliable counts are needed most precisely in the densest and most occluded scenes. The annotations are released to support reproduction and extension of these results.
- Abstract(参考訳): 現在のモデルにはキャパシティがないためではなく、カメラが群衆を急勾配でほぼ垂直な角度から観察し、個人がお互いを広範囲に遮蔽し、1つのフレームに1000人以上を収容できるという仮定に違反しているからだ。
このような環境で観客数をテストするベンチマークは、プライベートか、毎秒詳細ではない。
HAJJv2データセットを再検討し、HAJJv2-CrowdCount: 1秒あたりの人称アノテート回数をテストビデオに含めます。
これらのアノテーションを用いて、オープンボキャブラリ検出器(YOLO-World)、ポイントベースカウンタ(APGCC)、即時セグメンテーションベースのカウンタ(SAM3Count)の3つの最近のゼロショットカウントパラダイムをベンチマークする。
SAM3Count は YOLO-World (92.0) と APGCC (152.9) に先立って、最も低い総合的な平均誤差 (MAE 70.4, 95% CI 56.0-86.1) を達成している。
しかし、最も密集したフレームでは、検出とセグメンテーションベースのカウンタは鋭く(MAEが300を超える)し、ポイントベースのカウンタははるかに優雅に分解する(MAE 114.9)。
この逆転は、最も密集したシーンと最も隠蔽されたシーンにおいて、信頼できるカウントが最も正確に必要となる、Hajjのクラウドマネージメントにとって決定に関連がある。
アノテーションは、これらの結果の再生と拡張をサポートするためにリリースされる。
関連論文リスト
- Item Response Theory for AI Safety [23.16156306184828]
アイテム反応理論 (IRT) は、心理測定値が推定された項目のパフォーマンスから潜伏者を測定する統計ツールキットである。
IRTは安全ベンチマークを読み、減らし、監査するための既製のツールキットです。
論文 参考訳(メタデータ) (2026-08-05T17:25:27Z) - Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games [69.57330692969543]
RNG-Benchは、過去の観測を再構築するベースモデルの能力を分離するために設計されたベンチマークスイートである。
RNG-Benchには2つの補完ゲームがある: マッチングペア(英語版) - 特定の場所でカードのIDを短期間明らかにする) と、エゴセントリックなビューを空間地図に統合する3D Maze である。
最も難しい構成では、約128Kのトークンと350のイメージ入力のコンテキストが必要であり、フロンティアMLLMによる飽和には程遠いままである。
論文 参考訳(メタデータ) (2026-06-17T17:59:34Z) - FailureScope: Cross-Regime Behavioral Diagnosis of Language Model Weaknesses [0.0]
FailureScopeは、クロスモデルパス/フェイルパターンによる評価プローブをクラスタ化する行動診断手法である。
通常、シングルターン・ベンチマーク、マルチターン・ダイアログ、敵エージェント・アタックの3つのレシスタンスに対して安定かつ解釈可能な障害をもたらすことを示す。
論文 参考訳(メタデータ) (2026-06-03T01:28:00Z) - Zero-Shot Object Re-Identification in Egocentric Kitchen Videos via Multi-Stage SAM3 Feature Fusion [59.32099847726022]
EPIC-Kitchensベンチマークを用いてゼロショットオブジェクトReIDについて検討した。
目標は、トレーニング済みのビジュアル機能のみを使用して、アクティブな食品とキッチンツールインスタンスをフレーム間でマッチングすることだ。
論文 参考訳(メタデータ) (2026-05-25T23:01:41Z) - WorldJen: An End-to-End Multi-Dimensional Benchmark for Generative Video Models [0.8640786765448132]
WorldJenは、生成ビデオモデルを評価するためのフレームワークである。
7つのアノテーションから2,696個のペアワイズアノテーションを蓄積する。
VLM-as-a-judge 評価エンジンを開発した。
論文 参考訳(メタデータ) (2026-05-05T08:03:34Z) - MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence [61.065486539729875]
MMSI-Video-Bench(MMSI-Video-Bench)は、MLLMにおけるビデオベースの空間知能の完全な人為的なベンチマークである。
4段階のフレームワークである知覚、計画、予測、クロスビデオ推論を運用しており、1,278のクリップで1,106の質問を下敷きにしている。
オープンソースとプロプライエタリなMLLMを25種類評価し,AIギャップが顕著であることを明らかにした。
論文 参考訳(メタデータ) (2025-12-11T17:57:24Z) - ProgRoCC: A Progressive Approach to Rough Crowd Counting [66.09510514180593]
私たちはRough Crowd Countingというラベルを付け、取得が容易なトレーニングデータに基づいて精度を向上します。
本稿では,ProgRoCCと呼ばれるCLIPに基づく大群カウント問題に対するアプローチを提案する。
具体的には、粗大なアプローチによってオブジェクト数を決定するプログレッシブな推定学習戦略を導入する。
論文 参考訳(メタデータ) (2025-04-18T01:57:42Z) - ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models [79.90955995669158]
大型マルチモーダルモデル(LMM)は、画像の解釈において大きな欠点を示し、いくつかの手段によっては、小さな子供や動物よりも空間認知が劣っている。
我々は,現代フロンティアLMMでは不可能な,軽量な視覚推論ベンチマークであるZeroBenchを紹介する。
ZeroBench 上で 20 LMM の評価を行い,そのスコアは 0.0% であり,誤差を厳密に分析した。
論文 参考訳(メタデータ) (2025-02-13T18:59:11Z) - HuBERT: Self-Supervised Speech Representation Learning by Masked
Prediction of Hidden Units [81.53783563025084]
本稿では、BERTのような予測損失に対して、アライメントされたターゲットラベルを提供するオフラインクラスタリングステップを提案する。
提案手法の重要な要素は,マスク領域にのみ予測損失を適用することである。
HuBERTは、より困難なdev-otherおよびtest-other評価サブセットに対して、最大19%と13%の相対的なWER削減を示す。
論文 参考訳(メタデータ) (2021-06-14T14:14:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。