論文の概要: GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
- arxiv url: http://arxiv.org/abs/2607.13569v2
- Date: Mon, 20 Jul 2026 14:28:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.482627
- Title: GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
- Title(参考訳): GHR-VLM:グラウンドドハイブリッド推論によるゼロショットトランジットビデオ分析の実現
- Abstract要約: GHR-VLMは、ゼロショットトランジットバスビデオ分析のためのビジュアルハイブリッド推論フレームワークである。
その動機は、長い監視ストリームをコンパクトで乗客中心の証拠に変換することにより、露骨な視覚的接地によりVLM推論が改善できることにある。
実世界のバス監視ビデオの486分間の評価は、乗客レベルの支払い分析のための地上のエッジクラウド推論の可能性を示している。
- 参考スコア(独自算出の注目度): 1.409283414986451
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Transit video understanding can provide valuable fine-grained data that conventional passenger counters and fare systems cannot capture. However, supervised video models require task-specific annotations, while applying vision-language models (VLMs) directly to long onboard videos is unreliable and costly. To leverage the complementary strengths of both approaches, we propose GHR-VLM, a visual grounded hybrid reasoning framework for zero-shot transit-bus video analytics. It is motivated by the observation that explicit visual grounding can improve VLM reasoning by converting long surveillance streams into compact, passenger-centered spatiotemporal evidence. Specifically, we propose an edge-cloud design in which a lightweight edge-based monitor continuously tracks door status and segments passenger clips. A backend VLM then identifies boarding passengers and classifies payment behavior through a two-stage coarse-to-fine refinement of spatiotemporal evidence. By invoking the VLM only on grounded passenger clips and contact sheets, GHR-VLM reduces cloud inference, avoids payment-specific training data, and supplies the localized evidence that VLMs otherwise struggle to identify. Evaluation on 486 minutes of real-world bus surveillance video demonstrates the potential of grounded edge-cloud reasoning for passenger-level payment analytics while highlighting the challenges posed by degraded video conditions.
- Abstract(参考訳): トランジットビデオの理解は、従来の旅客カウンターや運賃システムでは捉えられない、貴重な詳細なデータを提供することができる。
しかし、教師付きビデオモデルはタスク固有のアノテーションを必要とするが、長いビデオに視覚言語モデル(VLM)を直接適用することは信頼性が低く、コストがかかる。
両手法の相補的長所を活用するために,ゼロショットトランジット・バス・ビデオ分析のための視覚的基盤ハイブリッド推論フレームワークであるGHR-VLMを提案する。
長期監視ストリームをコンパクトで旅客中心の時空間的証拠に変換することにより、視覚的明瞭化がVLM推論を改善することが観察の動機となっている。
具体的には、軽量エッジベースのモニターがドアの状態を追跡し、乗客のクリップをセグメント化するエッジクラウド設計を提案する。
バックエンドのVLMは、乗客を識別し、2段階の粗大な時間的証拠の精細化を通じて支払い行動の分類を行う。
接地された旅客用クリップとコンタクトシートだけにVLMを呼び出し、GHR-VLMはクラウド推論を減らし、支払い専用のトレーニングデータを避け、VLMが識別に苦慮しているという局所的な証拠を提供する。
実世界のバス監視ビデオの486分間の評価は、乗客レベルの支払い分析のための地上のエッジクラウド推論の可能性を示し、劣化したビデオ条件による課題を強調している。
関連論文リスト
- TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living [22.90849009713782]
長いビデオの時間的根拠に基づく推論のための費用効率のよいフレームワークであるTimeProVeを紹介する。
TimeProVeは、まず軽量モジュールを使用してアクショングラウンドの回答-エビデンス仮説を生成する。
私たちのフレームワークの中核はAction-based Candidate Evidence (ACE)モジュールにあります。
論文 参考訳(メタデータ) (2026-06-18T17:59:48Z) - Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding [86.37002814396674]
ビデオ時間グラウンドのためのフォアシー・ツー・グラウンド(F2G)を提案する。
F2Gは予測的時間知覚とエビデンス駆動推論を統合している。
さまざまなベンチマークでグラウンド化の精度を一貫して向上させる。
論文 参考訳(メタデータ) (2026-05-21T04:03:25Z) - CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models [41.60751475372144]
ビデオ生成モデル(VGM)は、ゴール指向タスクにおいて繰り返し発生する障害モードを示す。
ステップレベルの批判においてVLMとVGMを結合するクローズドループフレームワークであるVLM-VGMコラボレーションビデオ推論(CollabVR)を提案する。
Gen-ViReとVBVR-Benchでは、CollabVRはシングル推論、Pass@$k$、マッチした計算における以前のテストタイムスケーリングベースラインよりも、オープンソースとクローズドソース両方のVGMを改善している。
論文 参考訳(メタデータ) (2026-05-09T06:39:17Z) - VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events [25.118024547769895]
VLM-AutoDrive(VLM-AutoDrive)は、トレーニング済みの視覚言語モデルを高忠実度異常検出に適用するためのモジュラーフレームワークである。
NVIDIAのCosmos-1 7B (CR1)のような市販のVLMはゼロショット設定でほぼゼロの衝突リコールを示す。
VLM-AutoDriveは、安全クリティカルで時間的ローカライズされた知覚タスクに汎用VLMを適用するためのスケーラブルなレシピを提供する。
論文 参考訳(メタデータ) (2026-03-18T18:23:34Z) - VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting [58.508924874097715]
VisonCoach は,(1) ビデオと質問に対して適切なプロンプト型を予測する Visual Prompt Selector と,(2) 視覚的プロンプトガイダンスとオブジェクトグラウンド報酬の下で RL で最適化された Spatio-Reasoner の2つのコンポーネントから構成される。
この結果から,トレーニング中の視覚的プロンプトが映像推論を改善するのに対し,注意散布センスは推論時にプロンプトを必要とせず,この能力を実現することが示唆された。
論文 参考訳(メタデータ) (2026-03-15T23:32:02Z) - LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling [87.98096428508181]
LongVTは、Multimodal Chain-of-Tool-Thoughtを通じて"Thinking with Long Videos"を可能にするエンドツーエンドのエージェントフレームワークである。
我々は、LMM固有の時間的接地機能を利用して、特定のビデオクリップをズームインし、よりきめ細かいビデオフレームを再サンプリングするネイティブビデオトリミングツールを開発した。
トレーニングデータセットは, ツール統合型冷間始動微調整用247.9K試料, エージェント強化学習用1.6K試料, エージェント強化微調整用15.4K試料からなる。
論文 参考訳(メタデータ) (2025-11-25T19:22:48Z) - TRANSPORTER: Transferring Visual Semantics from VLM Manifolds [56.749972238005604]
本稿では,ビデオ生成のためのモデルに依存しないアプローチであるTransportERとともに,ロジット・トゥ・ビデオ(L2V)タスクを提案する。
TransporterはVLMの高セマンティック埋め込み空間への最適輸送結合を学習する。
代わりに、ロジットスコアは条件付きビデオ生成のための埋め込み方向を定義する。
論文 参考訳(メタデータ) (2025-11-23T09:12:48Z) - iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning [51.15353027471834]
iFinderは、ダッシュカムのビデオを大規模な言語モデルのための階層的で解釈可能なデータ構造に変換するセマンティックグラウンドディングフレームワークである。
iFinderはトレーニング不要のパイプラインとして動作し、トレーニング済みの視覚モデルを使用して重要な手がかりを抽出する。
これは、4つのゼロショット駆動ベンチマークにおいて、エンドツーエンドのV-VLMよりも大幅に優れている。
論文 参考訳(メタデータ) (2025-09-23T20:25:53Z) - Tracking the Unstable: Appearance-Guided Motion Modeling for Robust Multi-Object Tracking in UAV-Captured Videos [58.156141601478794]
マルチオブジェクトトラッキング(UAVT)は、ビデオのフレーム間で一貫したアイデンティティを維持しながら、複数のオブジェクトを追跡することを目的としている。
既存の手法は、通常、動作キューと外観を別々にモデル化し、それらの相互作用を見渡して、最適下追跡性能をもたらす。
本稿では、AMC行列とMTCモジュールの2つの主要コンポーネントを通して、外観と動きの手がかりを利用するAMOTを提案する。
論文 参考訳(メタデータ) (2025-08-03T12:06:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。