論文の概要: SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding
- arxiv url: http://arxiv.org/abs/2604.03697v1
- Date: Sat, 04 Apr 2026 12:01:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.728275
- Title: SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding
- Title(参考訳): SGTA:ビデオ理解のためのシーングラフに基づくマルチモーダルトラヒックエージェント
- Abstract要約: SGTA(Scene-Graph Based Multi-Modal Traffic Agent)は、トラフィックビデオ理解のためのモジュラーフレームワークである。
検出、追跡、車線抽出を使用して、道端のビデオからトラフィックシーングラフを構築し、続いてシンボルグラフクエリと視覚入力の両方に対するツールベースの推論を行う。
- 参考スコア(独自算出の注目度): 48.47968852253859
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present Scene-Graph Based Multi-Modal Traffic Agent (SGTA), a modular framework for traffic video understanding that combines structured scene graphs with multi-modal reasoning. It constructs a traffic scene graph from roadside videos using detection, tracking, and lane extraction, followed by tool-based reasoning over both symbolic graph queries and visual inputs. SGTA adopts ReAct to process interleaved reasoning traces from large language models with tool invocations, enabling interpretable decision-making for complex video questions. Experiments on selected TUMTraffic VideoQA dataset sample demonstrate that SGTA achieves competitive accuracy across multiple question types while providing transparent reasoning steps. These results highlight the potential of integrating structured scene representations with multi-modal agents for traffic video understanding.
- Abstract(参考訳): SGTA(Scene-Graph Based Multi-Modal Traffic Agent)は、構造化されたシーングラフとマルチモーダル推論を組み合わせた、トラフィックビデオ理解のためのモジュラーフレームワークである。
検出、追跡、車線抽出を使用して、道端のビデオからトラフィックシーングラフを構築し、続いてシンボルグラフクエリと視覚入力の両方に対するツールベースの推論を行う。
SGTAはReActを採用し、ツール呼び出しによる大規模言語モデルからのインターリーブド推論トレースを処理し、複雑なビデオ質問に対する解釈可能な意思決定を可能にする。
選択したTUMTraffic VideoQAデータセットを用いた実験は、SGTAが透過的な推論ステップを提供しながら、複数の質問タイプ間での競合精度を達成することを示した。
これらの結果は、交通映像理解のためのマルチモーダルエージェントと構造化シーン表現を統合する可能性を強調している。
関連論文リスト
- Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models [46.09809083890632]
シーングラフ思考(Scene Graph Thinking, SaGe)は、明示的なシーングラフ表現を通じて、きめ細かな、構造化された視覚的推論を可能にする新しいパラダイムである。
シーングラフからの推論トレースをサンプリングすることにより,120Kの高品質なトレーニングデータを構築する。
キュレートされたデータとグラフ整合トレーニングにより、我々のアプローチは8つのマルチモーダルベンチマークで大幅に改善される。
論文 参考訳(メタデータ) (2026-07-07T01:00:51Z) - TrafficLens: Multi-Camera Traffic Video Analysis Using LLMs [8.205106134817763]
マルチカメラフィードを効率的に管理し、分析することは、大量のデータのために課題を引き起こす。
これらの課題に対処するために,マルチカメラ交通交差点に適したアルゴリズムであるTrafficLensを提案する。
実世界のデータセットによる実験結果から、TrafficLensは情報精度を維持しながら、ビデオからテキストへの変換時間を最大4倍に短縮することを示した。
論文 参考訳(メタデータ) (2025-11-26T01:34:08Z) - Language-Guided Graph Representation Learning for Video Summarization [96.2763459348758]
本稿では,映像要約のためのLGRLN(Language-guided Graph Representation Learning Network)を提案する。
具体的には,ビデオフレームを構造化グラフに変換して時間的順序と文脈依存性を保存するビデオグラフ生成装置を提案する。
提案手法は,複数のベンチマークにおいて既存手法より優れている。
論文 参考訳(メタデータ) (2025-11-14T04:35:48Z) - FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning [65.42201665046505]
現在のビデオ理解モデルは、各質問の特定の推論条件にかかわらず、固定されたフレームサンプリング戦略に依存し、所定の視覚入力を処理する。
この静的アプローチは、視覚的エビデンスを適応的に収集する能力を制限し、広範囲の時間的カバレッジやきめ細かい空間的詳細を必要とするタスクにおいて、最適以下のパフォーマンスをもたらす。
Frame-Interleaved Chain-of-Thought (FiCOT)を通して、モデルが推論中に視覚情報を動的に要求することを可能にする強化学習で訓練されたエンドツーエンドフレームワークであるFrameMindを紹介する。
従来のアプローチとは異なり、FrameMindは複数のターンで動作し、モデルがテキスト推論とアクティブな視覚知覚を交互に切り替え、ツールを使って抽出する。
論文 参考訳(メタデータ) (2025-09-28T17:59:43Z) - Multimodal Referring Segmentation: A Survey [93.24051010753817]
マルチモーダル参照セグメンテーション(Multimodal reference segmentation)は、テキストやオーディオフォーマットでの参照表現に基づいて、画像、ビデオ、および3Dシーンなどのターゲットオブジェクトを視覚シーンに分割することを目的としている。
過去10年間で、畳み込みニューラルネットワーク、トランスフォーマー、および大規模言語モデルの進歩によって、マルチモーダルコミュニティにおいて大きな注目を集めてきた。
論文 参考訳(メタデータ) (2025-08-01T02:14:00Z) - When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis [6.213279061986497]
SeeUnsafeは、ビデオベースの交通事故分析を、よりインタラクティブで対話的なアプローチに変換するフレームワークである。
本フレームワークでは,様々な長さの動画をマルチモーダル・アグリゲーション・ストラテジーで処理し,レビューと評価のために構造化された応答を生成する。
本研究では,トヨタウーブン交通安全データセットについて広範な実験を行い,SeeUnsafeが事故対応ビデオ分類と視覚的グラウンド化を効果的に実施できることを実証した。
論文 参考訳(メタデータ) (2025-01-17T23:35:34Z) - TrafficVLM: A Controllable Visual Language Model for Traffic Video Captioning [0.0]
本稿では,車載エゴカメラビューのためのマルチモーダル高密度映像キャプションモデルであるTrafficVLMを提案する。
私たちのソリューションは、AI City Challenge 2024のトラック2で傑出した成果を上げました。
論文 参考訳(メタデータ) (2024-04-14T14:51:44Z) - Traffic Scene Parsing through the TSP6K Dataset [109.69836680564616]
高品質なピクセルレベルのアノテーションとインスタンスレベルのアノテーションを備えた,TSP6Kと呼ばれる特殊なトラフィック監視データセットを導入する。
データセットは、既存の運転シーンの何倍ものトラフィック参加者を持つ、より混雑した交通シーンをキャプチャする。
交通シーンの異なるセマンティック領域の詳細を復元するシーン解析のためのディテールリフィニングデコーダを提案する。
論文 参考訳(メタデータ) (2023-03-06T02:05:14Z) - Dynamic Graph Representation Learning for Video Dialog via Multi-Modal
Shuffled Transformers [89.00926092864368]
音声・視覚シーン認識ダイアログタスクのためのセマンティクス制御型マルチモーダルシャッフルトランスフォーマー推論フレームワークを提案する。
また,フレーム内推論層を用いた動的シーングラフ表現学習パイプラインを提案する。
その結果,全ての評価指標について最先端の性能を示すことができた。
論文 参考訳(メタデータ) (2020-07-08T02:00:22Z) - Understanding Dynamic Scenes using Graph Convolution Networks [22.022759283770377]
本稿では,移動カメラが捉えた時間順のフレーム列から道路車両の挙動をモデル化する新しい枠組みを提案する。
微調整に頼らずに複数のデータセットへの学習のシームレスな移行を示す。
このような振る舞い予測手法は,様々なナビゲーションタスクにおいて即時関連性を見出す。
論文 参考訳(メタデータ) (2020-05-09T13:05:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。