論文の概要: A Simulation-Grounded Agentic VLM Framework for Wildfire Monitoring and Reporting
- arxiv url: http://arxiv.org/abs/2610.02451v1
- Date: Thu, 01 Oct 2026 20:22:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.076689
- Title: A Simulation-Grounded Agentic VLM Framework for Wildfire Monitoring and Reporting
- Title(参考訳): 森林火災モニタリング・報告のためのシミュレーション・グラウンドエージェントVLMフレームワーク
- Abstract要約: 本稿では,2次元の山火事シミュレーションをラベル付き映像に自動変換するフレームワークを提案する。
固定されたブレンダーマッピングは、シミュレーター地形、燃料レイアウト、火災活動、風速と整合した低深度3Dプロキシを生成する。
このフレームワークは、シミュレーションからプロキシへの自動変換と、実際の物理的なアノテーションが不足しているメモリベースのVLM推論を結合する。
- 参考スコア(独自算出の注目度): 23.27783432451687
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Effective wildfire monitoring requires relating visual evidence to physical fire dynamics, yet real videos with synchronized physical annotations are scarce and high-fidelity 3D simulation is costly. We present a simulation-grounded vision-language model (VLM) framework that automatically converts 2D wildfire simulations into labeled video episodes. A fixed Blender mapping produces low-detail 3D proxies aligned with simulator terrain, fuel layout, fire activity, and wind cues; controllable video generation supplies richer appearance. The proxies are intermediate representations rather than finely rendered final scenes. Generated videos and simulator labels form reusable multimodal memory for a training-free multi-agent VLM system that retrieves reference episodes, reconciles visual and memory-based predictions, and produces structured wildfire reports. On held-out generated episodes, video memory achieves 51.5% exact four-tag accuracy, compared with 22.6% for direct VLM querying and 16-17% for text-only memory; the complete system achieves 77.3% accuracy on six simulator-derived report fields. Component ablations, cross-generator tests, and three real-UAV evaluations assess retrieval, reporting, generator changes, and observable monitoring tasks. The framework connects automatic simulation-to-proxy conversion with memory-based VLM reasoning under scarce real-world physical annotations.
- Abstract(参考訳): 効果的な山火事モニタリングには、物理的な火災力学に関する視覚的証拠が必要であるが、同期された物理的なアノテーションを持つ実際のビデオは少なく、高忠実度3Dシミュレーションはコストがかかる。
本稿では,2次元の山火事シミュレーションをラベル付き映像に自動変換する視覚言語モデル(VLM)を提案する。
固定されたブレンダーマッピングは、シミュレータ地形、燃料レイアウト、火災活動、風速と整合した低次元の3Dプロキシを生成し、制御可能なビデオ生成はよりリッチな外観を提供する。
プロキシは、微調整された最終シーンではなく、中間的な表現である。
生成したビデオとシミュレーターラベルは、トレーニング不要なマルチエージェントVLMシステムのために再利用可能なマルチモーダルメモリを形成し、参照エピソードを検索し、ビジュアルおよびメモリベースの予測を調整し、構造化されたワイルドファイアレポートを生成する。
ビデオメモリは51.5%の精度で、直接のVLMクエリでは22.6%、テキストのみのメモリでは16-17%、シミュレータ由来の6つのレポートフィールドでは77.3%の精度を実現している。
コンポーネントの短縮、クロスジェネレータテスト、3つの実UAV評価は、検索、レポート、ジェネレータの変更、観測可能な監視タスクを評価する。
このフレームワークは、シミュレーションからプロキシへの自動変換と、実際の物理的なアノテーションが不足しているメモリベースのVLM推論を結合する。
関連論文リスト
- A Sim-to-Real Integration Pipeline for Training and Deployment of Chunk-Based VLA Manipulation Policies [7.704461099776405]
VLA(Vision-Language-Action)モデルは、マルチモーダル入力をロボットアクションにマッピングするための重要なパラダイムとなっている。
これらのモデルのトレーニングと評価には、大規模な実世界デモの収集が必要である。
このボトルネックに対処する,オープンソースのsim-to-real実験プロトコルを提案する。
論文 参考訳(メタデータ) (2026-09-18T14:22:46Z) - Building Pretraining Data for World Models: An Unreal Engine-Based Pipeline for Action-Conditioned Video Generation [53.851483224691634]
動作条件付きマルチビュービデオを生成するためにUnreal Engine上に構築した大規模合成データ生成パイプラインを提案する。
パイプラインは1080pビデオの2,691時間、720pビデオの6,076時間を生成する。
論文 参考訳(メタデータ) (2026-09-03T08:58:04Z) - Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA [6.404338288187941]
エージェント駆動型ゲーム品質保証パイプラインにおける異常検出における視覚言語モデル(VLM)の利用について検討した。
我々は、ゼロショットプロンプト設定下で6つの最近のVLMをベンチマークし、その感度を4つのプロンプト変種に解析する。
以上の結果から,VLMは幾何学的クリッピングに関連する視覚的手がかりを捉えることができるが,視覚的不明瞭なフレームに対して有意な偽陽性が生じることが示唆された。
論文 参考訳(メタデータ) (2026-07-28T16:10:47Z) - Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory [79.01059178883817]
IAMFlowはトレーニング不要のID対応メモリフレームワークで、永続的なエンティティのIDを明示的にモデル化し追跡する。
VLMは、レンダリングフレームから属性を非同期に検証し、洗練し、暗黙の類似性ベースのマッチングの代わりに明示的なエンティティ追跡を可能にする。
NarraStream-Benchは,6次元にまたがる324のマルチプロンプトスクリプトを備えた,ナラストリームビデオ生成のためのベンチマークである。
論文 参考訳(メタデータ) (2026-05-18T17:54:34Z) - Asset Harvester: Extracting 3D Assets from Autonomous Driving Logs for Simulation [63.01022057888141]
Asset Harvesterはイメージ・ツー・3Dモデルとエンドツーエンドのパイプラインで、実際の運転ログからスパース・イン・ザ・ワン・オブジェクトの観察を完全なシミュレーション可能なアセットに変換する。
SparseViewDiTは、限定角度ビューやその他の実世界のデータ課題に対処するように明示的に設計されている。
論文 参考訳(メタデータ) (2026-04-20T16:20:57Z) - Agentic Video Generation: From Text to Executable Event Graphs via Tool-Constrained LLM Planning [4.964902130083661]
既存のマルチエージェントビデオ生成システムは、LLMエージェントを使用してニューラルビデオジェネレータをオーケストレーションする。
本稿では,このパラダイムを逆転させ,空間と時間におけるイベントの形式的なグラフを構築するエージェントシステムを提案する。
プログラム状態バックエンドは、検証済みのツールコールを通じてすべてのシミュレータの制約を強制し、生成されたすべての仕様が実行可能であることを保証します。
論文 参考訳(メタデータ) (2026-04-11T23:51:13Z) - A Synthetic Eye Movement Dataset for Script Reading Detection: Real Trajectory Replay on a 3D Simulator [12.307366979757065]
本稿では,参照ビデオから実際の人間の虹彩軌跡を抽出し,合成ラベル付き眼球運動ビデオを生成するパイプラインを提案する。
144セッション(72読取,72会話)を25fpsで12時間合成眼球運動ビデオとしてリリースした。
一致したフレーム・バイ・フレーム比較により、3Dシミュレータは読み出しスケールの動作に対して有界感度を示すことが明らかとなった。
論文 参考訳(メタデータ) (2026-04-07T06:15:48Z) - SimGen: Simulator-conditioned Driving Scene Generation [50.03358485083602]
シミュレーション条件付きシーン生成フレームワークSimGenを紹介する。
SimGenは、シミュレータと現実世界のデータを混ぜることで、多様な運転シーンを生成することを学ぶ。
テキストプロンプトとシミュレータからのレイアウトに基づいて制御性を保ちながら、優れた生成品質と多様性を実現する。
論文 参考訳(メタデータ) (2024-06-13T17:58:32Z) - Virtual laser scanning with HELIOS++: A novel take on ray tracing-based
simulation of topographic 3D laser scanning [0.0]
HELIOS++は、C++で実装された地上静的、移動型、UAVベース、空中レーザースキャンのためのオープンソースのシミュレーションフレームワークである。
HELIOS++のユニークな特徴は、シミュレーションを制御するPythonバインディングの可用性と、3Dシーン表現のためのモデルタイプの範囲である。
論文 参考訳(メタデータ) (2021-01-21T16:39:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。