論文の概要: Frame-to-Panorama Localization and Context-Aware Sampling for Scene-Specific Ship Detection in a Smart Marina Testbed
- arxiv url: http://arxiv.org/abs/2609.29447v1
- Date: Thu, 24 Sep 2026 12:05:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.907295
- Title: Frame-to-Panorama Localization and Context-Aware Sampling for Scene-Specific Ship Detection in a Smart Marina Testbed
- Title(参考訳): スマートマリーナ試験場におけるシーン特異的船体検出のためのフレーム・トゥ・パノラマ局所化とコンテキスト認識サンプリング
- Abstract要約: 本稿では,パン,傾き,ズームメタデータを欠いた歴史的海洋ビデオのフレーム・ツー・パノラマ・ローカライズとコンテキスト・アウェア・サンプリング・アプローチを提案する。
主な貢献は、歴史的デジタルビデオからカメラビュー情報を復元するエンドツーエンドのデータキュレーションアプローチである。
これらの結果は、コンパクトで空間的に多様なトレーニングセットに変換できる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Smart maritime infrastructures provide continuous access to heterogeneous sensing streams, enabling repeated experimentation, digital-twin development, and AI-based maritime services. However, sensing hardware alone is not sufficient for scene-specific model development: historical video streams must also be spatially indexed, contextualized, and reduced to informative subsets for annotation. This paper presents a frame-to-panorama localization and context-aware sampling pipeline for ship detection in historical PTZ maritime video lacking reliable pan, tilt, and zoom metadata. The main contribution is an end-to-end data-curation approach that recovers camera-view information from historical PTZ video and combines it with environmental context and visual diversity to construct compact, scene-specific training sets. Specifically, frames are localized on a reference panorama using SuperPoint and LightGlue, enriched with weather and solar-state metadata, and selected through diversity sampling to preserve variation across camera view and environmental conditions. A second context-aware stage targets under-represented distant-vessel cases near the horizon using tile-level visual embeddings and Gaussian Mixture Model clustering. Applied within the CMMI MDigi-I Smart Marina testbed, the proposed pipeline reduces 40,718 candidate frames to 220 images for annotation, corresponding to a 99.5% reduction. A YOLO26-m detector fine-tuned on this subset achieves a mean AP50 of 94.78% $\pm$ 0.51% and a mean AP50-95 of 75.10% $\pm$ 1.73% under sequence-grouped five-fold cross-validation. These results demonstrate that highly redundant infrastructure video streams can be transformed into compact, spatially and contextually diverse training sets for scene-specific detector adaptation while substantially reducing annotation effort.
- Abstract(参考訳): スマートな海洋インフラは、異質なセンシングストリームへの継続的なアクセスを提供し、繰り返しの実験、デジタルツイン開発、AIベースの海洋サービスを可能にする。
歴史的ビデオストリームは、空間的にインデックス付けされ、文脈化され、アノテーションのための情報的サブセットに還元されなければならない。
本稿では, パン, 傾き, ズームメタデータに欠ける過去のPTZ海洋ビデオにおける船舶検出のためのフレーム・ツー・パノラマ・ローカライゼーションとコンテキスト・アウェア・サンプリング・パイプラインを提案する。
主な貢献は、過去のPTZビデオからカメラビュー情報を復元し、環境コンテキストと視覚的多様性を組み合わせて、コンパクトでシーン固有のトレーニングセットを構築する、エンドツーエンドのデータキュレーションアプローチである。
特に、フレームはSuperPointとLightGlueを使用して参照パノラマ上にローカライズされ、気象や太陽状態のメタデータが豊富になり、多様性サンプリングによって選択され、カメラビューと環境条件の変動を保存する。
第2の文脈対応段階は、タイルレベルの視覚埋め込みとガウス混合モデルクラスタリングを用いて、地平線付近で表現されていない遠隔血管ケースをターゲットにしている。
CMMI MDigi-I Smart Marinaテストベッドに適用されるパイプラインは、40,718の候補フレームを220の画像に削減し、99.5%の削減に対応する。
このサブセットで微調整されたYOLO26-m検出器は平均AP50が94.78%$\pm$0.51%、平均AP50-95が75.10%$\pm$1.73%となる。
これらの結果から,高度に冗長なインフラストラクチャビデオストリームをコンパクト,空間的,文脈的に多様なトレーニングセットに変換し,シーン特異的なディテクター適応を実現し,アノテーションの労力を大幅に削減できることが示唆された。
関連論文リスト
- From Multi-Fisheye Sensing to Panoramic Perception: A Parallax-Aware Onboard Platform for Ultra-Low-Altitude UAVs [9.663036325597135]
超低高度無人航空機(UAV)は、建物、植生、その他の障害物の近くでの周囲の視界を必要とする。
4つの同期魚眼ストリームをオープン1280x640矩形パノラマ (ERP) インターフェースに変換するパララックス対応プラットフォームを提案する。
論文 参考訳(メタデータ) (2026-09-02T09:04:52Z) - WUTDet: A 100K-Scale Ship Detection Dataset and Benchmarks with Dense Small Objects [68.44670476527155]
WUTDetは100,576イメージと381,378のアノテートされた船舶インスタンスを備えた大規模な船舶検出データセットである。
CNN, Transformer, Mambaの3つの主流検出アーキテクチャから20のベースラインモデルを体系的に評価した。
Ship-GENの結果は、WUTDetでトレーニングされたモデルは、異なるデータ分布下でより強力な一般化を示すことを示している。
論文 参考訳(メタデータ) (2026-04-09T03:28:05Z) - EPRBench: A High-Quality Benchmark Dataset for Event Stream Based Visual Place Recognition [54.55914886780534]
イベントストリームに基づく視覚的位置認識(VPR)は、従来の可視光カメラの不安定性に対して、低照度、過剰露光、高速モーションといった困難な条件下で魅力的な解決策を提供する、新たな研究方向である。
イベントストリームベースのVPR用に特別に設計された高品質なベンチマークであるEPRBenchを紹介する。
EPRBenchは10Kのイベントシーケンスと65Kのイベントフレームで構成され、ハンドヘルドと車載のセットアップを使用して収集され、さまざまな視点、気象条件、照明シナリオで現実世界の課題を包括的にキャプチャする。
論文 参考訳(メタデータ) (2026-02-13T13:25:05Z) - MID: A Comprehensive Shore-Based Dataset for Multi-Scale Dense Ship Occlusion and Interaction Scenarios [10.748210940033484]
海上航行行動データセット(MID)は、複雑な海上環境における船舶検出の課題に対処するために設計されている。
MIDには5,673の画像と135,884の微調整されたターゲットインスタンスが含まれており、教師付き学習と半教師付き学習の両方をサポートしている。
MIDの画像は、43の水域を横断する現実世界のナビゲーションの高精細なビデオクリップから得られたもので、天候や照明条件も様々である。
論文 参考訳(メタデータ) (2024-12-08T09:34:23Z) - Improving Underwater Visual Tracking With a Large Scale Dataset and
Image Enhancement [70.2429155741593]
本稿では,水中ビジュアルオブジェクト追跡(UVOT)のための新しいデータセットと汎用トラッカ拡張手法を提案する。
水中環境は、一様でない照明条件、視界の低さ、鋭さの欠如、コントラストの低さ、カモフラージュ、懸濁粒子からの反射を示す。
本研究では,追尾品質の向上に特化して設計された水中画像強調アルゴリズムを提案する。
この手法により、最先端(SOTA)ビジュアルトラッカーの最大5.0%のAUCの性能が向上した。
論文 参考訳(メタデータ) (2023-08-30T07:41:26Z) - Beyond Cross-view Image Retrieval: Highly Accurate Vehicle Localization
Using Satellite Image [91.29546868637911]
本稿では,地上画像と架空衛星地図とをマッチングすることにより,車載カメラのローカライゼーションの問題に対処する。
鍵となる考え方は、タスクをポーズ推定として定式化し、ニューラルネットベースの最適化によってそれを解くことである。
標準自動運転車のローカライゼーションデータセットの実験により,提案手法の優位性が確認された。
論文 参考訳(メタデータ) (2022-04-10T19:16:58Z) - Flow-Guided Sparse Transformer for Video Deblurring [124.11022871999423]
FlowGuided Sparse Transformer (F GST) はビデオデブリのためのフレームワークである。
FGSW-MSAは、推定光流のガイダンスを楽しみ、隣り合うフレームの同じシーンパッチに対応する、空間的にスパースな要素を世界中にサンプリングする。
提案するFGSTは,DVDおよびGOPROデータセットの最先端パッチよりも優れており,実際のビデオの劣化に対して,より視覚的に満足な結果が得られる。
論文 参考訳(メタデータ) (2022-01-06T02:05:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。