論文の概要: PAANI : On Device Visual Evidence Fusion and Explainable Guidance for River Robot Simulation
- arxiv url: http://arxiv.org/abs/2609.22353v1
- Date: Thu, 17 Sep 2026 09:15:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:03.867589
- Title: PAANI : On Device Visual Evidence Fusion and Explainable Guidance for River Robot Simulation
- Title(参考訳): PAANI : 河川ロボットシミュレーションのためのデバイス・ビジュアル・エビデンス・フュージョンと説明誘導について
- Abstract要約: 移動河川モニタリングロボットは、地理的な道標だけでは説明できない障害物や水の境界を解釈しなければならない。
Arduino UNO Q 上でのタイムスタンプに整合したエビデンス融合によるプロジェクトトレーニング YOLO11n 検出器とカスタム MobileNetV3 セマンティックセマンティクスセグメンタを組み合わせた,デバイス上でのガイダンスアーキテクチャ PAANI を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Mobile river monitoring robots must interpret obstacles and water boundaries that geographic waypoints alone cannot describe. On resource constrained platforms, converting imperfect visual predictions into timely and inspectable guidance is a distinct challenge. An object label or steering command does not explain which evidence supports a decision or when that evidence is unreliable. We present PAANI, an on-device perception to guidance architecture that combines a project trained YOLO11n detector and a custom MobileNetV3 Small semantic segmenter with timestamp aligned evidence fusion on Arduino UNO Q. Bounded tracking supplies object persistence, while an explicit corridor policy combines surface labels, accepted detections, urgency and mask uncertainty. Each final advisory exposes its contributing evidence and policy reasons. ROS 2 interfaces connect the local AI pipeline to a separate Gazebo vessel, localization and control testbed. Training uses 10,000 WaterScenes images for four-class detection and 1,127 MaSTr1325 images for segmentation, including 198 segmentation validation images. The selected FP32 ONNX models occupy 14.817 MB. Detector checkpoint test mAP at 0.5 IoU is 0.7388, while the separately evaluated rectangular ONNX export achieves validation mAP at 0.5 IoU of 0.7367. Segmentation ONNX validation mIoU is 0.9750. A five-minute UNO Q recording produced median and 95th percentile pipeline latencies of 467.8 ms and 580.3 ms at a configured 0.5 Hz cadence. The evaluation also identifies black input misclassification and a sampling rate mismatch that prevents the diagnostic apparent motion estimator from collecting sufficient evidence. These results support an inspectable and reusable edge robotics foundation while clearly distinguishing model accuracy and on-board execution from validated on-water collision avoidance.
- Abstract(参考訳): 移動河川モニタリングロボットは、地理的な道標だけでは説明できない障害物や水の境界を解釈しなければならない。
リソース制約のあるプラットフォームでは、不完全な視覚的予測をタイムリーかつ検査可能なガイダンスに変換することは、大きな課題である。
オブジェクトラベルやステアリングコマンドは、どのエビデンスが決定を支持しているのか、あるいはそのエビデンスが信頼できないのかを説明しません。
PAANIは、トレーニング済みのYOLO11n検出器とカスタムのMobileNetV3と、Arduino UNO Q上でのタイムスタンプ対応のエビデンスを融合した小さなセマンティックセグメンタを組み合わせた、デバイス上でのガイダンスアーキテクチャである。
それぞれの最終諮問は、その貢献する証拠と政策上の理由を明らかにする。
ROS 2インターフェイスは、ローカルAIパイプラインを別のGazeboコンテナに接続し、ローカライゼーションとテストベッドを制御する。
トレーニングでは4つのクラス検出に10,000のWaterScenesイメージを使用し、セグメンテーションには1,127のMaSTr1325イメージを使用する。
選択されたFP32 ONNXモデルは14.817MBである。
0.5IoUでの検出器チェックポイント検定mAPは0.7388であり、別々に評価された長方形のONNXエクスポートは0.5IoUの0.5IoUでの検証mAPを達成する。
セグメンテーションNNX検証mIoUは0.9750である。
5分間のUNO Q記録は、0.5Hzの周期で467.8msと580.3msの中央値と95番目のパーセンタイルパイプラインレイテンシを発生させた。
評価はまた、ブラック入力誤分類とサンプリングレートのミスマッチを識別し、診断の見かけの運動推定器が十分な証拠を収集するのを防ぐ。
これらの結果は、検査可能で再利用可能なエッジロボティクスの基礎をサポートしながら、モデル精度とオンボード実行を、実証されたオンウォーター衝突回避と明確に区別する。
関連論文リスト
- Towards Practical Precision Agriculture: Real-Time Fruit Detection and Video Analytics on Embedded Edge Hardware [0.815557531820863]
本研究では,NVIDIA Jetson Orin Super上で実時間果物の検出,追跡,計数を行うためのエンドツーエンドフレームワークを提案する。
軽量のYOLO26s検出器は、リンゴ、マンゴー、ブルーベリー、イチゴを表す4つの公開データセットで独立に訓練されている。
APPLE MOTSは、果肉の恒常性を持った果樹配列を提供するため、時間的ビデオ解析に使用される。
論文 参考訳(メタデータ) (2026-09-11T21:32:02Z) - Solution for UCF UrbanTwin V2X-Real Track: Sim-to-Real Urban LiDAR 3D Object Detection [54.03436243843709]
本報告では,Sim2Real 3D検出のためのマルチソース協調学習とクラス認識融合フレームワークを提案する。
この方法は、デジタルツインスキャン、拡散露光スキャン、密度安定化スキャン、歩行者形態に整列したサンプルを補完的な役割を持つ統合トレーニングプールに整理する。
論文 参考訳(メタデータ) (2026-09-07T15:16:15Z) - Can Webcam Gaze Constrain Mesa-Objectives in Driving Models? An Instrument Precision Analysis [0.0]
ウェブカメラによる視線追跡によって捉えた人間の視線パターンが、メザ・オブジェクト形成を制限する特権情報として機能するかどうかを検討する。
危険アノテーションと同期した137,663個のフレームレベルの視線サンプルを実ダッシュカムクリップ388本で収集した。
実験では視線から統計的に有意な改善が得られない。
論文 参考訳(メタデータ) (2026-08-09T22:55:28Z) - Zero-Shot Traffic Accident Detection via a Coarse-to-Fine VLM-Tracking Pipeline [0.10874100424278173]
ACCIDENT @ CVPRベンチマークは、厳密な制約の下で、この共同予測を正確に評価する。
我々は,凍結したQwen3-VL-32B-インストラクション視覚言語モデルとYOLO11xオブジェクト検出とBoT-SORTトラッキングを組み合わせた,トレーニングフリーで2パスの粗いパイプラインを提案する。
公式の2,027クリップの実CCTVテストセットにおいて,本システムは0.504の3方向高調波平均スコアを達成した。
論文 参考訳(メタデータ) (2026-08-09T19:08:56Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Acquisition state behaves as a structured, measurable variable governing lung-nodule AI: kernel-driven measurement instability and noise-driven detection fragility, invisible to DICOM metadata [0.0]
2026年のACR-SIIMプラクティスでは、局所的な受け入れテストとドリフトモニタリングが推奨されている。
我々は、必要な、現在監視されていないレイヤが、出力メトリクスの下にあることを論じる: 入ってくる研究が、モデルが検証された取得エンベロープ内に留まっているかどうか。
論文 参考訳(メタデータ) (2026-06-11T02:38:37Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Selfie-Capture Dynamics as an Auxiliary Signal Against Deepfakes and Injection Attacks for Mobile Identity Verification [4.2958409172092225]
モバイルリモートID認証(RIdV)システムは、顔のビデオストリームを操作または置換する攻撃にさらされる。
ETSI TS 119 461 や CEN/TS 18099 といったヨーロッパの近年の要求は、カメラベースのプレゼンテーション攻撃検出以上の補完的なエビデンスチャネルを動機付けている。
本稿では,自撮り撮影中に記録された受動運動軌跡が,スプーフスクリーニングとユーザ検証の補助的証拠となるかどうかを検討する。
論文 参考訳(メタデータ) (2026-04-30T20:46:18Z) - Instance-level Visual Active Tracking with Occlusion-Aware Planning [61.982298426203165]
Visual Active Tracking (VAT)は、カメラを3D空間でターゲットに追従することを目的としている。
VATは、視覚的に類似したイントラクタからの混乱と、閉塞下での深刻な障害という、現実世界のデプロイメントにおいて2つの重要なボトルネックに直面している。
3つの相補的なモジュールを持つ統一パイプラインであるOA-VATを提案する。
論文 参考訳(メタデータ) (2026-04-23T09:11:50Z) - DAAIN: Detection of Anomalous and Adversarial Input using Normalizing
Flows [52.31831255787147]
我々は、アウト・オブ・ディストリビューション(OOD)インプットと敵攻撃(AA)を検出する新しい手法であるDAINを導入する。
本手法は,ニューラルネットワークの内部動作を監視し,活性化分布の密度推定器を学習する。
当社のモデルは,特別なアクセラレータを必要とせずに,効率的な計算とデプロイが可能な単一のGPUでトレーニングすることが可能です。
論文 参考訳(メタデータ) (2021-05-30T22:07:13Z) - Risk-Averse MPC via Visual-Inertial Input and Recurrent Networks for
Online Collision Avoidance [95.86944752753564]
本稿では,モデル予測制御(MPC)の定式化を拡張したオンライン経路計画アーキテクチャを提案する。
我々のアルゴリズムは、状態推定の共分散を推論するリカレントニューラルネットワーク(RNN)とオブジェクト検出パイプラインを組み合わせる。
本手法のロバスト性は, 複雑な四足歩行ロボットの力学で検証され, ほとんどのロボットプラットフォームに適用可能である。
論文 参考訳(メタデータ) (2020-07-28T07:34:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。