論文の概要: FUSEye: Training-Light Fisheye Detection with Overlapping Views and Zero-Initialized Adapters
- arxiv url: http://arxiv.org/abs/2610.02799v1
- Date: Fri, 02 Oct 2026 04:42:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.209852
- Title: FUSEye: Training-Light Fisheye Detection with Overlapping Views and Zero-Initialized Adapters
- Title(参考訳): FUSEye: オーバーラップビューとゼロ初期適応器による訓練用軽水魚眼検出
- Abstract要約: FUSEyeは、凍ったバックボーンのCOCOをトレーニングした超大型のYOLO26検出器を魚眼検出器に変えるフレームワークだ。
転送ギャップは3つの因果的にリンクされたレベルに対処する。
WoodScapeのサラウンドビュー魚眼のベンチマークでは、FUSEyeはYOLO26-xを0.148から0.266 mAP50に上げ、84.3%の精度を維持している。
- 参考スコア(独自算出の注目度): 26.32137721461474
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fisheye cameras give mobile robots a single-sensor, low-cost view of their surroundings, yet the COCO-pretrained detectors that practitioners routinely reuse fail on them: strong radial distortion warps local image structure, while boundary compression shrinks objects to near-invisible sizes. Full fine-tuning closes much of the gap but requires abundant fisheye labels and compute. We present FUSEye, a training-light framework that turns a frozen-backbone COCO-pretrained extra-large YOLO26 detector (YOLO26-x) into a fisheye detector. FUSEye adds roughly 227k new parameters while updating the inserted modules and the pretrained detection head. It addresses the transfer gap at three causally linked levels. At the input level, overlapping grid view generation and box remapping (GridViews) enlarge compressed boundary regions. At the feature level, zero-initialized residual adapters (Z-Adapters) correct distortion-induced feature misalignment. At the decision level, learned cross-projection agreement fusion (AgreeFusion) promotes low-confidence detections only when they are supported by consistent evidence across multiple views. On the WoodScape surround-view fisheye benchmark, FUSEye raises YOLO26-x from 0.148 to 0.266 mAP50 and retains 84.3% fully fine-tuned accuracy. Moreover, randomly using only 25% of the labeled training images, FUSEye achieves 0.2597 mAP50, retaining 97.6% of its full-label performance. FUSEye also consistently improves YOLOv8-11 detectors, showing that the recipe is architecture-agnostic. Source code will be available at https://github.com/Su-wenya/FUSEye.
- Abstract(参考訳): 魚眼カメラは、移動ロボットに周囲の単一センサーで低コストな視界を与えるが、COCOが規制している検知器は、日常的に再利用されるが失敗する: 強い放射歪みが局所的な画像構造を歪め、境界圧縮は物体をほぼ見えない大きさに縮小する。
完全な微調整はギャップの多くを埋めるが、豊富な魚眼ラベルと計算を必要とする。
FUSEyeは、凍ったバックボーンのCOCOを前提とした大型のYOLO26検出器(YOLO26-x)を魚眼検出器に変えるためのトレーニングライトフレームワークである。
FUSEyeは挿入されたモジュールと事前訓練された検出ヘッドを更新しながら、約227kの新しいパラメータを追加している。
転送ギャップは3つの因果的にリンクされたレベルに対処する。
入力レベルでは、オーバーラップしたグリッドビュー生成とボックスリマッピング(GridViews)が圧縮境界領域を拡大する。
特徴レベルでは、ゼロ初期化残留アダプタ(Z-アダプタ)が歪みによって引き起こされる特徴の不適応を補正する。
意思決定レベルでは、学習されたクロスプロジェクション合意融合(AgreeFusion)は、複数の視点で一貫した証拠によって支持された場合にのみ、低信頼度検出を促進する。
WoodScapeのサラウンドビュー魚眼のベンチマークでは、FUSEyeはYOLO26-xを0.148から0.266 mAP50に上げ、84.3%の精度を維持している。
さらに、ラベル付きトレーニング画像の25%しかランダムに使用せず、FUSEyeは0.2597 mAP50を達成し、フルラベルのパフォーマンスの97.6%を維持している。
FUSEyeはまた、YOLOv8-11検出器を一貫して改善し、レシピがアーキテクチャに依存しないことを示した。
ソースコードはhttps://github.com/Su-wenya/FUSEye.comで入手できる。
関連論文リスト
- OmniPoint: Universal Monocular Metric Pointcloud from Any Camera [79.24417597712802]
OmniPointは、様々な画像センサにまたがるメートル法再構成を一般化するために設計された統合されたフレームワークである。
射影剛性を克服するため、OmniPointは従来の平面深度回帰を放棄する。
代わりに、分離された訓練目標とともに、分離された光線と距離の表現を採用する。
論文 参考訳(メタデータ) (2026-09-08T19:45:58Z) - Albireo: Adaptive, Energy-Efficient Inference Framework for Video Object Detection on the Edge [35.270814297601184]
アルビレオ(Albireo)は、シェルフ検出器を包む検出器に依存しない適応型推論フレームワークである。
Albireoは、シーンの内容とオブジェクトごとの時間状態に基づいて、検出呼び出しを安全にスキップできるかどうかを判断する。
軽量の空のスクリーンは、オブジェクトレスフレーム上の検出器呼び出しを避ける。
論文 参考訳(メタデータ) (2026-08-29T12:42:45Z) - Depth-Aware Pothole Detection Using YOLO and RT-DETR at the Edge [0.0]
既存のアプローチは2D RGB画像に依存しており、ポットホールの物理的深さを測定することはできない。
深度対応ポットホール検出フレームワークを提示し、5つのアーキテクチャを比較した。
YOLOv8n, YOLOv8nSeg, YOLOv9t, RTDETRL, RTDETRX。
論文 参考訳(メタデータ) (2026-08-27T19:18:08Z) - CM-MAE: A Physics-Guided Cross-Modal Self-Supervised Learning Framework for Vision-Wireless Applications [4.943233471540466]
CM-MAEは、クロスシナリオ表現転送のための無線事前トレーニングフレームワークである。
CM-MAEはRGBフレームとDeepSense 6Gで利用可能な64ビーム受信パワーベクトルのみを使用する。
論文 参考訳(メタデータ) (2026-08-16T23:55:03Z) - Tactus: Open-Vocabulary Object Recognition from Low-Cost Pressure Arrays [0.0]
圧力データのみからテキストクエリに回答するオープンモデルであるTactusを提示する。
187のトレーニング記録、144kの未ラベルの同センサーフレームで事前トレーニングされたマスク付きオートエンコーダ、センサー独自のキャリブレーションアフィン。
重み、コード、モデルがプラグインするメモリ層は、オープンにリリースされる。
論文 参考訳(メタデータ) (2026-08-04T06:08:21Z) - RayTun3R: Online Camera Adaptation in 3D Foundation Models [53.97305597591864]
最近の3Dファウンデーションモデルは、強力なフィードフォワード深度を提供し、ピンホールのイメージを推定するが、魚眼カメラ幾何学の下では鋭く劣化する。
この失敗は、事前訓練された3次元基礎モデルの位置符号化におけるピンホールカメラバイアスによってもたらされることを示す。
軽量カメラ適応手法であるRayTun3Rを提案する。
論文 参考訳(メタデータ) (2026-07-02T18:55:35Z) - iSAGE: A Human-in-the-Loop Framework for Remote Sensing Semantic Segmentation via Sparse Point Supervision [0.1749935196721634]
既存のHuman-in-the-loopフレームワークは、余分なクリックを補助機械を介して密集した監視に拡張する。
本稿では, 任意の画素ではなく, 信頼度の高いモデル誤差をターゲットとした, 専門家によるクリックが, 厳密な監督と一致させるのに十分である,という仮説を立てる。
iSAGEは補助機械を使わずに動作する唯一の反復型人間-イン-ザ-ループフレームワークである。
論文 参考訳(メタデータ) (2026-06-08T20:09:35Z) - Learning to Make Keypoints Sub-Pixel Accurate [80.55676599677824]
本研究は,2次元局所特徴の検出におけるサブピクセル精度の課題に対処する。
本稿では,検出された特徴に対するオフセットベクトルを学習することにより,サブピクセル精度で検出器を拡張できる新しいネットワークを提案する。
論文 参考訳(メタデータ) (2024-07-16T12:39:56Z) - EdgeYOLO: An Edge-Real-Time Object Detector [69.41688769991482]
本稿では, 最先端のYOLOフレームワークをベースとした, 効率的で低複雑さかつアンカーフリーな物体検出器を提案する。
我々は,訓練中の過剰適合を効果的に抑制する拡張データ拡張法を開発し,小型物体の検出精度を向上させるためにハイブリッドランダム損失関数を設計する。
私たちのベースラインモデルは、MS 2017データセットで50.6%のAP50:95と69.8%のAP50、VisDrone 2019-DETデータセットで26.4%のAP50と44.8%のAP50に達し、エッジコンピューティングデバイスNvidia上でリアルタイム要求(FPS>=30)を満たす。
論文 参考訳(メタデータ) (2023-02-15T06:05:14Z) - UniFormer: Unifying Convolution and Self-attention for Visual
Recognition [69.68907941116127]
畳み込みニューラルネットワーク(CNN)とビジョントランスフォーマー(ViT)は、ここ数年で主要なフレームワークである。
コンボリューションと自己注意の利点を簡潔なトランスフォーマー形式にシームレスに統合する新しいUnified TransFormer(UniFormer)を提案する。
我々のUniFormerはImageNet-1K分類において86.3トップ1の精度を実現している。
論文 参考訳(メタデータ) (2022-01-24T04:39:39Z) - FOVEA: Foveated Image Magnification for Autonomous Navigation [53.69803081925454]
入力キャンバスを小さく保ちながら、ある領域を弾性的に拡大する注意的アプローチを提案する。
提案手法は,高速R-CNNより高速かつ微調整の少ない検出APを高速化する。
Argoverse-HD と BDD100K の自律走行データセットでは,提案手法が標準の高速 R-CNN を超越した検出APを微調整なしで促進することを示す。
論文 参考訳(メタデータ) (2021-08-27T03:07:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。