論文の概要: YOLOv14:Unified Cross-Domain Real-Time Object Detectionwith Adaptive Multi-View Representation
- arxiv url: http://arxiv.org/abs/2608.04720v1
- Date: Wed, 05 Aug 2026 11:39:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.855946
- Title: YOLOv14:Unified Cross-Domain Real-Time Object Detectionwith Adaptive Multi-View Representation
- Title(参考訳): YOLOv14:Adaptive Multi-View Representationを用いた統合クロスドメインリアルタイムオブジェクト検出
- Abstract要約: リアルタイム物体検出器は、制御された条件下では顕著な精度を達成するが、非理想的な入力では急激に劣化する。
4つの相乗的革新を通じてこれらの課題に対処する統合検出フレームワークYOLOv14を提案する。
YOLOv14achieves 49.1 mAP on COCO val 2017 at 2.91 ms (T4 GPU) で、魚眼(+4.1 mAP)、パノラマ(+6.6 mAP)、ドローン(+6.4 mAP)、ゲームキャラクタ(+26.1 mAP)のベンチマークでかなりの利益を得ている。
- 参考スコア(独自算出の注目度): 8.040649850566211
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-time object detectors achieve remarkable accuracy under controlled conditions, yet degrade sharply on non-ideal inputs: fisheye distortion, game-rendered characters, aerial viewpoints, and 360° panoramas. We present YOLOv14, aunified detection framework addressing these challenges through four synergisticinnovations. (1) Deformable Area-Attention (D-AAttn) replaces rigid attentiongrids with learned 2D deformation fields, enabling adaptive sampling under geometric distortion. (2) Game2Real Domain Adaptation aligns rendered-game and photographic feature distributions via Adaptive Instance Normalization (AdaIN)and adversarial domain confusion, allowing game characters are detected as realhumans. (3) Multi-View Conditioning injects learned viewpoint embeddings intothe backbone with a cross-view contrastive loss that pulls same-class features fromdifferent perspectives closer. (4) An Adaptive Augmentation Policy automaticallyclassifies each input' scene type and routes to optimal augmentations, while a DynamicScaleRouter learns per-input feature pyramid weights. Together, YOLOv14achieves 49.1 mAP on COCO val2017 at 2.91 ms (T4 GPU), and delivers substantial gains on fisheye (+4.1 mAP), panorama (+6.6 mAP), drone (+6.4 mAP), andgame-character (+26.1 mAP) benchmarks
- Abstract(参考訳): リアルタイム物体検出器は、制御された条件下では顕著な精度を達成するが、魚眼歪み、ゲームレンダリング文字、空中視界、360度パノラマといった非理想的な入力によって著しく劣化する。
4つの相乗的革新を通じてこれらの課題に対処する統合検出フレームワークYOLOv14を提案する。
1) 変形性エリアアテンション (D-AAttn) は剛性アテンショングレードを学習された2次元変形場に置き換え, 幾何歪み下での適応サンプリングを可能にする。
2)ゲーム2Real Domain Adaptationは,AdaIN(Adaptive Instance Normalization, 適応インスタンス正規化)と対向ドメイン混乱を通じて,レンダリングゲームと写真の特徴分布を整列させ,ゲームキャラクタをリアル人間として検出する。
(3)マルチビューコンディショニングは、異なる視点から同一の特徴を引き出すクロスビューコントラスト損失で学習された視点埋め込みをバックボーンに注入する。
(4)Adaptive Augmentation Policyは各入力のシーンタイプとルートを自動的に分類し、DynamicScaleRouterは入力毎の特徴ピラミッド重みを学習する。
YOLOv14achieves 49.1 mAP on COCO val2017 at 2.91 ms (T4 GPU) and provide a significant gains on fisheye (+4.1 mAP), panorama (+6.6 mAP), drone (+6.4 mAP), andgame-character (+26.1 mAP) benchmarks
関連論文リスト
- 4DP-QA: Scalable QA for 4D Perception in Vision Language Models [68.67551474392373]
本稿では、動きに関するシーン理解に焦点を当てた生成パイプラインを提案する。
本稿では,従来手法とTrue-Motion Trackingと呼ばれる新しい参照システムの両方でトラッキングをキャストすることで,カメラと物体の動きの絡み合いを特に注意する。
このパイプラインから400Kサンプル、4DP-QA(4D知覚QA)、2.2Kサンプルベンチマーク、4DP-QA-Benchの大規模なトレーニングデータセットを生成する。
論文 参考訳(メタデータ) (2026-06-10T01:49:55Z) - Distortion-Aware PETR for BEV Object Detection with Mixed Pinhole-Fisheye Cameras [0.0]
魚眼カメラは低コストフルカバー視野(FOV)のために自律走行認識スイートに広く配備されている
急激な放射歪みは、一様サンプリングの基本的な仮定に違反して、ほとんどのBEV検出器に挑戦する。
本研究では, ピンホール・フィッシュカメラの複合設置に適したプロジェクションフリー検出装置であるDistortion-Aware PETR (DAPETR) を提案する。
論文 参考訳(メタデータ) (2026-06-07T15:32:10Z) - Real-Time Oriented Object Detection Transformer in Remote Sensing Images [36.48263676876599]
本稿では,初のリアルタイム・エンドツーエンド指向オブジェクト検出装置であるリアルタイム指向オブジェクト検出変換器を提案する。
具体的には、角度の回帰を再構成するために、角度分布の微細化を提案する。
また、トレーニングを安定させ、4つのノイズモードを解析するために、指向性コントラストデノケーションを提案する。
論文 参考訳(メタデータ) (2026-03-16T16:28:31Z) - YOLO11-4K: An Efficient Architecture for Real-Time Small Object Detection in 4K Panoramic Images [7.5117172634019775]
本研究では,4Kパノラマ画像に適したリアルタイム検出フレームワークYOLO11-4Kを紹介する。
このアーキテクチャは、小さなオブジェクトに対する感度を改善するために、P2層を備えた新しいマルチスケール検出ヘッドを備えている。
YOLO11-4Kは0.95 mAPを0.50 IoUで達成し、1フレームあたり28.3ミリ秒の推論を実現し、YOLO11と比較して75%の遅延低減を実現している。
論文 参考訳(メタデータ) (2025-12-18T13:00:05Z) - Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models [79.06910348413861]
Diff4Splatは、単一の画像から制御可能で明示的な4Dシーンを合成するフィードフォワード方式である。
単一の入力画像、カメラ軌跡、オプションのテキストプロンプトが与えられた場合、Diff4Splatは外見、幾何学、動きを符号化する変形可能な3Dガウス場を直接予測する。
論文 参考訳(メタデータ) (2025-11-01T11:16:25Z) - TY-RIST: Tactical YOLO Tricks for Real-time Infrared Small Target Detection [6.0340092200636475]
赤外線小目標検出(IRSTD)は、防衛と監視に重要であるが、依然として困難である。
我々は、ストライド対応のバックボーンと微粒な受容場を統合した、最適化されたYOLOv12nアーキテクチャであるTY-RISTを提案する。
4つのベンチマークと20の異なるモデルの実験では、最先端のパフォーマンスを示し、0.5 IoUでmAPを+7.9%、精度を+3%、リコールを+10.2%改善した。
論文 参考訳(メタデータ) (2025-09-26T20:36:57Z) - A Comparative Study of YOLOv8 to YOLOv11 Performance in Underwater Vision Tasks [0.0]
YOLOファミリーの1段階検出器は、単一の低遅延ネットワークで局所化と分類を融合するため、魅力的である。
比較操作条件にまたがる2つのデータセットをキュレートする。コーラル病セット(4,480イメージ、18クラス)と魚種セット(7,500イメージ、20クラス)である。
YOLOvs, YOLOv9-s, YOLOv10-s, YOLOv11-sを同一のハイパー参照でトレーニングし, 精度, リコール, mAP50, mAP50-95, 画像毎の推論時間, フレーム毎秒(FPS)を評価する。
論文 参考訳(メタデータ) (2025-09-16T05:12:59Z) - Enhancing Underwater Imaging with 4-D Light Fields: Dataset and Method [77.80712860663886]
4次元光場(LF)は、光吸収、散乱、その他の課題に悩まされる水中イメージングを強化する。
水中4次元LF画像強調と深度推定のためのプログレッシブフレームワークを提案する。
学習手法の定量的評価と教師あり訓練のための,最初の4次元LFに基づく水中画像データセットを構築した。
論文 参考訳(メタデータ) (2024-08-30T15:06:45Z) - MonoTDP: Twin Depth Perception for Monocular 3D Object Detection in
Adverse Scenes [49.21187418886508]
本論文は,モノTDP(MonoTDP)と呼ばれる悪シーンにおける2つの深度を知覚するモノクル3次元検出モデルを提案する。
まず、制御不能な気象条件を扱うモデルを支援するための適応学習戦略を導入し、様々な劣化要因による劣化を著しく抑制する。
そこで本研究では, シーン深度と物体深度を同時に推定する新たな2つの深度認識モジュールを提案する。
論文 参考訳(メタデータ) (2023-05-18T13:42:02Z) - Geometric-aware Pretraining for Vision-centric 3D Object Detection [77.7979088689944]
GAPretrainと呼ばれる新しい幾何学的事前学習フレームワークを提案する。
GAPretrainは、複数の最先端検出器に柔軟に適用可能なプラグアンドプレイソリューションとして機能する。
BEVFormer法を用いて, nuScenes val の 46.2 mAP と 55.5 NDS を実現し, それぞれ 2.7 と 2.1 点を得た。
論文 参考訳(メタデータ) (2023-04-06T14:33:05Z) - Behind Every Domain There is a Shift: Adapting Distortion-aware Vision Transformers for Panoramic Semantic Segmentation [73.48323921632506]
パノラマ的セマンティックセマンティックセグメンテーションは2つの重要な課題により未探索である。
まず、変形性パッチ埋め込み(DPE)と変形性(DMLPv2)モジュールを備えたパノラマセマンティックトランス4PASS+を改良したトランスフォーマーを提案する。
第2に、教師なしドメイン適応パノラマセグメンテーションのための擬似ラベル修正により、Mutual Prototypeal Adaptation(MPA)戦略を強化する。
第3に、Pinhole-to-Panoramic(Pin2Pan)適応とは別に、9,080パノラマ画像を用いた新しいデータセット(SynPASS)を作成します。
論文 参考訳(メタデータ) (2022-07-25T00:42:38Z) - EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm [111.17100512647619]
本稿では、実証された実用的な進化的アルゴリズム(EA)と類似したビジョントランスフォーマーの合理性を説明する。
本稿では,EA ベースのトランス (EAT) ブロックのみを含む新しいピラミッド EATFormer バックボーンを提案する。
画像分類,下流タスク,説明実験に関する大規模かつ定量的な実験は,我々のアプローチの有効性と優位性を示すものである。
論文 参考訳(メタデータ) (2022-06-19T04:49:35Z) - Decoupled Adaptation for Cross-Domain Object Detection [69.5852335091519]
クロスドメインオブジェクト検出は、オブジェクト分類よりも難しい。
D-adaptは4つのクロスドメインオブジェクト検出タスクで最先端の結果を達成する。
論文 参考訳(メタデータ) (2021-10-06T08:43:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。